Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
NEWS 约 1 分钟

Echo Dot 2跑起2800万参数模型

老旧 Echo Dot 2 跑通本地语音助手,缓存设计把响应等待从约 17 秒压到 2.3 秒。

IMAGE — r/LocalLLaMA 日榜

你对智能音箱说“把灯打开”,录音通常要送到云端处理。开发者 alberto_zurini 做了另一种尝试:让只有 512 MB 内存、采用老式 ARMv7 处理器架构的 Echo Dot 2,在设备上完成听写、生成回答和播音,不必上传录音。它运行的语言模型只有 2800 万参数,适合开灯、调音量这类短而固定的指令。

真正关键的不是硬塞进一个小模型,而是少做重复劳动。作者把 llama.cpp——让量化模型在多种处理器上运行的推理工具——重新编译给旧芯片使用,并让模型服务常驻后台,避免每句话都从头加载。固定的指令还能保存在 KV Cache 中;它像模型留下的计算草稿,只需处理每次变化的用户话语。作者自测称,这套设计把热查询延迟从约 17 秒降到约 2.3 秒;模型处理输入约每秒 7 个 token(模型处理文字的基本单位),生成约每秒 4 个。更大的 MobileLLM-143M 即使经过量化压缩,简单指令仍需约 20 秒。这个实验的意义很克制:旧硬件未必能胜任开放聊天,但小模型配合缓存,可能让一批存量设备重新获得有限而实用的本地智能。


供稿材料 SOURCES — 1

← 返回 2026-08-08 · 开源板块