你对手表说“把客厅灯调暗到 30%”,它未必需要一个会写文章、懂历史的通用 AI。它只要听懂你的意思,选中“调灯”功能,再把“客厅”和“30%”填进正确位置。Needle 2 瞄准的正是这种窄而实用的工作:让极小模型在手机、穿戴设备、智能家居、小型机器人乃至微控制器上充当操作编排器。
微控制器是家电、传感器和机器人控制板里常见的小型芯片,资源远少于电脑。把 Agent——能选择并调用外部功能的 AI——塞进这类设备,难点首先不是“够不够聪明”,而是模型能不能装下、跑得动。
本文数据与效果说法均来自 Cactus 作者发布的 Reddit 帖子及其同机构论文,属于单一信源,尚无独立复现。
14MB 里装的是什么?
据 Cactus 作者介绍,Needle 2 是一个包含 4500 万参数的单一 14MB 文件,完整会话占用 28MB 内存。它采用 2bit compression,也就是用极少的比特保存模型权重,以牺牲一定数值精度换取更小体积和更低内存占用。这类做法通常称为量化。
它也不是要包办知识问答。Needle 2 聚焦 tool calling——模型按规定格式选择搜索、传感器或设备控制等外部功能,并填写参数。比如用户说“回家前十分钟打开空调”,模型的任务是找到对应功能,并提取时间、设备和动作,而不是自己控制空调。
研究方认为,当设备能力被写成带有明确参数类型的函数后,核心问题就缩小为:该调用哪个函数、参数填什么。按他们的概括,这种限定任务不需要世界知识或开放式写作,因此 4500 万参数已经足够。这个判断只适用于结构化设备操作,不能外推为通用 Agent 能力。
它为什么能跑得这么快?
Needle 2 基于 Cactus 论文提出的 Simple Attention Networks。供稿没有展开这一架构的具体设计,只给出计算量对比:相同宽度和深度的传统 Transformer——当前语言模型常用的基础架构——每生成一个 token 需要 164 MFLOPs;压缩到与 Needle 相近的参数规模后仍需 87 MFLOPs,而 Needle 为 70 MFLOPs。MFLOPs 衡量计算操作量,但不能直接换算成耗电,实际功耗还取决于芯片、内存访问和软件实现。
作者报告称,Needle 2 在 Raspberry Pi 5 上的解码速度为每秒 500 tokens;在 Meta Quest 3S、Apple Vision Pro 等 VR 设备上为每秒 400 至 1500 tokens;在 Samsung A-Series 等售价低于 200 美元的手机上为每秒 300 至 700 tokens。token 是模型处理文字的基本单位,并不等同于一个汉字或单词。
这些速度区间看起来很高,但帖子没有交代具体机型对应值、线程数、上下文长度、硬件配置或功耗,因此目前更适合视为研究方展示的运行结果,而不是可横向比较的标准成绩。
真正值得看的,是资源下限
端侧模型直接在设备上运行,不必把每次输入都发往云端,因此有机会降低延迟、支持离线使用,并加强用户对数据的控制。代价是它必须面对严格的内存和算力限制。
Needle 2 的意义不在于用 14MB 取代大型模型,而在于重新划定分工:大模型负责开放问题,小模型留在设备上,把自然语言翻译成结构化操作。若这条路线成立,Agent 就不必只存在于高端电脑和旗舰手机,也可能进入资源更紧张的家电、传感器和机器人控制板。
作者还称,Needle 2 在工具调用和移动设备使用基准上与 LFM2.5 230M、Apple Foundation Model 互有胜负,同时小 5 至 70 倍。不过,帖子没有提供基准表、任务集合和筛选标准,而且对比混用了对方的 f16 精度与 Needle 2 的 2bit 量化。这一结果带有明显的发布方营销色彩,暂不能视为公平、独立验证的领先结论。
局限与未知
- 供稿未提供测试脚本、功耗、预填充速度及复现实验,体积、内存、速度和计算量都只有单一信源。
- “计算量少 7 至 85 倍”等说法缺少明确比较对象与统一条件,不宜当成已证实结论。
- 原帖末尾截断于“Needle 2 expands to stru”,后续功能无法核查。