让手表开灯、让机器人转向,其实不必请一个什么都能聊的大模型。Needle 2 瞄准的正是这类窄任务:它把用户随口说的话转换成结构化指令,再由设备调用对应工具。换句话说,它更像端侧任务调度器,而不是聊天助手。
开发方称,Needle 2 只有 4500 万参数——模型训练后保存的数值——并通过 2-bit 量化,也就是用更少比特保存这些数值,压成一个 14MB 文件,运行时内存峰值约 28MB。关键做法是从训练阶段就按量化后的形态训练,而非训练完成后再强行压缩;作者自述,这让它在其基准测试中没有因压缩损失表现。其宣称模型可在 Raspberry Pi 5 上以每秒约 500 个 token 的速度生成,也能运行于 200 美元以下的手机和较新的微控制器。
这项工作的看点不是把聊天模型做得更小,而是主动缩窄问题:只判断该调用哪个功能、填写哪些参数。模型还会输出置信度,拿不准时可追问或转交云端。不过,现有材料主要来自开发方页面,尚不足以独立判断其跨设备表现和“无损”量化结论。