Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
PAPER 约 1 分钟

手机大模型只加载需要的神经元

SelectInfer让手机只加载、计算当前任务需要的神经元,把端侧优化细化到运行时选择。

手机想在本地跑大模型,常遇到一个朴素问题:模型太大,内存装不下。SelectInfer的思路像按订单备货,不把整座仓库搬进手机。它先离线观察哪些神经元最重要——神经元是模型里执行数字变换的基本计算单元——部署时只加载相关部分,运行时再只计算当前输入预计会用到的部分。

最值得注意的是作者发现的“双层分工”。在Llama3.2-3B的问答、摘要和翻译测试中,各任务最活跃的前40%神经元,两两重合约68%至72%,三类任务共同重合约60%;但各任务专属部分的跨任务重合仅约24%至26%。这意味着模型既有通用骨干,也有随任务切换的专门单元,因而内存占用与计算量可以分开调节。

作者称,这套方法让原本无法直接装入NVIDIA Jetson Orin Nano可用内存的两款3B模型得以运行。它没有像剪枝那样永久删除单元,也不只靠量化降低数字精度;代价是需要提前用相应任务数据做离线分析,实际效果仍取决于部署任务与分析数据是否匹配。


供稿材料 SOURCES — 1

← 返回 2026-07-24 · 学术板块