你刚用手机 AI 聊完一件事,转去拍照或玩游戏,再切回来,它可能要等很久才开口。原因是其他应用挤占内存后,系统会赶走模型权重——模型学到的规则——以及 KV cache(保存对话中间计算结果的“速记”)。mzCache要解决的,就是手机多任务环境下这段恢复等待。
它最巧的一步,是优先移走模型靠后的层,保留计算时最先用到的前层。这样请求到来后,GPU 可以立刻从前层开始推理,CPU 同时按计算顺序恢复后层;系统还把缓存细分,只移走释放内存所需的部分,并结合压缩内存与存储两条恢复路径。论文称,手机端模型及缓存合计可占 5–7 GB,切换应用后的首字等待可从 0.8 秒升至 16 秒;其 Android 原型基于 llama.cpp,相比存储支持的部分卸载方案,将首字响应加快 2.1–5.5 倍。