Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
PAPER 约 1 分钟

边缘投机解码开始看内存下单

MemSpec先看设备内存,再安排草稿模型,让边缘端投机解码少为换模型付账。

手机上让 AI “先打草稿再审稿”,未必真的更快。投机解码会让较小的草稿模型先猜一串词元——也就是模型处理文字的基本单位——再由较大的目标模型一次检查。但手机等边缘设备内存有限,换用一个没驻留在内存里的草稿模型,光加载权重就可能比一轮生成更久。

MemSpec把“哪个草稿模型更合适”和“眼下哪个能直接运行”分开处理。轻量预测器根据提示词和最近的生成上下文,判断接下来可能有效的草稿模型;系统先用当前驻留内存中最好的一个继续生成,同时在后台预取候选模型、淘汰暂时不用的模型。像小厨房备菜:先用手边食材出餐,再提前把下一道菜需要的材料拿出来,避免临时翻仓库。

作者在 Jetson Orin Nano 上测试称,MemSpec的稳定生成吞吐量平均比基于多臂老虎机——靠运行中反复试用候选模型来做选择——的自适应方法高 40.7%,并接近预知最佳选择的动态上限。它的价值不只是“选得更准”,而是把模型是否装得进、切换是否划算,也纳入运行时排程。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 学术板块