Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
NEWS 约 1 分钟

小模型先自知,再决定是否求援

让端侧小模型先判断自己是否靠谱,没把握时再求助云端大模型。

IMAGE — r/LocalLLaMA 日榜

像请一位随身助理答题:简单问题由它当场处理,遇到拿不准的再请教专家。Cactus 为 Gemma 4 E2B 做了后训练——即基础训练完成后的额外调整——让这个端侧模型在回答时同时给出 0 到 1 的置信度。置信度不是正确保证,而是决定采用本地答案还是转交云端模型的信号。

具体做法是增加一个 6.8 万参数的探针层,从模型生成答案时的中间状态预测“答错概率”,而不是让模型用文字自评。作者称,在 12 个未参与训练、覆盖文本、视觉和音频的基准上,这套探针的平均 AUROC——衡量它区分对错答案能力的指标——为 0.814,词元熵方法为 0.549。更值得注意的是,探针没用音频数据训练,却在四个音频基准上达到 0.79 至 0.88。

按作者测试,只把约 15% 至 35% 的多数基准请求交给 Gemini 3.1 Flash-Lite,整体表现就能追平它;MMLU-Pro 则需转交 45% 至 55%。这给混合推理提供了一条实用思路:把速度、隐私和成本留在本地,只在确有必要时购买更强的云端能力。上述效果来自 Cactus 自述,尚未见独立核查。


供稿材料 SOURCES — 1

← 返回 2026-07-24 · 开源板块