像请一位随身助理答题:简单问题由它当场处理,遇到拿不准的再请教专家。Cactus 为 Gemma 4 E2B 做了后训练——即基础训练完成后的额外调整——让这个端侧模型在回答时同时给出 0 到 1 的置信度。置信度不是正确保证,而是决定采用本地答案还是转交云端模型的信号。
具体做法是增加一个 6.8 万参数的探针层,从模型生成答案时的中间状态预测“答错概率”,而不是让模型用文字自评。作者称,在 12 个未参与训练、覆盖文本、视觉和音频的基准上,这套探针的平均 AUROC——衡量它区分对错答案能力的指标——为 0.814,词元熵方法为 0.549。更值得注意的是,探针没用音频数据训练,却在四个音频基准上达到 0.79 至 0.88。
按作者测试,只把约 15% 至 35% 的多数基准请求交给 Gemini 3.1 Flash-Lite,整体表现就能追平它;MMLU-Pro 则需转交 45% 至 55%。这给混合推理提供了一条实用思路:把速度、隐私和成本留在本地,只在确有必要时购买更强的云端能力。上述效果来自 Cactus 自述,尚未见独立核查。