Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
NEWS 3 信源 约 5 分钟

Mica:4B模型不写字,只做决定

Mica 不负责写答案,只负责选动作:一个 4B 开放模型,把 Minecraft 与俄罗斯方块变成了 Agent 决策实验。

IMAGE — r/LocalLLaMA 日榜

你让 AI 助手处理一封邮件,它未必需要先写一段长篇分析。很多时候,它只要判断:直接回复、追问用户,还是调用另一个工具。Mica v0.1 盯上的正是这种工作。它不负责说漂亮话,只在给定选项中做决定。对于每天可能判断成百上千次的 Agent,这种分工值得关注:复杂模型负责生成,小模型守在流程的岔路口。

这里的 4B,指模型约有四十亿个参数,属于相对较小、较容易在单张消费级 GPU 上运行的规模。Mica 基于 Qwen3.5-4B,经 rank-16 LoRA——一种只训练少量附加参数的微调方法——调整后再合并进模型。作者以 Apache-2.0 许可证公开了权重和代码。

不写句子,直接看选项分数

普通语言模型会一个词接一个词地生成回答。Mica 换了一种读法:输入当前状态、问题和允许的答案后,它只运行一次 prefill——也就是先把整段输入读完——然后查看答案标签 token 对应的 logits。

logit 是模型把分数转换成概率前的原始数值。比较各标签的 logit,就像不让裁判写评语,只让它给候选项亮分。作者因此把它概括为“零输出 token”。但这不等于没有语言模型计算:模型仍然要读完整段输入,只是不再继续生成文字。

据作者发布的信息,Mica 支持 yes/no、2 至 255 个选项的 choice,以及 2 至 10 级的 score,并兼容 TypeSafe /v1/systemone 格式。它面向的是 Agent 的门控与路由:门控就是流程里的条件开关,例如判断要不要调用昂贵模型、是否需要追问用户;路由则是决定下一步交给哪个工具或流程。

训练数据由约 3.4 万个源决策扩展到 77,732 条样本,约 3470 万 tokens,覆盖 12 个领域,英语和韩语各约一半。作者称,全部实验加最终训练使用租赁 RTX 3090,总 GPU 时间成本低于 30 美元。这是作者自述,并无账单或第三方复核,也不能直接理解成其他人都能以同样价格复现。

游戏不是终点,而是压力测试

Minecraft 演示把这种决策方式变得很直观。机器人把背包、附近方块、实体和上一步结果写成文本,再让 Mica 给候选命令评分。命令由 Mindcraft 的技能库执行。按作者日志,Mica 在真实 Minecraft 1.20.4 服务器中,从空背包出发,经过 23 次决策依次完成取木、制作工具、采石、熔炼等步骤,最后拿到 iron pickaxe。运行环境为 llama.cpp、Q5_K_M 量化和 RTX 3090,每次判断约需 90 至 150 毫秒。

这并不是说语言模型比专门脚本更适合挖矿。社区讨论中也有人指出,Minecraft 合成与俄罗斯方块落点完全可以用硬编码规则处理。Mica 真正想展示的是:同一个选择器能否跨场景工作,而不必为每个任务重新写一整套规则。

俄罗斯方块测试进一步展示了这一点。每回合,Mica 和 Kev 4B 都看到棋盘及四个候选落点,没有搜索和前瞻。在三个使用相同种子与方块顺序的对比中,Mica 分别消除 33、97、93 行,Kev 分别为 27、17、11 行,合计 223 对 55。Kev 三局都堆到顶部结束;Mica 在其中两个种子里处理完全部 250 个方块。按作者定义的候选与评价标准,Mica 约 75% 的回合选中当时最佳落点,Kev 约为 50%。

它强在哪,也差在哪

在作者构建、训练结束后才开启的 held-out 测试集中,英文子集包含 7,328 条决策。Mica 得分 67.0,高于 JevK5 4B 的 61.0、Kev 4B 的 57.0,以及未经相同微调的 Qwen3.5-4B base 的 55.0;但仍低于闭源 API Jev 1.13 的 74.1。这个结果更像是证明“小型开放模型可以专门练习做选择”,还不能证明它已经追上更强系统。

公开测试也呈现类似轮廓:Mica 在 SemIf、Kev transfer v9 和 MMLU-Pro 10k 上分别得到 94.4、69.2 和 53.0。JevBench hard 的结果则存在口径差异:作者直接评测为 69.5,换用 JevBench 官方 runner 与 llama.cpp server 后为 64.9。两者都应保留,不能只取较高数字。

我们 9 月 18 日曾介绍过 Jev 式路线:让小型 Qwen 模型或排序模型只输出候选概率。Mica 延续了这条思路,并把它推进到可下载的 4B 模型与实际行动演示。它最有意思的地方,不是让 AI 少说几句话,而是重新划分 Agent 的工作:需要表达时再生成,只需选择时就让专门模型迅速做决定。

局限与未知

  • 目前材料都来自同一作者及其指向的仓库和权重,没有第三方复现或独立榜单验证。
  • Minecraft 视频经过剪辑:长动作被加速,连续重试被缩短,界面也由日志绘制,因此不能当作未经剪辑的完整实机证据。
  • 俄罗斯方块只有三个种子,“约 4 倍”来自总消行数的小样本对比;“最佳落点”也依赖作者设定的候选和评价标准,不能外推成普遍性能提升。

供稿材料 SOURCES — 3

← 返回 2026-09-27 · 开源板块