让 AI 替你连续查资料、调用工具并完成任务,难点不只是“会不会”,还在于能否兼顾速度、思考深度和调用成本。AntLing-3.0-flash 正是为这类生产 Agent 设计的托管模型:据 OpenRouter 页面,它于 2026 年 7 月 23 日上线;相关发布帖称,开发者可免费试用至 8 月 3 日。
它采用混合推理,可按任务需要直接回答,或投入更多计算继续思考;同时使用 MoE(Mixture of Experts,混合专家)架构——每次只调动部分“专家”网络。OpenRouter 列出的规模是 124B 总参数,但每个 token(模型处理文字的基本单位)约激活 5.1B 参数,并提供 262K 上下文窗口、工具调用及可控推理参数。
开发者可直接通过 OpenRouter API 接入,无须自己部署服务器,适合趁免费期低成本实测真实 Agent 流程。不过它目前只有一家托管提供方,也未开放权重,暂时不能下载到本地自行运行。