让 AI 做难题,通常要在速度、价格和准确率之间取舍。Gemini 3.7 Flash 这次值得看,是因为它在两类复杂任务上同时冒头:既能归纳陌生规律,也能调用工具完成真实数据分析,而且成本和耗时都较低。
ARC Prize 公布的 Verified(由评测方按规定环境核验)结果显示,它在 ARC-AGI-2 上得分 84.6%,每题成本 0.25 美元;在 ARC-AGI-1 上得分 95.5%,每题 0.12 美元。ARC-AGI 用陌生图形题检验模型能否从少量示例中找出规则。评测方认为,相比其他前沿模型,它的得分与成本组合突出。
另一边,据 Google 转述 Artificial Analysis 的 AA-AnalystAgent 榜单,Gemini 3.7 Flash 在覆盖 14 个商业和科学领域的 80 项真实任务中总准确率排名第一。Analyst Agent 指能读取数据、调用分析工具并分步骤完成任务的 AI。Google 称,它比其他头部模型快 60% 至 90%,速度是准确率最接近对手的 2.4 倍。榜单仍只代表特定题集和设置,但两项结果共同指向一个趋势:高阶推理与 Agent 工作,正在被更小、更快的模型压低成本。