同一道题交给 AI 多答几遍,常能用多数票降低偶然出错。但这笔额外算力也可以换个花法:先把问题改写成几种意思相同的说法,再分别作答。就像从不同角度拍同一件东西,单一措辞造成的误判更容易被抵消。
Kozodoi、Afolabi 和 Butler 研究了这种测试时增强(Test-Time Augmentation,模型训练完成后,变换输入并汇总答案)。他们让模型一次生成多个语义改写,再逐一回答并多数表决;同时用大致相同的计算量,与自洽性——固定原问题、重复采样多条推理路径——比较。作者称,在覆盖知识、数学、多模态问答和情感分类的六项任务中,语义改写在五项胜过自洽性,每美元带来的准确率收益约为后者的 1.8 倍,且优势达到统计显著。
这项结果提示,测试时扩展不必只在答案端“多抽几遍”:对当前中档模型,把预算分给输入多样性可能更划算。论文还称,这一优势在更强模型不可用或费用过高时最明显;结论边界仍是其测试的六项任务与模型设置。