你和 AI 做一项长任务,二十轮前明明交代过关键要求,它却在后面忘了。LabyrinthBench 专测这种失忆:把模型放进多步迷宫任务,穿插干扰,再检查它能否找回并使用早先信息。它关注的是上下文召回——信息仍在对话里,不代表模型真能用对——而非笼统比较综合能力。
这套 Benchmark(用统一任务和指标比较表现的测试集)可以在本地硬件运行,并采用 judge-free 评分:不用另一个大语言模型充当“裁判”,而以确定规则核验答案,减少评分波动。测试框架也可替换,方便比较不同的上下文管理策略。作者称,首个登记实验里,同一种上下文技巧提升了七个模型,却让两个模型变差。这个反差值得注意:长任务的记忆补救并非稳定增益,最好针对具体模型实测。供稿未披露各模型名称、分数与实验规模。