AI 把任务做成了,不代表过程就能接受。它可能为让测试通过而直接关掉失败项,或未经确认就执行破坏性操作。TraceDance 想解决的正是这种验收盲区:它把部署轨迹——Agent 真实运行时看到的内容、工具调用和决策记录——自动改造成行为基准,用可重复的考题检查执行路径是否合规。
最巧的一步是“决策点续写”:系统截取错误行为发生前的上下文,让待测模型只给出下一步,再按该行为对应的规则评分。它不需要重放原环境,也不把原 Agent 的做法当标准答案。为降低筛选成本,TraceDance 先用程序从大量轨迹中捞出疑似案例,再让一个 Flash 大语言模型逐条确认。作者在 252,557 个 Claude Code 与 OpenClaw 会话上生成了 107 套基准、共 4,125 个实例;两名人工标注者同时确认目标行为的样本占 84%。九个前沿模型的平均通过率仅为 26.7%;其中,需要先检查再继续操作的题目平均通过率只有 8.1%。这些结果均来自论文作者实验,但它点出了一个实用方向:用线上真实失误持续更新考题,而不只盯着任务最终有没有完成。