你问 AI 一道数学题,屏幕上只出现答案,像是服务员端来一道成品菜。至于“后厨”里怎样推算,产品通常不会展示。现在,一篇题为《Stealing Reasoning Traces from Proprietary LLM APIs》的论文被指可以从 Claude 与 GPT 的 API——开发者调用闭源模型的接口——还原这些隐藏过程。若说法成立,影响的不只是模型安全,也包括用户隐私、评测可信度和思维链产品设计。
不过,目前供稿只有一篇 Reddit 帖子,没有论文原文、厂商公告或独立复现。下文涉及效果的说法,均只能视为帖子转述。
它声称看见了什么?
模型解决多步问题时,可能生成思维链(Chain of Thought),也就是通向答案的中间推理文字。帖子称,新方法利用某个未说明的“gap”,取得了 Claude 和 GPT 模型的推理轨迹——模型推理过程中产生的中间 token 或状态,并公开了大量示例。
帖子进一步宣称,该方法能看到“所有”相关模型“100%”的推理 token。但这两个绝对化数字没有独立证据支撑。材料也没有解释这个 gap 究竟是安全漏洞、特定 API 行为,还是只在某种攻击设置下有效。
为什么值得警惕?
第一,隐藏推理若能经由接口外泄,模型厂商原本划定的“只给答案、不开放内部过程”边界就可能失效。
第二,它可能提供新的评测线索。帖子举出一道 AIME——常用于测试模型数学推理能力的美国中学数学竞赛——称 Claude 的推理像是记得题目和答案。但单个样例不能证明训练数据污染,也不能据此断言闭源模型的整体成绩被高估。
第三,公开轨迹或许能让研究者观察前沿模型是否也会出现怪词、推理断裂或过度思考。不过帖子所称“几乎总是如此”没有统计数据。
局限与未知
- 帖子称漏洞已经关闭,但没有厂商确认、受影响接口或修复时间。
- “中国长期借此蒸馏前沿模型”没有主体、证据和时间线,只能视为传言。
- “闭源模型没有 secret sauce,差距只在数据、算力和工程”是发帖者观点,不是已验证的研究结论。
眼下最重要的不是接受这些惊人结论,而是等待论文原文、可复现实验和厂商说明。这个故事真正成立之前,问号仍多于答案。