Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.039 — 2026-08-12
NEWS HN 348 约 1 分钟

专有模型的推理痕迹也能被偷

专有模型藏起推理过程后,接口返回的信息仍可能被其他模型还原利用。

IMAGE — Hacker News 高分帖(24h+ 滚动窗口)

把模型的“草稿”锁起来,并不代表别人看不到草稿里的内容。这个研究展示了一种值得警惕的情形:专有模型只通过 API——远程提交问题、取得结果的接口——提供服务,即使返回的是加密内容或签名,其他模型仍可能从中恢复推理痕迹。推理痕迹是模型生成答案时留下的中间推导文本,不等同于全部内部计算,却可能包含可复用的解题方法。

材料给出的案例中,GPT-5.2 Codex 的 encrypted_content 被 GPT-5.6 Luna 解码,恢复出处理代码仓库密钥的具体步骤;Claude Sonnet 4.6 的 signature 则被 Haiku 4.5 解码,显露出订票任务中的个人与支付信息。问题因此不只关乎隐私:若攻击者能批量提取这类过程,再用于模型蒸馏——拿强模型的输出训练另一个模型——专有模型的能力资产也可能被低成本复制。现有材料未披露成功率、样本规模和通用性,因此它更像一项风险演示,但已说明商业模型的防线不能只停在隐藏权重或给输出加密。


供稿材料 SOURCES — 1
01
Stealing Reasoning Traces from Proprietary LLM APIs Hacker News 高分帖(24h+ 滚动窗口) · NEWS
原文 ↗

← 返回 2026-08-12 · 科技板块