你调用一个远程 AI,只能看到回答,看不到服务器和代码;但如果精确记录每个词元——模型逐个吐出的文字单位——之间的等待时间,快慢节奏本身就可能泄密。LeakyLMs 展示了一种侧信道攻击:不破解模型,而是像从机器声判断运转状态那样,从逐词元延迟反推内部架构与推理优化。
最巧的一步针对“投机解码”:系统先让较便宜的草稿模型猜一串词元,再交给主模型核验。研究者构造必须依赖很远处文本才能答对的提示,并不断拉长距离;一旦超出草稿模型能看到的范围,猜测更易与主模型分歧,输出节奏也随之变化。作者据此判断 Gemini Flash 2.5 使用了投机解码,草稿模型的上下文窗口约为 128K 词元。
他们还建立 GPU 计时模型,搜索可能的层数、隐藏维度和注意力头数;在 Llama 实验中,接近正确的架构超过 90% 的时候进入前十个猜测。论文也说明,这些结果来自作者实验;团队已于 2025 年 11 月向 Google 披露投机解码攻击,Google 于 2026 年 1 月确认收到相关发现。