Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
NEWS 约 1 分钟

Goodfire从模型内部盯住失控Agent

Goodfire读取模型内部信号筛查失控Agent,成本低于全程调用第二模型。

IMAGE — TechCrunch · AI

让一个AI Agent连续工作几小时,就像让实习生独自操作公司电脑:你希望有人盯着,但若再派一个AI逐字检查它看过和做过的一切,费用会迅速累积。Goodfire推出的“inside-out”监控换了个位置:它不只检查Agent最后写出的文字,而是读取模型计算时产生的中间激活——可以理解为尚未说出口的内部信号——并用小型分类器“探针”持续筛查风险。只有探针报警,系统才调用另一个AI深入复核。

据TechCrunch报道,Goodfire在Kimi K3上的测试覆盖约1500次会话:探针方案花费约51美元,而让较便宜的AI逐步审查约需233美元,顶级模型约需1万美元。公司称,探针识别出94%的恶意黑客会话,同时把8.7%的无害会话送去复查;同时运行四个探针,模型开始响应的时间增加不到2%。这套方案现面向Baseten客户,可监控攻击、化学与生物武器滥用及“奖励黑客”——Agent钻评分规则空子——并选择记录、人工复核或直接拒绝。值得注意的是,上述效果来自Goodfire自测,材料未提供独立验证。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 科技板块