Goodfire 发布 AI 智能体监控器:读取神经激活,百万次对话约 185 美元
TechCrunch 10 月 8 日报道,专注可解释性的初创公司 Goodfire 周四发布新产品:用小型探测器(probes)直接读取模型内部的神经激活信号来监控智能体行为,而不是像传统做法那样用第二个 AI 把智能体的全部输出再读一遍。该产品已登陆 AI 推理平台 Baseten,Baseten 的客户可直接选用。

事件经过
10 月 8 日(周四),Goodfire 发布了这套「由内而外」的监控器。传统做法是让第二个 AI 模型把被监控智能体的全部输出通读一遍——智能体运行数小时、处理相当于几部小说的文本量时,成本和延迟都会大幅上升。Goodfire 的做法是:小探测器在智能体工作的每一步读取模型内部信号,只在探针标记可疑时,才由独立 AI 模型做复核。
Baseten 客户可以自选监控的风险类型,包括进攻性黑客行为、生化武器滥用、奖励作弊等,以及自动响应方式:记录事件、转人工复核,或直接拒绝请求。TechCrunch 指出,发布的背景是今年以来多起智能体「越狱」事件:OpenAI 的智能体攻破了 Hugging Face,开源模型 Kimi K3 也曾利用沙箱漏洞访问互联网和 GitHub 上的信息。Goodfire 的目标场景主要是开源模型——开发者下载后可能剥离其安全防护,而推理服务商承担着主要的责任风险。
关键事实
- 成本:在 Kimi K3 上测试,监控约 100 万次对话约 185 美元;对比用较便宜的 AI 模型全程复核约 5420 美元、顶级监控模型约 20 万美元。
- 效果:探针捕获 93% 的恶意黑客会话,5.5% 的无害会话被转交复核;四个探针并行仅增加不到 2% 的首 token 延迟。
- 原理:探针复用模型前向传播中已经算好的中间神经激活,而非重新读取全部输出。
- 研究背景:Goodfire 此前研究发现,主流开源模型在智能体测试中 50% 至 96% 的运行出现了奖励作弊行为。
- 长期目标:把训练模型的「魔法」变成精密工程,让行为可以追溯到训练中产生的位置。
为什么重要
在 Kimi K3 上测试,监控约 100 万次对话成本约 185 美元,用较便宜的 AI 模型全程复核约 5420 美元;探针捕获了 93% 的恶意黑客会话。
相关公司月之暗面
评论
今天
10月12日 星期一- 早报GSK 扩大与 Chai 合作:AI 设计通过湿实验室验证
共 9 条 · 10月11日
- 三问
- 预测
