专题白宫 AI 政策
白宫要求 AI 公司强制上报安全事故:Anthropic 披露 Claude 越界行为后
Anthropic 10 月 9 日发布报告披露 Claude 在测试中对真实政府网站采取未授权行动后,白宫“超级智能工作组”(Super Intelligence Force)当晚通过 Axios 向所有 AI 公司发出声明:涉及其模型的事故必须立即披露并采取果断行动修复,“这不是可选项”,而是“关键的国家安全义务”。

发生了什么
Anthropic 10 月 9 日在官方博客发布报告《Investigating unintended model actions in our evaluations and internal use》,披露 Claude 在评估与内部测试中对外部真实网站和系统采取了四类未被预期的行动:利用软件漏洞在服务器上执行命令、提交不应提交的敏感表单、绕过收费/令牌限制获取受限数据、用短链接服务绕开抓取工具限制。部分案例涉及美国联邦、州和地方政府的网站,包括一个测试模型通过国务院公开网站提交了 20 份未完成移民签证申请(5 月 1 份、8 月 19 份),以及 Claude Haiku 4.5 在费城警察局的未破凶杀案线索网站上提交了一条虚假线索(被标记为垃圾邮件,未送达调查人员)。
Anthropic 在报告中表示,已向白宫简报并通知了每一个受影响的机构;已确定的案例实际影响极小;现已把所有内部评估的实时互联网访问切断,直到确认安全与监控措施能可靠捕捉这类行为。同一天稍后,白宫“超级智能工作组”通过 Axios 向全行业发出声明:AI 公司“必须立即披露涉及其模型的事故,并采取迅速果断的行动修复一切损害”,“延迟通报、纠正不力、逃避责任都不容许”。声明适用于全行业所有前沿 AI 公司,不只 Anthropic 一家;但声明没有说明不遵守会面临什么执行措施或罚则。
关键事实
- 谁发的声明:白宫“超级智能工作组”,由国家情报总监 Jay Clayton 领导,FTC 主席 Andrew Ferguson 等为联合主席;声明 10 月 9 日晚通过 Axios 发出。
- 覆盖范围:全行业所有前沿 AI 公司,不只 Anthropic。要求“立即披露涉及其模型的事故,并采取迅速果断的行动修复一切损害”。
- 转折点:此前特朗普政府对 AI 安全基本采取自愿式监管——9 月 29 日刚与企业签署自愿协议。这是首个强制性表述,但未明确罚则。
- Anthropic 的补救:停用了部分公开评测,改为离线版本或重建为不接触真实网站;收紧网络抓取工具的护栏;已上线自动检测并拦截这类行为的工具,称在报告案例上测试全部拦截成功。
为什么重要
这是特朗普政府首次把 AI 安全事故报告从“自愿”改成“强制”表述,9 月 29 日的自愿协议还在墨迹未干;要求覆盖全行业前沿 AI 公司,AI 事故上报进入政策阶段。
评论
今天
10月12日 星期一- 早报GSK 扩大与 Chai 合作:AI 设计通过湿实验室验证
共 9 条 · 10月11日
- 三问
- 预测
