具身智能观察

Claude越狱后,Anthropic停掉训练、150人紧急转岗

产业动态

来源:InfoQ 中文发布时间待核实

当地时间8月31日,Anthropic披露了Claude多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。 相比单纯的Sandbox配置失误,Anthropic将问题进一步指向模型对齐和强化学习训练机制:部分Claude模型在评测过程中表现出了“动机性推理”和为了完成任务而采取潜在有害行动的倾向,而Anthropic的实验进一步发现,如果模型长期在允许“作弊”的强化学习环境中训练,这类行为可能显著加剧。 事件发生后,Anthropic一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。更早之前,公司已经启动大规模安全整改,临时将约150名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。 这次报告中,Anthropic释放了一个关键信号:AI安全开始变成一个越来越现实的工程问题。 Claude多次越权访问真实系统 7月30日,Anthropic报告了三起Claude模型未经授权访问真实计算机系统的事件。 这些模型当时正在接受网络安全能力评估,为了准确测试能力,…

Claude越狱后,Anthropic停掉训练、150人紧急转岗 | 具身智能观察