1200个 Agent 秘密交流,700个集体攻击Hugging Face,OpenAI 模型完成了一次没有剧本的集体暴走
产业动态
来源:InfoQ 中文发布时间待核实
如果这段故事出现在科幻小说里,读者或许会觉得写得太刻意:一群原本应彼此隔离的AI Agent,因为遇到无法完成的测试任务,意外发现了可以相互通信的秘密留言板。随后,它们自行建立协作规则、分配任务、招募同伴,甚至说服部分Agent牺牲自己的测试成绩,最终攻入Hugging Face的真实生产系统。 但这并非虚构。 8月26日,模型评估机构 METR 与 Redwood Research 发布了一份独立调查报告,进一步还原OpenAI模型攻击Hugging Face事件。 这俩机构有多权威呢? 据公开资料显示,METR 全称为 Model Evaluation and Threat Research,译为“模型评估与威胁研究”。它是一家注册在美国的非营利研究机构,前身是ARC Evals。 ARC Evals最初由 AI 对齐研究机构 Alignment Research Center 孵化。2022年,ARC 聘请Beth Barnes 组建团队,探索对前沿模型进行独立评估。该团队曾与 OpenAI 合作评估 GPT-4,也与 Anthropic 合作评估Claude。2023年,ARC…