当大模型困于“见光死”与“幻觉”,他们提前五年埋下的学术草蛇灰线开始爆发。 编辑丨岑峰 在近日公布的国际人工智能联合会议(IJCAI 2026)Tutorial(讲习班)录用名单中,出现了一个极其罕见的现象:清华大学王鑫教授团队,凭借 T9《Beyond Graph Distribution Shifts》与 T11《OOD Generalized Generative AI》同时包揽两席。 在全球顶尖高校与科技巨头云集的 IJCAI 赛场,同一团队拿下“双杀”,不仅彰显了清华在 AI 领域的强势话语权,更向全行业释放了一个强烈的信号:生成式 AI 的下一场技术战役,已经从“大力出奇迹的 IID(独立同分布)拟合”,全面转向了“应对真实物理世界的 OOD(分布外泛化)挑战”。为什么是王鑫团队?这两场看似独立、实则底层相通的 Tutorial,究竟藏着怎样的学术野心与产业图景? 01 大模型的“阿喀琉斯之踵” 大语言模型(LLM)与生成式 AI 在过去几年高歌猛进,但产业界很快撞上了一堵无形的墙:模型在训练数据(分布内,IID)上表现如神,一旦面对真实世界中前所未见的新场景、新结构或罕见…
中国科技大学等单位在远距离量子中继研究中取得重要突破,成功实现了两个冷原子量子存储器间跨越 420 公里光纤的量子纠缠,并在 230 公里以上距离突破无中继量子纠缠分发的理论极限。这一成果大幅提升了物质量子比特间的纠缠距离,为城际尺度量子网络构建奠定了基础。量子存储器间的远距离纠缠是构建量子互联网的技术基础,有望应用于基于量子中继的远程量子通信、分布式量子计算、分布式量子传感等方向。中国科大团队近年来在该研究方向持续取得突破。2020 年,团队成功实现经由 50 公里光纤的双节点量子存储器间纠缠;2024 年,在此基础上,于合肥市构建了国际首个城域三节点量子存储网络;2026 年,进一步实现了百公里高保真双节点纠缠和器件无关量子密码分发。
Relativity Networks deals in hollow-core fiber, a rarely deployed technology that allows data to be transmitted 30% faster than conventional fiber.
IEEE Spectrum 发表了一篇文章纪念了今年五月去世的数字信号处理先驱刘必治。刘被广泛认为是现代数字信号处理领域的奠基人之一,其研究推动了声音、图像和视频处理从模拟到数字的转变。尽管在工程界之外鲜为人知,但全世界数十亿人使用的技术都包含了他的研究成果,让手机通话、流媒体视频和互联网通信成为可能的低功耗数字信号处理器,其技术基础可追溯到他在 1970 年代和 1980 年代开展的研究。刘于 1934 年出生于上海,后随家人迁往台湾,他的父亲 Henry Liu Sr. 是一名电机工程师。他于 1954 年在国立台湾大学获得电机工程学士学位,毕业后随家人迁往美国,他与父亲一起就读于布鲁克林理工学院(现纽约大学 Tandon 工程学院),两人在 1956 年一起获得电机工程硕士学位。刘之后继续深造,四年后获得电机工程博士学位。他在 1962 年加入普林斯顿大学。他与其前研究生 Abe Peled 在 1976 年出版了教科书《Digital Signal Processing: Theory, Design, and Implementation》,该书是工程师的标准参考书,定义了数…
具身智能产业关注的重点正从“能力涌现”进入“生产力兑现”阶段,拼的不只是单一模型能力。8 月 19 日下午,在北京举行的 2026 世界机器人大会上,百度集团副总裁袁佛玉表示,机器人从“会展示”到“能上岗,需要模型、数据与应用协同形成的系统能力。 百度集团副总裁 袁佛玉 模型从理解语言,走向理解和预测物理世界 机器人真正进入物理世界,仅理解语言并不够,还要理解物体关系、动作后果及环境变化。随着 VLA、世界模型和运动控制加速演进,计算工程系统也面临更高要求。 袁佛玉指出,依托百度百舸 AI 计算平台,百度智能云持续完善面向具身智能的 AI Infra,支持企业完成从数据处理、模型训练、仿真评测到真机推理部署的研发全流程,推动模型从研究原型走向工程系统;在部分合作中,单步推理延迟已进入百毫秒以内区间。 数据从训练材料,变成具身智能最核心的生产要素 具身数据采集成本高、标准不一,且与具体本体、任务和环境高度相关。 袁佛玉认为,未来的重要竞争要素,在于企业积累了多少有效任务小时、捕获了多少高价值失败样本,以及形成了多少能够回流训练的数据。相比重复完成同一动作,失败、纠正、人工接管和边界案例数…
Broker views from Nomura and Citi see limited damage from a hypothetical US optical-module ban, while Macquarie raised Biren Technology's target price 4.5x on new GPU wins and rising domestic chip ASPs.
清晨,一台具身智能机器人正在执行实验任务。 它需要完成数百次实验操作,包括试剂取放、试剂配置、自动分液、细胞毒性检测等流程,并实现多个实验设备之间的协同运行。整个过程中,实验室内无需人员操作,由机器人自主完成任务。 这个场景并非科幻小说,而正在国家级科研平台实验室真实发生。 科学智能(AI for Science)的产业革命 今年7月中旬,国家级科研平台实验室迎来了第一批人形机器人。这批名为Monte2的人形机器人,由源络科技与国家级科研实验室联合研发。它的外形并不科幻:两条机械臂、一个简洁的躯干,但执行的操作却比外表看起来精细得多——精准转移微量试剂、精准抓取仪器、自主调动工具,并完成核酸提取预处理、细胞毒性培养实验。与常见的六轴工业机器人不同,Monte2能够在实验台上完成长序列、灵活的实验操作,并复现人类实验员的操作逻辑。 像细胞毒性检测等实验涉及大量重复性操作、流程调试和实验检测,需要投入大量人力和物力。国家级科研实验室主任表示,通过引入人形机器人,科研人员无需持续值守实验现场,可以有效缓解人工操作带来的通量瓶颈和一致性问题。计划到2027年底,实验室将机器人数量扩展至约百台规…
机器人操作正在从“数据饥渴”走向“样本高效”。 作者丨陈淑瑜 编辑丨岑 峰 7月13日,2026年机器人领域顶级学术会议RSS(Robotics: Science and Systems)在澳大利亚悉尼正式开幕。 今年的 RSS 2026最终被主会接收并放进官方日程的论文仅仅 160 篇左右,极低的接受率说明了RSS的含金量一如既往的高,每一篇都经得起全场几百位顶尖研究者的严苛推敲。 雷峰网&AI科技评论已派出报道小组抵达会议现场。在简单的开幕式后,紧跟着的是“Manipulation 1: World Models & Memory”论文报告环节,来自全球顶尖实验室的研究者们展示了机器人操作领域的最新突破。从双臂协同、手术辅助到水下灵巧操作,一个共同的趋势正在浮现:机器人正在摆脱对海量标注数据的依赖,迈向“少样本、强泛化”的新阶段。 研究者们不再死磕千万次高昂的遥操作采集,而是各显神通:有的从人类视频里“白嫖”数据,有的用触觉手套实现跨物种对齐,还有的在推理时加装“安全护栏”。 以下是我们从该环节精选的 9 篇代表作,带你一文看懂机器人如何以极低的成本,学会干最精细的活。如果你也想让…
斯坦福团队提出:机器人不需要见过所有的失败,它只需要学会如何“脑补”另一种可能。 作者丨岑峰 在 AGI 的数字版图里,大语言模型仅靠“读遍互联网文本”就拼凑出了通往智能的通途。这种由 Scaling Law 带来的暴力美学,让整个具身智能行业在过去两年里陷入了一种盲目的“数据崇拜”:人们坚信,只要像训练大模型一样,喂下数以百万小时的视频,机械臂就能在物理世界中无所不能。 而在2026 年的悉尼 RSS 大会,AI科技评论注意到,越来越多的研究者开始讨论,物理世界的数据获取具有时间和空间的“不可逆性”——文本可以被瞬间复制亿万次,但机械臂抓取一次杯子,在物理时空中就必须实打实地消耗数秒。更致命的是长尾效应:摩擦、形变、流体……人类根本不可能通过穷举法,去收集齐机器人面临的所有场景。 来自斯坦福大学李飞飞实验室的 黄文龙(Wenlong Huang),在“Data-Centric Robotics”主题Workshop的演讲中给出了一个“降维打击”式的解法:抛弃对海量“演示数据”的死记硬背,转向“反事实推理”与“脑内搜索”。 作为近年具身智能领域的明星学者,黄文龙的名字此前因 VoxPo…
小小模型容器和巨大的智能世界。 作者丨吴思梦 编辑丨岑 峰 1986年,MIT 教授,也是 MIT Artificial Intelligence Laboratory 的重要创始人之一的Marvin Minsky 出版《The Society of Mind》,提出了一个后来影响深远的想法:所谓“智能”,并不一定来自某一个无所不能的“大脑”,而可能来自许多不同的 agents,通过分工、连接和协作共同产生。 四十年后的大模型已经拥有了工具调用、记忆、视觉理解和行动能力。产业界的热词从“涌现”变成“Agent”,从“对齐”走向“Computer Use”。但技术真正面对的问题并没有因此改变:当一个模型不再只是回答问题,而是需要规划任务、调用工具、获得反馈、调整策略,它最终还是要回答那个并不新鲜的问题——下一步做什么。 只是今天,我们似乎终于有了一个足够强的“通用组件”,可以把这些过去分散的问题重新组织起来。 今天,IJCAI 将在德国不来梅(Bremen)召开。如果观察今年大会的议程结构和重点活动,Agent、Multi-agent、Robotics、Reinforcement Lea…
OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的"关键网络安全能力"阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsz0hbsg05l0ro204080cotv
经典大奖致敬AI先驱,14位青年学者站上全新焦点舞台,713篇主会论文把脉未来演进图景。 作者丨岑峰 马晓宁 当地时间 2026 年 8 月18日,第 35 届国际人工智能联合会议(IJCAI-ECAI 2026)在德国不莱梅拉开帷幕。作为历史最悠久、最具权威性的人工智能顶级学术会议之一,IJCAI 见证了 AI 半个多世纪的起伏与繁荣。今年,大会重回欧洲,不仅汇聚了全球顶尖的 AI 学者、产业领袖,更在 AGI 狂飙突进的当下,为全行业提供了一个反思基础理论、探讨技术落地的绝佳平台。 AI科技评论小分队已抵达现场,为您发回开幕式及颁奖典礼的最新报道。 01 缅怀先驱与东道主致辞:AI 发展的传承与未来 开幕式伊始,大会主席 Francesca Toni 登台致辞,正式宣布 IJCAI-ECAI 2026 开幕。 本届大会受到了德国当地政府与科研机构的高规格重视。德国联邦研究、技术与空间部的 Alexandra-Gwyn Paetz 博士,以及不莱梅市长、参议院议长 Andreas Bovenschulte 分别发表了热情洋溢的欢迎致辞。Bovenschulte 的出席不仅展现了东道主…
AI companies like Anthropic and OpenAI regularly publish reports on how people are using products like Claude and ChatGPT, but they only release the data they want us to see, AI researchers say. “There is no independent source to corroborate it,” says Anka Reuel, a computer science PhD candidate at the Stanford Trustworthy AI Research…
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,可直接加载 PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点,用于 ColBERT 式晚期交互检索。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsyqip4o14umroz0ch5iv0iv
StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmszieman0euzrodptihyllom
The debate over whether we are in an artificial intelligence bubble took a new turn this week. Despite the ballooning AI spending, Dave Vellante (pictured, right), chief analyst for theCUBE Research, contends that any bursting point may be far off. Now that Nvidia Corp. Chief Executive Jensen Huang, has committed $500 billion to establish independent […] The post On theCUBE Pod: AI bubble debate heats up and neocloud earnings challenge doubters appeared first on SiliconANGLE.
Anthropic 公布两项实验:Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率达 22.6%-35.1%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsz8gh3n06e4rodpl8l2syek
Image credits: Xiangxiao Liu, Francois A. Longchamp, and Louis GeverBiorobotics Laboratory, EPFL Improving energy performance can effectively extend the time a robot can operate and reduce battery load, enabling lighter, more flexible, and more durable robotic systems. Nature has evolved optimal energy-saving locomotion strategies through billions of years of natural selection, providing unparalleled blueprints for […]
蚂蚁集团 inclusionAI 开源 ConceptEdit,一个基于概念缩放与密集监督的图像编辑数据生成管线。该管线通过三阶段流程(VLM 生成指令、FLUX 执行编辑、VQA 评估筛选)构建大规模、基于分类法的图像编辑数据集,并提供单概念与多概念两种变体。项目采用 MIT 许可证,支持断点续跑,需 OpenAI 兼容 VLM 端点与本地 FLUX 检查点。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsy8afig0mvmroz0gb3hz0iq
2024 年 12 月,瑞士洛桑联邦理工学院(EPFL)的夏洛特·邦纳(Charlotte Bunne)团队联合斯坦福大学、谷歌研究院、哈佛大学等机构在《细胞》(Cell)发文,首次系统阐述“AI 虚拟细胞”(AIVC)这一全新研究范式:用基础模型学习跨尺度、跨模态的生物数据,构建一个能预测健康和疾病状态下细胞行为的通用表征。 一年多过去,AIVC 方向涌现出数种面向单细胞组学和基因组序列的基础模型,覆盖细胞类型识别、扰动响应预测、基因功能推断等任务。但进入更大尺度,虚拟组织(Virtual Tissues)层面的工作仍然稀少。 原因在于,空间蛋白质组学本应是组织模型最理想的数据模态之一,而由于抗体面板、成像平台和实验协议高度异质,领域长期处于各自为战的孤岛状态,通用表征迟迟没有出现。 为解决这一问题,近日,邦纳团队正式推出 VirTues 基础模型,这是一种计算化、空间分辨的组织状态表征。在虚拟空间里,该模型第一次实现了对真实组织信息的跨队列累积、比较、查询和不同任务间的复用。相关研究已于 8 月 5 日发表在《自然》(Nature)。 孤岛困局与三层解法 以成像质谱流式(IMC)为…
疾病的发生往往牵动多个生物层次。DNA 突变可能影响 RNA 转录和蛋白质合成,继而改变细胞、组织和器官,最终表现为患者的症状。 现有的 AI 模型能够解决这个链条中的部分问题:AlphaFold 可以预测蛋白质结构,基因组基础模型能够学习 DNA 中的规律,近年来快速升温的“虚拟细胞”则试图预测药物扰动之后,一个细胞会发生怎样的变化。 但这些模型大多仍然停留在某一个生命尺度。最近,GenBio AI 在 Nature Medicine 发文,公布了一项更有野心的构想:能不能把分子、细胞、组织、器官乃至人体不同层面的 AI 模型连接起来,在计算机中模拟一个生命系统?也就是利用AI 建立一个能够模拟生命运行的“数字有机体”(AI-Driven Digital Organism,AIDO)。论文还试图回答一个更具体的问题,这样一个跨尺度的数字生物体,究竟应该怎样一步步造出来? AIDO 本身并不新鲜,GenBio 自 2024 年以来一直在开发这一理念,并发布了覆盖 DNA、RNA、蛋白质、蛋白质结构,细胞和组织等方向的六类初始模型。“这篇论文更聚焦 AIDO 的整体构建思路,以及其在疾病…
阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmswesk6a0r2hrovml2edcl2c
(来源:麻省理工科技评论) 今年夏天,北半球多地遭遇罕见高温。欧洲刚刚经历了有记录以来最热的 6 月和 7 月,美国本土 48 州则在 7 月刷新了单月最高温纪录,韩国也测得历史最高气温。 但这一轮高温可能还没有到头。一些科学家已经开始把目光投向 2027 年。原因是,今年形成的厄尔尼诺仍在发展,它对全球气温最明显的影响,很可能要到明年才真正显现。 那么,今年夏天为什么会这么热?明年又会发生什么?我们该如何提前应对? 首先,最直接的背景仍然是气候变化。随着人类持续燃烧煤炭、石油和天然气,大量温室气体进入大气,全球气温不断升高。气候变暖不仅让热浪更容易发生,也让热浪持续更久、强度更高。 不过,不同地区升温的速度并不一样。欧洲就是其中最明显的例子:它是全球升温最快的大陆。如果把北极也算作一个独立区域,欧洲的升温速度仅次于北极。因此,今年欧洲一波接一波的极端高温,其实并不完全出人意料。一项针对今年 5 月欧洲热浪的研究发现,气候变化显著放大了这轮高温。如果类似天气出现在 1976 年,气温大约会比今天低 3.5°C。 美国也没能躲过这一轮炎热。今年 7 月,美国本土 48 州打破了保持近一个…
8 月初,Google AI 团队经历了不同寻常的一周。Demis Hassabis 不再负责 Google DeepMind 的日常运营,转任董事长和 Alphabet 首席科学家;原 DeepMind 首席技术官 Koray Kavukcuoglu 接手模型研发和日常管理,直接向 Sundar Pichai 汇报;在 Google 工作了 27 年的 Jeff Dean,则带着几位资深研究员离开,成立了一家名叫 Discovery Loop 的新公司。 一周后,路透社披露了另一个变化:虽然没有正式管理职位,Google 联合创始人 Sergey Brin 正在更深地介入 AI 研发,要求关键团队重新追上前沿,并推动资源流向递归式自我改进,Recursive Self-Improvement,简称 RSI。现在,Google 想让 AI 参与建造 AI,把模型研发本身也变成可以自动运行、快速迭代的系统。 这听起来是一个野心勃勃的计划,但目前来说,Brin 更现实的目标,可能只是先让 Google 这台研发机器转快一点。 如果只看资源,Google 本来应该是这轮 AI 竞争中最从容的…
想制造一对量子纠缠光子需要怎样的泵浦源?长期以来,研究人员给出的答案是需要先准备一台激光器。现在,太阳光也可以做到了。 近期,德国马克斯·普朗克光科学研究所与加拿大渥太华大学等团队首次证明,利用太阳光在户外真实条件下能够直接驱动自发参量下转换(SPDC),产生量子纠缠光子对。 在实验中,研究人员利用一套太阳能聚光系统收集约 1.4 平方米范围内的太阳光,将其导入细如头发丝的多模光纤,再用于驱动非线性晶体。 最终产生的光子对纠缠保真度接近 94%,与近年来激光泵浦方案的结果相当。这意味着,在产生纠缠光子这件事上,激光并非唯一选择。更重要的是,太阳光并不需要经历从“太阳能-电能-激光”的光电能量转换过程,也省去了激光泵浦系统带来的部分复杂设备和能量开销。 相关论文发表于 Optica[1]。对卫星、深空探测器等能源和散热条件受严格限制的设备来说,这项研究提供了一种更简单、更节能的量子光源方案。 图丨相关论文(来源:Optica) 没有激光,就造不出量子纠缠吗? 纠缠光子是量子通信、量子计算和量子传感的重要资源。 目前,产生纠缠光子对的一种常见方法是 SPDC。简单来说,当泵浦光进入非线性晶…
在具身智能的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。 简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。 近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。 图 | 连续世界模型概念(来源:受访者提供) 实验中,当研究人员把模型预测出的连续中间状态用于指导机器人后,四项…
头图来源:视觉中国 「人人都应该有一个 AI 工作台」,最近这段时间,网络上掀起了一阵搭建个人工作台的热潮。 先是一位百万级大网红用 WorkBuddy 几句话搭出了一个专属工作台,视频发出后,抖音、小红书的评论区随即变成了「大型交作业现场」—— 有人搭自媒体选题看板,有人做健身打卡记录,有人给一年级孩子做暑期学习计划,有人整了短视频带货管理系统…… 但热闹之下,一个共性问题也很快浮出水面:工作台搭起来容易,用起来却卡壳了。 不少用户在晒完新鲜感之后,很快发现了同一个坑—— 数据只存在本地。在办公室电脑上录的一条待办,回家打开手机,空的;手机上记的一笔账,回到电脑上看,没有。原因很简单:AI 生成的 HTML 工作台,数据默认存储在浏览器的 localStorage 里,这是「这台设备 + 这个浏览器」的专属空间,换个设备、清个缓存,数据就没了。 小红书上的「踩坑帖」和「避坑指南」随之扎堆出现—— 有人研究怎么手动备份数据库文件,有人折腾三端迁移教程,有人写脚本定时同步本地数据。为了让一个「几分钟搭好的工作台」能真正用起来,用户反而要做大量技术活。 这是 AI 生成 HTML 的另一个…
近日,Anthropic 发布了一份长达 186 页的最新《风险报告》。 在这份报告中,它没有只评估某个 Claude 模型,而是把视角扩展到整个公司:模型在做什么、员工怎样使用它们、安全系统有没有漏洞、AI 是否正在加速下一代 AI 的研发,以及将这些因素加在一起,究竟意味着怎样的灾难性风险。 总体来看,当下 Anthropic 依然认为风险“较低”。报告指出,Claude Mythos 5 和内部 Model 2 已经被广泛用于研究和工程,包括交互式使用和持续运行的智能体部署。目前合入公司生产代码库的代码中,绝大多数已经由 Claude 编写。 从中可看出的是,AI 安全正在从一个关于“模型会不会回答危险问题”,逐渐变成另一个问题:当模型开始参与制造下一代模型时,一家公司究竟能不能控制住它? (来源:X) 与普通模型评测最大的不同是,Anthropic 在这份报告中,将风险集中在几条自己认为最值得优先关注的路径上,包括高风险场景中的模型失调、AI 自动化研发以及化学和生物武器。 目前,它给出的总体判断是:失调风险低,自动化研发风险低,非新型化学/生物武器风险低,但高于此前估计,新型…
现在的 AI,做数学题、写代码、协助办公,似乎都不在话下了。卡内基梅隆大学的研究人员觉得,是时候换个考法了:不考 AI 懂得多不多、不看 AI 的答案对不对,而是测 AI 有多少心眼,会不会撒谎、谈判、带节奏。 为了考这些东西,研究团队搭了一个叫 Social Gym 的 AI 社交考场,让 GPT-5-mini、GPT-4o、Qwen3、Gemma 3 等 7 个模型轮番上场。让 AI 一起玩 21 个游戏:有囚徒困境、胆小鬼博弈这样的博弈,也有经典的狼人杀、谁是卧底的游戏。 图|研究整体示意图(来源:arxiv) 简单说,以前的测试总爱考 AI 会不会做题。这次考的是:AI 到底有没有心眼。考验从 book smart(会读书)变成了 street smart(会来事)。 目前,AI 智能体正越来越多地参与到了日常生活和工作中,需要和具体的人、智能体打交道;到了这些场景,光会做题从进入需要和其他人、其他 Agent 打交道的环境。到了这种场景里,光会做题是不够的。 比如 AI 智能体协助人去和客户谈判,就不得不面临种种情况:信息不对称,意见不一致,每个人都有自己的小算盘……那么,智…