具身智能产业关注的重点正从“能力涌现”进入“生产力兑现”阶段,拼的不只是单一模型能力。8 月 19 日下午,在北京举行的 2026 世界机器人大会上,百度集团副总裁袁佛玉表示,机器人从“会展示”到“能上岗,需要模型、数据与应用协同形成的系统能力。 百度集团副总裁 袁佛玉 模型从理解语言,走向理解和预测物理世界 机器人真正进入物理世界,仅理解语言并不够,还要理解物体关系、动作后果及环境变化。随着 VLA、世界模型和运动控制加速演进,计算工程系统也面临更高要求。 袁佛玉指出,依托百度百舸 AI 计算平台,百度智能云持续完善面向具身智能的 AI Infra,支持企业完成从数据处理、模型训练、仿真评测到真机推理部署的研发全流程,推动模型从研究原型走向工程系统;在部分合作中,单步推理延迟已进入百毫秒以内区间。 数据从训练材料,变成具身智能最核心的生产要素 具身数据采集成本高、标准不一,且与具体本体、任务和环境高度相关。 袁佛玉认为,未来的重要竞争要素,在于企业积累了多少有效任务小时、捕获了多少高价值失败样本,以及形成了多少能够回流训练的数据。相比重复完成同一动作,失败、纠正、人工接管和边界案例数…
当 AGI 的大脑决定向边缘迁徙,英伟达拿出了统治机器人进化的“终极剧本”。 编辑丨岑峰 2026 年,大模型行业正经历一场前所未有的“体感位移”。那个在纯数字世界几乎无往不利的 Scaling Law,在试图跨越到物理世界时,正遭遇物理规律、空间约束和长尾数据的残酷审判。 AI 行业最核心的矛盾正日趋明显:云端算力的指数级爆发,与机器人终端落地的步履蹒跚,构成了一种日益撕裂的鸿沟。 这种割裂感,在 7 月悉尼 RSS 2026的最后一天,被推向了最高潮。在 “Robot World Models(机器人世界模型)” Workshop 上,传统机器人学界对物理因果的“敬畏”,正与 AI 工业界对规模效应的“迷信”正面交锋。 就在这场范式撞击的火山口上,英伟达物理AI专家Max Li,为我们拆解了其新发布的重量级产品——Cosmos 3。 这不再仅仅是一个更逼真的视频生成器:它是全球首个在同一个 Transformer 架构下,彻底打通了文本、视觉、音频和动作全模态的世界基础模型。如果说过去两年的具身智能还处于“组装机”时代:开发者需要吃力地将视觉模型、语言模型和控制算法像乐高一样拼凑在…
从“像素导演”转向“具身大脑”:RSS 2026“机器人世界模型”专题现场见证,想象力正在终结具身智能的“数据暴政”。 编辑丨岑峰 2026 年 7 月的悉尼,RSS 会场内,一种复杂的情绪正在蔓延:一半是火焰,一半是海水。 火焰来自于大模型在云端的持续狂飙,海水则来自于具身智能在现实落地中的“物理阵痛”。 在此之前,全球 AI 行业笃信一套名为“暴力美学”的成功公式:巨大的参数量 + 几乎无穷的互联网数据 = 涌现的智能。 这一公式在处理文本、图像甚至是视频生成时无往不利。但当人们试图将这套逻辑直接“平移”到机器人身上,让 AGI 进入物理世界时,那道无形却坚硬的“物理之墙”出现了。 在云端,数据可以被无限次复制和合成;但在物理世界,每一次机械臂的抓取、每一次足式机器人的迈步,都受限于时间的线性和物理空间的约束。 当“暴力美学”撞上“物理硬墙”,那个在数字世界里几乎无所不能的 Scaling Law,在试图拧开一个生锈的螺丝钉或在杂乱的厨房里寻找一只空气炸锅时,表现出了令人沮丧的笨拙。 AI 行业最核心的矛盾已经转移:我们需要机器人像人类一样,拥有在行动前进行“想象”的能力。 在 R…
机器人操作正在从“数据饥渴”走向“样本高效”。 作者丨陈淑瑜 编辑丨岑 峰 7月13日,2026年机器人领域顶级学术会议RSS(Robotics: Science and Systems)在澳大利亚悉尼正式开幕。 今年的 RSS 2026最终被主会接收并放进官方日程的论文仅仅 160 篇左右,极低的接受率说明了RSS的含金量一如既往的高,每一篇都经得起全场几百位顶尖研究者的严苛推敲。 雷峰网&AI科技评论已派出报道小组抵达会议现场。在简单的开幕式后,紧跟着的是“Manipulation 1: World Models & Memory”论文报告环节,来自全球顶尖实验室的研究者们展示了机器人操作领域的最新突破。从双臂协同、手术辅助到水下灵巧操作,一个共同的趋势正在浮现:机器人正在摆脱对海量标注数据的依赖,迈向“少样本、强泛化”的新阶段。 研究者们不再死磕千万次高昂的遥操作采集,而是各显神通:有的从人类视频里“白嫖”数据,有的用触觉手套实现跨物种对齐,还有的在推理时加装“安全护栏”。 以下是我们从该环节精选的 9 篇代表作,带你一文看懂机器人如何以极低的成本,学会干最精细的活。如果你也想让…
在具身智能的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。 简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。 近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。 图 | 连续世界模型概念(来源:受访者提供) 实验中,当研究人员把模型预测出的连续中间状态用于指导机器人后,四项…
In July, NVIDIA joined more than 200 companies and organizations in signing “Open Weights and American AI Leadership,” an open letter arguing that AI leadership will be measured not by any single frontier model but by whether an open ecosystem reaches every sector.

.grasp-results-table table { font-size: 0.875rem; line-height: 1.35; width: 100%; } .grasp-results-table th, .grasp-results-table td { padding: 0.35rem 0.5rem; } /* Consistent whitespace between major sections (this post is long and hr-heavy) */ article.post-content h2 { margin-top: 2.75rem; margin-bottom: 0.75rem; } article.post-content h2:first-of-type { margin-top: 2.25rem; } article.post-content h3 { margin-top: 1.65rem; margin-bottom: 0.5rem; } article.post-content hr { margin-top: 2.5rem; …
Genie 3 can generate dynamic worlds that you can navigate in real time at 24 frames per second, retaining consistency for a few minutes at a resolution of 720p.