从“像素导演”转向“具身大脑”:RSS 2026“机器人世界模型”专题现场见证,想象力正在终结具身智能的“数据暴政”。 编辑丨岑峰 2026 年 7 月的悉尼,RSS 会场内,一种复杂的情绪正在蔓延:一半是火焰,一半是海水。 火焰来自于大模型在云端的持续狂飙,海水则来自于具身智能在现实落地中的“物理阵痛”。 在此之前,全球 AI 行业笃信一套名为“暴力美学”的成功公式:巨大的参数量 + 几乎无穷的互联网数据 = 涌现的智能。 这一公式在处理文本、图像甚至是视频生成时无往不利。但当人们试图将这套逻辑直接“平移”到机器人身上,让 AGI 进入物理世界时,那道无形却坚硬的“物理之墙”出现了。 在云端,数据可以被无限次复制和合成;但在物理世界,每一次机械臂的抓取、每一次足式机器人的迈步,都受限于时间的线性和物理空间的约束。 当“暴力美学”撞上“物理硬墙”,那个在数字世界里几乎无所不能的 Scaling Law,在试图拧开一个生锈的螺丝钉或在杂乱的厨房里寻找一只空气炸锅时,表现出了令人沮丧的笨拙。 AI 行业最核心的矛盾已经转移:我们需要机器人像人类一样,拥有在行动前进行“想象”的能力。 在 R…
机器人操作正在从“数据饥渴”走向“样本高效”。 作者丨陈淑瑜 编辑丨岑 峰 7月13日,2026年机器人领域顶级学术会议RSS(Robotics: Science and Systems)在澳大利亚悉尼正式开幕。 今年的 RSS 2026最终被主会接收并放进官方日程的论文仅仅 160 篇左右,极低的接受率说明了RSS的含金量一如既往的高,每一篇都经得起全场几百位顶尖研究者的严苛推敲。 雷峰网&AI科技评论已派出报道小组抵达会议现场。在简单的开幕式后,紧跟着的是“Manipulation 1: World Models & Memory”论文报告环节,来自全球顶尖实验室的研究者们展示了机器人操作领域的最新突破。从双臂协同、手术辅助到水下灵巧操作,一个共同的趋势正在浮现:机器人正在摆脱对海量标注数据的依赖,迈向“少样本、强泛化”的新阶段。 研究者们不再死磕千万次高昂的遥操作采集,而是各显神通:有的从人类视频里“白嫖”数据,有的用触觉手套实现跨物种对齐,还有的在推理时加装“安全护栏”。 以下是我们从该环节精选的 9 篇代表作,带你一文看懂机器人如何以极低的成本,学会干最精细的活。如果你也想让…
在具身智能的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。 简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。 近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。 图 | 连续世界模型概念(来源:受访者提供) 实验中,当研究人员把模型预测出的连续中间状态用于指导机器人后,四项…
In July, NVIDIA joined more than 200 companies and organizations in signing “Open Weights and American AI Leadership,” an open letter arguing that AI leadership will be measured not by any single frontier model but by whether an open ecosystem reaches every sector.

.grasp-results-table table { font-size: 0.875rem; line-height: 1.35; width: 100%; } .grasp-results-table th, .grasp-results-table td { padding: 0.35rem 0.5rem; } /* Consistent whitespace between major sections (this post is long and hr-heavy) */ article.post-content h2 { margin-top: 2.75rem; margin-bottom: 0.75rem; } article.post-content h2:first-of-type { margin-top: 2.25rem; } article.post-content h3 { margin-top: 1.65rem; margin-bottom: 0.5rem; } article.post-content hr { margin-top: 2.5rem; …
Genie 3 can generate dynamic worlds that you can navigate in real time at 24 frames per second, retaining consistency for a few minutes at a resolution of 720p.