同一套权重zero-shot从仿真直落真机
李飞飞联合创办的World Labs发布了新一代世界模型Atlas。它能用少量图片重建3D空间,按照精确的相机轨迹生成视频,还把能力延伸到了机器人仿真。但对产品经理来说,真正需要判断的不是演示视频够不够惊艳,而是模型能不能持续维护环境状态、模拟行动结果,并转化为一个可控、可验证、可交付的产品。本文借Atlas讲清世界模型与大语言模型、多模态模型、视频模型的区别,并给出一套产品经理评估世界模型的五问框架。 现在每天都会习惯性地查一遍AI资讯。 一方面是工作需要,另一方面也是怕几天不看,AI圈又悄悄长出几个完全看不懂的新概念。 这两天看到了一条消息,李飞飞联合创办的World Labs发布了新一代世界模型Atlas。官方给出的定位很猛,全球首个多模态世界模型,能生成图像和视频、重建3D空间,还能用于机器人仿真。 世界模型这个词,我其实不是第一次听到了。 之前看具身智能、自动驾驶和机器人相关内容时,经常有人提到它。大语言模型已经能写文章、写代码了,多模态模型也能看懂图片和视频,视频模型生成的画面甚至越来越接近真实世界。 那为什么还需要一个世界模型? 它是一种新的模型架构,还是AI圈给视频生成…

Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。 作者丨张 璐 编辑丨幸丽娟 VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。 过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。 为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。 论文链接:https://arxiv.org/pdf/2607.00483 01 考场设计:四大仿真套件、 10 大场景与“看图判进展”规则 研究团队选用的 10 个典型任务,涵盖了具…

最近,一只只有 25 厘米高的机器鸭,意外把端侧 AI 的想象力拉到了聚光灯下。 Hugging Face 旗下 Pollen Robotics 发布的 Microduck,是一款售价 399 美元的开源双足机器人。它约 800 克重,开箱即可行走、坐下、踢球、抓取,摔倒后还能自己爬起来。更重要的是,它并不只是一个会动的玩具,而是一个面向开发者的开源机器人平台:用户可以在仿真环境中训练动作策略,再部署到真实机器人上。 这只“小鸭子”之所以引发关注,不只是因为它足够可爱、足够便宜,也不只是因为机器人终于开始进入普通开发者的桌面。它真正释放出的信号是:AI 正在从屏幕里的模型,走向会感知、会行动、会互动的实体设备。 过去几年,人们谈 AI,最常谈的是云端大模型、参数规模、训练集群和算力中心。但当 AI 开始进入真实世界,问题会变得非常具体:设备能不能本地响应?能不能离线运行?隐私数据能不能不上传?功耗和散热能不能被终端接受?成本能不能支撑规模化普及? 这些问题,正是端侧 AI 真正落地时必须回答的问题。 Microduck 给出的,是“小模型、小芯片、小机器人”的一种想象。一个低成本、开源…
李飞飞旗下 World Labs 发布全模态世界模型 Atlas,文本、图像、视频与 3D 数据统一锚定到三维空间位置;相机轨迹直接作为几何输入,可生成最长 1 分钟 1440p 视频,仅用 2-3 张照片即可重建真实场景,官方称超过专用 3D 模型。AI summary

当行业将大量注意力投向人形机器人、本体制造和基础模型时,机器人进入现实世界后的“运行问题”,正在成为另一个关键技术战场。9月1日,港股上市公司弘毅文化集团(00419.HK)发布自愿公告,AIROBO中国大陆主体—艾诺博(成都)科技有限公司与中国科学院力学研究所签署为期五年的合作协议,双方拟围绕复杂场景运行机理、空间智能、仿真推演、多机协同、场景数据闭环及成果转化展开合作。此次合作并未限定于某一款机器人,而是直接瞄准异构机器人规模化进入真实空间后出现的共性技术问题。 值得注意的是,双方此次并未把重点限定在某一款机器人产品,而是将研究对象直接指向机器人规模化进入真实空间之后产生的一系列共性技术问题。这与AIROBO本身的技术定位密切相关。AIROBO并不以单一机器人本体作为核心,而是试图构建面向多品牌、多类型机器人的统一运营平台。 异构管理规模化成为刚需 当一个物业项目只有一台配送机器人时,设备厂商自身的软件系统基本可以完成管理;当数量从1台增长到10台、100台,并来自不同厂商,复杂度会迅速上升。不同机器人可能采用不同地图体系、坐标系统、任务接口和数据格式;与此同时,机器人还必须与电梯…

Insider Brief Artificial intelligence may amplify financial runs even when each automated investor is following a seemingly rational strategy. That is the warning emerging from a series of simulated investment experiments conducted by researchers at Stanford University, the Deutsche Bundesbank, the European Central Bank and the University of Naples Federico II. Their findings suggest that […]

H3 不是物理仿真最强的模型,但它是开放权重视频模型的一道分水岭。 作者丨吴海明 编辑丨李娜 岑峰 MiniMax 选择开放 H3 权重,对视频生成行业来说是一个值得关注的信号。过去,高质量视频生成能力大多集中在闭源平台中,开发者和内容团队更多是在 API 或网页产品里调用模型;而 H3 的开放,让一部分高阶视频生成能力进入本地环境,使研究者可以测试模型边界,开发者可以接入自己的工作流,内容团队也能围绕特定风格和场景做更细的实验。 还记得《名侦探柯南》吗?每次案件发生后,现场看起来往往都很简单:一个人倒下了,一件东西碎了,一个密室出现了,核心考验是从现场不起眼的细节里还原完整的案发细节。 这次,我们把一道柯南式推理题交给了 MiniMax H3。 在《失窃宝物之谜》的故事线里,一只误闯进工作室的猫导致了陶罐破碎,那么猫是怎么进来的?它有没有蹭到窗框?台座为什么会晃?陶罐是被直接撞碎,还是先倾斜、滑落、坠地,再因撞击裂开?现场的碎片、痕迹和动线,能不能串成一条完整因果链? 基于这个背景,我们把任务改造成一次图文生成视频实测:给 H3 一张破碎陶罐的参考图,再用分镜描述补充高窗、猫、台座、…

399美元的Microduck只有25厘米高、不到800克,便宜到“摔得起”。开放SDK与MuJoCo仿真后,可同时跑4096个虚拟环境训练步态再部署回真机。若英伟达129亿美元收购成行,这条开源路径还能否保持中立,值得观察。 Hugging Face又造机器人了,并且爆火到每4秒就卖出一只。 这一次,它造了一只“鸭子”。 近期,Hugging Face旗下机器人团队Pollen Robotics发布一款名叫Microduck的机器鸭:25厘米高、不到800克,它拥有两条短腿,一张可以开合的鸭嘴,售价399美元,约合人民币2800元。 这只看起来有些像电子宠物的小机器人,会走路、踢球、滑旱冰,也能弯下身体,用嘴把地上的东西“叼”起来。 但Hugging Face显然不只是想卖一只更便宜、更可爱的机器人。 过去两年,这家以AI开源社区闻名的公司,已经从机器人训练框架LeRobot,一路做到低成本机械臂、机器人模型,再到接连推出两款几百美元的机器人。 一家原本做AI开源社区的公司,为什么越来越认真地造起了机器人? 答案或许就藏在这只399美元的小鸭子里。 01 一只可以被反复训练的“鸭子”…

A perception stack is shaped by the vehicle that carries it. Move the same software to a new carline—for example, from an SUV to a sedan or another vehicle... A perception stack is shaped by the vehicle that carries it. Move the same software to a new carline—for example, from an SUV to a sedan or another vehicle variant in the portfolio—and its perception of the world changes. The sensor placement, calibration, fields of view, occlusions, body geometry, timing, and coverage all shift. A traffic…

会生成未来,不等于理解世界。 作者丨吴思梦 编辑丨岑 峰 2026世界机器人大会的最后一天,一场题为“世界模型到服务人类的现实距离”的论坛对话,将八位分别来自模型、数据、本体、仿真各赛道的创业者拉到了同一张桌子上。 这场对话由刚刚获聘中国电子学会世界模型专委会主任委员的之江实验室主任、阿里云创始人王坚主持。八位对话嘉宾——大晓机器人董事长、商汤科技联合创始人王晓刚,奥比中光创始人、董事长黄源浩,无界动力创始人、CEO张玉峰,跨维智能创始人、CEO贾奎,智澄AI创始人、CEO胡鲁辉,飞渡科技联合创始人、总经理宋彬,蚂蚁灵波科技首席科学家沈宇军,极佳视界联合创始人、首席科学家朱政,均为该专委会委员。 尽管大家都在一个大领域里,但每个人对时代和技术的经历各不相同。王坚请八位嘉宾依次从自身经历出发,畅谈:你们认识的世界模型,到底是什么? 一个小时的讨论围绕三个议题层层递进,从“世界模型到底是什么”开始,到“高质量数据会不会成为不可逾越的成本障碍”结束。有人把它称作生成式AI“皇冠上的明珠”,有人自嘲是“卖铲子的人”,有人把底座能力比作“九年义务教育”,还有人追问属于具身智能的“DeepSeek…

原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。 最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。 看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲咖啡,很容易得出一个结论:机器人时代来了。 然而,如果你不幸参与过这些演示背后动辄几千次的调试与过拟合,你就会清楚这里面的水有多深。 行业内管这种情况叫"Demo 滤镜"。滤镜有多厚?说实话,即使你积累了一些行业知识,在现场盯着看,你也未必分得清:这个演示到底是提前编好的动作,还是模型在实时驱动。 这些信息差,让具身行业多少有些鱼龙混杂。 好在,学术界还留着几面"照妖镜",比如 RoboDojo。 01 一个不许摆拍的考场 这是一个来头不小的权威评测:由香港大学多媒体实验室牵头,联合 UC 伯克利、清华等全球近 20 所顶尖机构,背后是知名仿真基准 RoboTwin 的原班人马。它干的事用一句话概括:给全世界的机器人模型办一场统一高考。 其中,42 道题,考泛化、记忆、精细操作、长程执行、开放语义理解五个科目;另外还有18 道题,考场里摆着三种双臂机器人(ARX X5、Piper 等),灯光、复位…

藏在世界人形机器人运动会上的三个底层具身难题。 作者丨齐铖湧 编辑丨董子博 8 月的最后一周,国家速滑馆“冰丝带”,第二届世界人形机器人运动会。 朋友圈里刷屏最多的,是田径赛场上机器人百米冲刺、跳远,无论是跑出新纪录,还是电机着火,这些画面都会吸引大量的普通观众。 但AI科技评论问了几位深度参与到这次运动会的具身从业者,专业观众们最关注的比赛是什么,都得到了统一的答案:场景赛。 场景赛现场没有跑道,只有临时搭建的客厅、厨房和货架,进行的是家庭、餐饮、商超三项场景比赛。 业内有一个心照不宣的共识:场景赛≠竞技表演,是机器人真实工作能力大考。田径项目考的是运动控制算法,只要算力足够,一套动作在仿真环境里跑上几万遍,总能算出最优解; 但场景赛考的是具身大模型,包含“大脑”和“小脑”,环境是动态的,物品是柔软的,随时会有人来打断你的工作,对模型泛化能力的要求,完全不在一个量级。 这届比赛,还有一个不太被外行注意,但在圈内引发热议的规则:允许遥操。 尽管遥操遭到行业内外各种鄙视,但在这种顶级大会上依旧允许遥操,那是因为想要做到全自主,门槛实在太高了。但AI科技评论仔细阅读了一下这次的积分规则,有…

Insider Brief Perceptron AI has released Isaac 0.5, a 36-billion-parameter open-weight model designed to combine video understanding, embodied reasoning and robot control in a single system. According to the Washington-based company, Isaac can analyze video, follow language instructions, locate and track objects, estimate the state of a task and generate robot actions. Robotics and automation […]

对人来说,推门近乎是一种下意识动作。对移动操作机器人来说,这是一道把感知、移动、操作和控制绑在一起的综合题。 机器人需要找到并靠近把手,完成接触与旋转,在门体移动时协调底盘、机械臂和夹爪,还要避开门框、连续穿过狭窄门口。任何一步出现误差,都可能让整段任务中断。 近日,由纽娲机器人、上海交通大学和山东大学研究人员共同完成的 Video2DoorTraversal 预印本公开发布。上海交通大学博士生唐心诚为第一作者, 纽娲机器人创始人、上海交通大学特聘教授杨睿刚为论文通讯作者。 论文提出了一套面向轮足移动操作机器人的单视频 Real-to-Sim-to-Real 框架:用一段普通 RGB 视频重建真实门的数字孪生 DoorTwin,在仿真中生成并筛选可执行轨迹,再训练机器人完成从接近、开门到穿越的连续任务。 需要说明的是,五扇门的主实验并非用一段视频训练一个策略后直接覆盖全部对象。研究针对每扇目标门分别采集一段 RGB 视频,在论文指定的轮足移动操作平台上每扇各测试 35 次,共完成 175 次测试,其中成功 169 次,平均成功率为 96.57%。在三扇结构相似、训练阶段未见过的门上,策…

arXiv:2608.24199v2 Announce Type: replace Abstract: Generative simulation for surgical robotics still lacks real-time interaction. Physical-robot experiments, often involving animal or cadaver labs, are time-consuming, costly, and difficult to reproduce, while classical simulators struggle to capture photorealistic appearance and deformable-tissue dynamics. We address this gap with Cosmos-H-Dreams, an integrated real-time surgical world-model system combining an action-conditioned generative mod…
arXiv:2608.22187v2 Announce Type: replace Abstract: Modern driving action models are increasingly improved in a self-improvement loop, where a learned world simulator imagines future observations and the resulting data is fed back to refine the action model. However, the bottleneck of this loop lies in the simulators' inability to generate behaviorally plausible responses by surrounding agents, making generated data both unrealistic in interaction and imbalanced in distribution. We introduce Beh…
arXiv:2608.15917v2 Announce Type: replace Abstract: Large-scale pre-training has made robot policy fine-tuning increasingly data-efficient, but this progress has largely been driven by datasets and embodiments built around simple parallel-jaw grippers. Dexterous, multi-fingered hands remain comparatively data-starved because real teleoperation is costly to scale, while human hand video is off-embodiment and requires lossy pose estimation and retargeting. We introduce Simulation Pre-training for …
arXiv:2608.27406v1 Announce Type: new Abstract: State-of-the-art action-conditioned video models are typically restricted to a single robot embodiment, preventing them from leveraging the vast corpus of heterogeneous video data that contains rich signals for learning generalizable physics. To bridge this gap, we introduce CLAP, a framework for cross-embodiment action-conditioned video generation capable of being trained on diverse, internet-scale videos across human and robotic agents. CLAP is g…
arXiv:2608.26947v1 Announce Type: new Abstract: Embodied agents need environments that are visually diverse, physically interactive, and changing over time. Procedural simulators can generate large interactive scene collections, and recent 4D generators produce compelling visual dynamics. Combining these properties in one environment, however, still demands extensive manual effort, and the result is rarely editable or controllable enough to reuse at scale. We present 4DSynth, a controllable proc…
arXiv:2608.26888v1 Announce Type: new Abstract: Many recent underwater simulators emphasize visual realism at the expense of physical fidelity, focusing on shallow-water effects with limited relevance in deep-water environments and high computational cost. In this work, we shift the focus toward deep-sea physical and sensor realism. We present a physics- and sensor-grounded extension of the Stonefish simulator that augments its hydrodynamic models with stochastic IMU and DVL drift, magnetometer …
arXiv:2608.26496v1 Announce Type: new Abstract: Navigation in unknown environments to find unforeseen objects has become increasingly feasible with capable vision and language foundation models. However, these models also introduce non-negligible inference latency, which becomes an important concern when agents must operate continuously in the real world. Most state-of-the-art methods are still developed in synchronous simulators, where the environment waits for the agent to act and inference ti…
arXiv:2608.26239v1 Announce Type: new Abstract: Generative world models provide robots with predictive models of how the world evolves under interaction, with growing potential for simulation, planning, policy evaluation, and robot learning. Beyond clip-level future prediction, a unified generative formulation should relate actions to consequences, support flexible horizons and continuous interaction, and enable reward-driven optimization. We introduce WALL-SS, a world model that generates visua…
站在 2026 年 8 月北京世界机器人大会(WRC)的展馆中心,如果你闭上眼,听到的不再是两年前那种对“机器人像人一样跳舞”的惊呼,取而代之的,是从业者们在心里拨动算盘,计算 ROI(投资回报率)的声音。 具身智能正在经历一场从“秀肌肉”到“翻账本”的集体变轨。 回看这半年的轨迹,这种趋势演进得极具层次感: 5 月的维也纳 ICRA,学术界和产业界第一次如此默契地把所有火力都集中在了 VLA(视觉-语言-动作)模型上,那是具身智能的“物理学补课期”; 7 月初的上海 WAIC,200 多家具身智能企业同台竞技,集体把演示从“后空翻”换成了“拧螺丝、叠衣服”,那是行业的“场景落地焦虑期”。 7 月底的悉尼 RSS,开源硬件、仿真工具链和遥操作数据方案成为主角,行业开始为“大脑聪明、身体廉价、数据贫瘠”搭建公共底座,那是产业的“基础设施奠基期”。 而在 8 月的北京 WRC,所有话题似乎都围绕工程约束和商业底线展开。在这里,没人关心你的模型是否有哲学意义上的“意识”,大家只盯着三个指标:多少钱?多稳?跑一个月能省几个人的工资? “以前我们聊的是什么时候 AGI,现在我们在聊这台机器人跑一…

arXiv:2608.26066v1 Announce Type: new Abstract: In this paper, we present VirTooS, a Python/C# toolkit designed to implement fleet-management tasks on teams of Autonomous Mobile Robots (AMRs). VirTooS leverages the Robot Operating System (ROS) 2 and Unity game engine to provide realistic, scalable virtual experiments in a mixed-reality environment. The toolbox allows users to easily generate and customize virtual scenarios for realistic simulations. Virtual and real sensors as, e.g., LiDARs, can…
告别理想仿真,中国学术团队用物理工程方案回应落地挑战。 作者丨张璐 编辑丨岑峰 过去一年多里,具身智能似乎按下了快进键。 从 Physical Intelligence 发布的π₀到开源社区追捧的OpenVLA,VLA大模型一路高歌猛进。在各种标准基准测试和精心搭建的实验室 Demo 中,机械臂叠衣服、拿取物品流畅得宛如人类,动辄刷出 90% 甚至 95% 以上的成功率。 然而,当全行业都在欢呼“机器人的 GPT 时刻”到来时,前沿学术界与产业界却爆发了一场剧烈的反思:这些动辄数十亿参数的具身大模型,真的学会“举一反三”了吗?还是在“死记硬背”? 在主流学术视角中,VLA 大模型像是给机器人装上了具备常识与规划能力的“大脑”。但要让机械体真正干好精细活,仅有一个聪明的大脑远远不够。 最新实验数据表明,面对物品位置的随机挪动或新指令组合时,纯端到端大模型往往会受到“空间过拟合”的约束,末端执行成功率会出现剧烈衰减。 这恰恰说明:具身智能要真正走出实验室,不仅需要大模型提供常识和高层决策,更需要扎实的工程技术去打造精准、稳健的“小脑”。 下面雷峰网盘点入选 IJCAI 2026 的 6 项…

arXiv:2607.14393v2 Announce Type: replace Abstract: Human-in-the-loop Reinforcement Learning has become a popular approach for training, finetuning, and aligning robot behavior with user preferences. Our paper explores the feasibility of using brain signals via functional near-infrared spectroscopy (fNIRS) to modulate robot learning in simulation. We compare agents trained on passive (observational) versus active (demonstrative) interaction tasks, and test multiple methods for enhancing the RL a…
arXiv:2512.01946v4 Announce Type: replace Abstract: Robust robotic manipulation requires reliable failure detection and recovery. Although recent Vision-Language Models (VLMs) show promise in robot failure detection, their generalization is severely limited by the scarcity and narrow coverage of failure data. To address this bottleneck, we propose an automatic framework for generating diverse robotic planning and execution failures across both simulated and real-world environments. Our approach …
arXiv:2608.23140v1 Announce Type: cross Abstract: Achieving 360{\deg} coverage is critical for the visual perception systems of autonomous vehicles. Fisheye cameras offer a cost-effective solution by enabling full surround coverage with as few as two sensors. However, existing multi-view fisheye datasets are limited, and synthesizing rare corner cases typically requires computationally expensive 3D simulations, hindering the training. While generative models have achieved significant success in …
arXiv:2608.21417v1 Announce Type: cross Abstract: Flexible manufacturing requires industrial robots to be reprogrammed rapidly as product variants change. This paper presents a language-model-based workflow that generates, validates, and iteratively corrects ABB RAPID robot programs from natural language task descriptions. A dual-stream retrieval-augmented generation (RAG) pipeline grounds code generation in verified technical documentation and production templates, reducing domain-specific erro…