过去三年,大模型的快速进步,首先发生在数字世界。文本、图片、代码、视频都可以被转化为数据,模型通过海量预训练学习其中的规律,再完成理解、推理和生成。 但数字世界能够覆盖的任务和场景终究有限。AI 如果要进一步扩大产业价值,就需要从信息处理走向真实世界,开始理解环境,并与物理世界发生交互。 如果把这一轮 AI 浪潮分成两个阶段,上半场争的是模型,下半场的竞争则正在越来越多地转向物理 AI 的落地。 在今年规模最大的消费电子与未来科技展会 IFA 上,雷峰网也清晰地感受到:人工智能正在从生成内容、解决数字任务,进一步走进物理世界。展会专门设置了“World of AI & Future of Tech”议程,集中展示机器人、AI 穿戴与智能家居的最新进展,参展的人形机器人规模也是历届之最。看得出来,各家企业都不想错失物理 AI 这个移动互联网之后最具想象力的产业机会。 而作为全球首个实现“人车家全生态”物理 AI 落地的科技公司,小米今年在 IFA 上意料之内的受到了海外消费者的广泛关注。 众所周知,物理 AI 的门槛远高于数字世界的模型应用,且链路极长,涵盖芯片、模型、操作系统、终端、制…

星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL
AI Agent要走出电脑,不仅需要一个更聪明的大脑,还得面对几十年工业系统留下的接口。现在,大模型公司与自动化行业开始从两端向同一层靠近。

8 月 19 日,北京亦庄的空气里飘着一种奇怪的兴奋,这是 2026 世界机器人大会开幕的日子。300 多家企业、2000 多件展品,几乎把具身智能行业能拿出的东西都搬到了这里:大模型、本体、关键零部件、数据,应有尽有。 开幕当天,宇树科技敲钟上市,盘中市值一度冲破 4000 亿元,这可能是过去十年,中国机器人行业最接近「资本狂欢」的一天。过去,机器人公司更多活在实验室、融资新闻和 Demo 视频里;而宇树的上市,第一次给这个仍处在早期的赛道钉下了一个资本锚点。 除此之外,云深处科技进入交易所受理或审核环节;智元机器人则于 2026 年 7 月确认启动赴港上市流程。一级市场的热,正在向二级市场传导,具身智能不再只是技术想象,也开始被要求回答收入、交付、毛利和规模化的问题。 逛完整个展区,跟我们此前预料的一样,今年没有让所有人「哇」的时刻,更多的是 demo 的展示。宇树没有展示刚刚发布的、原地跳高 2 米、奔跑速度 12.66 米/秒的「超人」,展台上更多是已有产品在解锁新动作;众擎把八角笼搬进了会场,维他动力用二次元偶像的方式整活……热闹是真热闹,但很少有人再讲「颠覆性突破」这四个字…

S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。 作者丨张 璐 编辑丨幸丽娟 过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。 很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。 华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。 他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数…

Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。 作者丨张 璐 编辑丨幸丽娟 VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。 过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。 为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。 论文链接:https://arxiv.org/pdf/2607.00483 01 考场设计:四大仿真套件、 10 大场景与“看图判进展”规则 研究团队选用的 10 个典型任务,涵盖了具…

给模型做一次脑部“CT”,低成本重塑真实空间智能。 作者丨张 璐 编辑丨幸丽娟 先来看一道简单的多模态大模型视觉考题: 观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么? A. 单人沙发以及旁边的一张小桌子 B. 摆着微波炉的桌子 C. 小厨房 D. 蓝色垃圾桶 Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。 按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。 但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。 研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“…

2026年9月4日至8日,全球领先的具身智能公司魔法原子(MagicLab)将亮相IFA2026,完整呈现其"本体硬件、物理AI大脑、场景交付"三层全链路闭环能力,同时面向欧洲企业级市场战略聚焦柔性搬运与物流分拣两大高价值工业场景,展示其作为“端到端工业级具身智能解决方案提供商”的全球化竞争力。 在现场,专业观众与行业买家将有机会近距离观摩MagicBot D1与HyperBot的多机协同调度,并亲身体验Magic-VLA K02大模型的零样本泛化与抗干扰能力。此外,现场还将设置商务洽谈专区,供全球合作伙伴深入了解魔法原子的渠道政策与本地化售后支持体系。 新品亮相——三款新品登陆欧洲,本体矩阵覆盖全场景作业 魔法原子此次将带来三款2026年全新发布的机器人产品,构成覆盖“技术摸高—工业主力—轻量部署”的完整硬件梯队。 MagicBot X1作为旗舰级高动态全尺寸人形机器人,负责技术摸高、代表本体能力上限。相较于魔法原子上一代全尺寸通用人形机器人MagicBot Gen1,X1自研关节模组全线升级,膝关节峰值扭矩350N·m以上、极限扭矩最高450N·m,关键关节运动范围提升超50%;钛…

最近,一只只有 25 厘米高的机器鸭,意外把端侧 AI 的想象力拉到了聚光灯下。 Hugging Face 旗下 Pollen Robotics 发布的 Microduck,是一款售价 399 美元的开源双足机器人。它约 800 克重,开箱即可行走、坐下、踢球、抓取,摔倒后还能自己爬起来。更重要的是,它并不只是一个会动的玩具,而是一个面向开发者的开源机器人平台:用户可以在仿真环境中训练动作策略,再部署到真实机器人上。 这只“小鸭子”之所以引发关注,不只是因为它足够可爱、足够便宜,也不只是因为机器人终于开始进入普通开发者的桌面。它真正释放出的信号是:AI 正在从屏幕里的模型,走向会感知、会行动、会互动的实体设备。 过去几年,人们谈 AI,最常谈的是云端大模型、参数规模、训练集群和算力中心。但当 AI 开始进入真实世界,问题会变得非常具体:设备能不能本地响应?能不能离线运行?隐私数据能不能不上传?功耗和散热能不能被终端接受?成本能不能支撑规模化普及? 这些问题,正是端侧 AI 真正落地时必须回答的问题。 Microduck 给出的,是“小模型、小芯片、小机器人”的一种想象。一个低成本、开源…
端侧大模型推理35–40W、流畅控制需200W+,电池越重越费电,人形机器人卡死在"能用-重量-散热"的物理内环。工厂平面工位,可拆掉双足;换个环境,腿无可替代。

Visko Platform Inc., an artificial intelligence research lab focused on developing persistent world models, said today it has raised $10 million in a pre-seed funding round from Llama Ventures. It’s also opening public access to its first foundation model, Orbis, which is based on a new paradigm the company calls “live models.” The startup says […] The post After raising $10M in funding, Visko debuts Orbis, its first live model for generating long-form videos appeared first on SiliconANGLE.
近日,VAST宣布完成B轮和B+轮融资,合计约30亿人民币,由经纬创投领投,完美世界、蓝色光标、芯动能投资、延趣游戏、中科创达、广电投资、三七互娱等一线产业资本,鼎晖VGC、中金资本、CMC资本、洪泰基金、三正健康投资、中平资本、福建产投基金、福创投、卓源亚洲、江西金控等一线财投联合参投,老股东达晨财智、春华资本、四三九九、慕华科创、绿洲资本、渶策资本、华控基金持续超额追投。 不到半年,VAST累计融资约50亿人民币,刷新AI 3D领域融资额纪录。 至此,VAST战略投资方已覆盖对3D原生基座模型和世界模型有切实需求的各行各业。多元产业方资本的加注,意味着VAST技术能力已跨过“生产可用”门槛,正在成为多个行业3D内容生产的默认基础设施。 本轮融资将持续投入于3D原生模型与数据能力的迭代、训练与推理基础设施的扩建、产品开发与商业化落地的加速,推进AI 3D从“可用”走向“好用”,成为各行各业的AI 3D基础设施。 Tripo P2.0:全球首个原生四边面拓扑3D大模型,开启3D领域的Vibe Coding时代 与融资同步,VAST发布旗舰3D原生基座模型Tripo P系列最新版本——T…

国家人工智能基金14亿元入股可灵AI;智谱上半年收入同比增近400%;欧菲光澄清“掏空资产”传闻;中际旭创拟回购40亿至80亿元股份;*ST闻泰:法院裁定冻结安世及安泰可相关股权财产;中国巨石据悉已正式上调9月份电子布价格;工信部:探索通过首购首用、风险补偿等模式,加大大模型、智能体、Token等服务采购力度。

Skild AI says its S1 robot foundation model enables robots to learn new tasks just by seeing a video of it being performed. The post Skild AI unveils S1 flagship robot foundation model appeared first on The Robot Report.

藏在世界人形机器人运动会上的三个底层具身难题。 作者丨齐铖湧 编辑丨董子博 8 月的最后一周,国家速滑馆“冰丝带”,第二届世界人形机器人运动会。 朋友圈里刷屏最多的,是田径赛场上机器人百米冲刺、跳远,无论是跑出新纪录,还是电机着火,这些画面都会吸引大量的普通观众。 但AI科技评论问了几位深度参与到这次运动会的具身从业者,专业观众们最关注的比赛是什么,都得到了统一的答案:场景赛。 场景赛现场没有跑道,只有临时搭建的客厅、厨房和货架,进行的是家庭、餐饮、商超三项场景比赛。 业内有一个心照不宣的共识:场景赛≠竞技表演,是机器人真实工作能力大考。田径项目考的是运动控制算法,只要算力足够,一套动作在仿真环境里跑上几万遍,总能算出最优解; 但场景赛考的是具身大模型,包含“大脑”和“小脑”,环境是动态的,物品是柔软的,随时会有人来打断你的工作,对模型泛化能力的要求,完全不在一个量级。 这届比赛,还有一个不太被外行注意,但在圈内引发热议的规则:允许遥操。 尽管遥操遭到行业内外各种鄙视,但在这种顶级大会上依旧允许遥操,那是因为想要做到全自主,门槛实在太高了。但AI科技评论仔细阅读了一下这次的积分规则,有…

前两年,我在河南、河北、东莞、深圳等地,认识过一批「AI 玩具公司」。 它们做的事情大体相似:定制一个手办,再给它加上语音对话;或者把语音模组塞进毛绒玩具,让一个普通玩偶可以和人聊天。一些公司甚至借着 AI 的新鲜感迅速出海。 2024 年前后,这件事情本身还有一定的技术门槛。要让一个玩具真正开口,需要把主控、麦克风、联网等硬件,与 ASR、LLM、TTS 等软件服务串起来。对于传统玩具厂商和 IP 方来说,这已经超出了原本熟悉的能力范围。 但这两年,AI 硬件的开发门槛下降得越来越快。 3D 打印、PCB 打样和成熟开发板越来越容易获得,开源社区也已经提供了大量现成方案,从语音对话到舵机、电机控制,都可以找到较为成熟的项目。 最近,我们拿到了这样一块近乎「傻瓜式」的 AI 模组。不用写代码,在开发平台选好模型、音色和角色,几分钟就能让它开口说话。再塞进一个毛绒玩具,一款最基础的 AI 玩具就有了。 做出这块模组的是一家 2025 年成立的澜存科技。 澜存目前有两个核心产品:澜卡 LC-1.7 系列标准 AI 模组,以及配套的澜存智能平台。前者集成语音、联网和多种硬件接口,可以继续外接…

Token 成本成为大模型硬件竞争的新坐标。 作者丨郑佳美 编辑丨岑 峰 今天,OpenAI 的自研推理芯片 Jalapeño,终于从规格表走到了跑分台。 这次公开的数据很接地气:Token 吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT 要一直回消息,Reasoning 模型要持续生成长链路内容,Agent 还会一轮接一轮调用模型。算力再高,Token 吐得慢、延迟压不下来、功耗又高,数据中心照样难受。 成绩一出来,Reddit 很快就把 Jalapeño 和 NVIDIA Rubin 摆到了一起。有人认为它已经进入 Rubin 的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。 更巧的是,Jalapeño 并不是孤例。NVIDIA 正在把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也把 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗? 01 Ja…

当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。 近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。 更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时…

谁不想在新年到来之际收到一只可爱的 AI 机器鸭呢? 距离 2026 年圣诞节还有四个月,在英伟达以约 129 亿美元收购消息曝光次日,AI 开源社区 Hugging Face 发布了一款名为 Microduck 的小机器人。它身高 25 厘米、重不足 800 克。演示视频里,它用喙叼着袜子摇摇晃晃地走路,被人推搡时会尽力稳住,即便倒下也能自己爬起来,甚至可以穿上轮滑鞋滑旱冰。 产品售价 399 美元(约合 2,700 元人民币),有奶油白、石墨灰、薰衣草紫、天空蓝四种配色可选,附赠一只游戏手柄。联合创始人克莱姆·德朗(Clem Delangue)在社交平台 X 上放出一段 50 秒的演示视频,几个小时内浏览量接近 40 万。 (来源:Pollen Robotics) 从语音互动,到“走”进真实世界 做开源大模型托管平台起家的 Hugging Face,入局具身智能的节点要追溯到 2024 年初,前特斯拉(Tesla)Optimus 团队科学家雷米·卡德内(Rémi Cadene)加入,主导开源机器人库 LeRobot 的开发;2025 年 4 月,Hugging Face 完成对法国…
