当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。 近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。 更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时…

谁不想在新年到来之际收到一只可爱的 AI 机器鸭呢? 距离 2026 年圣诞节还有四个月,在英伟达以约 129 亿美元收购消息曝光次日,AI 开源社区 Hugging Face 发布了一款名为 Microduck 的小机器人。它身高 25 厘米、重不足 800 克。演示视频里,它用喙叼着袜子摇摇晃晃地走路,被人推搡时会尽力稳住,即便倒下也能自己爬起来,甚至可以穿上轮滑鞋滑旱冰。 产品售价 399 美元(约合 2,700 元人民币),有奶油白、石墨灰、薰衣草紫、天空蓝四种配色可选,附赠一只游戏手柄。联合创始人克莱姆·德朗(Clem Delangue)在社交平台 X 上放出一段 50 秒的演示视频,几个小时内浏览量接近 40 万。 (来源:Pollen Robotics) 从语音互动,到“走”进真实世界 做开源大模型托管平台起家的 Hugging Face,入局具身智能的节点要追溯到 2024 年初,前特斯拉(Tesla)Optimus 团队科学家雷米·卡德内(Rémi Cadene)加入,主导开源机器人库 LeRobot 的开发;2025 年 4 月,Hugging Face 完成对法国…

arXiv:2608.25757v2 Announce Type: replace Abstract: Generalist vision--language--action (VLA) policies learn long-horizon behavior mainly through short-horizon action prediction and reveal little beyond sampled commands. This creates two coupled bottlenecks: a single action target must implicitly absorb task progress, intermediate intent, and local reliability, while these control states remain hidden during execution. Inspired by functional principles of biological sensorimotor control, we intr…
arXiv:2510.25548v3 Announce Type: replace Abstract: In task and motion planning, high-level task planning is done over an abstraction of the world to enable efficient search in long-horizon robotics problems. However, the feasibility of these task-level plans relies on the downward refinability of the abstraction into continuous motion. When a domain's refinability is poor, task-level plans that appear valid may ultimately fail during motion planning, requiring replanning and resulting in slower…
arXiv:2608.26182v1 Announce Type: cross Abstract: Large language models (LLMs) are increasingly used for verbal interaction in social robots, yet prompt design in human-robot interaction (HRI) remains underspecified. As a result, robots may present hallucinated capabilities, unclear behavioural boundaries, and misleading personas. This paper develops a framework for prompt design in LLM-based robots and introduces a structured prompt template comprising eight functional components through which …
arXiv:2608.27384v1 Announce Type: new Abstract: Vision-Language-Action (VLA) models are increasingly promising for robotic manipulation, yet their real-world deployment remains bottlenecked by high inference latency and unstable asynchronous execution. This challenge is particularly pronounced in flow-matching-based VLA models, where action decoding requires multiple iterative steps conditioned on the VLM context. While efficient inference methods improve control frequency and asynchronous metho…
arXiv:2608.27079v1 Announce Type: new Abstract: Pretrained vision-language-action (VLA) policies provide strong priors for robot manipulation, yet adapting them online to fine-grained biomedical tasks remains challenging. Task success often hinges on subtle, view-dependent visual cues, while task-level rewards provide little guidance about which regions matter, making it difficult to learn task-relevant visual grounding from limited real-robot interaction. Online adaptation is further constraine…
arXiv:2608.26821v1 Announce Type: new Abstract: Vision-language-action (VLA) models leverage pretrained vision-language representations for robot control, yet simply adding historical frames does not reliably capture recent physical change. This is especially problematic in multi-stage manipulation, where visually similar states may require different actions depending on prior execution. To address this challenge, we present TemporalFlow-VLA, which learns compact execution history through physic…
arXiv:2608.26673v1 Announce Type: new Abstract: Large pretrained vision-language-action models dominate modern robot-manipulation benchmarks, but it remains unclear how much model scale is necessary for strong language-conditioned control, or whether fundamentally different control architectures can remain competitive at much smaller parameter budgets. We present PredVLA, a language-conditioned predictive-coding policy with only 0.68 million trainable network parameters and no robot-data pretrai…
arXiv:2608.26645v1 Announce Type: new Abstract: Vision-Language-Action Models~(VLAs) have demonstrated significant promise in generalizing to complex, long-horizon robotic manipulation tasks. However, their performance remains brittle, as they are typically trained on trajectory-monotonic, failure-free demonstrations. This reliance on ``perfect" data leaves them unable to recover from common execution errors, such as a missed grasp, a dropped object, or an unexpected collision. In this paper, we…
arXiv:2608.26578v1 Announce Type: new Abstract: This work introduces Configured Failure Trapping, a novel backdoor attack task against Vision-Language-Action (VLA) models, which aims to activate attacks through stealthy textual triggers and induce configured failure modes. Unlike prior backdoor attacks that treat any task failure as a successful attack, Configured Failure Trapping requires the attacker to control how the robot fails (e.g., causing the robot to grasp with a specified positional o…
arXiv:2608.26496v1 Announce Type: new Abstract: Navigation in unknown environments to find unforeseen objects has become increasingly feasible with capable vision and language foundation models. However, these models also introduce non-negligible inference latency, which becomes an important concern when agents must operate continuously in the real world. Most state-of-the-art methods are still developed in synchronous simulators, where the environment waits for the agent to act and inference ti…
站在 2026 年 8 月北京世界机器人大会(WRC)的展馆中心,如果你闭上眼,听到的不再是两年前那种对“机器人像人一样跳舞”的惊呼,取而代之的,是从业者们在心里拨动算盘,计算 ROI(投资回报率)的声音。 具身智能正在经历一场从“秀肌肉”到“翻账本”的集体变轨。 回看这半年的轨迹,这种趋势演进得极具层次感: 5 月的维也纳 ICRA,学术界和产业界第一次如此默契地把所有火力都集中在了 VLA(视觉-语言-动作)模型上,那是具身智能的“物理学补课期”; 7 月初的上海 WAIC,200 多家具身智能企业同台竞技,集体把演示从“后空翻”换成了“拧螺丝、叠衣服”,那是行业的“场景落地焦虑期”。 7 月底的悉尼 RSS,开源硬件、仿真工具链和遥操作数据方案成为主角,行业开始为“大脑聪明、身体廉价、数据贫瘠”搭建公共底座,那是产业的“基础设施奠基期”。 而在 8 月的北京 WRC,所有话题似乎都围绕工程约束和商业底线展开。在这里,没人关心你的模型是否有哲学意义上的“意识”,大家只盯着三个指标:多少钱?多稳?跑一个月能省几个人的工资? “以前我们聊的是什么时候 AGI,现在我们在聊这台机器人跑一…

强化学习之父Rich Sutton接受红杉访谈,把矛头对准当下最主流的大模型路线:互联网数据终有上限、模型上线后权重基本冻结,行业或已陷入“局部最优”。他创办Oak Lab,押注能从自身经验持续学习的Agent,重新定义AI演进路径。 说起强化学习之父 Rich Sutton,AI圈几乎没人陌生。 他写下的《苦涩的教训》,至今仍被很多人视为理解AI发展的重要框架:从长期看,能够随着计算规模扩展的通用方法,往往会战胜依赖大量人工知识设计的方案。 但最近接受红杉资本访谈时,Sutton却把矛头对准了今天最主流的大模型路线。在他看来,LLM当然是一次伟大的科学突破,却也可能成为《苦涩的教训》的反面案例。 原因很简单。今天的大模型虽然摆脱了大量人工规则,却重新被“人类已经知道的东西”限制住了。互联网数据终究有限,合成数据背后依然需要人来决定什么值得生成。 而更关键的是,模型仍然不具备人类那样的持续学习能力。 一个司机开了10年车,会从经验里形成大量直觉。但今天的大模型,大部分学习都集中在预训练和后训练阶段。模型上线后,即使每天和几百万人交互,核心权重依然基本被冻结。 在Sutton看来,今天的…

从录音卡到儿童手表,再到摄像机,小度AI硬件掌舵人孙浩复盘了多款产品的成败得失。他提出,大模型能力涌现后,真正的挑战在于场景、成本、上下文与安全之间的平衡。本文从实战出发,拆解AI硬件从技术到产品成立的完整路径。 在 2026 AI 产品大会上,小度AI智能硬件掌舵人孙浩分享在 360 和小度做过的几条产品线,从复盘录音卡、儿童手表、摄像机和家庭 AI 伙伴的路径。他想回答的是能力涌现之后,怎样在场景、成本、上下文和安全之间把产品真正做成立。 以下内容根据现场音频和演示材料整理,Enjoy: 一、我做过很多硬件,但真正的问题一直没变 大家好,我是孙浩。 我一毕业就进了 360,在那里干了 12 年,最早做儿童手表,后来做智能音箱、边缘计算、视觉云,再后来整体负责 360 IoT 的产品研发、供应链和生产相关工作。年初我离开 360,到了小度。对我来说,这次分享不是站在旁观者角度讲一个趋势,而是把自己做过、踩过、犹豫过的产品拿出来复盘。 我给自己的定位一直是“极客型产品经理”。 这个词不是说我要做只有极客才会用的东西,而是说我希望自己有前沿技术的判断,把原来只在小圈子里流行、很晦涩的技术…

XPeng debuts the first major upgrade to its second-generation VLA, adding dynamic 4D spacetime understanding and bringing Robotaxi-grade L4 behavior to production cars.

Overnight undercutting by Zhipu's GLM-5.3-Flash and Alibaba's Qwen3.8-Flash is resetting what it means to be a flagship LLM in China's pricing war.

AI 硬件的较量,正从"接入 AI"转向"产品成立"——从 Demo 能跑,走向产品能卖、用户能留。 过去两年,大模型快速进入智能眼镜、机器人、AI 陪伴、AI 教育等终端。到了 2026 年,”接入 AI”已经不再新鲜,行业真正开始较量的,不再是 Demo 能不能跑起来,而是一个更传统、也更难的问题:这款产品为什么存在,能不能稳定量产,用户会不会长期使用。能力越多,产品越需要克制——多模态交互的真正难点,也从”能不能加上”,变成了”怎么取舍、怎么让用户觉得对”。 8月9日下午,声网联合人人都是产品经理,在北京渔阳饭店举办「AI 硬件多模态交互的产品化破局」专场沙龙,近百位产品人、开发者与创业者到场,共同拆解 AI 硬件从 Demo 走向真实产品的那道坎。 浙江湃启科技CEO孙思宁、声网AI产品线负责人姚光华、灵宇宙产品负责人刘翠涛、阿里云百炼应用高级产品经理司红江,以及移远通信北区技术总监武风停,从产品、交互、端侧与供应链等不同位置,围绕 AI 硬件从 Demo 走向真实产品展开讨论。以下为几位嘉宾分享的核心内容。 一、具身在神不在形:先定义产品,再谈模型 孙思宁老师作为语音AI领域…

国产大模型内卷到算子底层。 作者丨高允毅 编辑丨岑 峰 昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。 这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。 它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。 今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。 他发现两者不仅都采用了 KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound) 同样是 - 5。 从 Kimi K3 公开技术报告到智谱上新,还不到一个月。有人感叹:哪怕是参考了 Kimi 的公开参数,短短 20 天内就能推出这么强的模型,也太惊人了。 …

亚马逊宣布其众包平台 Mechanical Turk 将于 9 月 30 日关闭。亚马逊上个月才宣布将于 7 月 30 日起停止接受新用户。当时亚马逊表示该决定是在“慎重考虑”后做出的,“现有用户可以继续正常使用该服务。AWS 将继续投资改进 Mechanical Turk 的安全性和可用性,但我们不打算推出新功能。如今它正式给 Mechanical Turk 画上了句号。亚马逊是从 2018 年起将 Mechanical Turk 变成训练神经网络的标注数据服务。但讽刺的是 2023 年的研究发现,该平台 33% 到 46% 的众包工作者使用大模型去完成任务,引发了对标注数据的可靠性以及是否真的需要人类参与的质疑。由于大量的机器人和欺骗行为,研究人员已经放弃了该平台,它的关闭只是时间问题。
随着大语言模型能力边界的持续拓展,AI Agent 已从概念验证阶段迈入大规模工程落地。然而,Agent 内部复杂的任务规划、工具调用与记忆检索机制,使得传统的应用观测手段在面临这类非确定性系统时显得力不从心。本文整理自火山引擎应用观测技术负责人钱世俊在 QCon 全球软件开发大会 2026 北京站的分享《给 Agent 做“CT”:大规模 Agent 的可观测与质量保障体系》。 钱世俊系统性地阐述了团队在 Agent 可观测性领域的工程实践,分享了如何从零构建一套覆盖基础设施到业务语义的统一观测底座,并以此为基础实现 Agent 内部链路的白盒化透视、根因可解释性以及持续优化的工程闭环。 以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。 背景与挑战:Agent的“黑盒”困境 从去年开始,Agent 的能力逐渐进入我们的视野并持续增强。与早期大模型简单的一问一答模式不同,现代 Agent 能够自主进行任务规划,调用种类繁多的外部第三方工具,并利用记忆与知识库来沉淀上下文,从而完成更为复杂的业务目标。然而,这种能力的跃升也带来了全新的观测挑战。当系统运行正常时,智能体的表现令…

大模型推理成本已成为AI产业落地的核心瓶颈。随着模型参数规模向万亿级迈进、多模态智能体应用场景爆发,推理引擎需要应对算子实现、内存管理、量化压缩、异构调度与并行策略等多维度的技术挑战。本文整理自清华大学助理研究员金煜阳博士在 QCon 全球软件开发大会 2026 北京站的分享《大模型推理加速全链路:内存管理、编译优化、量化与并行策略》。 金煜阳系统介绍了其所在实验室在大模型推理加速全链路方面的探索,覆盖从底层算子优化到上层并行策略的完整技术栈。本文将逐一展开算子级性能调优中的细粒度图层优化方法、面向异构模型结构的KV Cache内存管理、编译与运行时协同的混合精度量化、基于负载特性的CPU-GPU异构调度,以及面向动态请求场景的自适应并行策略,最后介绍开源推理引擎赤兔在国产芯片生态中的实践成果。 以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。 背景与挑战 人工智能的市场规模正在以超出预期的速度扩张。去年来自Precedence Research和艾瑞咨询的数据预测,到2030年全球AI市场规模将达到11万亿。但今年年初OpenAI的持续爆发,以及智能体应用的集中涌现,让这…

截至 2026 年 6 月,我国日均词元调用量已突破 500 万亿,中国大模型在全球竞争中位居第一梯队。当前旗舰模型几乎以月为单位更新,竞争焦点转向智能体落地与生态建设,推理算力需求随之爆发。腾讯混元 3 正式版上线第一周,Token 调用量比上一代混元 2 增长 68 倍。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtbbhr1c0r0jroamimh5nql2
如果说,基础模型是具身大脑的“大学”通识课;那么,垂域模型则是机器人在工业领域的“专业课”。 作者丨董子博 编辑丨林觉民 今天要做世界模型,所有人都知道要做预训练,来让具身大脑变得更聪明;也知道要做后训练,让机器人可以在专门的任务下得到锻炼、做得更好。 和不少公司聊过,AI 科技评论发现,谈到中训练(Mid-train)的公司却很少。 而实际上,在具身的实际落地中,却存在一些原有方案不易解决的问题:当预训练的 VLA 模型,没法在具体的场景中发挥全部智能;而后训练却有时间、成本的门槛;在训练技能的环节,也容易出现数采、训练和调试的重复工作——VLA 落地要真正提效,中训练或许才是破局的良方。 AI科技评论独家获悉,乐聚机器人将推出面向工业场景构建的“垂域具身智能模型”——KUAVO VLA。据了解,该模型以通用VLA 基础模型为能力起点,使用 600+ 小时KUAVO 同构型真机数据进行了中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。 乐聚机器人 KUAVO VLA 赋能下,在不少场景中可以实现大约一倍的提效,在某些任务中甚至可以做到100% 的成功率。 模型中训练,会…

智谱 GLM-5.3-Flash 上线即成新标杆:321B 参数、全新架构,靠 10 万+ 张国产芯片跑出 OpenRouter 历史 4 倍的 token 消耗纪录并限时半价。能力越级、价格脚斩的背后,是混合注意力重写与 IndexPool 池化带来的成本重构。 这几天 ox-alpha 用爽了吧… 正如很多人猜的那样,这个模型来自智谱,正式名称为 glm-5.3-flash,支持多模态,但很多人没猜到的是:这个乱杀的模型只有 321B,且与 glm-5.3 不同,是完全的新架构 更尼玛离谱:智谱的这段时间模型给全世界畅跑,完全是用国产卡供的!!其支撑起的单日 token 消耗量,创下了 OpenRouter 平台历史纪录的 4 倍,而这一切的背后,是 10万+ 张国产芯片集群的服务 还有就是:这模型比 ds4p 聪明,比 ds4f 便宜,还开源,至此…大模型行业又多了一条斩杀线 你以为这就完了?不不不…这个模型开启了限时折扣,半价,所以…真实的斩杀线在这里….斩杀这个词,现在具像化了 对此…只能说唐老师的信用分还是太稳定了:牛来,就是给啊哞的情书 能力越级,价格脚斩 对于这个模型,…

一家成立仅一年多的上海初创公司,单人团队上线 9 款应用,多次获得 App Store 年度创新推荐。其最新产品「好友哈哈队」瞄准真人声音二次创作赛道,以低门槛、轻体量、自然传播的方式切入音频创作市场,也为 AI 应用的全球化预留了接口。 7月底,一款名为「好友哈哈队」的应用悄然上线App Store。这款产品有着脑洞大开的创意:录入你和朋友真实的笑声,系统会把人脸贴合到卡通人偶上,搭配香蕉人形、肌肉猛男、绿色外星人等无厘头换装素材,组成一支“有点抽象,但很快乐”的合唱队,一键产出搞笑音乐唱片。 在这款产品之前,我们已经追踪创作型音乐产品有一段时间了。如「怪物合唱团」「Incredibox」等都是以“混音+合奏”为主的产品。其中「Incredibox」全球用户超过1亿,营收已经突破千万美元。 但「好友哈哈队」又比较特别,这是一款瞄准音频创作赛道的产品,更准确来说,是“真人声音二次创作”赛道。 过去两年里,中国移动互联网的创业叙事基本是AI大模型、短视频和电商直播,音频赛道一直是一个很难有大突破的领域——播客赛道太重,音乐制作门槛太高,语音社交又太依赖社交关系链。 而「好友哈哈队」以笑声…

arXiv:2603.15857v2 Announce Type: replace-cross Abstract: Behavioral Foundation Models (BFMs) produce agents with the capability to adapt to any unknown reward or task. These methods, however, are only able to produce near-optimal policies for the reward functions that are in the span of some pre-existing state features, making the choice of state features crucial to the expressivity of the BFM. As a result, BFMs are trained using a variety of complex objectives and require sufficient dataset co…
arXiv:2608.22149v2 Announce Type: replace Abstract: LLMs generate fluent plans for robots but routinely violate the syntactic and se8mantic constraints they must satisfy to execute, and existing remedies trade formal guarantees against plan quality: soft methods (affordance scoring, grounded decoding) give no guarantee, while symbolic planners (LLM+P) discard the LM's commonsense. We propose \textbf{Meta-Ctrl}, a constrained-decoding framework that guarantees the encoded constraints while preser…