
一个经营分析的 AI 智能化需求背后,产品负责人与 FDE 负责人争论不断。拆解 B 端 Agent 产品如何分层:规则、Workflow、LLM 节点、Agent 各司其职,产品守住稳定解,FDE 承接边界外问题,让共性能力在真实业务里回流产品、沉淀底座。 前段时间在一家做数字员工公司的咨询过程中,我旁听了他们 FDE 负责人和产品负责人一场挺激烈的争论。 他们的问题是:AI 时代下,B 端的 Agent 产品到底应该做成什么形式?以及如何设计才能兼顾可处理问题难度、结果确定性和灵活性? 一个业务的复杂度低的时候,可以保证它的确定性足够高,但当一个业务的复杂度过高的时候,使用工作流缺少灵活性、已经很难维护了,但是 Agent 驱动又很难保证结果确定性。 一开始聊技术,争论的是业务理解到底应该在什么载体上面,Workflow 在哪里承载?数字员工应该怎么定义? 慢慢地聊到产品边界,产品负责人认为,产品一定要有边界,什么能做、什么不能做,必须定义清楚。否则客户每来一个需求,就得重新开发一次,最后做出来的不是产品,只是一套越来越复杂的项目平台。 而 FDE 负责人的观点正好相反,现在的大量…

银河通用旗下全球首款原生智能体人形机器人“银河星仔”预订开启后热度走高,上线24小时预订量突破200台。该产品于2026年世界机器人大会(WRC)首发,搭载银河通用全自研的物理世界原生智能体与亿级参数具身大模型,为人形机器人的实时多模态交互与精准运动控制打造。不同于传统预设脚本机器人,它无需动捕或视频示范,能够直接在真实环境中通过人机交互主动学习,并具备像人类一样的动态思考与行为规划能力——边看、边想、边行动。
AI Agent要走出电脑,不仅需要一个更聪明的大脑,还得面对几十年工业系统留下的接口。现在,大模型公司与自动化行业开始从两端向同一层靠近。

8 月 19 日,北京亦庄的空气里飘着一种奇怪的兴奋,这是 2026 世界机器人大会开幕的日子。300 多家企业、2000 多件展品,几乎把具身智能行业能拿出的东西都搬到了这里:大模型、本体、关键零部件、数据,应有尽有。 开幕当天,宇树科技敲钟上市,盘中市值一度冲破 4000 亿元,这可能是过去十年,中国机器人行业最接近「资本狂欢」的一天。过去,机器人公司更多活在实验室、融资新闻和 Demo 视频里;而宇树的上市,第一次给这个仍处在早期的赛道钉下了一个资本锚点。 除此之外,云深处科技进入交易所受理或审核环节;智元机器人则于 2026 年 7 月确认启动赴港上市流程。一级市场的热,正在向二级市场传导,具身智能不再只是技术想象,也开始被要求回答收入、交付、毛利和规模化的问题。 逛完整个展区,跟我们此前预料的一样,今年没有让所有人「哇」的时刻,更多的是 demo 的展示。宇树没有展示刚刚发布的、原地跳高 2 米、奔跑速度 12.66 米/秒的「超人」,展台上更多是已有产品在解锁新动作;众擎把八角笼搬进了会场,维他动力用二次元偶像的方式整活……热闹是真热闹,但很少有人再讲「颠覆性突破」这四个字…

S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。 作者丨张 璐 编辑丨幸丽娟 过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。 很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。 华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。 他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数…

Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。 作者丨张 璐 编辑丨幸丽娟 VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。 过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。 为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。 论文链接:https://arxiv.org/pdf/2607.00483 01 考场设计:四大仿真套件、 10 大场景与“看图判进展”规则 研究团队选用的 10 个典型任务,涵盖了具…

给模型做一次脑部“CT”,低成本重塑真实空间智能。 作者丨张 璐 编辑丨幸丽娟 先来看一道简单的多模态大模型视觉考题: 观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么? A. 单人沙发以及旁边的一张小桌子 B. 摆着微波炉的桌子 C. 小厨房 D. 蓝色垃圾桶 Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。 按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。 但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。 研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“…

2026年9月4日至8日,全球领先的具身智能公司魔法原子(MagicLab)将亮相IFA2026,完整呈现其"本体硬件、物理AI大脑、场景交付"三层全链路闭环能力,同时面向欧洲企业级市场战略聚焦柔性搬运与物流分拣两大高价值工业场景,展示其作为“端到端工业级具身智能解决方案提供商”的全球化竞争力。 在现场,专业观众与行业买家将有机会近距离观摩MagicBot D1与HyperBot的多机协同调度,并亲身体验Magic-VLA K02大模型的零样本泛化与抗干扰能力。此外,现场还将设置商务洽谈专区,供全球合作伙伴深入了解魔法原子的渠道政策与本地化售后支持体系。 新品亮相——三款新品登陆欧洲,本体矩阵覆盖全场景作业 魔法原子此次将带来三款2026年全新发布的机器人产品,构成覆盖“技术摸高—工业主力—轻量部署”的完整硬件梯队。 MagicBot X1作为旗舰级高动态全尺寸人形机器人,负责技术摸高、代表本体能力上限。相较于魔法原子上一代全尺寸通用人形机器人MagicBot Gen1,X1自研关节模组全线升级,膝关节峰值扭矩350N·m以上、极限扭矩最高450N·m,关键关节运动范围提升超50%;钛…

最近,一只只有 25 厘米高的机器鸭,意外把端侧 AI 的想象力拉到了聚光灯下。 Hugging Face 旗下 Pollen Robotics 发布的 Microduck,是一款售价 399 美元的开源双足机器人。它约 800 克重,开箱即可行走、坐下、踢球、抓取,摔倒后还能自己爬起来。更重要的是,它并不只是一个会动的玩具,而是一个面向开发者的开源机器人平台:用户可以在仿真环境中训练动作策略,再部署到真实机器人上。 这只“小鸭子”之所以引发关注,不只是因为它足够可爱、足够便宜,也不只是因为机器人终于开始进入普通开发者的桌面。它真正释放出的信号是:AI 正在从屏幕里的模型,走向会感知、会行动、会互动的实体设备。 过去几年,人们谈 AI,最常谈的是云端大模型、参数规模、训练集群和算力中心。但当 AI 开始进入真实世界,问题会变得非常具体:设备能不能本地响应?能不能离线运行?隐私数据能不能不上传?功耗和散热能不能被终端接受?成本能不能支撑规模化普及? 这些问题,正是端侧 AI 真正落地时必须回答的问题。 Microduck 给出的,是“小模型、小芯片、小机器人”的一种想象。一个低成本、开源…
端侧大模型推理35–40W、流畅控制需200W+,电池越重越费电,人形机器人卡死在"能用-重量-散热"的物理内环。工厂平面工位,可拆掉双足;换个环境,腿无可替代。

大模型竞争开始拼组织,这一次轮到字节。 8 月 19 日,据晚点 Late Post 报道,Seed 基础模型团队新设 Pretrain Data(预训练数据)、Horizon RL(强化学习)、Product Posttrain-Work(面向办公场景的产品后训练)和 Product Posttrain-Chat(面向对话场景的产品后训练)四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳等人负责,均向吴永辉汇报。 雷峰网了解到,四个新部门之下的分支架构与带队人选也已落定,而这些更细的调整,或许更能透露出此次组织变动背后的真实意图。 01 数据和RL开始集中 先看模型能力侧的两个部门。 有接近字节的人士称,Pretrain Data 由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支,统一为 Omni 全模态模型和超大模型供给数据; 负责人李成刚是清华机械系本硕,曾从 0 到 1 搭建字节搜索系统,先后负责今日头条网页搜索和 TikTok 视频搜索的技术工作,其麾下沈科 2…

大模型演示惊艳,上线却频频翻车?问题不在模型能力,而在产品设计。本文从任务拆解、幻觉控制到长上下文陷阱,教你如何将模型能力转化为稳定可靠的产品功能。 过去两年,我听得最多的一类需求是“能不能接个大模型”。客服希望它自动回复,设计部门希望它审图,运营希望它直接出方案,管理层则希望看到一个会查资料、会调用系统、还能自己推进任务的智能体。 这类需求很容易做出让人兴奋的演示。准备几份干净文档,选一个能力较强的模型,再配上一段经过反复打磨的提示词,十分钟就能看到颇像成果的回答。它能解释术语,也能整理表格,还能给出下一步建议。会议室里的第一反应通常很一致,既然回答已经这么像专家,离上线应该不远了。 真正的产品工作从这一刻才开始。 把同一个功能交给真实用户,输入会立刻变脏。半句话、旧版制度、写错的零件名称都可能进入系统,一个问题里还可能混着三个目标。模型可能引用过期条款,也可能补出原文里没有的参数。接上工具以后,风险又多了一层。一次不准确的回答还可以修改,一次错误写库、误发邮件或误停设备,后果很难靠一句“模型会犯错”带过。 因此,讨论大模型的能力边界,价值并不在于列出一张“能做”和“不能做”的清单。…


BenchMIRT is a new method for auditing LLM benchmarks question by question, revealing which capabilities they actually measure and helping researchers build smaller, more focused, and easier-to-interpret evaluations.

OpenAI previewed the precautions it is taking as it prepares to release Astra, its newest, cyber-critical LLM.
Visko Platform Inc., an artificial intelligence research lab focused on developing persistent world models, said today it has raised $10 million in a pre-seed funding round from Llama Ventures. It’s also opening public access to its first foundation model, Orbis, which is based on a new paradigm the company calls “live models.” The startup says […] The post After raising $10M in funding, Visko debuts Orbis, its first live model for generating long-form videos appeared first on SiliconANGLE.
数据分析建议不被采纳?学学三国军师的智慧!本文结合《三国演义》案例,拆解答疑、建议、提醒、总结四种指导姿势,教你用AI多方案测算提升建议说服力,让运营真正听你的。 “数据分析要指导运营决策,提供可落地的建议”是很多企业对数据分析师的要求。很多同学直接用大模型生成分析、写建议,以为数据够全、算得够快,运营就会照做。 可真做起来,很多同学叫苦连天:我提的建议,运营都不听!也不按我说的做!让我咋落地呀…… 那到底该咋办? 一个通俗的例子,看懂指导方式 我们看《三国演义》里边的军师是怎么指导主公决策的。凡是那种喊着:“主公不听我言,必遭大败”的军师,都被主公拖出去咔嚓了。此时主公的内心独白都是:“我是主公还是你是主公!”而真正受主公信任的军师,则在用这4种方式发言。 方式1:答疑 主公问:敌方摆的是啥阵型呀? 军师答:敌方摆的是八门金锁阵,这个阵法分为…… 此时主公不了解情况,军师给主公科普,讲清楚事情就是“支持”决策。 方式2:建议 主公问:军师有何退敌良策呀? 军师答:上策是趁敌人远道而来,疲惫困顿,粮草不济,坚壁清野。中策是……下策是…… 这里有很多细节: 1、军师给建议,是分析+结论一…

不管哪个时代,人都会遇到同一道题:无论宏大叙事还是人生决策,面前问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。(雷峰网) 从 1812 年黑格尔的辩证法,到马克思、列宁,再到 1915 年毛泽东在延安写下的《矛盾论》,一百多年里,这套思想最终落到了一个很实际的问题上:复杂事物中矛盾很多,但真正重要的是找到决定其他矛盾的主要矛盾。 今天的大模型行业也不例外,当前大模型行业面临的主要问题有以下这些: 1.模型能力的增长速度,同把这种能力转化成可靠产出的能力之间的矛盾(模型强,但产出物没价值)。 2.算力资源受限,同能力需求无限之间的矛盾(人们总吐槽 AI 太傻)。 3.单价在快速下降,同真实账单在上涨之间的矛盾(模型便宜了,但每个月花的更多了)。 4.要做通用智能,同要交付一个能用的产品之间矛盾(简单的不好用,好用的不简单)。 这些矛盾才构成了交错向上发展的行业和机会。没有人能逃避这些选项,DeepSeek 也一样。 我们对 deepseek-v4-Pro以及 Harness 做了几轮实测:直接打接口的探针、七次编码任务运行(其中四次是只改一个变量的对照)、把上下文压到 92 …

Max长程Agent能力的背后,是精雕细琢的典范,还是算力黑洞的失控? 作者丨李娜 编辑丨岑峰 我让Qwen 3.8-Max从零搭建了一个3D大模型演进宇宙网站,又和GPT-5.6做了迭代对比。 (Qwen3.8-Max运行成果截图) 效果上限方面,Qwen 3.8-Max 展现了远超 GPT-5.6 的交付细节; 效率和成本代价方面,Max高完成度背后是低效,而且因为无法自主判断任务终点导致了额度耗尽中断; 适用场景方面, 追求快速迭代、低成本原型,GPT 依然是首选,但在不计成本追求极致性能的场景,Qwen 3.8-Max 提供了一个昂贵但有效的国产替代。(雷峰网) 01 2.4万亿参数之后, Max3.8为什么开始强调Agent? 8月3日,阿里正式发布Qwen 3.8-Max。 从规格看,它依然足够醒目:2.4万亿总参数、约950亿激活参数、100万Token上下文,覆盖文本、代码和视觉任务,并计划开放Max权重和27B小模型。榜单、规模、价格和开源,延续着Qwen过去几年的竞争路线。 (阿里Qwen3.8 max官方技术博客截图) 但到了这一代,仅靠这些已经很难解释Max的差…

最近,亚马逊云科技发布了 aws-bench"。这是一个开源基准测试工具,用于评估 AI 代理完成真实 AWS 任务的准确性,例如诊断配置错误、配置基础设施以及运营实时云环境。 该项目声称,他们采用了与传统静态测试环境基准测试不同的方法。该公司表示,使用在一次性真实亚马逊云科技账户中创建的实际资源,可以在一些开发人员和团队经常在 AWS 上执行的工作中更准确地评估智能代理的表现。 每个基准测试都会在隔离的亚马逊云科技账户中部署一个场景,由 CDK 堆栈中定义的一组 AWS 资源组成。当场景就绪后,待评估的智能代理会使用范围限定凭证,在沙箱容器中运行一项任务。任务完成后,结果将通过自动化验证器进行评分。该验证器可以是大语言模型(LLM)评判器,也可以是对实时 AWS 状态进行程序化检查。 该基准测试附带预定义的数据集,包含基础任务和高级任务。这些任务涵盖可观测性、计算与数据、数据库与存储、EC2 多区域、无服务器、流处理与物联网、参考架构以及多服务故障排除等用例。 尽管这次发布主要面向的是人工智能研究人员和模型提供商,但工程团队也可以尝试使用该基准测试,并通过扩展现有的场景和任务来满足自…

用了三年多 AI,从对话、画图到搭 Agent、写工作流,作者越跑越确信:个人差距不在谁的工具多,而在谁能建立可持续的成长系统。直面恐惧、动手闭环,比收藏十篇教程都值。 上周,看了卡神的一篇文章,讲的是他们创业两年半后,关于AI组织的7点心得。 读完后,我最受触动的,不只是他对AI、业务和商业本质的洞察,还有他对“人”和“组织”的期待。在一个总在谈效率、模型和商业化的时代,这种真诚和善意反而显得稀缺。 回头想想,我们开始用AI也有三年多了,从chatgpt时代开始,开始和大模型对话;再到AIGC的火爆,开始频繁画图、做视频、做音乐;再到Agent的出现,用coze搭各种各样的工作流;再到小龙虾的出现,开始搭建自己的助手,去完成很多自动化的任务,沉淀skill;到现在的workbuddy和codex,真正拥有了自己的办公助手…… 上一届卡塔尔世界杯梅西捧杯的场景仿佛还在昨天,转眼间,美加墨世界杯已经由西班牙捧起了新的奖杯。AI产品的更迭速度,甚至比四年一届的世界杯更能提醒人:时间真的过得很快。 这三年多,AI发展的实在是太快了,快到小红书上的热评总是“只要你够懒,学得够慢,你就不用学了,…

近日,VAST宣布完成B轮和B+轮融资,合计约30亿人民币,由经纬创投领投,完美世界、蓝色光标、芯动能投资、延趣游戏、中科创达、广电投资、三七互娱等一线产业资本,鼎晖VGC、中金资本、CMC资本、洪泰基金、三正健康投资、中平资本、福建产投基金、福创投、卓源亚洲、江西金控等一线财投联合参投,老股东达晨财智、春华资本、四三九九、慕华科创、绿洲资本、渶策资本、华控基金持续超额追投。 不到半年,VAST累计融资约50亿人民币,刷新AI 3D领域融资额纪录。 至此,VAST战略投资方已覆盖对3D原生基座模型和世界模型有切实需求的各行各业。多元产业方资本的加注,意味着VAST技术能力已跨过“生产可用”门槛,正在成为多个行业3D内容生产的默认基础设施。 本轮融资将持续投入于3D原生模型与数据能力的迭代、训练与推理基础设施的扩建、产品开发与商业化落地的加速,推进AI 3D从“可用”走向“好用”,成为各行各业的AI 3D基础设施。 Tripo P2.0:全球首个原生四边面拓扑3D大模型,开启3D领域的Vibe Coding时代 与融资同步,VAST发布旗舰3D原生基座模型Tripo P系列最新版本——T…
