一个工厂老兵,试图把老师傅的报价经验装进AI 在CNC非标加工行业,一张图纸抵达工厂后,通常不会立刻变成一串价格。 报价员需要先判断材料和毛坯尺寸,再识别孔、槽、曲面、薄壁等几何特征,然后手动评估需要使用几轴机床、什么刀具、安排多少道工序。 公差、表面处理、装夹次数、材料利用率以及工厂当前的设备和人工成本,都会改变最终结果。 对于标准件,这套流程可以被固化在系统中,但非标零件这套流程就复杂多了,处理这类非标准件每一张图纸都可能意味着一次重新计算。 曹冬冬在工厂里做了15年工业产品。 过去,他看到的报价方式往往高度依赖人:老师傅打开图纸,凭经验判断加工难度,再结合材料、工时和损耗给出价格。一套复杂图纸,可能需要两三个小时才能完成报价。 经验丰富的人能够迅速发现薄壁变形、深孔加工或者多次装夹带来的额外成本,但这些判断通常存在于个人脑中,很少被完整记录下来。人员一旦离开,经验也很难留在工厂。 这是曹冬冬决定开发一套AI报价系统的起点。 他不是算法工程师,也没有专业软件开发经历。从零开始学习大模型、Python和本地推理后,他完成了“Union·由你|CNC非标智造炼金术师报价系统”,并获得A…
在AI芯片快速迭代的今天,上一代GPU并没有像传统硬件一样迅速贬值。 “我们2023年部署的那批H100芯片,如今出租价格甚至高于最初上线时。”近日,云服务商Lambda联合创始人兼CTO Stephen Balaban在播客节目The MAD Podcast中表示。 这并不是某代芯片的“传奇故事”。过去,人们曾期待GPU算力最终会像传统云计算资源一样,随着供应增加和硬件迭代逐渐标准化、商品化:性能越来越高,价格越来越低,不同供应商之间的差异也越来越小。 但AI算力并没有完全沿着这条路径发展。一张GPU能够提供多少价值,越来越取决于它被放进怎样的系统、如何与其他GPU协同,以及这些昂贵设备能否持续被利用。芯片性能仍然重要,但它已经很难单独解释一套AI基础设施能够交付多少算力。 那么,为什么GPU供应越来越多、产品迭代越来越快,算力却还没有像电力或带宽一样成为真正标准化的商品? 01 算力不是加法题,超节点难在协同 前沿大模型正在改变的,并不是算力如何计价,而是算力在什么层级上被商品化。在最上层,AI服务正在把模型输出逐渐标准化为Token,并按Token计费。 从这个意义上看,客户最终…
当大多数模型公司还在围绕“是否开放权重”争论时,一个总参数达到5350亿的大模型,选择在训练尚未完成、甚至仍可能中途失败的时候,把训练曲线、数据配方、模型配置和技术讨论直接放到了网上。 近日,斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任 Percy Liang 在 x 上发帖宣布,开放基础模型项目 Marin 已于上周启动 Marin 535B-A23B 的训练。 按照目前公布的计划,Marin 535B-A23B 将处理18.75万亿Token,其中约80%用于预训练,20% 用于中期训练;训练运行在 11 套NVIDIA GB200 NVL72 系统上,预计持续约3个月,总计算量约为 2.7×1024 FLOPs,之后还将进入后训练阶段。 据 Marin 项目发起公告,项目最早诞生于斯坦福大学基础模型研究中心CRFM,于2025年5月正式对外公布。发起公告的作者包括 David Hall、Percy Liang,以及来自斯坦福、Open Athena和开放社区的多位研究人员。 David Hall Percy Liang Percy Liang 曾就职于对话式 AI…
雷峰网独家获悉,AI 基础设施公司基元律动(TokenRhythm)近日完成新一轮融资,截至目前累计融资金额达数千万美金。本轮融资由弘晖基金领投,聚合资本、尚势资本等机构参与。此前,公司已完成由 Granite Asia 领投,鼎晖 VGC、元璟资本、无限基金参与的种子轮融资。 在技术战略上,基元律动押注的赛道是大模型与应用之间的全新基础设施层 —— Routing Harness(智能路由与调度底座)。伴随着大模型数量的爆发,各家模型在能力、价格和适用场景上加速分化,行业的关注点正在从“哪个模型能力最强” 转向“多模型协同如何优化”。如何根据任务阶段动态选择、切换模型,在保障效果的同时控制调用成本,成为 Agent 落地的核心痛点。 同时,基元律动认为,Routing Harness 的价值并不止于“把模型连起来”或降低调用成本。随着越来越多真实任务通过 Routing Harness 在不同模型之间流转,任务执行过程中的模型选择、调用结果与用户反馈,也将沉淀为真实的多模型任务,并进一步反哺模型能力。 基元律动希望以此为基础,从 Routing Harness 进一步走向 Agent…
RoboHarness用编排异构策略,让VLA、WAM、RL和TAMP不再各说各话,并零样本完成长时序任务。 作者丨邓哲敏 编辑丨齐铖湧 想象这样一个任务:打开柜门,找到藏在里面的积木,然后把它们搭成一座桥。 对人来说,这是一件很简单的事,几个动作自然衔接,幼儿园小朋友也能顺利完成。 但对机器人来说,这个任务横跨多种完全不同的能力:找积木,需要视觉理解和语言指令跟随;开柜门,需要与环境进行复杂交互;搭积木,需要几何规划和精准操控并推测环境变化。 更麻烦的是,这些种能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL 策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。 今天在机器人领域,能力不缺,但协作缺位。 华为诺亚方舟实验室近期发布了一篇论文,提出了名为 RoboHarness 的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与我们(雷峰网)进行了交流。 论文:https://arxiv.org/abs/2607.18060 项目主页:https://www…
将动作从输出端搬到调度端,推理速度提升1.79倍。 作者丨邓哲敏 编辑丨齐铖湧 机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。 不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。 VLA 模型是当前具身智能领域最受关注的技术路线之一。它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。但 VLA 模型有一个部署层面的老大难问题:推理太慢。 每个控制时刻,模型都要把一个庞大的视觉语言骨干网络跑一遍,计算量极大,导致延迟居高不下,实时控制频率难以保证。 这个问题并不新鲜,学界已经有不少人在尝试解决。今年 IJCAI 收录的一篇论文认为,现有的大多数方案都走偏了一步。AI科技评论(雷峰网公众号)联系到一作于闻达,围绕高效 VLA 方法进行交流。 论文原文:https://arxiv.org/abs/2601.19634 01 大家都在剪视觉, 但问题真的在这儿吗 现有的高效 VLA 方法,主流路线是在视觉侧做文章,剪掉“不重要”的视觉 …
When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels,... When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels, and capturing NVIDIA CUDA graphs. For large models, initialization can take several minutes, during which surviving workers must absorb the displaced traffic. Shadow engine recovery…
Apple 发布搭载 M5 Max 与全新 M5 Ultra 的 Mac Studio,AI 性能最高提升 4.3 倍,图形性能提升 1.8 倍,存储速度提升 2 倍。M5 Ultra 版本支持最高 512GB 统一内存与 1.2TB/s 内存带宽,可完全在设备端运行大型 LLM;四台集群可带来最高 3 倍分布式 AI 推理速度提升。新品今日起接受预购,9 月 22 日开售。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt8qee503kvnro73qp7543yv
8月25日,据外媒报道,国际知名新闻机构汤森路透(路透社母公司)近日推出了其自研大模型Thomson-1。该模型基于阿里Qwen大模型开发,旨在降低对Claude等闭源模型的依赖并减少长期使用成本。 此前,汤森路透曾推出自己的AI助手,接入的是海外大模型厂商Anthropic的Claude大模型。出于降低闭源模型的依赖和成本因素考量,近期,汤森路透选择基于阿里开源模型Qwen3.5自研出Thomson-1 大模型。Thomson-1 将首先用于表格分析、文档审核等专业工作,并逐步承接部分此前由 Claude 完成的任务。 开源模型允许企业自行部署和调整,性价比高,安全可控。随着阿里Qwen等开源模型能力的持续增强,越来越多的企业和机构由闭源转向开源。美国互联网公司爱彼迎Airbnb CEO布莱恩·切斯基称公司正“大量依赖阿里巴巴的千问模型”,并直言“比OpenAI更好更便宜”;“美国版小红书”Pinterest也于近期转投Qwen,其CEO比尔·雷迪直言使用Qwen的成本不到Anthropic、OpenAI等同类闭源模型的8%。 截至目前,Qwen已经开源460多个模型,在开源社区总下…
真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。 作者丨张璐 编辑丨岑峰 幸丽娟 高质量标注数据快用完了,算力贵得离谱,黑盒依然无解。 大模型时代信奉的 Scaling Law,正在面临多重瓶颈。 更麻烦的是另一件事:很多任务天生就没有大数据——药物研发、冷启动推荐、科学探索。这些不是技术的短板,是世界的常态。 在IJCAI 2026大会的 Early Career Spotlight(早期职业焦点)环节,北京雁栖湖应用数学研究院(BIMSA)副教授王雅晴,给这些问题做出了系统回应。 王雅晴长期从事小样本学习与 AI for Science 研究。她博士毕业于香港科技大学,曾任百度研究院资深研究员,现任北京雁栖湖应用数学研究院(BIMSA)副教授。贯穿其研究经历的一条主线是:如何提高 AI 对有限数据与经验的利用效率,使其在监督稀缺的场景下仍能实现可靠的泛化、适应与决策。 她在题为《迈向高效数据智能:从少样本学习到智能体系统》(Toward Data-Efficient Intelligence: From Few-Shot Learning to Agentic Syste…

告别理想仿真,中国学术团队用物理工程方案回应落地挑战。 作者丨张璐 编辑丨岑峰 过去一年多里,具身智能似乎按下了快进键。 从 Physical Intelligence 发布的π₀到开源社区追捧的OpenVLA,VLA大模型一路高歌猛进。在各种标准基准测试和精心搭建的实验室 Demo 中,机械臂叠衣服、拿取物品流畅得宛如人类,动辄刷出 90% 甚至 95% 以上的成功率。 然而,当全行业都在欢呼“机器人的 GPT 时刻”到来时,前沿学术界与产业界却爆发了一场剧烈的反思:这些动辄数十亿参数的具身大模型,真的学会“举一反三”了吗?还是在“死记硬背”? 在主流学术视角中,VLA 大模型像是给机器人装上了具备常识与规划能力的“大脑”。但要让机械体真正干好精细活,仅有一个聪明的大脑远远不够。 最新实验数据表明,面对物品位置的随机挪动或新指令组合时,纯端到端大模型往往会受到“空间过拟合”的约束,末端执行成功率会出现剧烈衰减。 这恰恰说明:具身智能要真正走出实验室,不仅需要大模型提供常识和高层决策,更需要扎实的工程技术去打造精准、稳健的“小脑”。 下面雷峰网盘点入选 IJCAI 2026 的 6 项…

Grafana Labs 宣布"正式上线两款工具 gcx CLI 和 Grafana MCP 服务器,使 AI 编码代理能够在开发过程中实时查询可观测性数据。这两款工具均允许智能代理从 Grafana Cloud" 或自建技术栈中提取指标、日志、追踪、SLO 以及合成监控结果。这种集成有助于弥合智能代理生成代码的速度与工程师对代码功能理解之间的差距。据 InfoQ 报道",这两款工具已于 4 月在 GrafanaCon 2026 大会上发布。 这些工具解决了基于智能代理的编码工作流中经常存在的一个问题。开发人员主要借助大语言模型(LLM)来规划、实现和审查变更。然而,它们可能在尚未完全理解代码变更的情况下就合并了拉取请求(PR)。过去,工程师在编写代码时会同步构建针对这次变更的心理模型。当代码差异由智能代理生成时,这一构建心理模型的过程便不复存在,尽管代码审查代理和“LGTM”审批会带来一种虚假的安全感。Grafana Labs 提出的解决方案是将可观测性数据纳入审查流程,作为一种额外的证据,用于对智能代理的输出结果进行检查,而非仅依赖代码审查。 从架构上讲,这两款工具的功能固化程度有…


头图来源:oxalpha.com 最近,海外开发者圈又被一个没有名字的模型刷屏了。 8 月 20 日,OpenRouter 上多了一个叫 Ox Alpha 的模型,100 万 token 上下文、支持图片和视频输入、能调用工具、免费。随后,它被接进 OpenCode、Hermes 等编程 Agent。有人拿它修代码,有人用它跑软件工程基准,还有人盯着 tokenizer 和报错信息,试图猜出它到底是谁家的。 目前,Ox Alpha 的身份还没有得到官方确认。社区最流行的猜测是,它与智谱 GLM-5.x 系列关系很近;依据是 tokenizer、推理模式报错和部分输出习惯的相似性。但这还只是技术分析,智谱官方目前还没有认领。 从 Ox Alpha 爆火,可以看到一个越来越常见的出海打法:模型先匿名上线,让海外开发者替它做第一轮测试、传播和身份鉴定。 一、从 HappyHorse 到 Ox Alpha Ox Alpha 并不是第一个蒙着脸跑出来的模型。 往前翻四个月,阿里的 HappyHorse(欢乐马)也是这个路数—— 没有发布会,没有公司名,直接空降到 AI 评测平台 Artifici…

arXiv:2608.20735v2 Announce Type: replace-cross Abstract: Manipulating moving objects requires a policy to anticipate contact events, yet vision-language-action (VLA) policies are commonly fine-tuned from the current observation alone. World action models (WAMs) learn predictive dynamics, but running a video-scale teacher or explicitly imagining future frames at deployment is costly. We introduce ForeTime-VLA, a dense pi0.5 policy that distills a future-aware, action-equivalent representation fr…
arXiv:2606.01734v2 Announce Type: replace-cross Abstract: This paper proposes ``FlatVPR,'' a novel geometric rectification paradigm that effectively bridges the trade-off between map lightweightness and localization accuracy in visual place recognition (VPR) by enforcing a feature manifold structure where any descriptor between two adjacent anchors $\mathbf{z}_A$ and $\mathbf{z}_B$ can be accurately reconstructed via linear interpolation $\hat{\mathbf{z}}_{pseudo} = (1-t)\mathbf{z}_A + t\mathbf{…
arXiv:2601.17885v2 Announce Type: replace-cross Abstract: Bimanual manipulation in cluttered scenes requires policies that remain stable under occlusions, viewpoint changes and scene variations. Existing vision-language-action models often lack such robustness because (i) multi-view features are fused via view-agnostic token concatenation, yielding limited cross-view spatial representations, and (ii) language is injected as global conditioning, resulting in coarse instruction grounding. In this …
arXiv:2608.18292v2 Announce Type: replace Abstract: Consider one robot guide dog escorting a blind user to a seat while a second retrieves and delivers an object. We introduce \textsc{GuideFetch}, a framework for coordinating this concurrent guide-and-fetch mission with heterogeneous robots. A large language model (LLM) instantiates a schedule-conditioned four-action schema; deterministic normalization and validation enforce registered targets, robot capabilities, and the selected schedule, whil…
arXiv:2608.00569v2 Announce Type: replace Abstract: Deploying billion-parameter Vision-Language-Action (VLA) policies on mobile robots creates a systems conflict: semantic reasoning benefits from cloud GPUs, whereas closed-loop control must respond locally despite network delay and jitter. Existing hierarchical and asynchronous policies improve throughput, but their slow-path representations can still arrive stale or require explicit scheduling and delay cues. We introduce CloudEdgeVLA, a cloud-…
arXiv:2607.02092v3 Announce Type: replace Abstract: Deploying a pretrained flow-matching vision-language-action (VLA) policy on a particular robot and workspace often calls for task-specific adaptation, while full- policy fine-tuning is costly and changes the base behavior. We present Guided Action Flow, an inference-time method that keeps a pretrained SmolVLA policy frozen and steers its reverse-time action-flow sampling with gradients from a task-specific action-chunk critic. QGF trains a visu…
arXiv:2606.08015v3 Announce Type: replace Abstract: We propose Q-Guided Value-Gradient Matching (Q-VGM), an offline-to-online reinforcement learning (RL) method for fine-tuning flow-matching vision-language-action (VLA) policies with a learned Q-function. Classical off-policy actor-critic methods improve a policy by following the critic gradient $\nabla_A Q$, but applying this update to flow policies requires backpropagation through the multi-step denoising process (BPTT), which is costly and un…
arXiv:2604.15395v3 Announce Type: replace Abstract: Over the recent years, the field of robotics has been undergoing a transformative paradigm shift from fixed, single-task, domain-specific solutions towards adaptive, multi-function, generalpurpose agents, capable of operating in complex, open-world, and dynamic environments. This tremendous advancement is primarily driven by the emergence of Foundation Models (FMs), i.e., large-scale neural-network architectures trained on massive, heterogeneou…
arXiv:2603.16673v5 Announce Type: replace Abstract: Embodied robotic systems increasingly rely on large language model (LLM)-based agents to support high-level reasoning, planning, and decision-making during interactions with the environment. However, invoking LLM reasoning introduces substantial computational latency and resource overhead, which can interrupt action execution and reduce system reliability. Excessive reasoning may delay actions, while insufficient reasoning often leads to incorr…
arXiv:2509.23155v3 Announce Type: replace Abstract: Robotic manipulation benefits from foundation models that describe goals, but today's agents still lack a principled way to learn from their own mistakes. We ask whether natural language can serve as feedback, an error-reasoning signal that helps embodied agents diagnose what went wrong and correct course. We introduce LaGEA (Language Guided Embodied Agents), a framework that turns episodic, schema-constrained reflections from a vision language…
arXiv:2608.22731v1 Announce Type: cross Abstract: Nonverbal behavior generation systems for virtual agents often take an utterance as input and generate nonverbal behaviors that emphasize or illustrate the content of the verbal channel. However, human nonverbal behavior is shaped by more than the content of the speech. It is also influenced by speaker roles, interpersonal relationships, social context, and the cognitive and emotional states of the interactants. As a result, the nonverbal channel…
arXiv:2608.21628v1 Announce Type: cross Abstract: Black-box VR and 3D applications are difficult to regression test because observable failures depend on where a tester moves, what objects are visible, and which views are captured. Manual exploratory testing can find such failures, but its evidence is time-consuming to reproduce; systematic sweeps are reproducible, but they lack semantic guidance and spend exploration budget on low-value viewpoints. We observe that an LLM can make the high-level…
arXiv:2608.23478v1 Announce Type: new Abstract: Vision-Language-Action (VLA) models can turn multimodal context into robot actions, but their action decoders are still trained largely by behavior cloning. This supervises which motor command was demonstrated while leaving implicit the local objective served by the behavior under the instruction. Future-based supervision enriches action learning with frames, latent observations, trajectories, or motion representations, but these signals capture pa…