斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtcxdp3f07l3roq5uk6om1aw
2024 年初,科罗拉多大学博尔德分校(University of Colorado Boulder)化学与生物工程系的博士生阿卡瓦·冈古利(Arkava Ganguly)已经在一个数学问题上卡了一年半。 他和导师安库尔·古普塔(Ankur Gupta)教授想知道,粒子的形状究竟如何影响它在电场中的移动速度。自上世纪初相关理论得到经典结论以来,该问题被学界讨论了一个多世纪,却一直缺乏一套广泛适用的解析框架。 新的发现往往来自交流。一次晚餐中,普林斯顿大学(Princeton University)流体力学家霍华德·斯通(Howard Stone)教授给安库尔提出了一个建议:不要试图直接处理任意形状,或许可以从“变形球体”(deformed sphere)入手,把粒子看成一个球,加上一个很小的形状扰动。 思路打开了,但求解所需的计算量依然巨大,他们决定把繁重的推导工作交给 Claude,并在短短五周后得到了答案,研究于 8 月 27 日发表在《流体力学杂志》(Journal of Fluid Mechanics)。 在这篇论文的正文和附录中,研究者几乎逐字公开了他们与 Claude 的关…

A federal court in San Francisco has ruled that the Pentagon unlawfully classified Anthropic as a supply chain risk. The Department of Defense blacklisted the company in retaliation for its public criticism of government AI policy. The designation formally remains in place because a parallel case in Washington is still pending. The ruling still sends an important signal ahead of Anthropic's planned IPO this fall. The article U.S. court rules Pentagon's blacklisting of Anthropic was unlawful appe…

MHS把一场新药研发实验速度提升3倍。 作者丨高允毅 编辑丨岑 峰 这是Anthropic第二次发布全行业统一协议。 第一次,它发布了MCP,它统一了 AI 代理调用外部工具、数据源与 API 的方式,如今满世界的 Agent 都靠它连数据库、接浏览器、调 API。这一次,它把完全相同的逻辑延伸到了物理世界,Agent可以和不同的物理设备之间对话了。 这是一套面向物理设备的 AI 代理接口标准,叫Model Hardware Standard(MHS),此次发布的是预览版本,已经在全球顶尖实验室的显微镜、机械臂和量子计算机上使用起来了。 它解决的,是整个科研与工业领域头痛了二十年的问题:硬件接口碎片化。 01 二十年未破的困局: 标准追不上硬件的多样性 这是一个所有实验室从业者都心照不宣的困境。 在一间自动化实验室里,成像相机可能基于 Python 开发,探测器运行在 MATLAB 环境中,电生理设备采用 C# 架构,而机械臂、共聚焦显微镜、移液工作站更是各有各的专属驱动、私有数据格式和封闭控制软件。多数情况下,哪怕是相邻的两台仪器,都无法感知彼此的运行状态。 如果研究人员想实现 “相…

类脑计算正从感知和低层控制切入机器人。 作者丨魏溶 编辑丨岑峰 “如果未来全球真的部署10亿至100亿台高度依赖AI的人形机器人,今天这套计算方式,还供得起电吗?” 德国慕尼黑工业大学教授Alois Knoll在2026世界机器人大会“类脑智算,让机器人学会自主决策”圆桌会议开场时提出了这个问题。 过去讨论计算中心,人们习惯谈千万亿次浮点运算、百亿亿次浮点运算;如今,随着AI基础设施不断扩张,数据中心的建设规模越来越多地与吉瓦级电力联系在一起,算力的度量衡,正在从“百亿亿次浮点运算(Exaflops)”变成“吉瓦级功耗(Gigawatts)”。 当AI进一步从数据中心进入实体世界,能源问题还会被继续放大。Knoll判断,如果人形机器人未来真的走向十亿级部署,沿用当前高功耗计算模式,累计能源需求可能变得难以承受。 产业因此需要寻找传统计算架构之外的其他可能性,神经形态计算便是其中之一。 Alois Knoll 教授在开场时曾回顾了这段历史:从百年前的神经元观察,到欧洲“人类大脑计划”中被架构师 Steve Furber 戏称为“智能水平大约等同于五只老鼠”的早期类脑系统,再到如今试图接管…

一年前,AI云服务商Nebius创始人兼CEO Arkady Volozh还在回答一个问题:谁会买那么多GPU?一年后,他给出的判断已经变成,真正的制约因素是人类究竟能够建出多少算力。 2025年,他主要从技术、资本和市场三个维度解释一家新云(Neocloud)如何成立;到了2026年,问题已经不只是“怎样做一家新云”,而是AI时代的云需要被怎样重新建设。 在Volozh的描述里,这套新的AI云向下延伸至土地、电力、数据中心和机架,向上则覆盖基础云服务、推理和智能体服务。支撑它的基础设施规模,可能达到过去建设规模的数百倍乃至数千倍,也因此需要“一套全新的工具”。 雷峰网对比了Arkady Volozh在《Spotlight On》中2025年和2026年的两次访谈,从中看见一种思维方式的转变:新云开始从GPU基础设施供应模式,向新一代AI云底座演进。 01 新云的三条腿:技术、资本与市场 对新云来说,拥有GPU从来不等于拥有一朵云。 GPU本质上是一种计算资源,要把这些资源持续交付给客户,还需要数据中心、机架、网络、软件栈,以及足够的资本和客户需求。对早期的新云厂商而言,竞争也不只是拿…

Chinese chipmaker ChangXin Memory Technologies (CXMT) reported a sharp surge in first-half revenue on Friday, as the firm released its first financial results since becoming China’s most valuable publicly traded company in a blockbuster Shanghai listing last month. The Hefei-based firm – China’s leading maker of dynamic random-access memory (DRAM) products – posted revenue of 150.31 billion yuan (US$22.4 billion) for the six months to June, up 873.64 per cent year on year, according to a filing.…

The company is testing robots that can swap cables, reset servers, and take on other tasks performed by technicians, fueling concerns among some workers that their jobs could be at risk.


In this guide, we show how to build a parking lot occupancy monitoring system with computer vision.

8月26日,第二届世界机器人运动会正式闭幕,奖牌榜第一的位置变成了首次参与此项赛事的智元——18金16银12铜,金牌数和奖牌总数都排在第一。


On-demand delivery giant Meituan swung back to profitability in the second quarter as China’s price war in food delivery cooled, allowing the company to scale back subsidies and target higher-value customers. Beijing-based Meituan posted an adjusted net profit of 2.5 billion yuan (US$372 million) for the June quarter, snapping a three-quarter losing streak according to its earnings report on Friday. The figure beat average analyst forecasts of 340 million yuan compiled by Bloomberg. Revenue rose…

当具身智能风口再起,诺亦腾机器人CEO戴若犁选择了一条与众不同的路:以人为中心的数据采集。从动作捕捉到数据工厂,他如何用跨本体复用的数据体系,为物理AI铺路?本文深度对话戴若犁,揭秘数据采集赛道的商业逻辑与创业心法。 PART 01 天真的创业者 大概半年前,戴若犁博士开始写美食笔记。不是寥寥几句的赞美,一篇笔记动辄几千字。 他会详实记录各种美味的细节。 比如香港的菠萝油。他会描写面包体如何松软、糖壳如何酥脆不掉渣。吃的时候,温热面包夹上冻过的黄油,趁黄油没化冻时大口咬下,以咬掉半块黄油为佳。随后务必快速咀嚼和吞咽,才能感受温度和口感的双重冲突。 深圳蛇口胜记餐厅的那碗猪油拌饭:大米是滚烫的、煮得略干的,应该是优质东北大米或者日本珍珠米,泛着珠光的饱满;猪油必须是嫩油,会留有一些油渣,增加酥脆口感;拌饭酱油用的是头抽。大口咽下,味蕾瞬间满足。 戴若犁在朋友圈里分享的街头美食 从餐厅、到背后的人和故事,他都娓娓道来。美食只是锚点,他真正想要留住的“数据”是关于故人的回忆。这听起来像是一位中年人的念旧。经历过几轮技术浪潮的他,确实也不算是年轻人了。 但如果你知道他的身份——诺亦腾机器人创始…

智元机器人在第二届世界人形机器人运动会斩获18金,验证其量产机型在运动与作业场景的硬实力。公司正冲刺港股IPO,三年营收从30万跃至10.5亿,出货量全球第一。虽难复刻宇树上市首日暴涨神话,但长期价值取决于能否兑现“生态构建者”的业绩增长逻辑。

The cost of running equivalent AI models has fallen sharply since 2022, yet major technology firms continue to increase capital spending on data centers, memory, packaging, and power. Efficiency gains are expanding total demand through multi-step agent systems, shifting physical bottlenecks and concentrating value in slower-to-scale assets.

红杉合伙人Sonya Huang提出“产品即智能”,Roblox用游戏卡带破解世界模型困境——两条线索指向同一件事:真正有壁垒的是应用与模型之间别人学不走的数据飞轮。国内少有公司同时做这两件事,Loopit发布自研世界模型Zing-0.5。 我之前写过红杉美国合伙人Sonya Huang的那篇演讲,也写过Roblox用“游戏卡带”破解AI世界模型困境的那篇研究。这两篇文章之间有一条我没有显式点出来的逻辑线——如果你把它们放在一起看,会发现它们其实在回答同一个问题:在AI时代,一个真正有竞争壁垒的产品,到底长什么样子? 红杉的答案是:Not your weights, not your product。你调用的API,是你的产品最核心的那部分,但你对它没有任何控制权。Roblox的答案是:画面连续不等于世界存在,AI负责渲染,代码负责逻辑,两者必须共同在场才能撑起一个真正可交互的世界。这两个判断看起来方向不同,但其实指向同一件事:光有应用不行,光有模型也不行,真正有价值的东西,是两者之间那个别人学不走的数据飞轮。 这条逻辑在美国开始有越来越多的公司在实践,但在国内,我很少看到同时做这两件…

“在顺雨与研究团队的努力下,Hy4将会迎来更多突破与更大的进步,大家可以拭目以待。但眼睛也不能只盯着模型这一层。”汤道生前两天在内部署名文章中说的,现在终于来了。 今天,腾讯发布了混元Hy4 preview,总参数 770B、激活参数 49B,上下文长度突破 1M,重点面向Agent、Coding与生产力场景优化,增强在真实业务场景中完成复杂任务的能力。 据悉,相比上一代,Hy4 preview在多步骤Agent、代码开发和生产力任务上进一步提升,尤其是在更好的任务拆解、上下文承接、指令遵循和长链路执行能力上。 在Coding场景中,进一步增强代码理解、生成、修改和复杂工程任务处理能力;在生产力场景中,重点提升文档处理、信息分析、办公自动化、游戏开发、网页生成及跨工具协作等能力;在游戏开发场景中,增强了一句需求直接生成可玩原型能力,并能熟练使用游戏引擎,开发者可以通过多轮交互持续完善复杂游戏项目;在科学研究场景下,提升复杂科研问题的理解、推理与求解能力。 值得注意的是,Hy4 preview 在自身研发的全链路过程中发挥了积极价值,首次参与训练方法、数据策略、评估体系和底层算子的自动优…

On August 28, Tencent Hunyuan released and open-sourced Hy4 preview, its next-generation large language model with 770 billion total parameters and a context window exceeding 1 million tokens.

OpenAI is building a "Persistent Mode" for its AI agent Codex that stays active indefinitely and generates its own follow-up tasks. WIRED found the relevant code, and OpenAI confirmed the tests. The feature comes with risks, though. With GPT-5.6 Sol, persistent behavior already led to unwanted actions, like deleting user data. The article Always-on and self-starting AI agents might be OpenAI's next big play appeared first on The Decoder.

Chinese artificial intelligence firm MiniMax has raised the three-year purchase ceiling on its cloud computing deals with Alibaba Group Holding by 220 per cent to US$1.2 billion, underscoring surging demand for computing power among the country’s top AI developers. The Shanghai-based company planned to spend up to US$300 million on Alibaba Cloud services this year, nearly triple its original US$115 million cap, after burning through two-thirds of its budget by the end of June, according to its..…
