Nvidia and Amazon announced an expanded partnership Wednesday that includes deploying an additional 2 million Nvidia GPUs, including Blackwell Ultra, Rubin, and Rubin Ultra chips, across Amazon Web Services data centers in 2027 and 2028. The deal follows an agreement five months earlier to deploy over 1 million GPUs, with Nvidia stating that demand had […]

The artificial intelligence juggernaut kept cruising along this week thanks to big earnings results from Nvidia — and even Salesforce, the supposed epicenter of the SaaSpocalypse. Nvidia not only beat all expectations for revenue, CEO Jensen Huang (pictured) indicated it’s going to be capacity-constrained for awhile longer, which certainly indicates no diminution of demand. Likewise […] The post It’s Nvidia’s world. We just live in it appeared first on SiliconANGLE.
类脑计算正从感知和低层控制切入机器人。 作者丨魏溶 编辑丨岑峰 “如果未来全球真的部署10亿至100亿台高度依赖AI的人形机器人,今天这套计算方式,还供得起电吗?” 德国慕尼黑工业大学教授Alois Knoll在2026世界机器人大会“类脑智算,让机器人学会自主决策”圆桌会议开场时提出了这个问题。 过去讨论计算中心,人们习惯谈千万亿次浮点运算、百亿亿次浮点运算;如今,随着AI基础设施不断扩张,数据中心的建设规模越来越多地与吉瓦级电力联系在一起,算力的度量衡,正在从“百亿亿次浮点运算(Exaflops)”变成“吉瓦级功耗(Gigawatts)”。 当AI进一步从数据中心进入实体世界,能源问题还会被继续放大。Knoll判断,如果人形机器人未来真的走向十亿级部署,沿用当前高功耗计算模式,累计能源需求可能变得难以承受。 产业因此需要寻找传统计算架构之外的其他可能性,神经形态计算便是其中之一。 Alois Knoll 教授在开场时曾回顾了这段历史:从百年前的神经元观察,到欧洲“人类大脑计划”中被架构师 Steve Furber 戏称为“智能水平大约等同于五只老鼠”的早期类脑系统,再到如今试图接管…

一年前,AI云服务商Nebius创始人兼CEO Arkady Volozh还在回答一个问题:谁会买那么多GPU?一年后,他给出的判断已经变成,真正的制约因素是人类究竟能够建出多少算力。 2025年,他主要从技术、资本和市场三个维度解释一家新云(Neocloud)如何成立;到了2026年,问题已经不只是“怎样做一家新云”,而是AI时代的云需要被怎样重新建设。 在Volozh的描述里,这套新的AI云向下延伸至土地、电力、数据中心和机架,向上则覆盖基础云服务、推理和智能体服务。支撑它的基础设施规模,可能达到过去建设规模的数百倍乃至数千倍,也因此需要“一套全新的工具”。 雷峰网对比了Arkady Volozh在《Spotlight On》中2025年和2026年的两次访谈,从中看见一种思维方式的转变:新云开始从GPU基础设施供应模式,向新一代AI云底座演进。 01 新云的三条腿:技术、资本与市场 对新云来说,拥有GPU从来不等于拥有一朵云。 GPU本质上是一种计算资源,要把这些资源持续交付给客户,还需要数据中心、机架、网络、软件栈,以及足够的资本和客户需求。对早期的新云厂商而言,竞争也不只是拿…

作者|包永刚 编辑|林觉民 英伟达GTC,聚光灯总属于最新一代GPU,但中国芯片投资人李华今年却盯上了CPU。 黄仁勋在台上表示,进入推理时代,并不是所有任务都需要塞进GPU机柜。随后,他展示了独立的CPU机柜、存储机柜和LPU机柜。过去几年站在GPU身后的CPU,被单独摆到了聚光灯下。 看到这一幕,李华重新联系了一家自己此前看过、最终没有投资的Arm CPU创业公司。几个月前,他还认为CPU市场格局稳定、初创公司机会有限;这一次,他开始询问对方的融资情况和产品进度。 李华不是唯一回头研究CPU的投资人。 “我们从2025年底就开始系统性研究CPU的投资机会。”商汤国香资本合伙人李扬对雷峰网表示,“2026年,以Agent为代表的推理需求兴起,让我们投资CPU的逻辑从两层变成了三层。” Agent兴起后,CPU的需求、价格和资本关注度同时抬升。多位业内专家将未来五年视为国内CPU公司的关键窗口期。 但市场升温并不意味着所有公司都拿到了入场券。被Agent点燃的CPU市场,正在走向一场横跨技术路线、新旧玩家和应用场景的五年混战。这场混战最大的变量是什么?欢迎添加作者微信BENSONEIT…

Token 成本成为大模型硬件竞争的新坐标。 作者丨郑佳美 编辑丨岑 峰 今天,OpenAI 的自研推理芯片 Jalapeño,终于从规格表走到了跑分台。 这次公开的数据很接地气:Token 吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT 要一直回消息,Reasoning 模型要持续生成长链路内容,Agent 还会一轮接一轮调用模型。算力再高,Token 吐得慢、延迟压不下来、功耗又高,数据中心照样难受。 成绩一出来,Reddit 很快就把 Jalapeño 和 NVIDIA Rubin 摆到了一起。有人认为它已经进入 Rubin 的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。 更巧的是,Jalapeño 并不是孤例。NVIDIA 正在把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也把 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗? 01 Ja…

MoK:把 token 调度、跨 GPU 通信和专家计算塞进同一个 GPU 内核。 作者丨郑佳美 编辑丨岑 峰 7 月 21 日,NVIDIA 公布了 GB300 NVL72 训练 DeepSeek-V3 的最新成绩:256 张 GPU 上,单卡性能达到 1,648 TFLOPS。 不到两周后,Cursor 开源了 Mixture-of-Kittens,简称 MoK。它没有继续折腾更快的矩阵乘法,而是直接重写了一层 MoE 的执行方式,把 token 调度、跨 GPU 通信和专家计算塞进同一个 GPU 内核。 这件事有点反直觉。因为 GB300 NVL72 已经把 72 张 GPU 放进同一个 NVLink Domain,整机架 NVLink 总带宽达到 130 TB/s。按这个规格看,GPU 之间传数据应该已经足够快。 可在大规模 MoE 训练里,通信依然会拖住专家计算。 问题出在 MoE 的数据流。Router 每一步都会重新决定 token 去哪个专家,而专家分散在不同 GPU 上。token 要先跨卡送过去,算完再传回来;发送之前还要整理位置,到达之后还要等待数据完整。随着 M…

谁不想在新年到来之际收到一只可爱的 AI 机器鸭呢? 距离 2026 年圣诞节还有四个月,在英伟达以约 129 亿美元收购消息曝光次日,AI 开源社区 Hugging Face 发布了一款名为 Microduck 的小机器人。它身高 25 厘米、重不足 800 克。演示视频里,它用喙叼着袜子摇摇晃晃地走路,被人推搡时会尽力稳住,即便倒下也能自己爬起来,甚至可以穿上轮滑鞋滑旱冰。 产品售价 399 美元(约合 2,700 元人民币),有奶油白、石墨灰、薰衣草紫、天空蓝四种配色可选,附赠一只游戏手柄。联合创始人克莱姆·德朗(Clem Delangue)在社交平台 X 上放出一段 50 秒的演示视频,几个小时内浏览量接近 40 万。 (来源:Pollen Robotics) 从语音互动,到“走”进真实世界 做开源大模型托管平台起家的 Hugging Face,入局具身智能的节点要追溯到 2024 年初,前特斯拉(Tesla)Optimus 团队科学家雷米·卡德内(Rémi Cadene)加入,主导开源机器人库 LeRobot 的开发;2025 年 4 月,Hugging Face 完成对法国…

arXiv:2608.24199v2 Announce Type: replace Abstract: Generative simulation for surgical robotics still lacks real-time interaction. Physical-robot experiments, often involving animal or cadaver labs, are time-consuming, costly, and difficult to reproduce, while classical simulators struggle to capture photorealistic appearance and deformable-tissue dynamics. We address this gap with Cosmos-H-Dreams, an integrated real-time surgical world-model system combining an action-conditioned generative mod…
英伟达收购Hugging Face引发了开发者群体担忧,对于中国开源生态来说,风险亦在增加。


据Business Insider报道,英伟达近期一直在与 Hugging Face 洽谈收购事宜。Hugging Face 是一个备受欢迎的、用于分享开源模型以及基于开源模型进行开发的AI 平台。如果交易最终达成,这可能成为这家芯片巨头迄今规模最大的交易之一。 据知情人士透露,双方最近几周已经就收购展开谈判,这笔交易对 Hugging Face 的估值可能超过 130 亿美元。目前双方尚未达成协议,谈判仍有可能破裂。 不过,The Information报道称,英伟达已同意以 129 亿美元收购 Hugging Face。截至发稿,双方均未对此做出回应。 而就在该消息曝出前数小时,英伟达发布了最新的季度财报。 在最新的2027财年第二季度财报电话会上,黄仁勋判断,客户对英伟达算力的需求明年可能增长约100%,但受供应限制,公司目前只能有把握实现约70%的营收增长。英伟达预计,至少到2028财年结束,供应仍将是主要瓶颈。 需求的拐点是,AI从“人发起一次请求”迅速转向“智能体持续工作”。黄仁勋称,一个AI智能体完成任务所需的计算量,可能是人类直接使用AI时的15—100倍。就在过去一个…

特努斯首秀开启 iPhone 18 Pro / Ultra 系列新篇章,苹果发布会官宣定档 9 月 10 日 8 月 27 日消息,苹果官方宣布将于当地时间 9 月 9 日(北京时间 9 月 10 日凌晨 1 点)举行秋季新品发布会,主题为「惊喜闪耀」(Surprise and shine)。 这将是约翰 · 特努斯(John Ternus)于 9 月 1 日正式接任苹果 CEO 后的首场发布会,预计将推出全新一代 iPhone 18 Pro / Max 以及 Ultra 系列折叠屏新机。后续,苹果还将于明年春季推出 iPhone 18 基础版及 iPhone 18e 等新品。 结合此前爆料,iPhone 18 Pro 系列预计为常规升级,外观几乎不变,主要亮点包括: 首发 2nm 工艺的 A20 Pro 芯片,能效与性能提升; 后置主摄有望升级可变光圈镜头; 采用苹果自研 C2 蜂窝调制解调器; 灵动岛打孔面积可能缩小; 新配色; 受内存芯片持续短缺影响,售价可能较前代大幅上涨。 正如大家所想到的那样,本次发布会的绝对主角将是苹果首款折叠屏 iPhone。据多方爆料,该设备采用横向书…

英伟达预计 2028 财年营收增长 70%,年销售额约达 6730 亿美元,将超过苹果和 Alphabet,仅次于亚马逊。CFO Colette Kress 于 8 月 26 日给出该预测,远高于分析师平均预期的 44%。供应而非需求成为近期上限,黄仁勋称内存等部件短缺限制了更高预期,客户群正从超大规模厂商扩展至 ACIE。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtc4fn8n01mwrozaq4bot3b4
NVIDIA will present at the following event for the financial community

Nvidia Corp. has reportedly bought Hugging Face Inc., a startup with a popular platform for hosting open-source artificial intelligence projects. Reports that an acquisition was in the cards first leaked on Monday. Business Insider broke the news that Hugging Face had received interest from multiple prospective buyers. On late Wednesday, The Information reported that Nvidia […] The post Nvidia reportedly acquires AI project hosting platform Hugging Face for $12.9B appeared first on SiliconANGLE.
Artificial intelligence is changing what storage and data management platforms look like. In collaboration with Super Micro Computer Inc. and Solidigm, DataDirect Networks Inc. has introduced DDN Enterprise AI HyperPOD, built on Nvidia Corp.’s AI Data Platform. The goal is to simplify the storage, scaling and deployment of AI inference for enterprise workloads. “Customers are […] The post The AI storage stack gets an inference-era rethink appeared first on SiliconANGLE.
SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行基准测试,其密集无损路径较 Diffusers 快 1.85-1.95×,无近似损失。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtbtrn8j0222ro2kb7opgppz
Anthropic has signed a deal to rent approximately $45 billion in AI compute from Nscale, a British AI infrastructure company, according to a source familiar with the matter. Nscale, founded in 2024 and already partnered with Microsoft, will supply Anthropic with computing power built on Nvidia’s new Vera Rubin chip system, a six-chip architecture representing […]

The Jetson Orin Nano 2 comes as the AI chip giant targets physical AI expansion.

The companies are expanding their collaboration beyond GPUs into CPUs, government AI infrastructure and robotics.

NVIDIA’s Gamescom announcements are revealing what’s next for GeForce NOW, with new ways to play, more supported devices and platforms, and even more big PC games headed to the cloud. New NVIDIA DLSS 4.5 technology controls give members more ways to fine-tune gameplay, while expanded support for new Steam devices, GOG single sign-on, Firefox browser […]

8月26日晚,智谱正式上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型。其总参数320B,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。GLM-5.3-Flash的架构专为极低成本而设计,结合智谱最新的30T Token多模态预训练语料,能够以更少的计算资源实现更强的性能。 依托先进的国产异构混推技术,商汤大装置为GLM-5.3-Flash上线提供大规模国产算力支持与Token服务,打造国产算力规模化商用又一硬核落地标杆。 这一合作的背后,正是商汤打造的 “一套模型、一座 Token(词元)工厂、一套智能体管控系统” 核心能力体系。其中 Token 工厂承担着把智能能力规模化生产出来的关键作用:它通过多模态模型和大装置基础设施的联合优化,把不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的Token。同时Token工厂与大…

Z.ai releases GLM-5.3-Flash, an open-source model with 320 billion parameters that lands just three points behind the larger GLM-5.3 on Artificial Analysis's Intelligence Index, at a seventh of the cost. What's notable is that all of the inference traffic ran on Chinese AI chips instead of Nvidia hardware. The article GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia appeared first on The Decoder.
