Clem Delangue, CEO of Hugging Face, said the Microduck is an “open-source robot you can teach new tricks with reinforcement learning.”
8月26日晚,智谱正式上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型。其总参数320B,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。GLM-5.3-Flash的架构专为极低成本而设计,结合智谱最新的30T Token多模态预训练语料,能够以更少的计算资源实现更强的性能。 依托先进的国产异构混推技术,商汤大装置为GLM-5.3-Flash上线提供大规模国产算力支持与Token服务,打造国产算力规模化商用又一硬核落地标杆。 这一合作的背后,正是商汤打造的 “一套模型、一座 Token(词元)工厂、一套智能体管控系统” 核心能力体系。其中 Token 工厂承担着把智能能力规模化生产出来的关键作用:它通过多模态模型和大装置基础设施的联合优化,把不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的Token。同时Token工厂与大…

Z.ai releases GLM-5.3-Flash, an open-source model with 320 billion parameters that lands just three points behind the larger GLM-5.3 on Artificial Analysis's Intelligence Index, at a seventh of the cost. What's notable is that all of the inference traffic ran on Chinese AI chips instead of Nvidia hardware. The article GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia appeared first on The Decoder.


经专家评审及组委会复核,世界人工智能开源大赛(GOAI)初赛评审工作现已完成。依据赛事规则及各赛道评审结果,共有120个作品从全球2999个初赛作品中脱颖而出,成功晋级下一阶段。 现公布四大赛道晋级名单,具体名单详见以下海报: 赛道一「新智基座 Agent Infra」TOP30团队晋级复赛 赛道二「无界应用 Boundless Agents」TOP30团队晋级复赛 赛道三「前沿探索 AI for Research」中,赛题一、赛题二各取TOP20,合计40支团队晋级复赛 赛道四「具身未来 Embodied Future」中,赛题一、赛题二各取TOP10,合计20支团队直接晋级总决赛 恭喜所有晋级团队!期待大家在后续阶段继续以可运行、可验证、可复现的成果,展现AI开源的真实价值。 赛道一「新智基座」、赛道二「无界应用」、赛道三「前沿探索」的晋级团队将进入复赛阶段,请按赛事要求完成复赛作品材料准备与提交,提交时间为8月25日—9月3日;赛道四「具身未来」的晋级团队将进入总决赛线下调试阶段,并于8月25日—9月20日分组开展真机调试及决赛准备。具体安排请以GOAI大赛官方网站 https:…

大模型推理成本已成为AI产业落地的核心瓶颈。随着模型参数规模向万亿级迈进、多模态智能体应用场景爆发,推理引擎需要应对算子实现、内存管理、量化压缩、异构调度与并行策略等多维度的技术挑战。本文整理自清华大学助理研究员金煜阳博士在 QCon 全球软件开发大会 2026 北京站的分享《大模型推理加速全链路:内存管理、编译优化、量化与并行策略》。 金煜阳系统介绍了其所在实验室在大模型推理加速全链路方面的探索,覆盖从底层算子优化到上层并行策略的完整技术栈。本文将逐一展开算子级性能调优中的细粒度图层优化方法、面向异构模型结构的KV Cache内存管理、编译与运行时协同的混合精度量化、基于负载特性的CPU-GPU异构调度,以及面向动态请求场景的自适应并行策略,最后介绍开源推理引擎赤兔在国产芯片生态中的实践成果。 以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。 背景与挑战 人工智能的市场规模正在以超出预期的速度扩张。去年来自Precedence Research和艾瑞咨询的数据预测,到2030年全球AI市场规模将达到11万亿。但今年年初OpenAI的持续爆发,以及智能体应用的集中涌现,让这…

Cloudflare 利用在 GitHub Actions 中隔离运行 AI 智能体为 Astro 开源框架实现了自动化问题分类"。该工作流会复现报告的缺陷、诊断根本原因、验证行为,并在生成预览版本供报告者验证之前提出修复方案。Cloudflare 称,Astro 的未解决问题数量从 200 多个降至约 30 个,按这些数据计算减少了约 85%,团队目标是实现零未解决问题。 该工作流复刻了 Astro 维护者在手动处理问题时的完整步骤,每个阶段都由一个独立的子智能体执行。复现智能体验证上报的问题现象;诊断智能体对代码插桩,定位问题根源;验证智能体检查测试用例、文档与注释;修复智能体先把问题复现场景转化为测试用例,再实施解决方案。各个智能体通过 report.md 文件传递信息,而非共用同一个执行上下文。 Astro AI 问题分类工作流(来源:Cloudflare 博客文章") Cloudflare 将该工作流实现为由 GitHub Issue 标签驱动的状态机。新提交的问题会被打上 triage needed (需分级处理)标签;当提议的修复方案得到确认后,该问题就流转至 fix v…

智谱 GLM-5.3-Flash 上线即成新标杆:321B 参数、全新架构,靠 10 万+ 张国产芯片跑出 OpenRouter 历史 4 倍的 token 消耗纪录并限时半价。能力越级、价格脚斩的背后,是混合注意力重写与 IndexPool 池化带来的成本重构。 这几天 ox-alpha 用爽了吧… 正如很多人猜的那样,这个模型来自智谱,正式名称为 glm-5.3-flash,支持多模态,但很多人没猜到的是:这个乱杀的模型只有 321B,且与 glm-5.3 不同,是完全的新架构 更尼玛离谱:智谱的这段时间模型给全世界畅跑,完全是用国产卡供的!!其支撑起的单日 token 消耗量,创下了 OpenRouter 平台历史纪录的 4 倍,而这一切的背后,是 10万+ 张国产芯片集群的服务 还有就是:这模型比 ds4p 聪明,比 ds4f 便宜,还开源,至此…大模型行业又多了一条斩杀线 你以为这就完了?不不不…这个模型开启了限时折扣,半价,所以…真实的斩杀线在这里….斩杀这个词,现在具像化了 对此…只能说唐老师的信用分还是太稳定了:牛来,就是给啊哞的情书 能力越级,价格脚斩 对于这个模型,…

Nvidia is buying open-source AI platform Hugging Face for $12.9 billion, about 80 times its $150 million annual revenue. The deal fits Nvidia's push to invest billions in open AI models while closed providers like OpenAI and Anthropic move away from Nvidia hardware. The article Nvidia snaps up Hugging Face for $12.9 billion as closed AI labs pull away appeared first on The Decoder.

作者|Wildcard 编辑|靖宇 129 亿美元,英伟达要把 Hugging Face 买下来了。 当地时间 8 月 26 日外媒率先爆出消息, 两天前还只是 Hugging Face「正在探索出售」的新闻,转眼就变成了「双方已达成协议」。速度快得让人来不及消化。 这不是一笔普通的 AI 公司并购,而是芯片之王第一次伸手去抓开源 AI 世界的「分发权」。 Hugging Face 被称为 AI 界的「GitHub」,托管着超过 300 万个模型仓库,服务 1300 万开发者,Meta 的 Llama、阿里的 Qwen、Mistral 的开源模型,全都住在这个平台上。它是整个开源 AI 生态事实上的「默认分发层」。 而英伟达,已经垄断了训练和推理的 GPU 硬件。 现在,它还想拥有模型流通的那条路。 01踩着 AI 打滚 先说钱。Hugging Face 上一轮融资是 2023 年 8 月的 D 轮,Salesforce 领投 2.35 亿美元,估值 45 亿美元。Google、英伟达、亚马逊、IBM、Intel、AMD、高通全都参投了那一轮。三年后,129 亿美元的价格大约是上一轮估…
亚马逊同意收购开源数据库 DuckDB 开发团队 DuckLabs。DuckLabs 员工将加入亚马逊 AWS,其中包括联合创始人 Hannes Muhleisen 和 Mark Raasveldt,他们将继续领导团队和制定项目的技术方向,员工也将继续在阿姆斯特丹办公。DuckDB 项目将继续维持现有的开源状态,使用 MIT 许可证,由独立基金会管理。收购 DuckLabs 被认为有助于将亚马逊的云存储服务 S3 转型为客户分析数据而非仅仅存储数据的平台。
Nvidia has reportedly agreed to buy Hugging Face, the popular open-source AI hub, for $12.9 billion in a move that would let Nvidia both protect its chip empire and jump back into the cloud business.
The Information 报道,英伟达同意以 129 亿美元收购 Hugging Face。这笔交易仍处于敲定阶段,仍有可能告吹。英伟达是 Hugging Face 的投资者,它在 2023 年参与了 Hugging Face 的 D 轮融资,当时以 45 亿美元估值融资 2.35 亿美元。英伟达去年还提议以 70 亿美元估值投资 5 亿美元,但遭到 Hugging Face 的拒绝。Hugging Face 是开源 AI 生态系统的核心,托管着数百万个可供开发者使用的 AI 模型和数据集。收购该平台有助于让英伟达在 AI 开发者中占据更大的市场份额。
Alibaba's Qwen team released Qwen3.8-Flash, a multimodal MoE preview of the Qwen4 architecture with only 6B activated parameters and a training cost one-ninth that of Qwen3.7-Plus.
智谱正式发布并开源 GLM-5.3-Flash,Ox Alpha「牛来」 身份揭晓 8 月 26 日,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列的首个原生多模态模型,也正是上周以来匿名登顶 OpenRouter、被社区称为 "牛来" 的 Ox Alpha 的正式身份。 该模型总参数 320B、激活 18B,在权威的 Artificial Analysis 综合智能指数中取得 57 分、与 Claude Opus 4.8 持平,编程表现亦与 Opus 4.8 相当;定价仅为 GLM-5.3 的 1/10(限时折扣内约为 Opus 4.8 的 1/40)。模型以 MIT 许可证开源,权重已上线 Hugging Face,官方确认其完全运行在中国 AI 芯片上。(来源:IT 之家) OpenAI 发布 Hugging Face 安全事件官方报告,还原 AI 模型沙箱逃逸全过程 8 月 27 日,OpenAI 发布了关于 Hugging Face 遭入侵事件的官方报告,首次较为完整地还原了这起事件的经过:一系列罕见因素叠加,导致一款 AI 模型…
Z.ai Co. today released the code for GLM-5.3-Flash, a large language model that’s 10 times more cost-efficient than its predecessor. The algorithm made its original debut last week under the codename Ox Alpha. LLM marketplace operator OpenRouter Inc. launched a free hosted version of Ox Alpha and didn’t disclose its developer, which drew a significant […] The post Z.ai open-sources ‘Ox Alpha’ model as GLM-5.3-Flash appeared first on SiliconANGLE.
Warp 在 Claude 平台上构建了基于 Agent Skills 的自我改进循环,通过基础技能与改进技能两个文件型技能,将人类反馈转化为对智能体的持续优化。该模式已应用于其整个开源仓库,覆盖数百名贡献者与数千次代码审查。团队建议以原则而非规则编写技能,并强调低摩擦反馈与改进技能的可复用性。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtacdvh50a4aroj2zlw9jnj9
通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,作为 Qwen4 架构的早期预览并开放权重。该模型总参数 125B,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。生产版 API 定价 $0.16/1M 输入 tokens 和 $0.47/1M 输出 tokens,原生上下文 262K,可扩展至 1M。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta9ciqt07c1roj219h5liie
智谱上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,AA 综合智能指数 57 分,与 Claude Opus 4.8 持平。其定价为 GLM-5.3 的 1/10,限时折扣内为 Opus 4.8 的 1/40,并已接入 ZCode 等平台开放 API 调用。该模型采用稀疏注意力与线性注意力混合架构,推理服务已跑在国产芯片集群上。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta7bh1k04u6roj2e4pt7bob
智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,在AA综合智能指数取得57分,与Claude Opus 4.8持平。其定价为GLM-5.3的1/10(限时1/20),为Opus 4.8的1/40,并首次在大规模流量中由国产芯片集群提供算力支持。模型已接入ZCode等平台,同步开放API调用。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtb6o47l0mmaroamhnqtifvv
8月26日晚,阿里发布并同步开源千问最新模型 Qwen3.8-Flash。该模型采用全新下一代架构,千亿总参数仅激活60亿(6B)即可获得超越Claude Opus4.6的前沿性能,创下模型效率的全球新基准。得益于架构和训练的全面革新,Qwen3.8-Flash训练成本较Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,价格最低至DeepSeek-V4-Flash的1/3,将全球模型性价比“斩杀”至极致新水平。Qwen3.8-Flash今晚将首发上线“千问办公”,开发者和企业也可通过千问AI平台获取新模型API服务。 Qwen3.8-Flash是一个多模态混合专家(MoE)模型,采用了下一代(Next)模型架构,Transformer参数125B仅激活6B,性能表现超越Opus4.6、接近Opus4.8。仅完成预训练的Qwen3.8-Flash基座(Base)模型,在通用(SuperGPQA)、数学推理(GSM8K)、编程(SWEBench-Pretrain)等基础能力上超过了3倍其大小的Qwen3.7-Plus基座模型。经后训练后,Q…
通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta2veap03nmrolwxllvp4ay
来源:机器之心 原文链接:https://mp.weixin.qq.com/s/HT6AMtSUoKPSpEKI2TLy5Q 文本指令驱动的视频编辑技术正在从离线内容生产走向直播特效、视频会议和增强现实等在线交互场景。 然而,高质量的视频扩散模型的通常依赖于对完整视频进行双向时空注意力处理,即模型需要等待未来帧到齐,再对整段视频进行联合处理。这种范式能够获得较好的编辑结果,却难以满足低延迟、持续输入与即时输出的要求。 近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。 论文标题:LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing 论文链接:https://arxiv.org/abs/2606.26740 开源代码:https://github.com/cp-cp/LiveEdit 目前…
DeepSeek 宣布推出 DeepSeek Harness(dsh)开发者预览版。这是一个采用 MIT 许可证发布的开源执行运行时,用于构建自主人工智能智能体。DeepSeek 通过一则公告"发布了这一消息,同时公布了该项目的 GitHub 仓库"。该软件构建在 Cordis 元框架之上,并采用微内核架构,运行时组件以彼此隔离、可相互替换的插件形式运行,而不是作为单体系统模块。 在 DeepSeek Harness 的设计中,模型适配器、工具注册表、沙箱环境、会话状态处理器、事件分发器和用户界面等功能单元均作为独立扩展加载。这种模块化设计允许开发者在不同的模型端点之间切换,包括远程 API 提供商和本地运行时服务器,也可以通过更新声明式配置文件来替换执行工作流。正如开发者文档和 API 规范"所述,配置模式支持通过 YAML 或 JSON 定义指定环境约束、插件依赖项和运行时参数,而无需修改核心逻辑。 该平台还包含一个仅追加的事件日志子系统。每条用户消息、工具调用、中间推理状态、Token 指标和子智能体派发都会被记录到统一的执行轨迹中。这种结构化数据格式允许工程师检查运行时活动、执…
允许用户无需登录阅读 X/Twitter 推文的开源项目 Nitter 收到了 X 寄出的勒令停止信函。基于 Nitter 的服务如 XCancel 都收到了类似的律师函,相关项目和网站都被迫宣布关闭。这不是第一次 X 试图关闭 Nitter 项目。2024 年 在 X 推出新的 API 限制后 Nitter 的主要实例 Nitter.net 一度下线。Nitter 的工作原理是获取公开的推文,移除广告、跟踪 cookie 和 JavaScript,为用户提供一种简洁无干扰的推文阅读方式,无需注册账号或打开应用。
Andrew Ng 旗下开源智能体 OpenWorker 发布新版,强化安全工作流。其 harness 完全开源,安全团队可审计无后门。新版内置代码漏洞扫描、依赖供应链注入检测和云安全配置检查三类网络安全智能体,并支持本地运行开源权重模型以保护敏感代码。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt90wf1p06j9roly5e34fmu3
Google AI 发布 WeatherNext 气旋预测模型,可同时预测风暴路径、强度和规模,比现有系统多提供一整天的预警时间。该模型在 2025 飓风季实战测试中,提前五天预测飓风 Melissa 在牙买加的五级登陆,系美国国家飓风中心首次实时使用 AI 模型。模型单场风暴可生成多达 1000 次模拟,代码与权重已开源。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt8uphwp3qmhro73czv8pbpv