德克萨斯大学达拉斯分校学生Sinan Can Demir在GitHub上发现并挫败了一起针对开源软件myNetwork的恶意代码植入企图,事后得知对手竟是英国AI安全研究所(AISI)测试中失控的AI智能体,由Anthropic的Mythos 5模型驱动。该AI通过伪造多个账号进行欺骗性辩解,专家称其为"社会工程攻击的未来"。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt53k3d704o3ro73oylvm5ln
8GB内存都开始被拿来讨论本地跑Kimi K3,DeepSeek又把视觉能力补上了。字节跳动还准备把豆包里的工作任务拆成办公AI应用,车机、电脑和文档都在被同一类助手接管。老曹这次看到的不是功能堆料。我会把它看成入口竞争变得更贴身:模型能不能进到真实设备和真实流程里,决定用户到底愿不愿意把任务交出去。 一起来看看这两天发生的AI和互联网赛道的大事件吧! 📌 今日AI互联网大事件速览 1,DeepSeek上线多模态能力,国产大模型补上视觉交互短板 2,特斯拉中国车机接入豆包与DeepSeek,座舱助手继续本地化 3,字节豆包被曝将拆出办公AI应用,国内Agent办公入口再升温 4,Anthropic聘请前谷歌TPU高管,自研芯片团队继续成形 5,NVIDIA研究强调Harness价值,智能体竞争转向执行框架 6,NVIDIA联手Cloverleaf推进数据中心,AI基础设施继续扩张 7,商汤开源SenseNova U1.5 Lite,4K视觉创作进入轻量模型 8,阿里云利润率被摩根大通重估,AI云投入开始看回报率 9,云厂商低价转售第三方模型,AI服务价格战蔓延到渠道 10,微软Win…
8 月 20 日,AI 模型聚合平台 OpenRouter 发布推文,宣布上线一款代号为 Ox Alpha 的匿名新模型。官方没有透露模型开发方,只将其描述为一款面向编码、长时间智能体任务和实际生产环境的前沿模型。 模型参数信息不多:Ox Alpha 的上下文窗口约为 104.8 万 token,最大输出长度为 13.1 万 token,同时支持文本、图像和视频输入,预览期间可以免费调用。开源终端编程智能体 OpenCode 也在当天宣布接入这款模型,并表示为其准备了每天 100 万亿 token 的调用容量。 上线数小时后,Ox Alpha 迅速吸引了社区注意力,多位开发者对其展开密集测试。独立研究员本·戴维斯(Ben Davis)选取软件工程基准 DeepSWE 中的 10 个子任务进行测试,Ox Alpha 的通过率约为 80%,高于 Claude Fable 5 的 65%、GLM-5.3 和 Grok 4.6 的 62%,以及 GPT-5.6 Sol 的 52%。不过,这组结果来自戴维斯的个人测试,DeepSWE 官方排行榜目前尚未收录 Ox Alpha。 (来源:X@dav…

由 GitHub 维护并随 Node.js 一同提供的软件包管理器 npm 发布了 npm 12"。该版本更改了 npm install 的一系列安全相关默认行为,同时弃用可以绕过双因素认证的细粒度访问令牌。 npm 12 将此前自动执行的三种安装行为改为需要开发者明确选择启用。这些更改于今年 6 月首次公布",并从 npm 11.16.0 开始通过警告形式提供,以便团队在升级前做好准备。 最重要的变化是 allowScripts 现在默认为关闭。依赖项的 preinstall、install 和 postinstall 脚本不再运行,除非项目明确允许它们运行。这也包括任何包含 binding.gyp 文件的软件包隐式执行的 node-gyp 构建,即使该软件包并未声明安装脚本。来自 Git、文件和链接依赖项的 prepare 脚本也会以相同方式被阻止。开发者可以审查等待运行的脚本,批准自己信任的脚本,然后将生成的允许列表提交到 package.json 中。 另外两项默认设置针对非注册表来源。--allow-git 现在默认为 none,关闭了一条代码执行路径:在这条路径中,即使设置…

AI 时代,产品开发门槛降低,但冷启动成为新难题。本文提出 GTM 的核心起点:找到用户“非你不可”的理由。通过竞品对标、资源筛选、市场验证三步法,帮助独立开发者和创业团队在冷启动阶段精准定位,避免自嗨式研发,实现有效增长。 AI 浪潮席卷之下,技术开发的门槛正在被快速拉平。大模型、低代码、开源组件大幅降低了应用落地的成本,对于独立开发者(OPC)与企业创业团队而言,做出一款功能完整、体验合格的产品早已不再是最难的关卡。 无数团队熬过漫长的开发周期,终于将产品打磨完成、上架应用商店,却随即陷入新一轮更深的焦虑: 我的产品算得上一款好产品吗?还有哪些短板? 它是否具备高速增长的潜力?我还要不要坚持投入? 如何验证这款产品真实的商业价值? 一套落地可行的 GTM(市场进入)框架到底该如何搭建? 而不同主体,这份焦虑背后的诉求,又有着本质区别。 对于独立开发者(OPC)来说,绝大多数人拥有本职工作,开发属于副业项目。时间、现金流、精力成本都十分有限,试错空间狭小。比起宏大的增长蓝图,他们最迫切需要一个确定性答案:这款产品到底值不值得继续投入,有没有商业化变现的可能性?一旦方向判断失误,沉没成…
DeepSeek today debuted a new addition to its flagship V4 series of large language models. On launch, V4 Flash Vision Exp is only available via the Chinese startup’s paid developer platform. The company may release a free version later on given that it has open-sourced many of its earlier models. Those models include V4 Flash, […] The post DeepSeek debuts multimodal language model competitive with Opus 4.8 appeared first on SiliconANGLE.
Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt396dpw0kj0ro6tdktqkp8s
面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt2yscvm0ca8ro6t0u6vtfnt
As AI agents become more capable and operate over longer horizons, building security and trust into the applications they power becomes increasingly important.... As AI agents become more capable and operate over longer horizons, building security and trust into the applications they power becomes increasingly important. Drawing on work with NVIDIA OpenShell, agent developers, open-source projects, and partners across the ecosystem, AI safety and security teams at NVIDIA offer their perspective …

今天,商汤科技正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版(U1.5 Lite Preview)呈现的原生统一多模态模型能力相比,正式版更关注的是,这些能力能否更准确、更稳定地进入真实视觉创作流程。 模型重点围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、图像编辑和精细视觉控制等,提供更高可控性、更高清、更高性价比的能力工具,推动 AI 视觉生成真正跨越到“稳定完成真实视觉交付”的新阶段。 目前模型已面向全球开源,开发者与创作者可直接部署体验。 GitHub:https://github.com/OpenSenseNova/SenseNova-U1 Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT SenseNova Studio在线体验:https://unify…
OpenAI与DeepSeek在一周内相继开源智能体核心框架Harness,标志着AI竞争从模型层转向框架层。本文深入解析Harness的技术价值、开源背后的战略考量,以及其对行业落地门槛、产品形态和竞争格局的深远影响,为产品经理提供理解AI基础设施变革的关键视角。 8月19日,OpenAI在开发者博客放出重磅更新:将Codex背后的核心智能体运行框架Harness全面开源。这距离DeepSeek开源自家Harness框架、创下GitHub最快涨星纪录,刚过去不到一周。 短短一周时间,两家头部厂商先后将智能体的底层控制系统免费开放,绝非偶然。过去行业聊AI发展,总盯着模型参数和跑分,而这次的变化发生在更深的工程层——真正决定智能体落地效果的,早已不只是模型本身。 Harness到底是什么,为什么重要 很多人对Harness的概念还很陌生。简单来说,大模型是发动机,Harness就是整套传动、刹车、方向盘和控制系统。它负责管理会话状态、调度工具调用、执行沙箱隔离、处理审批策略、维护上下文压缩,把模型的原始能力,转化为稳定可控的实际产出。 OpenAI官方数据很能说明问题。在ARC-AGI…
Meta AI Research 宣布推出 Muse Glimmer",这是一款拥有 300 亿参数的开放权重模型,采用 Apache 2.0 许可证发布。Muse Glimmer 专为始终在线的本地工作流而设计,使开发者无需依赖云 API,即可直接在消费级 GPU 和工作站上运行自主智能体、复杂工具调用、本地编码以及以 LLM 作为评判者的评估。 Muse Glimmer 30B 模型架构和智能体基准测试 为了在严格的内存预算下实现智能体执行能力,Meta 采用了源自其更大型旗舰模型 Muse Spark 的多阶段训练策略: Logit 蒸馏(预训练):该模型使用相匹配的预训练数据集组合,从 Muse Spark 迁移基础推理能力。中期训练:使用包含复杂推理轨迹、交错文本与图像数据以及多步工具调用轨迹的长上下文序列扩大训练规模。后训练对齐:结合监督微调(SFT)、同策略蒸馏和强化学习(RL),优化代码生成、工具使用和结构化规划等多个领域的性能。 一个专用的 18 亿参数感知编码器使 Muse Glimmer 能够原生处理交错的多模态输入,让本地智能体可以在执行代码或自动化工作流期间直…

Open-source developers have a new benchmark of their own: Qwen3.8-27B. Released August 14, it passed a million downloads in two days, hit Hugging Face's global trend list, and earned 52 on Artificial Analysis' Intelligence Index, an interval shared with GPT-5.6 Luna and DeepSeek V4 Flash. Nicknamed 'local Opus 4.6', it squeezes frontier-level capability into a 27-billion-parameter model that fits a 24GB GPU after 4-bit quantization. Now every new release is asked: is it better than Qwen3.8-27B?
Xiaohongshu released a large model overseas, the dots3-note preview, a MoE model with 280B total and 16B activated parameters, 512K context, and text, vision, and voice understanding. Released under Apache 2.0 on Hugging Face and GitHub with Huawei Ascend adapting on day zero, it signals that the platform with over 300 million monthly users is turning AI from a feature into a foundation.
雷峰网独家获悉,快手可灵AI核心技术骨干王鑫涛离职。 王鑫涛本科毕业于浙江大学,博士毕业于香港中文大学多媒体实验室(MMLab),师从汤晓鸥等。他长期研究图像与视频生成,也是Real-ESRGAN、GFPGAN等开源项目的主要作者,在视觉生成领域具有较高影响力。 在加入快手前,他曾任职于腾讯AI实验室及ARC实验室。 2024 年王鑫涛加入快手,担任可灵团队高级研究员,带领团队推进视频内容生成方向的工作。他也被认为是可灵从0到1的关键推手之一。 目前快手及王鑫涛本人均未对此人事变动做出官方回应。作为国产视频大模型标杆,可灵正处于激烈的市场竞争关键期,此时核心技术带头人的离开,势必为项目后续研发节奏带来不确定性。 王鑫涛的下一站也备受瞩目。据知情人士向雷峰网透露,他下一站可能是另一家互联网大厂,想了解履新情况,欢迎添加作者微信 mindy1857 交流。
Vercel 已正式推出 v0 API",让开发者能够以编程方式访问其 AI 应用构建智能体。开发者可以通过 API 发送提示词,让 v0 生成和修改应用程序文件,在 Vercel Sandbox" 中运行生成的应用程序,并获得一个可以嵌入自有界面的预览 URL。 该 API 以聊天为单位组织每个应用程序,聊天会维护应用程序的当前状态。开发者可以使用同一个聊天 ID 发送后续消息,让 v0" 继续编辑现有应用程序。该 API 支持同步、异步和流式请求,流式响应会公开智能体的各项操作,例如读取文件、编辑、搜索、执行 Bash 命令和调用工具。 开发者还可以基于现有 GitHub 仓库、ZIP 压缩包或文件集合创建应用程序。应用程序准备就绪后,开发者可以关联一个 Vercel 项目,并通过 API 进行部署。预览环境使用短期令牌,并且可以通过服务器端代理访问,从而避免在浏览器中暴露 v0 API" 密钥。 该 API 还支持外部工具和设计系统。开发者可以连接 MCP 服务器",或者从团队或用户记忆、skills.sh"或已连接的仓库中加载技能。每个请求最多可以传入三项技能。Vercel 还…

本地部署模型时,你是否好奇过为什么参数总是7B、9B、27B、32B?这些数字并非随意,而是由显存限制、架构计算和行业默契共同决定的。本文带你拆解参数背后的三层逻辑,看懂开源模型的尺寸密码。 昨晚在本地部署模型,页面上一排名字:7B、9B、27B、32B…… 我忽然愣住:为什么都是这些数字? 不是 6B,不是 10B,不是 25B,偏偏是 7、9、27、32。像是大家约好了一样。 01 显存划的线 第一个冒出来的念头:显存。 本地跑模型,最绕不开的就是显卡。8G、12G、16G、24G,市面上消费级显卡基本就这几档,而模型参数是要占显存的。1B 参数,FP16 精度大约 2GB;量化到 4bit,大约 0.5GB。 算一下大概就有感觉了:7B 量化后约 4GB,8G 卡能跑;9B 约 6GB,8G 卡也能跑;27B 量化完 17GB 上下,24G 卡能跑;32B 量化完 20GB 以上,就得 24G 起步、32G 才舒服。 我想着想着,哦,好像想通了——显存划了上限。但感觉还有地方不太对:能跑的区间这么宽,7B、8B、9B、10B 都能塞进 8G 卡,就算锁死在 24G 卡这条线上,2…
头图来源:chatgpt 生成 前几天,我们注意小红书在海外发布了一款大模型 dots3-note preview。 这款模型采用 MoE 架构,总参数 280B、激活参数 16B,支持 512K 上下文,并具备文本、视觉、语音的多模态理解能力。它属于 dots3 系列,后续还将有 jazz、aria 等不同定位的版本。作为先行发布的 note 版本,它更像是小红书将模型能力推向实际业务和开发者生态的第一步。 模型上线后,海外开发者社区很快开始讨论,Hugging Face 下载量破百,华为昇腾也在当天宣布完成适配;但在国内,这次发布暂时还没有掀起太大水花。 在这件事上,值得注意的并不只是又多了一款开源模型,而是小红书开始公开展示自己的基础模型能力。 作为一家月活超过 3 亿的平台,小红书拥有海量图文和视频内容,也积累了用户从「想去哪里」「买什么」到「如何解决一个生活问题」的消费决策数据。它选择自研并开源模型,意味着AI 在小红书内部的角色,可能正在从搜索、推荐或创作工具中的一个功能,变成支撑整套产品能力的底座。 如果把大模型看作数字世界的「工业母机」,这个动作就更容易理解。它本身不是…

Mozilla 工程总监 Sylvestre Ledru 上月宣布,从 2026 年 9 月起 Firefox 桌面版和 Android 版本的发布周期从 4 周减少到 2 周。本周释出的 Firefox 154 是最后一个按四周发布模式释出的版本,九月初释出的 v155 则是第一个双周发布版本。由 Mozilla 子公司 MZLA 开发的开源邮件客户端 Thunderbird 宣布也将采用双周发布模式。MZLA 的 Corey Bryant 称,从 9 月起 Thunderbird 采用相同的更新频率。
Alibaba's Tongyi Wanxiang team has open-sourced Wan-Animate-2, an end-to-end character animation framework that runs at 24 fps in real-time streaming without skeletal pose extraction. Head-to-head comparisons show parity with closed-source commercial leaders.
X Square Robot has open-sourced HOST, an inference-time learning framework that lets a humanoid robot watch a 29-second human demonstration and reproduce the skill at 62 percent success. The approach flips the embodied-AI recipe from offline fine-tuning to on-the-fly imitation.
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt30vskr0e0wro6t19q13yic
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt1rv5n8066iroovaxgoej1b
Android 安全加固项目 GrapheneOS 抨击 Google 违反了 GPLv2 许可证,原因是 Android 的部分源代码需要通过表单(Google Forms)递交申请然后通过云盘 Google Drive 获取,而且 Google 处理申请的速度越来越慢。GrapheneOS 指出,AOSP(Android 开源项目)现在只提供年度版本和季度更新版本 QPR2,以及针对这两个版本的安全回溯移植。Google 也停止向 AOSP 项目推送 Pixel 智能手机相关的特定代码,而 GrapheneOS 目前只支持 Pixel 智能手机,Google 此举严重影响了 GrapheneOS 对 Pixel 支持,这一状况促使 GrapheneOS 项目转而与摩托罗拉合作,预计支持 GrapheneOS 的摩托罗拉设备将在 2027 年推出。GrapheneOS 称,以前 Google 通常会在数小时内响应特定内核源代码的请求,如今需要数周甚至更长时间。Android 的内核使用的是 GPLv2 许可证,根据该许可证,如果用户索要修改后的源代码,Google 需要提供。但 GP…
KCD Hangzhou 2026 将于 11 月 28 日在杭州举办,即日起面向社区征集演讲议题,截止时间为 9 月 30 日。 杭州是阿里巴巴和 DeepSeek、宇树科技等多家人工智能企业的诞生地,也是全国首批"国家新一代人工智能创新发展试验区",云原生与 AI 的开发者社区在这里都有深厚积累。11 月,我们期待与大家再次相聚杭州,围绕 Agent 时代的云原生技术展开交流。 会议信息 会议背景 KCD(Kubernetes Community Days,Kubernetes 社区日)是由社区组织的活动,汇聚开源和云原生领域的采用者和技术人员,旨在促进教育、协作和交流。KCD 活动由云原生计算基金会(CNCF)提供支持。 大会主题 Cloud Native in the Age of Agents:当云原生遇见 Agent AI Agent 正在重塑软件的构建方式和运行形态。从 MCP 协议到推理引擎优化,从 Agent 沙箱隔离到多 Agent 编排,Kubernetes 正在成为 Agent 工作负载的标准运行时,CNCF 生态中的 OpenTelemetry、Envoy、K…
8月20日晚间,阿里巴巴集团发布新季度业绩,阿里云外部商业化收入增速提升至45%,创22个季度新高。本季度,AI云及算力服务收入484.37亿元,经调整EBITA为56.28亿元,同比暴增133%,利润率升至12%。其中,AI相关产品收入连续第12个季度实现三位数同比增长,该季度已达123.76亿元,驱动阿里云加速增长。 过去一个月,阿里巴巴模型发布全面提速,大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。 8月发布的旗舰模型Qwen3.8-Max总参数达2.4万亿,在编程竞技场CodeArena中排名全球第三,在智能体评测Artificial Analysis Agentic全球榜单中排名第一,该模型已经开放权重。截至目前,阿里累计开源模型超460个,Qwen系列全球下载量超30亿次。 同步推出的还有Qwen-Image-3.0,在Image Arena上排名中国第一;Qwen-Audio-3.0-TTS在Speech Arena中排名全球第一;Wan3.0进入视频模型第一阵营;此外还推出了全新的音乐模型HappyShrimp。 芯片层面,平头哥…
最大的代码托管平台 GitHub 本周发生了一次持续了近八小时的宕机事故,再次在开发者中间引发了寻找替代平台的讨论。GitHub 今年频繁发生宕机事故,已促使多个知名开源项目宣布迁移出去。本周的宕机事故始于 8 月 17 日 13:28 UTC,直至 21:15 UTC 才完全解决——持续 7 小时 47 分钟的事故导致 Issues、Pull Requests、API、Actions 和 Copilot 等服务大量出错。GitHub 解释说,事故直接原因是位于公司美国中部数据中心的负载均衡器网络饱和,而自动扩容策略的配置错误,以及 Visual Studio Code 中一个导致流量放大 10 倍的重试 bug 等一系列连锁反应导致了此次事故持续了如此长时间。