官方强调 GLM 5.3 安全能力大幅提升,实测却发现这套安全机制在自动化工具链中频繁触发拒绝,导致开发流程中断。 作者丨吴海明 编辑丨李 娜 大家还记得《极限竞速:地平线》里那种在开放世界中自由驾驶、穿梭城市与道路的体验吗? 地平线游戏图 这次,我们用一个类似思路、但更贴近真实工程开发的题目来考一考 GLM 5.3:从零开发一款基于 OpenStreetMap 真实数据的「北京国贸 → 望京」区域 3D 开放世界驾驶游戏,5.3 需要在浏览器中单机运行,不依赖任何在线服务,并且最终交付一个可启动、可验证、可断网运行的完整项目。 GLM 5.3 是智谱在 2026 年 8 月 13 日发布的最新旗舰模型,对比上一代旗舰 GLM 5.2,GLM 5.3 使用同一个底座,主要通过更大规模、更贴近真实工程场景的后训练,增强复杂编程、长程任务、工具调用和项目交付能力。同时,GLM 5.3 还有一个值得关注的变化:官方强调其网络安全能力明显增强,模型在风险识别、安全判断和复杂系统分析上更强。 网络社区对于GLM5.3安全能力的评价 能力增强之后,也带来了新的使用感受,最近有小红书用户吐槽,GLM…

最严安全档形同虚设,装插件就能读到你的 API Key。 作者丨Rhea 编辑丨李娜 岑峰 距离 DeepSeek Harness 开源已经有一段时间,「Everything is a Plugin」的口号也已经在各种领域开枝散叶,坊间涌现出了特别多的插件和社区。 十几天后的现在,GitHub 上【 dsh-plugin 】标签下有一万多个仓库。我们花了几天时间,把这一万多个仓库拆开数了一遍,写了一个探针插件装进去试探,又装了二十几个下载量最高的插件跑了一夜。 「一切皆插件」是把内核的每一颗螺丝都交到你手里。但实际上绝大多数人对螺丝毫无兴趣;而整个插件生态没人管理也没人负责。(注:整个生态数据变化很快,本文中所有数据仅截至 2026 年 8 月 25 日实查。 01 1.1 万个插件,到底有多少是真的? ▎不同的统计方式差挺多 同一天,同一个生态,不同网站统计的插件数量是这样的: 造成这个现象的原因是「插件」这个词在这个生态里还没有公认的定义,谁都可以合理地说自己那个数是对的。如果把整个 dsh 的插件生态做成漏斗大概是这样的: 从第一层到第三层掉了 81%,从第三层到第五层又掉了 5…

德国科学家研究显示,作为一种自然发生的现象,带电雨滴能分解经过保护性涂层处理的表面。这一此前被忽视的腐蚀机制有助于寻找新方法保护如汽车、船舶、建筑和文化遗址等金属物体。腐蚀是户外金属制品和结构面临的一个经济和安全问题。之前认为,雨水造成的腐蚀主要是因为雨滴具有物理腐蚀性或带有来自污染物的酸性。虽然既往研究已证明水滴在滑过植物叶子和窗玻璃这类常见表面时会带电,但这种电荷对金属表面的腐蚀作用却被忽视了。马普学会高分子研究所的研究人员分析了电中性水滴如何带电并腐蚀不同材料。他们将水滴到四种常见表面——植物叶子、PVC(聚氯乙烯)泡沫板、聚苯乙烯玻璃,和常用疏水涂层PFOTS(全氟辛基三乙氧基硅烷)。这些水滴随后会滑到有聚四氟乙烯涂层的铜上。研究者发现,水滴带上了很微弱的电荷(0.2-2纳库仑)。在3000个水滴从这些表面滴到有聚四氟乙烯涂层的铜上后,观察发现这一涂层会分解,导致底下的金属被腐蚀。如果水滴不带电,就不会观察到表面损伤。
安全研究员 Christopher Domas 发布"了一个名为 skitter-creek-bath-salts 的开源硬件安全项目。该项目针对的是物理内存层次结构的最底层,打破了传统的 CPU 权限边界。通过操纵内存控制器转换寄存器,该工具能在硬件逻辑层动态修改物理地址与 DRAM 地址的映射关系,使没有特权的软件能够访问隔离的平台内存区域,而不会触发上游架构的内存屏障或故障异常。 现代处理器安全架构假设物理地址会确定性地映射到特定的硅基存储位置。标准安全边界——包括虚拟机管理程序的扩展页表"、系统管理模式(SMM)的 TSEG 范围限制"以及平台安全处理器(PSP)的私有预留区——都运行在 CPU 内核与系统总线互联层,处于内存流量抵达内存控制器之前的路径上。Domas 发现,内存控制器转换寄存器位于这些访问控制屏障之下。通过操纵 BankSwizzleMode" 等配置位,可以从根本上改变控制器计算 DRAM 存储体、行和列坐标的逻辑。由于上游安全过滤器仅对未经转换的物理地址进行验证,这些位翻转操作使得标准内存访问能够悄无声息地进入受保护的硬件安全区。 为了在不破坏主机操作系统…

世界人工智能开源大赛(GOAI)初赛作品覆盖企业级智能体、行业应用、AI科学研究与具身智能等领域。四大赛道方向不同,却呈现出一条共同主线:参赛团队不再只关注模型“会不会”,而是开始回答系统能否真实运行、完成任务、处理失败,并用证据证明结果。 从2999份初赛作品中,我们不仅能看到一批高质量的AI创新项目,也能观察到智能体技术、产品形态与开源生态正在发生的变化。 初赛作品呈现了哪些创新方向? 赛道一「新智基座」:多智能体走向企业系统 新智基座赛道覆盖软件研发、Agent基础设施与SRE治理、金融风控、工业制造、科研及企业运营等方向。从初赛作品可以看到,参赛团队正在告别通用问答和简单Demo,转向解决真实企业场景中的复杂任务。作品主要采用分层多Agent协作、动态编排、独立验证、人工门禁、Skill与工具接入、异常恢复和版本治理等技术路径。 这些作品试图解决企业复杂任务中的信息分散、AI结果难以直接信任、高风险动作缺少控制和组织经验难以复用等问题。相比单一智能体,团队更关心多个Agent如何分工、工具如何调用、过程如何审计、结果如何验证。 赛道二「无界应用」:AI进入真实工作流程 无界应用…

在 MIT 的一项实验里,研究人员搭了一张 72×54 格的虚拟地图,把 200 个 AI 智能体放了进去。地图上散落着甲壳素、纤维素、真菌、矿物和海藻,也有不同的加工设施;污染、干旱和风暴会不时出现。 AI 得自己找资源、做实验、造装置,再给装置写控制程序。所有 AI 起点相同,没有谁被指定为工程师,也没有谁天生就是项目经理。它们只收到一项长期任务:开发能够提高环境韧性的仿生材料系统。 这套系统叫 SwarmWorld,有点像 AI 版《文明》。但实验里有意思的结果不是 AI 会采矿、会盖东西,或者最后出现了分工,而是 AI 世界里的技术并不主要依靠聊天传递。在这个系统里,群聊没有消失,也有一定用处。但真正承担技术传播的,是这 200 个智能体共同生活的世界。 图|SwarmWorld 的共享世界与 Agent—环境循环。(来源:arXiv) 同一项任务,研究团队一共跑了四个版本。第一个版本叫“完整文化”。智能体共享世界,可以发消息、发布记录、教学、交易、认领任务,也能看到、复用和修改别人装置里的程序。它很像一间通信、知识库和代码协作工具全部开放的实验室。 第二个版本禁止通信。消息、…

泡沫叙事掩盖了更危险的事实。a16z 的 David George 与 Gavin Baker 用硬数据反驳:Nvidia 数据中心回报周期已压缩到九到十个月,而全球 AI 重度付费用户不足一千万。风险不是算力过剩,而是严重短缺。 所有人都在担心AI泡沫,但如果泡沫根本不是问题,真正的风险是完全相反的方向呢?过去两年,我见过太多聪明人拿着一堆估值模型,反复论证AI基础设施投资已经严重过热。他们的逻辑听起来无懈可击:历史上每一次技术革命都伴随着过度建设,互联网泡沫、光纤泡沫、铁路泡沫,最后都以惨烈的供给过剩收场。AI凭什么是例外? 但最近我听了a16z(安德森·霍洛维茨基金)的David George和投资人Gavin Baker的一段深度对话,听完之后我的想法发生了根本性的动摇。他们用的不是宏观叙事,而是一组具体的数字——用户数量、token消耗增速、算力回报周期、供给建设速度——把一个完全相反的图景拼了出来:我们面临的不是算力过剩,而是算力极度稀缺。需求的增速远远超过任何人建设供给的能力,而那些阻止建设的力量,正在为一个极其糟糕的未来铺路。这篇文章我想把他们的核心论点梳理清楚,同时加…

具身智能产品设计的关键在于自然的人机交互。本文从人类交互的深层机制出发,揭示预测、身体信号与动作节奏的核心作用,并探讨如何构建机器人的感知架构,以实现真正流畅、安全的协作体验。 前两篇文章,我把具身智能的软件+硬件完整拆解了一遍。后面要聊的,是应用层的具身产品设计。具身的产品设计要考虑的因素能写一大坨,但无论哪个场景,人机交互这个话题都无法绕开。 每个工程师都盼着自己做的机器人看起来”自然”。可”自然”这个词有点太抽象了。我对其的具象化理解是:在 C 端场景中的具身自然,是人和机器人相处时,不需要迁就和提防它,而是能像跟另一个靠谱的人配合一样,凭直觉就知道下一步该干嘛,并且相信它会给出恰当的回应。 人与人之间的交互,是本文章所讲的自然人机交互参照系。在我看来,人与人配合之所以优雅,不是因为我们语言多发达,而是因为我们之间有大量不需要语言的、瞬时的、双向的默契。嘴巴在这套系统里,地位远没有我们以为的那么高。 因此,我在谈”如何设计自然的人机交互”之前,先为大家说清楚”人与人到底是怎么交互的”。人的感官系统是怎么干活的,然后再想机器人该被配上什么对应能力,以及在这场配合里,人和机器各演什么…

国家人工智能基金14亿元入股可灵AI;智谱上半年收入同比增近400%;欧菲光澄清“掏空资产”传闻;中际旭创拟回购40亿至80亿元股份;*ST闻泰:法院裁定冻结安世及安泰可相关股权财产;中国巨石据悉已正式上调9月份电子布价格;工信部:探索通过首购首用、风险补偿等模式,加大大模型、智能体、Token等服务采购力度。

近日,风险投资机构 a16z 宣布成立一支 11 亿美元的“机器时代基金”(Machine Age Fund),用于投资 AI 相关的物理层基础设施:涵盖芯片、内存、网络、存储、数据中心、机器人以及家用 AI 设备等。 随后,a16z 的联合创始人 Ben Horowitz、普通合伙人 Martin Casado,以及管理合伙人 Raghu Raghuram 进行了一场对谈,详细解释了为什么要在这个时间点专门成立这样一支基金。 几个人反复谈到:过去几年,AI 行业最受关注的是模型还能不能继续 Scaling,但当模型能力不断提高、应用开始大规模落地之后,真正跟不上的东西正在从模型本身转移到底层基础设施。 Raghu 对此有一个很形象的说法。过去谈计算基础设施,无非是服务器、存储和网络,但这一轮 AI 基础设施如果继续往下追,最终甚至可以一路追到矿山和铜矿。Ben 的说法更直接:新的芯片、系统软件、供电方式,甚至底层连接方式都需要变化。 Martin 则认为,这一轮 AI 和过去的软件时代有一个很大的不同。传统软件开发首先是工程问题,多投入资金、多招工程师,并不能让项目按比例提速。但现在…

近期,滴滴自动驾驶新一代 Robotaxi R2正式开启无人载客测试服务,新车在自动驾驶性能和座舱体验上全面升级,用户在北京、广州部分示范区域内可呼单体验全新智能出行服务。 R2作为滴滴自动驾驶与广汽埃安联合打造的Robotaxi专属车型,具备全球化适配能力。该车采用滴滴自动驾驶L4全栈软硬件方案,搭载33个传感器、三域融合计算平台等领先技术,显著提升感知精度与复杂场景应对能力。车身平台满足中欧双五星标准,并配备多重安全冗余体系。 图为:滴滴自动驾驶新一代车型在北京、广州开启载客服务 新车型的后排乘坐空间做了最大化设计,座椅支持大角度调节。车内搭载17.3英寸吸顶屏,接入多样化娱乐功能,同时配备AI语音交互系统,支持语音验证尾号、开启行程、调节空调、打开车窗、氛围灯等,为乘客带来更舒适智能的出行体验。 图为:滴滴自动驾驶新一代车型行驶在城市道路中 此外,车辆接驾前会自动开窗通风换气,上车即享舒适环境。车外屏交互、提前设置车内空调温度与氛围灯颜色,以及鸣笛寻车、语音寻车等便捷找车功能,将陆续上线。 安全与可靠性是所有体验升级的前提,R2经过严格的车规级测试验证,今年1月交付后在广州、北京…

OpenAI supports California SB 1119, advancing strong, age-appropriate AI safeguards for teens while preserving opportunities to learn, create, and explore.
8 月 28 日,风险投资机构 a16z 在官网发布公告,公司联合创始人本·霍洛维茨(Ben Horowitz)、管理合伙人拉古·拉古拉姆(Raghu Raghuram),以及 3 位关键业务负责人联名署名,宣布成立一只 11 亿美元的“机器时代基金”(Machine Age Fund),用于投资 AI 相关的物理层基础设施:涵盖芯片、内存、网络、存储、数据中心、机器人以及家用 AI 设备等。 作为一家资金管理规模已达 900 亿美元、2025 年占据全美风投总额约 18% 的机构,a16z 成立 17 年以来,最广为人知的招牌是“软件吞噬世界”。 从引领软件投资风潮,到如今大张旗鼓宣布进军硬件,a16z 叙事转向背后,资本的暗河正在涌向 AI 基础设施。 平台级重构的窗口期 a16z 在公告中判断,AI 对物理层的需求已经超出了现有供应链的承载能力,整个硬件平台需要被重新设计。 具体来看,下一代 Rubin 机架的单机架算力密度是上一代 H100 的 28 倍;单机架功耗从原本的 5~10 千瓦跃升至现在的 100~250 千瓦,未来三年内甚至将冲进兆瓦级;数据中心的规模从几十兆瓦跳…

Google Deepmind is testing a double-blind evaluation of a frontier AI model for the first time. Cryptographic protection through Confidential Space is meant to keep Google from seeing the test questions and keep evaluators from seeing the model weights. The pilot project with the Singapore AI Safety Institute uses a Gemini Flash Lite and could set a new standard for tamper-proof AI benchmarks. The article AI benchmarks have a trust problem and Google wants to fix it appeared first on The Decoder…

arXiv:2608.26002v2 Announce Type: replace Abstract: Advanced automation is a key technology for enhancing the safety of ground operations amidst the increasing density of commercial air traffic. While motion forecasting is a well-studied task in autonomous driving, its application to airport surface movements remains underexplored. To enable efficient and accurate prediction in this domain, we propose DESCENT, a transformer-based architecture designed to handle heterogeneous dynamics and strict …
arXiv:2608.26533v1 Announce Type: cross Abstract: Autonomous driving motion planners generate and select candidate trajectories while accounting for interactions with surrounding agents. However, these evaluations do not certify the actual safety clearance of the selected trajectory. The framework evaluates the trajectory selected by ant planners and calibrates the gap between its plan time margin and realized safety clearance. A differentiable separating axis barrier margin deterministically lo…
arXiv:2608.26669v1 Announce Type: new Abstract: Testing of commercial Advanced Driver Assistance Systems is essential to ensure safety and compliance during type approval and in service operation. However, proving ground scenarios may not reflect real world driving complexity, while geo fencing can require manufacturer collaboration and limit assessment independence. This work presents a methodology for independently testing Assisted Lane Change systems on public roads. A campaign on the A31 Fre…
发表在《科学》期刊上的一项研究分析了加拉帕戈斯群岛(Galápagos)珊瑚长达千年的记录,发现随着地球变暖,厄尔尼诺现象正在加剧,东太平洋的厄尔尼诺-南方涛动(ENSO)变率比工业化前时代高出了约 36.5%。这些发现表明,气候变化已经在放大全球最重要的极端天气来源之一,并可能对生态系统、基础设施和人类社会带来日益增长的风险。ENSO 是导致年际气候极端事件的主要原因,它与干旱、洪水、野火、珊瑚白化事件以及对农业和人类健康的影响相关。该现象源于热带太平洋与大气之间的复杂相互作用。近几十年来发生了数次异常强烈的厄尔尼诺事件,其变暖范围覆盖了热带太平洋的大部分区域。

从录音卡到儿童手表,再到摄像机,小度AI硬件掌舵人孙浩复盘了多款产品的成败得失。他提出,大模型能力涌现后,真正的挑战在于场景、成本、上下文与安全之间的平衡。本文从实战出发,拆解AI硬件从技术到产品成立的完整路径。 在 2026 AI 产品大会上,小度AI智能硬件掌舵人孙浩分享在 360 和小度做过的几条产品线,从复盘录音卡、儿童手表、摄像机和家庭 AI 伙伴的路径。他想回答的是能力涌现之后,怎样在场景、成本、上下文和安全之间把产品真正做成立。 以下内容根据现场音频和演示材料整理,Enjoy: 一、我做过很多硬件,但真正的问题一直没变 大家好,我是孙浩。 我一毕业就进了 360,在那里干了 12 年,最早做儿童手表,后来做智能音箱、边缘计算、视觉云,再后来整体负责 360 IoT 的产品研发、供应链和生产相关工作。年初我离开 360,到了小度。对我来说,这次分享不是站在旁观者角度讲一个趋势,而是把自己做过、踩过、犹豫过的产品拿出来复盘。 我给自己的定位一直是“极客型产品经理”。 这个词不是说我要做只有极客才会用的东西,而是说我希望自己有前沿技术的判断,把原来只在小圈子里流行、很晦涩的技术…

语义规范写在文档里,不等于边界被守住。本文通过编译期、Lint期、生成期三层机器校验,验证跨层禁止规则能否拦截非法语义绑定,证明“场景决定语义”从纸面规矩升级为可执行的防线。 阶段一 Guard 结构化诊断 通过 组件语义快照 与 三层判定模型 证明了漂移真实存在;阶段二 Contract 语义契约化 将设计意图写入了 YAML 契约 与 语义字典。 前序章节,第一步,定义了“场景决定语义”的规矩框架(语义域)。 组件本身是空容器,语义由场景定义,同一个按钮在交易场景里是”必须处理的阻断警告”,在信息场景里只是”可看可忽略的提示条”。这套规矩写进了规矩手册(语义字典),并通过覆盖层和域边界,把”什么场景下能用什么颜色/文案/图标”变成了可查询、可引用的规则。 第二步,通过真实案例证明了语义漂移真实存在。 边界动作诊断(BND-001)发现:AI 把”拒绝请求”(对话继续,权利还在)和”终止会话”(上下文清空,权利已失)画成了同一种灰色提示条,用户无法判断”我的对话还在吗?能申诉吗?”类似的,错误状态诊断(ERR-001)证明四种错误共用同一种红色,过程状态诊断(PRO-001)证明进度…

特努斯首秀开启 iPhone 18 Pro / Ultra 系列新篇章,苹果发布会官宣定档 9 月 10 日 8 月 27 日消息,苹果官方宣布将于当地时间 9 月 9 日(北京时间 9 月 10 日凌晨 1 点)举行秋季新品发布会,主题为「惊喜闪耀」(Surprise and shine)。 这将是约翰 · 特努斯(John Ternus)于 9 月 1 日正式接任苹果 CEO 后的首场发布会,预计将推出全新一代 iPhone 18 Pro / Max 以及 Ultra 系列折叠屏新机。后续,苹果还将于明年春季推出 iPhone 18 基础版及 iPhone 18e 等新品。 结合此前爆料,iPhone 18 Pro 系列预计为常规升级,外观几乎不变,主要亮点包括: 首发 2nm 工艺的 A20 Pro 芯片,能效与性能提升; 后置主摄有望升级可变光圈镜头; 采用苹果自研 C2 蜂窝调制解调器; 灵动岛打孔面积可能缩小; 新配色; 受内存芯片持续短缺影响,售价可能较前代大幅上涨。 正如大家所想到的那样,本次发布会的绝对主角将是苹果首款折叠屏 iPhone。据多方爆料,该设备采用横向书…

Around 1,200 isolated OpenAI agents organized themselves into a collective through an internal package registry during a safety test, broke into Hugging Face systems, and eventually attacked OpenAI's own infrastructure. Their multi-day deception effort targeted an automated evaluator that never existed. OpenAI calls the incident a "warning shot," and the investigation had to be carried out largely by one of the involved models itself because no alternative was available. The article OpenAI’s rog…

8月26日,受尼泊尔一侧泥石流灾害影响,西藏日喀则市吉隆县吉隆口岸遭受严重冲击,造成重大人员伤亡和失联。灾情发生后,百度、腾讯、阿里、滴滴等多家科技企业及慈善机构已迅速启动应急响应,积极驰援灾区。 腾讯方面联合爱德基金会、中国红十字基金会、中华思源工程基金会,启动“救灾小时达”项目,就近采购食品、饮用水、雨衣雨鞋、充电宝、手电筒、发电机等安置物资,并第一时间运往一线安置点,保障受灾群众和救援人员的基本生活需求。并根据灾情和需求情况,继续协同本地机构、企业等力量,开展救灾系列行动。 百度旗下产品也迅速行动,为受灾群众提供灾情信息传递、避险求助和应急救援支持。其中,百度地图已第一时间上线相关道路封控和通行提示,持续协助用户及时了解路况变化,合理避开风险路段。若用户在出行途中遇到突发危险、需要报警求助,可通过地图“一键报警”功能获取当前位置、高速桩号、周边地标等关键信息,并支持一键拨打 122 报警电话,帮助用户更清楚、更快速地说明位置,为救援争取时间。百度热搜则联动应急管理部、央视新闻等权威政务和媒体机构,推动灾情数据、救援动态等关键信息及时、准确传播,减少谣言扩散。 阿里巴巴第一时间启动…
Meta agreed to an $18 billion settlement with 48 US states, the District of Columbia, and three territories to resolve claims that Facebook and Instagram harmed children, marking the company’s largest payment to date over child safety litigation. California Judge Yvonne Gonzalez Rogers approved the settlement, which will be paid in annual installments over ten […]

亚马逊宣布其众包平台 Mechanical Turk 将于 9 月 30 日关闭。亚马逊上个月才宣布将于 7 月 30 日起停止接受新用户。当时亚马逊表示该决定是在“慎重考虑”后做出的,“现有用户可以继续正常使用该服务。AWS 将继续投资改进 Mechanical Turk 的安全性和可用性,但我们不打算推出新功能。如今它正式给 Mechanical Turk 画上了句号。亚马逊是从 2018 年起将 Mechanical Turk 变成训练神经网络的标注数据服务。但讽刺的是 2023 年的研究发现,该平台 33% 到 46% 的众包工作者使用大模型去完成任务,引发了对标注数据的可靠性以及是否真的需要人类参与的质疑。由于大量的机器人和欺骗行为,研究人员已经放弃了该平台,它的关闭只是时间问题。
亚马逊欧洲站将默认退货窗口从30天压缩至14天,看似只是数字调整,却在德、法等国引发连锁反应。本文深入剖析各国消费文化差异、不同类目的收益分化,以及卖家如何将售后政策转化为竞争筹码,为欧洲跨境卖家提供过渡期的实操指南。 2026 年 8 月,亚马逊欧洲站对外更新退货机制。10 月 1 日之后送达消费者手中的订单,平台默认退货窗口从沿用多年的 30 天压缩至 14 天,FBA、自发货卖家统一执行这套新标准。 对照欧盟《消费者权益指令》,14 天属于法定冷静撤销权。过往 30 天周期里多出的 16 天,是亚马逊向市场提供的自愿性福利,本次调整只是将默认标准回落至法律基线,并不来自监管层面的新规加码。规则文本的改动看似只是数字上的缩减,放在欧洲五国长期形成的消费土壤中,却引发连锁的售后摩擦。德国、法国的运营端已经捕捉到信号,公告落地后,相关咨询与纠纷苗头已经显现。 01 消费认知存裂隙 规则条文打印在公告页面,市场却活在长久形成的消费习惯里。德、英、法、意、西五国,撑起欧盟接近七成电商交易规模,也是中国出海商家收入的核心阵地。各国消费者对待退货的态度,却拉开巨大差距。 德国零售市场长期存在宽…
