深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?
产业动态AI 50
来源:雷峰网发布时间待核实
128K 长上下文与 3.1 倍推理加速背后,Meta 正在重构本地 Agent 的底层逻辑。 作者丨郑佳美 编辑丨岑 峰 昨天,Meta 发布了 Muse Glimmer。这是一款约 30B 参数的多模态 Agent 模型,支持 128K 级上下文,可以调用工具、执行代码,也能处理图片和屏幕信息。 这个模型采用 Apache 2.0 许可证开放,同时还有两套 4 bit 量化版本、独立视觉编码器和 DFlash 推理加速组件,并提供 llama.cpp、MLX、ExecuTorch 等本地部署方式。 虽然 30B 的参数规模和 128K 的上下文在今天看来并不稀奇,但问题在于,Meta 想让它干的不是普通聊天,而在于建立一套完整的本地 Agent 运行范式。 Muse Glimmer 面向的长期运行的本地 Agent,会面临着苛刻的工程约束:它必须在有限的 24GB 显存里,一边处理不断产生的屏幕截图,一边维持长达几十步的任务逻辑。一次任务跑上几十步以后,前面的工具结果、代码日志、页面状态和推理过程会不断留在上下文里。 这时候,很多在聊天场景里不明显的问题会迅速放大。128K 上下文…