小扎高调开战闭源AI,推30B智能体模型,消费级显卡就能跑,杨立昆点赞

智东西·2026年08月11日 21:36
Meta的愿景是为数十亿人提供免费Agent。

智东西8月11日消息,昨晚,Meta推出300亿参数本地Agent模型Muse Glimmer,并宣布开放权重,这也是Meta成立超级智能实验室后首次开放模型权重。 

随后,Meta创始人兼CEO马克·扎克伯格(Mark Zuckerberg)发长文阐述Meta的超级智能路线,并呼吁减少美国对开源AI模型的限制,批评部分AI厂商通过封闭模型控制技术和用户,同时支持继续实施芯片出口管制。 

他还预告Meta即将开放最新旗舰模型Muse Spark 1.2的权重。 

▲扎克伯格官宣开放Muse Glimmer权重并发长文(图源:X)

据技术博客称,Muse Glimmer可以调用工具、进行多步推理、处理文字和图片,并在工具执行失败后分析问题并重新尝试。Meta将其定位为本地个人Agent的基础模型,可用于整理文件、管理日程、起草消息、本地编程和函数调用等场景。 

Meta称,Muse Glimmer针对持续运行的本地Agent工作流进行优化,量化后的体积不到20GB,可以在部分Mac或配备单张消费级显卡的PC上运行,即使没有网络连接也能执行任务。 

Meta前首席AI科学家、AI公司AMI Labs创始人、图灵奖得主杨立昆(Yann LeCun)直接在扎克伯格评论区鼓掌称,(开放权重)是很棒的一步。

▲杨立昆评论(图源:X)

Meta首席AI官、超级智能实验室负责人亚历山大·王(Alexandr Wang)称,Muse Glimmer是一款300亿参数稠密模型,采用Apache 2.0开源协议开放权重,可在24GB显存显卡上本地运行,且不会削弱智能体任务的执行稳定性。 

▲亚历山大·王官宣开放Muse Glimmer权重并预告开放Muse Spark 1.2权重(图源:X)

Meta已在Hugging Face开放Muse Glimmer的模型权重,开发者可以下载并在本地部署。 

▲Muse Glimmer的开放权重页面(图源:Hugging Face)

Muse Glimmer发布后,多名开发者测试了它在个人设备上的运行效果。现有实测显示,该模型能够离线操作Mac应用、一次生成多款可运行游戏,并在单张RTX 4090上支持长上下文,但其响应速度、token消耗和工具接口仍存在优化空间。 

有网友实测称,Muse Glimmer的着色器生成能力十分亮眼。他在BF16精度下对比Meta Muse Glimmer 30B与Qwen 3.6 27B。他让二者生成FBM动态地形,Muse Glimmer 30B一次就能产出完整山地渲染图,Qwen 3.6 27B重试4次输出的仍是模糊失效画面。 

基准测试方面,在Meta公布的22项Agent、编程、多模态和通用能力测试中,Muse Glimmer拿下12项SOTA,优势主要集中在Agent任务和部分推理测试。但该模型在桌面操作、编程、多模态上弱于Qwen 3.6;在两项安全测试中,Gemma 4以更低的违规率和攻击成功率领先Muse Glimmer。 

▲Muse Glimmer在Agent、编程、多模态测试中的表现(图源:Meta)

从技术路线看,Meta称,Muse Glimmer能够在本地运行,主要依靠知识蒸馏、4比特量化和DFlash推测解码。Meta将完整精度下超过55GB的模型压缩至不到20GB,并利用配套草稿模型提高输出速度。 

扎克伯格在长文中称,超级智能不应集中在少数公司或个人手中。Meta超级智能实验室将恢复开放部分模型,面向数十亿用户提供免费或低价的个人Agent,并允许有更高需求的用户付费购买额外算力;该公司还将推出连Meta自身也无法读取用户数据的完全私密模式。 

▲Meta认为应将超级智能普及到每个人手中(图源:Meta)

此外,扎克伯格还在长文中宣布设立“未来属于每个人”基金(Future Is For Everyone Fund),用于支持Meta在美国建设和运营数据中心的社区。外媒Axios随后确认,该基金初始规模为10亿美元(约合人民币68亿元),将用于支持当地教师、急救人员以及能源和水务基础设施。 

01 三组网友实测:能操作Mac、生成游戏,单卡支持13万token上下文

一位开发者通过Cua Driver验证了Muse Glimmer的本地电脑操作能力,他让Muse Glimmer在Mac本地操作备忘录和提醒事项。 

在实测中,该模型结合macOS辅助功能接口与屏幕图像识别完成点击操作,完成了备忘录中新建清单、提醒事项中添加日程提醒任务。 

▲Muse Glimmer在本地操作macOS备忘录(图源:X) 

 

▲Muse Glimmer在本地操作macOS提醒事项(图源:X)

这位开发者称,这是他们第一次感到“离线操作电脑”真正具备了可用性。尽管Muse Glimmer在搭载苹果自研芯片的消费级设备上仍存在较高延迟,但如果任务对速度要求不高,这是他首款愿意推荐用于“启动后无需持续监督”工作流的本地模型。 

不过,Muse Glimmer在测试中也在操作上产生混乱。比如,在Muse Glimmer执行任务时,工具定义、屏幕截图和辅助功能树会迅速占用该模型上下文,测试团队精简工具接口后,Muse Glimmer才顺利完成任务。 

针对这一问题,这位开发者称计划减少工具及电脑状态信息的上下文占用,使模型能够将更多上下文用于任务本身,并连续运行更长时间。 

AI平台Atomic Chat对比了Muse Glimmer、Gemma 4 31B和Qwen 3.6 27B的本地编程能力。三款模型分别在配备32GB显存的RTX 5090上运行,并根据相同提示词一次生成《太空侵略者》《俄罗斯方块》和《打砖块》三款复古街机游戏。 

▲Atomic Chat比较三款本地模型生成复古街机游戏的效果(图源:X)

Atomic Chat称,Muse Glimmer生成的三款游戏均可正常运行。《太空侵略者》中的敌机会随击杀加速,《俄罗斯方块》可以锁定方块并消除行,《打砖块》中的砖块也能正常击碎,测试过程中没有出现卡死或崩溃。 

相比之下,Gemma 4生成的《俄罗斯方块》存在方块堆积逻辑问题;Qwen 3.6虽然完成了三款游戏,但《打砖块》中的部分球会直接穿过挡板。 

不过,Muse Glimmer也花费了更多时间和token。其运行记录为8.34万token、耗时17.7分钟,明显高于Qwen 3.6的2.37万token和5.4分钟,以及Gemma 4的1.78万token和4.5分钟。 

▲Atomic Chat比较Muse Glimmer、Gemma 4 31B和Qwen 3.6 27B的本地编程能力(图源:X)

另一名开发者主要测试了Muse Glimmer在消费级显卡上的部署效率。他称,在单张RTX 4090上运行UD-Q4_K_XL量化版本时,该模型在不量化KV缓存、不开启DFlash推测解码的情况下,可配置13万token上下文,占用约19.34GB显存,输入预处理速度超过3100 token/s,输出速度约为50 token/s。 

加入DFlash草稿模型后,Muse Glimmer在8万token上下文下占用23.93GB显存,基本用满RTX 4090,输出速度则提高至75 token/s。 

▲开发者在单张RTX 4090上测试Muse Glimmer的UD-Q4_K_XL量化版本效果(图源:X)

该开发者称,Muse Glimmer通过让多组注意力查询共享同一组缓存数据,降低了长文本处理所需的显存。因此,他认为,在不压缩KV缓存精度的情况下,该模型也能在单张24GB显卡上支持13万token上下文。 

▲开发者在单张RTX 4090上测试Muse Glimmer(图源:X)

02 可调用工具并处理报错,官方演示从零开发智能家居面板

Meta称,一个能够管理日程、起草消息和整理文件的个人Agent,需要同时具备长流程执行、准确调用工具、多模态理解、长上下文记忆和指令遵循等能力。 

Muse Glimmer可以在多轮操作中维持任务计划,并按照工具预先定义的数据格式发起调用。如果工具执行失败或返回异常结果,模型可以判断错误原因并重新尝试,而不是直接停止任务。 

该模型配备独立的感知编码器,可以同时处理文字和图片,理解软件截图、图表及文档。Muse Glimmer还支持100多种语言,并允许开发者调节推理强度,在响应速度和输出质量之间进行选择。 

Meta展示了Muse Glimmer在OpenCode中完成长流程编程任务的案例。用户只提供了一条自然语言指令给模型,让它找到家庭网络中的Home Assistant智能家居系统,并为连接的影音接收器开发控制面板。 

Muse Glimmer首先制定任务计划,包括查找Home Assistant、识别影音接收器、设计界面、编写代码并测试功能。随后,该模型调用多个网络工具,找到Home Assistant在局域网中的IP地址。 

当模型发现缺少访问权限时,它没有继续尝试绕过认证,而是向用户索取连接方式和长期访问令牌。获得授权后,模型通过Home Assistant API识别出连接的影音接收器,并读取设备支持的电源、音量、音源、声音模式和分区控制等功能。 

最后,Muse Glimmer从零编写HTML、CSS和JavaScript,生成一套响应式网页控制面板,并测试页面功能和不同尺寸下的显示效果。最终页面可以控制接收器开关、音量、音源、声音。 

▲Muse Glimmer在OpenCode中开发影音接收器控制面板(图源:Meta)

03 22项测试拿下12项第一,Agent任务表现更突出

Meta将Muse Glimmer与参数规模相近的Gemma 4 31B和Qwen 3.6 27B进行了比较。在不含安全测试的22项Agent、编程、多模态和通用能力基准中,Muse Glimmer取得12项SOTA。 

其中,Muse Glimmer在检验大模型多工具串联调度能力的MCP Atlas和检验深度检索问答能力的DeepSearch QA中分别获得75.5分和74.6分,均超过另外两款模型;在编程测试SWE-Bench Pro中获得51.2分,略高于Qwen 3.6的50.2分;在数学测试AIME 2026中则以94.7分位列第一。 

不过,Muse Glimmer并未全面领先。Qwen 3.6在部分桌面操作、编程和多模态测试中表现更好,Gemma 4则在两项安全测试中取得更低的违规率和攻击成功率。 

▲Muse Glimmer与Gemma 4、Qwen 3.6基准测试对比(图源:Meta)

04 模型从超过55GB压缩至不到20GB,解码速度提升3.1倍

Meta称,Muse Glimmer的技术重点在于,在300亿参数规模下平衡Agent能力、运行速度和个人设备的内存限制。 

该模型采用知识蒸馏路线,以更大的Muse Spark作为教师模型。预训练阶段,Meta使用Muse Spark的输出进行logit蒸馏,并采用与教师模型相近的数据组合。 

中期训练阶段,Meta加入更长上下文、更多Agent任务和更丰富的推理轨迹;后训练阶段则结合监督微调、在线蒸馏和强化学习,覆盖通用、推理、编程及Agent等领域。 

按照完整精度计算,Muse Glimmer需要超过55GB内存,超出多数消费级显卡的容量。Meta采用量化技术,将模型权重压缩至约4比特精度,使语言模型体积降至20GB以下。 

压缩后的模型可以与负责图片理解的感知编码器、保存工作状态的KV缓存,以及用于推测解码的小型模型共同运行在24GB或32GB内存环境中。因此,Meta所说的“消费级设备可运行”仍存在一定门槛,并不意味着所有普通电脑都可以部署该模型。 

▲压缩后的模型可以与KV缓存和小型模型共同运行在24GB或32GB内存环境中(图源:Meta)

为缩短模型执行长推理及多步骤工具调用时的等待时间,Meta还提供了一个基于DFlash的轻量级草稿模型。它会一次提出多组候选token,再由Muse Glimmer并行验证,在保持最终输出质量的同时提高生成速度。 

Meta测试显示,DFlash推测解码使Muse Glimmer在RTX 5090上的解码速度提升3.1倍,在M5 Max和M4 Max上分别提升1.8倍和1.5倍。 

▲DFlash推测解码在不同硬件上的加速效果(图源:Meta)

Muse Glimmer权重已经上传至Hugging Face。Meta称,Ollama、LM Studio和Unsloth将提供支持,llama.cpp、ExecuTorch和MLX等本地及端侧框架的优化集成也将陆续上线。 

开发者还可以通过vLLM和SGLang部署模型,或利用PyTorch的TorchTitan功能进行定制训练。AMD、Arm、戴尔、英特尔和英伟达正在参与Muse Glimmer在不同设备上的性能优化。 

05 扎克伯克长文详解Meta超级智能愿景,将为数十亿人提供免费Agent

扎克伯格在长文中提出,Meta将向数十亿用户和小企业提供免费或低价的个人Agent,推出连该公司自身也无法读取用户数据的完全私密模式,并继续开放部分模型权重。Meta将引入独立董事会审查发布标准,并考虑在训练期间向政府提供模型中间检查点用于模型治理。扎克伯格称,将加快芯片、能源和数据中心建设,并支持继续限制先进芯片对华出口。 

为了将这套个人超级智能路线落地,Meta计划从产品定价、隐私保护、模型开放和基础设施建设等方面采取具体措施。 

第一,Meta将提供免费或低价的个人Agent。按照扎克伯格的设想,每个人都可以拥有一个了解自身目标和偏好的Agent,用于处理健康、职业、财务、学习和家庭管理等任务,并通过手机、电脑和AI眼镜使用。需要更多计算资源的用户可以付费购买额外算力,Meta还考虑采用动态竞价机制分配有限的计算资源,但尚未公布具体推出时间和收费方式。 

第二,Meta计划推出完全私密的个人Agent模式。在这一模式下,即使Meta也无法读取用户信息或将其提供给其他机构。本地运行的Muse Glimmer与这一方向相符,可以减少个人文件及任务数据上传至云端的需要。不过,Meta尚未确认未来面向普通消费者的个人Agent是否会直接采用Muse Glimmer。 

第三,Meta将继续开放部分模型权重。除Muse Glimmer外,该公司还将开放最新基础模型Muse Spark 1.2。扎克伯格呼吁美国减少对开源AI模型的限制,并批评部分厂商通过封闭模型控制技术和用户。他认为,美国不应增加可能拖慢模型发布的统一审查流程,即使延迟一个月,也可能削弱美国AI公司的竞争优势。 

第四,Meta将继续建设支撑个人超级智能的芯片、能源和数据中心基础设施。扎克伯格认为,美国及其盟友虽然在芯片设计方面具有优势,但电力供应和数据中心建设速度仍是短板。与支持开放模型的立场不同,他同时支持继续限制先进芯片出口,认为这一政策现阶段可以减缓竞争对手训练前沿模型的速度。 

在模型治理方面,Meta计划由独立董事会批准模型发布的安全标准,并审查每次发布是否符合要求。扎克伯格称,超级智能如何部署不应由他或任何一名管理者独自决定。 

针对网络安全等潜在风险,他提出,前沿AI实验室可以在模型训练期间向政府提供中间检查点和技术人员,帮助政府提前评估模型能力并加固关键基础设施。 

06 结语:Meta把个人超级智能,路线落到本地Agent

Muse Glimmer将300亿参数Agent模型压缩至消费级硬件可以承载的范围,是Meta推进本地AI的一项实际进展。现有实测显示,该模型已经能够在断网状态下操作桌面应用、调用工具和完成编程任务,24GB或32GB的内存要求也使其进入部分个人电脑的部署范围。 

这款模型与扎克伯格长文提出的个人超级智能路线形成呼应:Meta希望通过免费服务、开放模型和完全私密模式,让个人Agent覆盖更多用户。本地运行可以减少对云端算力和网络连接的依赖,也为处理文件、日程等个人数据提供更具隐私性的方案。 

现阶段,Muse Glimmer在运行延迟、token消耗和工具接口方面仍有优化空间。随着模型进一步压缩、消费级硬件性能提升及本地工具生态完善,Agent竞争将从云端模型能力延伸至个人设备上的任务执行效率和数据隐私。 

本文来自微信公众号 “智东西”(ID:zhidxcom),作者:茄子,36氪经授权发布。

+1
4

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

再精密的零部件也得看整机厂脸色。

50分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业