Meta|开源Muse Glimmer:约30B本地智能体模型(Apache 2.0)

PromptTree|阅读 0
2026/08/11 08:49
MetaMuse GlimmerApache 2.0开源权重本地Agent
Meta于8月10日发布约300亿参数的Muse Glimmer并以Apache 2.0在Hugging Face开放权重,面向常开本地Agent;支持量化与推测解码,目标单卡消费级GPU可跑,配套文档与生态集成陆续到位。

云端智能体可以很强,但要碰个人日程、本地文件与弱网场景,最终还得「能跑在自己机器上」——Meta把约300亿参数的Glimmer权重开出去了。

Meta Superintelligence Labs是Meta平台公司的前沿模型团队,近年在开源与闭源之间多次调整策略。Muse系列是其面向智能体与编程场景的模型线;所谓开源权重(open-weight),白话就是权重可下载、可本地部署、可按许可证二次使用——与「只能通过云端API调用」形成对照。Apache 2.0则是较宽松的开源许可,对企业集成通常更友好。

8月10日,Meta AI Research官方博客发布Muse Glimmer:约300亿参数,面向常开本地智能体工作流,目标可在配备单块消费级GPU的Mac或PC上运行,覆盖本地Agent、函数调用、本地编程与LLM-as-a-judge等场景。训练路径包括对Muse Spark输出的logit蒸馏、更偏Agent的中期训练,以及监督微调与强化学习后训练。

能力叙述强调几件事一起工作:

  1. 端到端任务完成:在DeepSearch QA、MCP-Atlas、SWE-Bench等基准上评估。
  2. 可靠工具调用:长流程中按精确schema调用函数。
  3. 多步推理与失败恢复:工具失败时诊断并重试,而不是直接停住。
  4. 多模态:经感知编码器接受交错文本与图像。
  5. 脚手架兼容、可控推理强度、多语言(训练数据覆盖百余种语言口径)。

部署侧,官方称全精度约300亿参数模型显存需求过高;约4-bit量化可将语言模型压到约20GB以下,以便在约24GB或32GB显存包络内同时放下KV缓存、感知编码器与推测解码drafter。所谓推测解码,白话就是先用小模型「起草」一批token,再由大模型并行校验,从而在不改输出质量的前提下加快生成。权重已在Hugging Face开放,文档与llama.cpp、MLX、ExecuTorch等集成将陆续到位;亦可经Ollama、LM Studio、vLLM、SGLang及云端合作方试用。

把Glimmer放进开源权重竞争:对手不只是更大参数海报,还有「单卡能不能流畅当Agent跑」。对开发者,Apache 2.0降低了试用与二次分发摩擦;对企业,真正要验收的是延迟、隐私边界与任务成功率。下一观察点是社区复现曲线,以及公司预告的更多开放权重节奏——本地智能体要赢的不是参数表,是开机就能用的响应速度。