Meta 的 AI 编程环境 Muse Code 现已开放测试,只需一条命令即可安装:
curl -fsSL https://dev.meta.ai/install.sh | bash
同时,最新大模型 Muse Spark 1.2 版也迎来更新。虽然在基准测试中对比 1.1 版提升有限,但 Meta 提供了一个“贡献者”版本——只要同意上传使用数据,就能享受 0.5 折优惠,立省 95%,比 DeepSeek 还便宜。以输出价格为例,普通版 Muse Spark 1.2 每百万 token 要 4.25 美元,而贡献者版仅需 0.20 美元。这摆明是不计成本也要收集训练数据,扎克伯格的司马昭之心路人皆知。
Muse Code 的设计思路是处理完整的工程任务:在大型代码库中理解需求、规划变更、跨文件改动、编写代码并验证结果。官方演示中,用户将一段房屋航拍视频(mp4)导入终端,Muse Code 能读懂视频内容,并产出一个度假屋营销与预订页面,最后在浏览器中验证成品。
它的结构是一个简单的主循环,外加一组异步后台智能体。与遇到子任务才临时派生智能体的做法不同,这些后台智能体在整个会话中保持活跃,自行推进下一步工作,并自己决定何时向主智能体反馈。已经扫描过项目结构、依赖、测试配置和历史改动的后台智能体,后续任务无需重复同样的探索。
后台观察智能体围绕记忆召回、技能召回、目标追踪和验证四个质量维度工作,前三项默认启用,验证观察器默认关闭。这些观察器自身也会发起模型调用,因此会带来额外的 token 开销。当任务可以拆成多个相对独立的部分时,Muse Code 会把工作分派给多个子智能体。开发者可以用 muse —subagent-worktree-isolation 启用隔离——此时每个子智能体从主提交点创建独立的 Git worktree,在各自的目录里修改并独立提交,主工作副本不会被直接改动,再由主智能体审查或合并结果。
运行时还内置了本地事件日志。每一次模型调用、工具运行、审批和编辑都被追加写入,作为唯一事实来源,使运行时具备精确回放和重启安全的能力。即使执行中断,智能体也能从停止点继续,而不是靠重新提示或猜测已有状态。这份日志同时构成一条可审计的时间线:哪个智能体在何时调用了什么工具、拿到什么结果、执行了哪些改动、在哪一步被批准或取消,都可以回看。
Muse Code 自带几个默认技能:
/plan 把任务转成需要审批才能推进的计划;
/grill 反复压力测试这份计划直到它站得住;
/goal 朝指定目标推进到完成。
兼容性方面,Muse Code 支持内置、用户级和项目级三层 skills,会扫描 .codex/skills 与 .claude/skills,支持从 Claude 或 Codex 导入 skills,可通过 MCP 连接外部工具,通过 hooks 接入生命周期事件。
和 Harness 一起训练的模型
Muse Spark 1.2 是 Muse Spark 1.1 与 Harness 联合训练的产物。Meta 显著增加了编程任务上的训练算力,并扩展训练环境的多样性,改进集中在代码生成、复杂调试、代码库理解和端到端开发流程,同时保留了通用智能体能力。
Muse Spark 的训练与 Muse Code 深度结合,训练素材包括经过拒绝采样的 Harness 轨迹,以及针对目标设定、上下文压缩和子智能体的配方优化。Muse Code 的工具集也被直接整合进训练,以最大化模型与运行时的兼容性。长时程能力来自另一组任务:整仓库生成、大型端到端项目和自动研究,模型用规划给工作排序,用目标条件化维持方向,用上下文压缩保留继续推进所需的知识。
此外还有一条自我改进回路:用上一代的 Muse Spark 1.1 生成有难度的编码环境和指令遵循模板,再由模型对候选解是否满足要求打分,形成可规模化的训练数据,用于提升复杂指令遵循能力。
Meta 还展示了一个高强度案例:在英伟达 Hopper GPU 上迭代优化 KDA 和 MLA kernel,执行超过 1000 次工具调用,最长运行时间达 24 小时。在不得直接导入第三方 kernel 库的限制下,模型自己编写、编译、剖析并逐步改进实现,最终相对给定基线取得了显著的性能提升。
参考链接:[1] https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
本文由云栈社区整理编辑。
|