Meta近日正式推出其AI编程智能体Muse Code(测试版),正式加入与Anthropic和OpenAI的竞争行列。该公司在官方公告中表示:“我们很高兴发布Muse Code(测试版),这是一款由Muse Spark 1.2模型驱动的终端编程智能体,标志着我们向前沿迈出新的一步,未来将推出更大、更强大的模型。”
作为一款智能编程工具,Muse Code专为大型代码库的软件工程任务设计。据Meta介绍,它能够“承担跨大型代码库的复杂软件工程任务:规划变更、编写代码并验证结果。它可为每个任务协调多个持久性子代理,从而更快、更准确、更少干预地解决难题。”
最引人注目的特点是其运行时设计。Muse Code将所有模型调用、工具运行、审批和编辑记录到本地事件日志中,作为单一事实来源。Meta表示:“这一单一事实来源使得运行时能够精确重放并安全重启:崩溃后,智能体可以从停止的位置精确恢复。”对于长时间运行的任务,这一特性比原始速度更为关键,而竞争对手尚未将其作为卖点。
此外,Muse Code内置了默认技能。`/plan`命令将任务转化为需审批的计划,`/grill`对计划进行压力测试直至稳定,`/goal`则致力于成功完成目标,类似于Hermes的功能。Meta称,他们与Muse Code联合训练了Muse Spark 1.2模型,使核心大语言模型与智能体协同工作。
基准测试与表现
Muse Spark 1.2是Muse Spark 1.1的编程专精版本。Meta表示:“我们大幅增加了编程任务的训练计算量,同时扩展了训练环境的多样性,在代码生成、复杂调试和端到端开发者工作流方面取得了显著改进。”图表显示,在Terminal-Bench 2.1上,Muse Spark 1.2搭配Muse Code得分82.9%,低于Claude Code on Opus 5的86.7%,但高于GPT-5.6 Terra on Codex的81.8%和Grok Build的81.6%。
在衡量智能编程能力的DeepSWE 1.1基准上,差距缩小:Muse为59.3%,Opus 5为65.0%,Codex为64.8%。在Meta内部编程基准上,Muse达到70.6%,而Opus 5为79.4%。
加速图表显示,在超过1000次工具调用后,Opus 5相对于基线提升最大(约74-75%),Muse Spark 1.2居中(约61-69%,取决于运行次数)。Meta强调,智能体随着工具调用积累而持续改进,这正是长周期编程所需的行为。
多模态与长时任务
最有趣的演示是长周期和多模态任务。在压力测试中,Meta表示Muse Code“在Nvidia Hopper GPU上通过1000多次工具调用(长达24小时)迭代优化GPU内核”,这意味着它能够随时间不断改进。此外,Muse Code还具备视觉编码能力:用户可将房屋漫游视频(mp4)拖入终端,Muse Code“解读视频并生成一个带有预订功能的视觉丰富的网站”。将原始视频转化为可工作的网页应用,是Meta在Muse系列中一直强调的多模态能力。
竞争格局与独特优势
虽然Meta入局较晚,但Muse Code的亮点在于崩溃安全运行时和子代理设计,而非基准测试领先。目前OpenAI的Codex已支持并行云端智能体,DeepSeek也构建了类似Claude Code的竞品,而Hermes或OpenClaw等工具已具备更多功能。Muse Code的风险在于:一个能崩溃后恢复并持续调用工具长达24小时的智能体,既强大又难以预测。Meta正在押注开发者渴望这种自主性,并已开始发货。
Muse Code现已开放测试,用户可通过以下命令安装:curl -fsSL https://dev.meta.ai/install.sh | bash
