继 Anthropic 和 Google 接连更新模型之后,meta 也加入了本周这场大模型密集发布潮。
就在刚刚,meta 正式发布 Muse Spark 1.3,新模型当天开始登陆 Muse Code 和 meta Model API。
相比上一代 Muse Spark 1.2,meta 将升级重点放在 Agent 长任务、编程、多任务处理和复杂指令遵循上,同时进一步降低了模型完成工程任务时需要消耗的工具调用和 Token 数量。
扎克伯格随后在 X 上表示,Muse Spark 1.3 是 meta 目前在编程和 Agent 工作上幅度最大的一次升级,并形容其已经获得接近前沿模型的性能,同时价格「低到几乎可以忽略不计」。
按照 meta 的规划,Muse Spark 1.3 还只是这一轮模型更新的开始。更大的 Muse 模型、Muse Spark 开放权重版本都已经进入后续发布计划。
meta 的个人 Agent 野心,藏在 Muse Spark 1.3 里
Muse Spark 1.3 最明显的变化,出现在长时间运行的 Agent 工作流上。
meta 希望模型在面对开放式任务时,不再只完成一连串预设步骤,而是能够自己使用工具收集上下文,从杂乱甚至互相冲突的信息中整理线索,发现计划存在缺口以后主动调整,同时持续记录已经获得的信息,直到生成最终交付物。
为了提高模型对不同 Agent 环境的适应能力,meta 表示,Muse Spark 1.3 在多种不同的 Agent harness 中进行了训练,希望模型离开固定工具链之后依然能够维持相近的工作能力。
用户与 Agent 的协作方式也发生了变化。
面对含义不明确的 Prompt,Muse Spark 1.3 会更主动地询问用户;任务进行不下去时,也会向用户寻求帮助;涉及不可逆或者影响较大的操作时,则会在执行之前确认。
长任务期间,模型还能根据用户偏好调整工作方式。有些用户希望不断看到进度更新,模型可以持续汇报;另一些用户希望减少打扰,它也可以降低通知频率,持续完成任务。
meta 还专门强化了模型对自身能力边界的判断,希望它能够更准确地区分自己「知道什么、不知道什么、能够做什么、做不了什么」,遇到障碍时明确表达,而不是虚构已经完成的结果。
复杂指令遵循同样是升级重点。Muse Spark 1.3 在包含大量限制条件的多步骤任务中,更容易持续记住前文要求,减少任务进行到后半段以后遗漏条件或者偏离原有流程的问题。
meta 展示的一个案例是一份航空工程报告。模型需要同时读取 CFD 仿真数据和 STEP 格式的机翼 CAD 文件,整理计算域、网格、材料属性、边界条件和收敛目标,提取速度、湍流强度、动能以及机翼受力等数据,再分析升阻力、激波、流动分离和湍流现象,最后按照指定章节生成并导出 PDF。
类似任务反映出 meta 对 Agent 的定位正在发生变化。
单次回答已经不足以代表模型能力,能否在一个持续很长时间、资料复杂、要求不断变化的任务中保持状态,开始成为下一阶段模型竞争的重要指标。
meta AI 负责人 Alexandr Wang 在接受外媒 Axios 的采访时表示,Muse Spark 1.3 在这一方向上的改进,会直接服务于扎克伯格此前多次谈到的个人 Agent,也就是能够长期代表用户工作,持续帮助用户完成目标的 AI 系统。
Coding Agent 继续变强,也开始认真算成本了
编程能力是 Muse Spark 1.3 另外一个重点升级方向。
meta 表示,新模型增加了大量长时间编程任务训练,并针对日常工程工作中的可用性进行了优化。相比 Muse Spark 1.2,它会减少不必要的对话轮次,回复更加克制,生成代码的整体风格也更加干净。
meta 工程师进行的内部比较显示,Muse Spark 1.3 完成相同任务时平均减少约 20% 的工具调用,同时减少约 25% 的 Token 消耗。
对于正在向 Agent 编程演进的 AI Coding 产品而言,这两个数字比单纯提高 Benchmark 分数更具有实际意义。
当前不少 Coding Agent 会在一个任务中反复搜索文件、调用终端、修改代码、重新测试,一个看似简单的需求可能产生几十甚至上百次工具调用。
模型能力提升之后,如果完成任务需要的调用次数下降,意味着等待时间、推理成本和 API 消耗都有机会同步降低。
参与 Muse Spark 1.3 研发的北大校友孙之清(去年加入 meta)也在模型发布之后发文打 call,并透露了一些研发侧的信息。
他表示,团队这次再次对 Avocado 模型进行了后训练,同时进一步强化了测试时扩展能力,并评价新版本相比前代在各个方面都有明显提升。
meta 还在通过另一种方式继续降低 Muse Code 的使用成本。
开发者如果同意 meta 使用自己的代码和工作数据训练、改进模型,就可以加入所谓的 contributor tier,以明显更低的价格使用产品。Wang 表示,目前已经有「具有实际规模的两位数比例」开发者选择了这一方案。
背后的逻辑并不复杂。meta 手里拥有庞大的算力基础设施,也需要大量真实开发场景数据继续提升 Coding Agent,如果能够用更低的订阅价格交换模型改进所需的数据,Muse Code 就有机会同时获得用户规模和训练数据。
当然了,模型能够连续工作更长时间以后,安全问题的重要性也随之提高。
不过正如 Wang 所说,meta 目前还没有因为安全问题暂停模型研发,公司采取的方式是增加安全与 Alignment 投入,尽量避免后续模型触碰内部设定的安全限制。
Muse Spark 1.3 当前已经提供此前开放的推理模式,更高计算量的 max reasoning 版本仍需要完成额外安全测试,随后才会发布。
本周依然是神仙打架的一周,几乎每天醒来都有新模型发布,且涵盖不同的中杯、大杯和超大杯模型。
昨天,Anthropic 更新了 Fable 和 Mythos 系列;Google 发布 Gemini 3.8 Flash 和面向网络安全任务的专用版本;OpenAI 也确认 Astra 即将推出。
meta 需要面对的已经不只是单项 Benchmark 竞争,还有前沿实验室正在同时争夺 Coding、Agent、长上下文、工具调用和单位成本。
更有意思的是,meta 新模型发布之后,meta AI 负责人 Alexandr Wang 也没忘记给这场竞争再添点火药味。他对着 Gemini 的新模型贴脸玩梗:「我真不想这么说,但是……Gemini 是谁?」。
真就 ·与其提升自己,不如诋毁对手。







