meta近日推出新一代旗舰AI模型Muse Spark 1.3,在Artificial Analysis的AI分析指数榜上以62分位列第三,仅次于Claude Fable 5.1(66分)和Claude Opus 5(63分),成功超越谷歌同日发布的Gemini 3.8 Flash(59分)。这款模型凭借低成本、高效率的特性,迅速成为开发者关注的焦点。
meta首席AI官汪滔在社交平台高调宣称,Muse Spark 1.3的智能体能力、编程效率及易用性实现质的飞跃,其成本低至"几乎可以忽略不计"。配合Muse Code工具使用时,该模型在代码生成任务中的表现已与Claude Code + Opus 5、Claude Code + Fable 5等组合不相上下。开发者实测显示,用Muse Spark 1.3开发《我的世界》游戏模组成本仅需10美分(约0.67元人民币),印证了其极致性价比优势。
性能对比数据显示,Muse Spark 1.3在5项基准测试中登顶,编程与长文本处理能力显著优于GPT-5.6 Sol和Claude Opus 5,仅在终端操作Agent测试中与GPT-5.6 Sol持平。不过该模型在联网搜索类Agent和通用知识任务GDPVal-AA v2中表现较弱,暴露出多模态理解能力的短板。价格方面,其API定价与前代持平,输入成本每百万token最低0.15美元(约1元人民币),输出成本4.25美元(约28.55元人民币),虽略高于Gemini 3.8 Flash,但仍低于DeepSeek-V4-Pro高峰期定价。
开发者社区的实测反馈呈现两极分化。部分用户称赞其迭代优化能力惊人:某测试中模型在2小时内完成20轮自我修正,执行60次智能体任务,总成本不足1美元。但开源基准测试MineBench显示,Muse Spark 1.3的首测Elo评分(1787分)低于Gemini 3.8 Flash(1888分),且平均推理耗时是其3倍。横向对比中,Qwen 3.8 Max虽在输出质量上更胜一筹,但耗时长达90分钟,远超Muse Spark 1.3的2分钟处理速度。
meta着重强化了模型的长周期任务处理能力。Muse Spark 1.3可并行管理多条工作流,在开放式目标场景下自主筛选有效信息、修复方案漏洞。例如在广告管理任务中,该模型能准确提取不同位置的活动详情、文案和图片,完成跨平台内容发布。编程效率提升方面,与1.2版本相比,新模型工具调用次数减少20%,token使用量降低25%,代码风格更趋简洁清晰。
安全性能升级是本次迭代的另一重点。研究人员通过多维优化增强了模型的对抗鲁棒性,使其能有效抵御提示注入攻击。在处理复杂智能体任务时,模型可识别不可逆操作风险并采取审慎策略。目前Muse Spark 1.3已通过基础安全测试,极致推理模式(max-reasoning)待完成额外验证后将向用户开放。meta透露,后续计划推出更大参数版本及开源权重模型,持续完善产品矩阵。













