ITBear旗下自媒体矩阵:

最强Fable 5.1发布!更强也更省:最高降价45%

   时间:2026-09-02 12:48:44 来源:AI普瑞斯编辑:快讯 IP:北京 发表评论无障碍通道
 

今天,Anthropic正式发布Claude Fable 5.1和Claude Mythos 5.1。据Anthropic自己说,它们是目前世界上最先进的编码和知识工作模型。

虽然名字不同,但Anthropic明确表示,它们实际上是完全相同的模型,区别主要在安全限制。

Fable 5.1面向普通用户和企业全面开放,而Mythos 5.1只通过可信访问计划提供给经过审核的专业用户和机构。

除了模型能力提升,Fable 5.1还重点解决了客户此前反复提出的三个问题:价格、数据保留和安全机制误判。

成本最多下降约45%

对于需要频繁调用工具、长上下文和多轮操作的高强度Agent任务,Fable 5.1成本最多可以下降约45%。

主要原因不是输入输出Token本身降价,而是Anthropic大幅降低了缓存读取价格。

Fable 5.1的输入价格仍然是每百万Token 10美元,输出为每百万Token 50美元。

但已经处理并缓存过的上下文,再次读取时价格降低75%,现在只需要每百万Token 0.25美元。

对于Agent来说,这项变化尤其重要。

智能体执行长任务时,需要不断读取之前的代码、文件、对话和工具运行结果,因此缓存读取可能占据成本的大头。

按照Anthropic基于今年8月4周真实使用量的统计,普通工作负载整体成本可以降到Fable 5的约75%,高度Agent化的任务则可能下降到55%左右。

不过,第三方测评机构Artificial Analysis的测试显示,缓存价格下降并不意味着每项任务的实际成本都会下降,每个任务的成本比Fable 5高20%。

主要原因是Fable 5.1使用的输出Token约为Fable 5的1.7倍。

但Artificial Analysis同时也强调,缓存读取降价仍明显节省了成本,平均为每项任务节省约1.40美元,这一变化主要体现在智能体测试中。

如果将推理强度从最高档调整到xhigh,Fable 5.1单项任务成本降至2.72美元,比最高强度低1.04美元。

科研性能大幅提升

在性能方面,Anthropic将Fable 5.1定位为编码、知识工作、科研和长时间自主任务的新旗舰之一。

总体跑分如下:

比较引人关注的是Terminal-Bench-Science 0.1。

这是一项由斯坦福牵头发布、Terminal‑Bench 团队打造的面向科研场景AI智能体的开源评测基准,专门衡量大模型智能体完成真实科研计算全流程任务的能力。

根据跑分榜单,本次升级最大的提升应该就是来自于科研能力。

Fable 5.1达到52.6%,相比Fable 5的24.7%提高了一倍以上,Opus 5为29.0%,GPT-5.6 Sol为22.4%。

不过,Anthropic也特别说明,这些测试中的安全护栏可能影响最终分数。

Fable 5.1是在正式生产环境安全机制开启的情况下进行评估。部分任务一旦触发安全规则,就会被判定为0分,因此Benchmark并不能完全代表模型在解除特定限制后的技术能力。

性能的提升也在在真实测试中有所体现,尤其体现在长时间任务这方面。

投资机构Millennium表示,公司内部曾有一段代码存在极其罕见的崩溃问题,大约每100万次运行才出现一次。

这个问题困扰工程团队长达四五年,包括Fable 5在内的其他模型也没有找到原因。

Fable 5.1最终反编译了一个外部供应商的程序库,并与Core Dump进行比对,最终把问题追踪到该程序库自身的Bug。

MongoDB则表示,Fable 5.1可以在无人监督的情况下连续运行数小时,先研究内部服务代码和文档,再自行设计并完成一个复杂原型。

Ramp的测试时间则更久。

他们让Fable 5.1连续自主运行38小时处理机器学习问题。

模型发现此前的一个实验结果实际上受到了标签数据问题影响,随后进行了修正,并启动6组并行实验运行了一整夜,最终返回结果和下一步方案。

这类长时间任务,也成为Fable 5.1重点强化的方向之一。

Agent能力外,科学研究能力也被重点介绍。

在分子设计实验中,Claude Mythos 5.1获得了开源蛋白质设计和折叠工具,然后自行设计能够与目标蛋白结合的分子。

相关设计随后被送往两家外部机构进行真实实验验证。

在3个目标上,Mythos 5.1设计出的结合分子,结合亲和力比Adaptyv Bio蛋白质设计比赛中的最佳方案高出10倍。

在12个目标上的整体命中率接近50%。

作为对比,目前蛋白质设计中10%至15%的命中率更加常见。

Fable 5.1还利用NASA麦哲伦号30多年前获得的雷达数据,训练神经网络,为大约三分之一的金星表面重新制作了一张高分辨率高程地图。

过去相关地图的细节精度大约为10至20公里,新地图提高到2至3公里,部分高度数据准确性提高最多25%。

Anthropic将这份地图以Creative Commons许可公开,希望为NASA未来的VERITAS任务以及欧洲航天局EnVision任务提供参考。

在计算生物学领域,Mythos 5.1则通过编写定制GPU Kernel,并缓存中间计算结果,把7个开源蛋白质和基因组深度学习模型的推理速度提高最多2.5倍。

在涉及全基因组分析的大规模任务中,预计可以降低30%至60%的GPU成本。

Anthropic表示,这类性能优化过去通常需要专业性能工程团队花费数周,而Mythos 5.1只依靠公开源码,在几天内就完成了。

相关优化代码之后也计划开源。

封堵模型蒸馏

Anthropic对Mythos 5.1进行了化学、生物、网络安全、智能体安全以及模型方面的大量测试。

在生物安全测试中,Mythos 5.1的能力已经超过上一代,但按照Anthropic自己的Responsible Scaling Policy,仍然没有达到下一风险等级。

因此,Anthropic决定继续维持严格访问限制。

在网络安全方面,Anthropic称Mythos 5.1是公司发布过网络能力最强的模型,但依然处于其Frontier Compliance framework中较低的风险级别。

Anthropic表示,与此前Fable 5使用的网络安全防护相比,新的防护机制在Claude Code中的平均干预次数减少约60%。

在智能体安全性上,新模型整体表现也比Mythos 5更稳定。

它在无法完成任务时,尝试突破测试环境访问外部资源的概率明显降低;为了达成目标而无视明确限制的情况也有所减少。

训练数据显示,模型尝试进行Reward Hacking,也就是通过钻规则漏洞作弊的频率,以及真正成功作弊的概率,都低于上一代。

但问题并没有完全消失。

Anthropic承认,Mythos 5.1有时仍然会绕过审批机制和自动模式分类器。

目前安全评估对于超长上下文、多智能体协作以及理论上无法完成的任务覆盖也不够充分,而这些恰恰是更容易出现异常行为的场景。

Anthropic还加强了针对模型蒸馏的保护。

所谓蒸馏攻击,是通过大规模调用先进模型,试图提取其能力并训练另一个模型。

Anthropic表示,这类攻击经常通过数千个虚假账号进行。

Fable 5.1调整了API机制。对于从现在开始新注册的API账号,用户将无法在保留Claude此前内部推理记录的同时,手动修改多轮对话中的历史上下文。

Anthropic称,这封堵了一种已经公开的模型蒸馏方式。

现有API账号暂时不会受到影响,但未来发布的新模型将把这一规则扩大到所有用户。

值得注意的是,Fable和Mythos这种“双版本”模式,可能代表一种新的前沿模型发布方式。

模型本身完全一样,但针对不同用户提供不同的权限边界。

普通用户使用Fable 5.1,获得更加严格的网络安全和生物安全保护;经过验证的网络安全人员和生命科学研究人员,则可以通过Cyber Verification Program和Life Sciences Verification Program使用Mythos 5.1。

Claude Security也已经改用Mythos 5.1,用于扫描代码库、寻找漏洞并向人类提供修复建议。

最后,还有一项与欧洲监管相关的变化。

Anthropic在2026年7月与另外190个签署方一起加入了欧盟AI法案有关AI生成内容透明度的行为准则。

根据相关要求,8月2日之后发布的Claude模型输出将加入文本水印。

这个水印并不是肉眼可见的标记,而是一种通过数值方式判断一段文字是否可能由Claude参与生成的机制。

Anthropic表示,水印不会包含用户身份、所属机构或者对话内容,也不会实际影响Claude输出文本的质量。

公司还开始以私人预览方式提供检测API。

目前主要向监管机构、执法部门、媒体、事实核查机构、独立研究人员、教育机构以及欧盟民间社会组织提供,同时也面向具有类似合规义务的企业开放。

Claude Fable 5.1目前已经在Anthropic全平台上线,同时进入AWS、Google Cloud和Microsoft Azure。

开发者可以通过Claude API使用claude-fable-5-1。

Mythos 5.1则仍然只面向通过审核的网络安全和生命科学专业用户开放,目前主要覆盖部分美国机构,之后将逐步扩大到更多美国及国际合作伙伴。(AI普瑞斯)

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version