如果只看实际使用量,Fable 5 很难算得上一款成功的旗舰模型。
作为 Anthropic 产品线里定位最高、价格也最贵的模型,Fable 5 上线后并没有拿到与旗舰身份相匹配的使用规模。Ramp 数据显示,Fable 5 只贡献了 Anthropic 企业端约 6% 的 Token 消耗量。
再加上数据留存政策带来的企业合规限制,很多客户最终选择了更便宜、更容易采购的 Opus 5。 然而让人意外的是,Anthropic 并没有因此放慢旗舰模型的更新速度。
官方博客🔗 https://www.anthropic.com/claude-fable-and-mythos-5-1
就在刚刚,Anthropic 正式发布 Claude Fable 5.1 与 Claude Mythos 5.1,新模型已经开始登陆 Claude、Claude Code、API,以及 AWS、Google Cloud 和 Microsoft Azure 等平台。
按照 Anthropic 的说法,Fable 5.1 和 Mythos 5.1 实际采用同一个模型,区别主要来自安全限制。Fable 5.1 面向普通用户和企业开放,Mythos 5.1 则拥有更宽松的网络安全和生命科学权限,目前只通过可信访问计划提供给经过审核的机构和研究人员。
相比单纯刷新 Benchmark, Anthropic 此次明显将更多精力放在 Fable 5 上线后暴露出的实际部署问题上。价格、数据留存、安全机制误判,以及 Agent 长时间运行成本,都成为 Fable 5.1 重点调整的方向。
Claude 开始进入「无人值守」时代
性能依然是 Fable 5.1 最显眼的升级之一。
更多跑分图如下:
Anthropic 还特别强调,Fable 5.1 在 Low 或 Medium Effort 模式下,已经能够以更低成本达到接近甚至超过 Fable 5 的效果。Claude Code 默认使用 High Effort,Claude Cowork 和 Claude.ai 默认则为 Medium Effort。
Benchmark 上的提升很快也开始出现在开发者的实际测试中。
Krax 则把 Fable 5 和 5.1 放进自己制作的 PortraitBench 测试自画像生成能力,并表示第一次对比已经让他开始期待 5.1 在其他视觉编程任务里的表现。
另一位开发者 S 使用 Fable 5.1 配合 Tesana,在几个小时内通过一个提示构建出一款支持多人游玩的 ARC 生存游戏,其中包含烹饪、制作、狩猎、恐龙驯服和 Boss 战等系统,开发者称最终可玩内容超过 20 小时。
开发者 wick 展示的测试也体现了类似倾向,在相同提示词和没有额外插件的条件下,他认为 Fable 5.1 的生成结果相比此前版本出现了相当明显的变化。
相比这些一次性生成案例,Anthropic 自己更愿意强调 Fable 5.1 能够连续工作多久。
投资机构 Millennium 在内部测试中,让 Fable 5.1 分析一个已经存在四五年的罕见程序崩溃问题。该故障大约每运行一百万次才会出现一次,此前公司的工程师以及包括 Fable 5 在内的其他模型都没有定位原因。
Fable 5.1 最终反汇编了第三方厂商的代码库,并结合 Core Dump 进行分析,最后将问题定位到了外部库中的一个 Bug。
Ramp 的测试更加接近典型的长周期 Agent 场景。在一次机器学习任务中,Fable 5.1 连续自主运行 38 个小时,首先判断此前实验结果受到标签问题影响,随后修正问题,并行启动六组实验,运行一整夜之后继续返回实验结果和后续建议。
MongoDB 的工程师则让 Fable 5.1 根据内部服务代码和文档设计一个复杂原型。模型先进行了跨服务研究,随后连续运行数小时完成实现和验证,整个过程基本没有人工持续干预。
Shopify 的工程师也提到,相比 Fable 5,新模型在长时间无人值守任务中更容易保持任务上下文,能够自行记录进展,在条件发生变化以后重新调整优先级,并继续从之前的位置完成工作。
Agent 能力之外,科研也是 Anthropic 此次重点介绍的方向。
比如在蛋白质设计实验中,Anthropic 使用 Mythos 5.1 使用生成结合剂并交由外部机构验证,最终的结果也表现优异,高于行业常见的 10%至 15%。
在计算生物学方面,Mythos 5.1 优化了七个开源蛋白质和基因组模型的 GPU Kernel,使 NVIDIA H100 推理速度提升约 1.4 倍至 2.5 倍,并预计降低大规模基因组分析的 GPU 成本约 30%至 60%。
类似能力已经开始延伸到更加开放的研究问题中,一项名为 Cyphral Distich 的测试直接把一个约 370 年无人破解的密码问题交给 Fable 5.1,测试方称模型在不到一天内给出了解法。
简言之,Fable 5.1 和 Mythos 5.1 都针对实际使用中的核心需求进行了多项优化,整体性能也得到大幅提升。
卷完性能,卷价格
Fable 5.1 最直接的变化来自价格。
新模型的基础 API 定价没有变化,输入依旧为每百万 Token 10 美元,输出为每百万 Token 50 美元,但 Anthropic 将 Cache Read, 也就是模型重复读取已经处理过的上下文的价格降低了 75%,目前为每百万 Token 0.25 美元。
🔗 https://platform.claude.com/docs/en/about-claude/pricing
按照 Anthropic 对今年 8 月实际工作负载进行的测算,在 Claude Enterprise、Claude Code 和 API 等典型使用场景中, Fable 5.1 的总体成本预计比 Fable 5 下降约 25%。对于大量读取历史上下文、频繁调用工具的复杂 Agent 工作负载,成本下降幅度最高可以达到约 45%。
缓存价格之所以在这一代变得重要,与 Agent 的工作方式有关。
传统聊天模型通常处理一次请求后就结束任务,而 Claude Code 一类 Agent 会持续读取代码库、工具结果和历史上下文,有些任务甚至连续运行数小时。运行时间越长,重复读取上下文产生的 Cache Read 越多,相关成本也越明显。
Cognition 联合创始人 Walden Yan 表示,Fable 5.1 在测试中达到或超过 Fable 5 的水平,同时单任务成本更低,因此公司准备将 Devin 的部分 Opus 5 流量迁移过去。随着 Cache Read 降价,一些过去受成本限制、仍由 Opus 处理的代码审查任务,也可以转向 Fable 5.1。
不过,虽然 Fable 5.1 降价了,但和竞争对手相比,它依然称不上便宜。
AI/ML API 使用完全相同的提示词测试 Fable 5.1 和 GPT-5.6 Sol 生成五个连续的 Three.js 场景,前者一次任务花费 5.69 美元,后者只有 0.88 美元,Fable 5.1 用约六倍成本换来了更密集的海浪、海岸线、水晶吊灯和水上乐园等视觉细节,但两款模型最终都出现了不同程度的场景状态错误。
价格之外,数据留存也是此次升级试图解决的问题。
Anthropic 推出了一套名为 Enterprise Frontier Safeguards 的企业安全系统,简称 EFS。 使用 EFS 以后,客户的数据将存储在企业自行控制的云基础设施中,而非 Anthropic 的服务器,默认情况下需要人工审核的内容也由客户自行处理。
EFS 计划从今年秋季开始分阶段上线,未来将覆盖 Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Google Agent Platform 和 Microsoft Foundry。正式开放以前,符合条件的企业可以直接通过零数据留存方式使用 Fable 5.1。
安全机制的误判率也有所下降。
在网络安全场景中,Anthropic 称 Fable 5.1 的新版安全机制相比此前平均减少约 60%的干预。新模型现在允许开发者直接寻找软件漏洞,也就是进行防御性质的漏洞分析,不过渗透测试、Exploit 生成以及基于二进制文件的漏洞扫描等双重用途任务,仍然会受到限制或转交其他模型处理。
生命科学领域的机制也进行了类似调整。相较 Fable 5 刚推出时的安全系统,新版机制针对基础生物学和普通医疗问题的误触发次数减少约 85%,更加专业的生命科学研发任务依旧受到额外限制。
最强 Claude 有了,Mythos 只给「持证玩家」
Fable 5.1 与 Mythos 5.1 最特殊的设计,依旧是 Anthropic 开始更明确地将模型能力与模型权限分开管理。
按照官方说明,两个版本使用相同的基础模型,Mythos 5.1 在网络安全和生命科学领域拥有更加宽松的安全机制,因此不会直接向普通用户开放。
网络安全领域,Anthropic 称 Mythos 5.1 是公司目前发布过网络安全能力最强的模型,不过按照其 Frontier Compliance Framework,目前仍然处于较低风险级别。
Anthropic 同时委托外部机构对 Fable 5.1 的网络安全机制进行了压力测试,其中包括 Gray Swan 的自动化测试。公司称目前仍然没有发现能够达到 Critical Severity 标准的安全绕过方式。
网络安全用户则可以通过 Cyber Verification Program 获得类似权限。目前该项目主要提供部分 Opus 和 Sonnet 系列模型的低限制访问,后续也将加入 Mythos 系列。
Anthropic 的代码安全产品 Claude Security 也已经开始使用 Mythos 5.1,主要用于扫描代码库中的漏洞,并为人类审核人员提供修复建议。
模型权限提高以后,Anthropic 同时继续加强反蒸馏限制。
从 Fable 5.1 开始,当地时间 9 月 2 日以后创建的新 API 账户将无法在多轮对话中手动修改 Claude 的历史上下文,同时继续保留模型此前的完整思考记录。
Anthropic 认为,此前这种机制可以被用于工业规模的模型蒸馏,通过大量虚假账户批量提取 Claude 的推理能力。新限制暂时不会影响现有账户,但未来发布的新模型会逐渐扩大适用范围,一些依赖相关机制的定制 API 集成后续可能需要调整。
另一个新增变化来自文字水印。
根据欧盟当地要求, Fable 5.1 也因此加入了一套不可直接看到的数字水印机制。Anthropic 称,水印不会包含用户身份、机构信息或对话内容,也不会改变模型输出质量。
此外,Anthropic 还将同时开始提供水印检测 API 的 Private Preview,目前主要开放给监管机构、执法机构、媒体、事实核查组织、独立研究人员、教育机构、欧盟民间组织以及有相关合规义务的企业。
从 Fable 5.1 的变化来看,Anthropic 已经清醒地意识到模型的性能当然还可以继续追求最强,但今天的市场,已经越来越不只奖励「谁能拿第一」。
最近,智谱的牛来模型和阿里的 Qwen 3.8 Flash,也都在尝试用更低的价格,提供接近旗舰模型的能力。某种意义上,这就是大模型行业正在出现的「智能密度斩杀线」。
当这条斩杀线不断上移,旗舰模型就会陷入一种越来越熟悉的困境。
领先者为了守住第一,需要投入更多算力,承担更高昂的训练成本,建设更复杂的基础设施,同时还要依靠更高的价格,维持原有的收入和利润结构;
后来者面对的任务却简单得多,它甚至不需要真正超过你,只要做到足够接近,再把价格压到你的十分之一,就能对你构成实质性威胁。
这就是所谓的「领先者的诅咒」。
你比我强一点,当然没关系。但如果我只花你十分之一,乃至百分之一的成本,就能完成和你差不多的工作,那你可就真的要遭老罪了。
我们正在招募伙伴
📮 简历投递邮箱hr@ifanr.com
上一篇:当AI客服 有了“新国标”
下一篇:王兴兴寻找下一个“王兴兴”