
9月1号,Anthropic 发布了 Claude Fable 5.1,最容易被注意到的数字是:
重度 Agent 工作流成本最高可下降约 45%。
这里大家会有疑问:
是不是 Token 用量少了 45%?
其实不是,这次真正变化最大的,是重复读取内容的价格变便宜了。
在正式理解这个规则之前,你需要了解AI工作的一些原理和名词。
Token 可以简单理解成:AI 处理文字时使用的计量单位。
你给 Claude 一段代码、一份文档、一个问题,这些都会被拆成 Token。
API 计费主要看两部分:
Input Token:Claude 读了多少内容
Output Token:Claude 生成了多少内容
普通聊天一般还好,但 Agent 不一样。
一个 Coding Agent 可能连续工作几十轮,问题是,很多内容每一轮其实都没变。
比如:项目说明、System Prompt、代码文件、工具定义。如果每一轮都按正常 Input Token 原价重新读取,Agent 跑得越久,费用越高。
Prompt Cache 可以理解成“上下文缓存”。
第一次 Claude 读取一批固定内容后,可以先缓存起来。
后面 Agent 再次需要这些内容时,不用按正常 Input 价格重新读取,而是走更便宜的:
Cache Read 可以这样理解:
第一次读取
↓
写入缓存
第二次再用
↓
Cache Read
第三次再用
↓
Cache Read
Fable 5.1 的关键就在这里!
普通 Input:$10 / 100万 Token
Cache Read:$0.25 / 100万 Token
也就是说,已经缓存过的内容,再次读取时,价格只有正常输入的 2.5%。
这才是为什么 Agent 跑得越久东西越多越长,Prompt Cache 就越重要。

拿具体的计算来举个简单例子
假设一个 Coding Agent 每一轮都需要带着 20 万 Token 的项目资料。
一共跑 50 轮
如果每轮都按普通 Input 重新读:
20 万 × 50 = 1000 万 Token。
按 Fable 5.1 的输入价格计算:
大约就是 100 美元。
如果稳定内容被缓存起来,后面 49 次都走 Cache Read:
20 万 Token 读取一次,只要大约 0.05 美元。
49 次也只有大约 2.45 美元。
真实使用还要算 Cache Write、新增内容、输出等费用,所以最终账单不会直接下降 97%。
通过例子已经很清楚了:
Token 没消失,只是大量重复 Token 换成了更便宜的读取方式。
这也是 Anthropic 为什么说,某些 Agent 工作流整体成本最高能下降约 45%。
这次还有几个变化,其实都是围绕 Agent 成本做的。

比如 Adaptive Thinking。
可以简单理解成:
Claude 不需要每一步都用最大推理强度。
简单任务少“想”一点,复杂任务再提高 effort。
再比如工具调用。
Agent 如果同时需要读三个文件,最好一次并行读取,而不是:
读一个 → 思考一次 → 再读一个 → 再思考一次。
Agent Loop 越多,Token 和等待时间都会增加。
所以以后做 Agent,成本不单单看:每百万 Token 多少钱。
还要看:跑了多少轮、缓存命中多少、工具调用是否合理等等这些。
最真正该看的,是Cost per Task。
(Cost per Task:完成一个完整任务,实际一共花了多少钱。)
现在不少团队已经不只用一个 AI 工具。
Claude、ChatGPT、Cursor、Copilot、Gemini,再加 API 和各种 SaaS。
月费、按量计费、自动续费混在一起,月底很容易对不上账。
我们自己在处理这类海外 AI 和 SaaS 支出时,会用 MXK8 虚拟卡把不同平台或项目拆开管理。
比如 Claude API 单独一张,团队 SaaS 单独一张。
这样某个项目费用突然上涨时,会更容易定位。
Agent 真正进入企业以后,成本管理大概率也会越来越像云服务:
不只是把账付掉,而是要知道钱到底烧在哪。
最后梳理一下,所以 Fable 5.1 这次并不是简单“Token降价”。
更准确地说:
它把 Agent 最容易重复花钱的那部分,变便宜了。
Prompt Cache、Cache Read、动态推理强度、工具调用方式,这些看起来不如“模型又提升多少分”吸引眼球。
但 Agent 真正开始长期运行以后,最终决定它能不能大规模落地的,看的就是这些成本细节。
关于我们

