
如果同时用过OpenAI、Claude和Gemini API,很容易遇到一个问题:到底哪家的API更便宜?
这个问题不能只看“1M Token多少钱”,因为真正影响成本的还有这些:
输入和输出Token比例;
是否大量重复上下文;
是否使用Batch;
Agent会不会反复调用模型;
是否开启搜索、文件、代码执行等工具;
长上下文是否进入更高价格区间。
下面直接按当前官方价格带大家核算一次。
以下价格均为标准API、每100万个Token的美元价格。为了方便比较,我按低成本、综合型、高能力三个使用层级整理。
注意:这里是按产品定位和价格区间比较,不代表不同厂商模型能力完全等价。
OpenAI GPT-5.6目前分为Sol、Terra和Luna三个主要档位,标准短上下文价格分别为:$5/$30、$2/$12和$0.2/$1.2。
Anthropic当前Claude Sonnet 5为$3/$15,Opus 5为$5/$25;Haiku 4.5则为$1/$5。
Google当前Gemini 3.6 Flash为$1.5/$7.5,3.5 Flash-Lite为$0.3/$2.5。Gemini 3.1 Pro Preview在20万Token以内的请求为$2/$12,超过20万Token后会上升到$4/$18。
单纯看价格:
低成本档:GPT-5.6 Luna最便宜
综合档:Gemini 3.6 Flash价格最低
高能力档:Gemini 3.1 Pro Preview账面价格最低
但实际项目不能到这里就下结论。
假设一个AI应用一个月调用1000次。
每次平均:
输入:2000 Tokens输出:500 Tokens
一个月就是:
输入:2,000,000 Tokens输出:500,000 Tokens
按照标准价格计算:
低成本模型
| $1.00 | |
| $1.85 | |
0.20+0.5 × $1.20=$1.00 |
对于分类、信息提取、格式转换、简单客服、批量数据处理这类任务,Token量一旦上去,低价模型之间的差距会非常明显。
综合型模型
同样的调用量:
| $6.75 | |
| $10.00 | |
| $13.50 |
这组比较里,Gemini 3.6 Flash的纯Token成本最低。
如果是普通问答、代码处理、RAG、Agent子任务等大量调用场景,价格差距会逐渐放大。
高能力模型
还是按照2M输入 + 0.5M输出:
| $10.00 | |
| $22.50 | |
| $25.00 |
这里Gemini账面价格明显更低,但要注意两点:
第一,Gemini 3.1 Pro目前仍属于Preview模型。
第二,如果单次Prompt超过20万Token,它的输入价格会从$2涨到$4,输出从$12涨到$18。
所以做超长文档、代码库分析时,不能直接拿短上下文价格计算。
目前三家基本都有一个共同特点:
输出Token明显比输入Token贵。
例如:
GPT-5.6 Terra输入:$2输出:$12Claude Sonnet 5输入:$3输出:$15Gemini 3.6 Flash输入:$1.5输出:$7.5
也就是说,同样消耗100万Token,全部发生在输出端,比全部发生在输入端贵很多。
所以控制成本最有效的方法之一,不是疯狂压缩Prompt,而是限制无意义的长输出。
比如:
max_output_tokens = 800
对于分类、JSON提取、关键词生成,本来200 Token就能完成的任务,没有必要允许模型输出几千Token。
RAG、Agent和长System Prompt场景经常会重复发送同一批内容。
这时候缓存会明显影响成本。
例如GPT-5.6 Terra标准输入为:
普通输入:$2 / 1M缓存输入:$0.20 / 1M
Luna则是:
普通输入:$0.20缓存输入:$0.02
也就是缓存命中价格约为普通输入的十分之一。
Claude Sonnet 5的普通输入为$3,而Cache Hit为$0.30;Opus 5则是$5和$0.50,同样有明显价差。
Gemini 3.6 Flash的普通输入为$1.50,缓存Token为$0.15,但Gemini的显式Context Cache还存在缓存存储费用,因此长时间保存大量上下文时需要一起计算。
如果应用长期重复使用:
大型System Prompt;
产品知识库;
API文档;
代码规范;
固定工具定义;
缓存优化的收益可能比换模型还大。
三家目前都提供批处理优惠。
以Claude Sonnet 5为例:
标准:输入 $3输出 $15Batch:输入 $1.5输出 $7.5
直接减半。
Gemini 3.6 Flash的Batch价格同样从:
$1.5 / $7.5
降至:
$0.75 / $3.75
OpenAI GPT-5.6系列也提供Batch档位,价格约为标准调用的一半。
因此以下任务没有必要全部走实时API:
夜间生成日报;
批量摘要;
数据分类;
商品描述生成;
大批量Embedding前处理;
离线代码分析;
文档标签提取。
如果一天处理几十万条数据,Batch带来的节省往往比微调Prompt明显得多。
Token价格只是基础费用。
一旦开始做Agent,账单还可能包含:
模型推理+搜索+文件检索+代码执行+缓存+多轮Agent循环
例如OpenAI当前Web Search为每1000次调用10美元,搜索返回给模型的内容还可能继续按照模型Token价格计算。
Gemini 3.x的Google Search Grounding目前提供每月一定免费搜索请求,超过后按搜索次数另外收费。
所以一个Agent任务最终显示“回答了500字”,不代表只产生了500字对应的费用。
它可能在后台已经进行了:
规划→ 搜索→ 阅读网页→ 调用工具→ 再推理→ 失败重试→ 最终回答
做Agent预算时一定要统计整条执行链。
如果只讨论成本,我会这样分。
大批量简单任务
优先测试:
GPT-5.6 LunaGemini 3.5 Flash-Lite
Luna目前Token单价非常低,适合分类、格式转换和轻量Agent子任务。
普通AI应用
优先在:
Gemini 3.6 FlashGPT-5.6 TerraClaude Sonnet 5
之间做真实业务测试。
不要只比较Benchmark,直接拿自己项目的50~100条真实数据测试:
成功率;
输出长度;
平均Token;
延迟;
单次成本。
输出一次就对的模型,可能比便宜但需要重试三次的模型更省钱。
高难度推理
再考虑:
GPT-5.6 SolClaude Opus 5Gemini 3.1 Pro
不要让整个应用默认使用最高档模型。
更合理的是模型路由:
简单请求→ 低成本模型普通请求→ 综合模型复杂任务→ 高能力模型
这通常比“全站统一一个模型”省得多。
同时测试OpenAI、Claude、Gemini后,很容易出现一个情况:
三个API账号+多个自动充值+几个AI开发工具+月底完全不知道钱花在哪里
建议至少做到:
不同项目使用不同API Key;
设置月度预算和费用提醒;
测试环境限制最大额度;
记录每个模型的Token和费用;
不要等付款卡拒绝交易才发现已经超预算。
如果同时管理多个海外AI平台,在目标平台支持对应卡类型的前提下,也可以按照平台或项目拆分付款方式。例如OpenAI、AI工具订阅、测试项目分别管理,月底对账会清楚很多。
像MXK8这类虚拟卡更适合放在付款和项目支出管理这一层,而不是代替API平台自己的Token预算。
开卡前最好先确认目标平台、币种、自动扣款以及支持的卡片类型。
如果只看目前官方Token价格:
追求极低成本:GPT-5.6 Luna很有优势
综合型调用:Gemini 3.6 Flash价格比较有竞争力
Claude Sonnet 5价格更高,但是否值得要看具体任务成功率
高能力模型中,Gemini 3.1 Pro Preview账面成本较低,但要考虑Preview状态和长上下文价格
大量离线任务优先使用Batch
重复Prompt多的项目,一定要利用缓存
真正选API时,不建议问:
哪个模型1M Token最便宜?
更应该计算:
完成一个真实任务需要多少Token×需要调用几次×成功率+工具费用+重试成本
最终成本最低的模型,才是真正“便宜”的模型。
关于我们

