
最近如果有在用 AI API,应该能明显感觉到一件事:
模型越来越强,价格却没有跟着往上涨。
OpenAI、Anthropic、Google 这几个月都在重新调整模型价格。新品发布时,“能力提升多少”当然还是重点,另一组数字现在越来越抢眼——每百万 Token 到底多少钱。
以前大家比参数、跑分、上下文长度。现在开发者会直接打开 Pricing 页面算账。
原因也很现实。
一个模型偶尔贵几美元没什么感觉,真正放进客服、内容生成、编程 Agent、数据处理这些长期任务里,每天几万、几十万次调用,单价差一点,一个月就是完全不同的成本。
新一轮 API 价格战已经很明显了。

OpenAI 现在的思路很清楚:不再让一个旗舰模型包打天下,而是把不同成本的任务拆给不同模型。
GPT-5.6 系列目前分成 Sol、Terra、Luna 几个档位。
GPT-5.6 Sol 当前促销价格为:
输入:4 美元 / 100万 Token
输出:20 美元 / 100万 Token
缓存输入:0.4 美元 / 100万 Token

官方标注,这一促销价格至少持续到 2026 年 11 月 21 日。相比此前价格,输入成本下降约20%,输出成本下降约33%。
真正值得注意的,是 Terra 和 Luna。
OpenAI 7月底进一步调整了价格:
GPT-5.6 Terra:
输入 2 美元 / 100万 Token
输出 12 美元 / 100万 Token
GPT-5.6 Luna:
输入 0.2 美元 / 100万 Token
输出 1.2 美元 / 100万 Token。
0.2 美元是什么概念?
100万输入 Token,大约只要人民币一块多。
对于分类、摘要、结构化提取、大批量文本处理这类任务,已经很便宜了。
这也是现在 OpenAI 一个很明显的变化:
最强的任务交给 Sol,大部分日常任务交给 Terra,海量低成本任务直接丢给 Luna。
API 成本开始从“选不选GPT”,变成“这一条请求到底值不值得用最贵的模型”。
Claude:Sonnet 5把价格压到了一个
很有竞争力的位置
Claude这边更值得开发者关注的是 Sonnet 5。
Anthropic给出的当前价格:
输入:2 美元 / 100万 Token
输出:10 美元 / 100万 Token
Sonnet 5上线时采用的就是这个价格。Anthropic最新页面已经把原来的介绍价调整为长期价格。
这个价格放在Claude身上,竞争力很强。
原因不是它最便宜。
而是 Claude 现在最有优势的场景,本身就是比较“烧 Token”的场景。
Sonnet 5 本身就是围绕 Agent 和 Coding 强化的模型,可以自己规划任务、调用浏览器和终端、连续执行多步操作。
Agent 和普通聊天最大的区别之一,就是调用次数非常多。
你让AI回答一个问题,也许只跑一轮。
让AI自己:
查资料 → 分析 → 调工具 → 修改代码 → 测试 → 发现错误 → 再修改
后台可能已经走了很多轮。
这类产品里,模型单价从3美元降到2美元,看起来只差1美元,调用规模一大,差距就出来了。
Claude这次真正打的不是“全网最低价”。
它在抢的是高质量Coding和Agent场景里的性价比。

Google的策略更直接。
最新的 Gemini 3.6 Flash 在2026年底之前执行促销价格:
输入:0.75 美元 / 100万 Token
输出:3.75 美元 / 100万 Token
缓存输入:0.075 美元 / 100万 Token
2027年1月1日以后,标准价格才会恢复到输入1.5美元、输出7.5美元。
如果还嫌贵,还有 Flash-Lite。
Gemini 3.5 Flash-Lite目前:
输入:0.30 美元 / 100万 Token
输出:2.50 美元 / 100万 Token。
单看价格表,Google的优势已经非常直接。
大量翻译、文本处理、内容审核、数据清洗、简单Agent任务,Gemini的价格很容易做出规模优势。
更重要的一点是,Gemini Flash已经不是以前那种“便宜模型只能干简单活”的定位。
Google正在把 Coding、Agent、长上下文、搜索 Grounding 这些能力继续往 Flash 系列下放。
Gemini 3.5 Flash已经支持100万 Token上下文以及Agent和Coding任务。
这就让市场变得有意思了。
以前的规律是:
模型越强,价格越贵。
现在越来越接近:
性能继续涨,单位智能成本继续降。

这里不强行拿三个完全不同定位的模型比跑分,只选现在比较有代表性的API型号看价格。
模型 | 输入 /100万Token | 输出/100万Token | 更适合 |
GPT-5.6 Sol | $4 | $20 | 高难度推理、复杂专业任务 |
GPT-5.6 Terra | $2 | $12 | 日常开发、Agent、通用任务 |
GPT-5.6 Luna | $0.20 | $1.20 | 大批量低成本任务 |
Claude Sonnet 5 | $2 | $10 | Coding、Agent、复杂执行 |
Claude Opus 5 | $5 | $25 | 高难度编程、长任务 |
Gemini 3.6 Flash | $0.75 | $3.75 | 高并发、Agent、通用任务 |
Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 翻译、分类、简单数据处理 |
以上为截至2026年8月26日官方公布的当前/促销价格,不同Batch、缓存、Priority、长上下文模式还会有单独计价。OpenAI、Anthropic、Google的模型定位并不完全一致,表格主要用于观察成本区间。
很明显:
单纯比每百万Token价格,Gemini和OpenAI的小模型已经非常便宜。
写代码和做Agent,Claude Sonnet 5目前很有吸引力。
复杂任务、工具生态和多模型组合,OpenAI的选择更多。

已经不存在一个简单的答案:谁家的API最好。
要看你拿它干什么。

价格表只能算第一笔账。真实成本还有很多东西。
比如一个模型输入便宜30%,完成同一个任务却需要多跑两轮,最后未必便宜。
一次任务可能包含几十次模型请求、搜索调用、工具调用、缓存读取。模型自己思考产生的 Token 也可能计费。
还有一个经常被忽略的成本:
输出Token通常比输入Token贵很多。
拿大模型生成长报告、代码、商品内容时,真正拉高账单的往往不是Prompt,而是输出。
做实际项目,我更建议按照任务拆模型:
简单分类、翻译、数据处理,用便宜模型。
普通内容、客服、日常自动化,用中档模型。
复杂Coding、深度研究、高价值Agent任务,再上旗舰模型。
没必要每一次请求都调用最贵的那一个。

这是这一轮降价里最容易被忽略的一件事。
模型降价之后,开发者会开始让AI做更多事情。
以前一次调用。现在一个Agent可能连续调用几十次。
以前只是生成一段文字。现在还要搜索网页、读文件、运行代码、操作浏览器、调用第三方API。
单次Token便宜了,AI实际消耗的Token反而越来越多。
这也是为什么现在不少企业开始给不同AI平台单独设置支付方式和额度,而不是所有订阅、API费用都绑在一张主卡上。
如果平时同时在用 OpenAI、Claude、Gemini,也可以给不同平台分配独立的虚拟卡,设置不同余额和消费额度。哪一个平台出现异常扣费,不会影响其他业务。
MXK8虚拟卡目前可以用于海外AI工具、API、SaaS等场景。对于需要长期跑API的团队,这类支付方式最大的意义不是“能付款”,而是把不同平台的成本拆开管理。
关于我们
