先看一句 OpenAI 官方文档里的原话:"While reasoning tokens are not visible via the API, they still occupy space in the model's context window and are billed as output tokens."(推理 Token 对 API 不可见,但它们既占用上下文窗口,也按输出 Token 计价。)这句话翻译成人话就是:模型"脑子里想"的那部分,你看不见,但每一颗都按最贵的输出价扣钱。
过去一年我们收到最多的成本类求助,不是"哪个模型便宜",而是"我明明换了单价更低的模型,账单为什么反而翻了三倍"。排查下来,十次里有七次的答案就是这四个字:思考 Token。这篇文章把四家厂商的计费规则掰开讲清楚,用 2026 年 9 月的真实价格算一笔账,最后给出 5 个当天就能上线的省钱方案。
一、思考 Token 是什么?三家机制对照
推理模型在给出可见答案之前,会先生成一段内部的思维链(Chain-of-Thought)。这段内容属于"生成过的 Token",所以按输出价计费——但三家对它的展示和控制方式差异很大:
| 厂商 / 机制 | 思考内容可见吗 | 控制参数 | 计费口径 | 查询字段 |
|---|---|---|---|---|
| OpenAI / reasoning tokens | 完全不可见,只给计数 | reasoning_effort(low/medium/high) | 按输出价计费 | completion_tokens_details.reasoning_tokens |
| Anthropic / extended thinking | 返回摘要(非全文) | effort(自适应);旧参数 budget_tokens | 按完整思考量计输出价 | output_tokens_details.thinking_tokens |
| Google / thinking | 返回摘要 | thinkingBudget(2.5)/ thinkingLevel(3 系) | "输出 Token + 思考 Token"合并计价 | usageMetadata.thoughtsTokenCount |
最容易误解的是 Anthropic 和 Google 的"摘要"机制。Anthropic 文档写得很直白:你收到的 thinking 内容是完整思考过程的摘要,而"计费的输出 Token 数与可见 Token 数不一致"。Google 的文档更狠一步,原话是"计费基于模型为生成摘要所需的全部思考 Token,尽管 API 只输出摘要"。也就是说:你看到的越少,不代表你付的越少。
DeepSeek 的 reasoner 系列会把思维链直接返回给调用方(reasoning_content 字段),是目前透明度最高的做法。但透明不等于免费——思维链 Token 同样按该模型的输出价计费。别因为"看得见"就以为这部分不要钱。
二、算一笔账:2026 年 9 月的真实价格
下面是主流推理/混合推理模型在第三方价格追踪站(Artificial Analysis 口径,2026-09-11 核对)的记录价,单位为美元/百万 Token:
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | 长上下文请求输入翻倍 |
| GPT-5.6 Terra | $2.00 | $12.00 | 中间档主力 |
| GPT-5.6 Sol | $4.00 | $20.00 | 旗舰档 |
| Claude Sonnet 5 | $2.00 | $10.00 | 输出价含思考 Token |
| Claude Opus 5 | $5.00 | $25.00 | 官方推荐的默认重型模型 |
| DeepSeek V4 Flash | $0.44 / $0.22 | $1.32 / $0.66 | 峰时/谷时,谷时五折 |
| GLM-5.3 | $1.40 | $4.40 | 开源权重 |
| Kimi K3 | $3.00 | $15.00 | 缓存命中价 $0.30 |
拿 GPT-5.6 Terra(输出 $12/M)做一个典型场景的测算:一个智能客服总结任务,可见答案只有 300 Token,但模型为了理清多轮对话里的指代关系,产生了 2,700 个思考 Token。你以为你在为 300 个 Token 付费($0.0036),实际账单是 3,000 个 Token($0.036)——10 倍差距,其中 90% 花在你永远读不到的内容上。按每天 10 万次调用算,这一项差异一个月就是数千美元级别。这也解释了为什么 OpenAI 在文档里建议:刚上手推理模型时,为"思考+输出"预留至少 25,000 Token——官方早知道思考量不会小。
三、三个官方文档里写明了的坑
坑一:HTTP 200,但 content 是空的,钱照扣。思考 Token 和可见输出共用 max_completion_tokens 上限。上限设小了,模型把额度全部花在思考上,返回 finish_reason=length、内容为空——OpenAI 文档明确写了这种情况"可能发生在任何可见输出产生之前"。看起来像代码 bug,实际是账单在默默燃烧。规则很简单:上限 = 预期答案长度 + 思考余量,并把"空响应 + length"当成重试信号而不是模型故障。
坑二:Anthropic 的预算参数直接拒单。budget_tokens 最低 1,024 且必须小于 max_tokens,设小了 API 直接报错;而且文档强调它是"目标而非硬上限",实际思考量随任务波动。想用固定预算锁死成本,是锁不住的。
坑三:Gemini 2.5 Pro 的思考关不掉。官方参数表写明其动态思考区间是 128–32,768 Token,Vertex AI 文档确认"思考无法关闭"。不少团队以为加了 thinkingBudget=0 就万事大吉,结果请求报错或参数被忽略。想彻底不思考,只能换非思考模型。
四、5 个能落地的省钱方案
方案一:任务分级路由,别让所有请求都会思考。分类、抽取、翻译、格式化这类"答案就在上下文里"的任务,走非推理档(GPT-5.6 Luna、GLM-5.3-Flash 这类 $1 以下的输出价);把推理额度留给数学、调试、多步规划。这是收益最大的一条——它直接把 90% 的隐形思考从账单里删掉。参考我们的模型路由指南。
方案二:把离线思考搬进谷时。DeepSeek 峰谷同价的时代结束了:现在谷时(工作日 UTC 01:00–04:00、06:00–10:00 之外的时段)输入输出一律五折。报告生成、代码评审这类不卡延迟的任务排进谷时批量跑,等于输出价直接砍半。详见DeepSeek 峰谷价省钱指南,或直接查看DeepSeek 平台页的实时价格。
方案三:把缓存用满。推理场景恰恰是缓存最有效的场景——系统提示词、工具定义、长文档上下文在多轮里反复重发。Kimi K3 缓存命中价 $0.30/M(原价 $3 的十分之一),DeepSeek 缓存命中与原价相差约 30 倍。具体做法见Prompt Caching 实操。
方案四:非实时任务全走批处理。OpenAI Batch API 输入输出统一五折,24 小时内返回。推理模型的批处理尤其划算——思考 Token 也享受五折。
方案五:把提示词写清楚,歧义是按输出价计费的。模糊的输入会让推理模型"脑补"消歧:一张不标注目标元素的截图配一句"修一下对齐",模型会先推理你指的是四十个元素里的哪一个——每一步都计费。结构化 JSON 输入替代模糊描述,省下的不只是 token,还有等待时间。
五、怎么查你有没有为隐形思考买单
上面提到的三个计数字段(reasoning_tokens / thinking_tokens / thoughtsTokenCount),建议这周就加进监控看板,按天统计"思考 Token 占输出总量的比例"。健康的业务这个比例应该稳定;如果某天突然从 30% 跳到 85%,多半是某个调用方的提示词被改坏了,或者该任务根本不该路由给推理模型。监控与告警的完整搭建见AI API 监控告警实战。
常见问题速答
Q:思考 Token 会出现在返回的回复里吗?
OpenAI 完全不返回内容只给计数;Anthropic 和 Google 返回的是思考摘要;DeepSeek 返回完整思维链。但四家都按完整思考量计费。
Q:能彻底关闭思考吗?
Gemini 2.5 Pro 不能(官方文档写明);OpenAI 推理模型只能用 reasoning_effort=low 降低、不能归零;Gemini 2.5 Flash 可以 thinkingBudget=0。彻底不思考的唯一办法是换非推理模型。
Q:推理模型更贵,是不是一律不划算?
别用单 Token 价格比,用"单任务成本"比。一次答对的推理模型,常比四轮重试的便宜模型更省——多轮对话每轮都要重发完整历史。拿核心任务做 A/B 实测再定路由,方法见选型 A/B 测试方法论。
结语
推理模型的价值是真实的,但它的账单结构被刻意藏在了"看不见的 Token"里。理解规则、盯住三个计数字段、把简单任务从推理队列里摘出去——做完这三件事,大多数团队的推理账单可以回到合理水位。各家价格随时在变,上 TokenNexus 首页查看实时报价,别用上个月的印象做这个月的路由决策。
推荐阅读
参考资料
- OpenAI Reasoning Guide(思考 Token 计费与 25,000 Token 预留建议):platform.openai.com/docs/guides/reasoning
- OpenAI API 定价页:https://openai.com/api/pricing/
- Anthropic Extended Thinking 文档(budget_tokens 下限与摘要计费说明):docs.claude.com/extended-thinking
- Google Gemini Thinking 文档(thinkingBudget 与 thoughtsTokenCount):ai.google.dev/gemini-api/docs/thinking
- DeepSeek API 定价与峰谷时段说明:api-docs.deepseek.com/quick_start/pricing
- LLM API 价格追踪(2026-09 各模型价格核对):cheapestinference.com/reports/llm-price-tracker