2026 年主流大模型 API 定价对比:OpenAI、Claude、Gemini 与 DeepSeek
对比 OpenAI、Anthropic Claude、Google Gemini 与 DeepSeek 主流文本模型的输入、输出和缓存 Token 标准 API 价格。
模型能力决定一个方案能不能做,API 成本则决定它能不能稳定上线。每百万 Token 看起来只是几美元,但真实应用还会加入系统指令、历史消息、检索资料、工具定义、失败重试和长篇输出,调用量增加后,这些细节会直接影响月度账单。
本文对比 OpenAI、Anthropic、Google 和 DeepSeek 公布的部分标准文本 API 价格。金额统一为每 100 万 Token 的美元价格,数据于 2026 年 8 月 16 日从厂商官方页面核对。模型名称、费率、上下文门槛和服务等级都可能调整,正式预算或对外报价前应再次打开文末官方来源确认。
在浏览器本地验证文章中的估算或清理流程,无需上传内容。
2026 年标准 API 价格对比
下表尽量采用按需、标准文本推理价格,不把 ChatGPT、Claude 或 Gemini 的个人订阅价格与开发者 API 混在一起。缓存输入只在厂商提供可直接比较的数据时列出;DeepSeek 的常规输入列采用缓存未命中价格,缓存列采用命中价格。
多数模型的输出 Token 明显贵于输入 Token,因此回答长度、推理输出与重试次数都是成本控制的重要变量。输入很便宜的模型,如果持续生成长报告或大段代码,最终费用仍可能由输出部分主导。
| 厂商与模型 | 输入 | 缓存输入 | 输出 | 规划说明 |
|---|---|---|---|---|
| OpenAI GPT-5.6 Luna | $1.00 | $0.10 | $6.00 | 成本较低的 OpenAI 通用选项 |
| OpenAI GPT-5.6 Terra | $2.50 | $0.25 | $15.00 | 适合更复杂任务的均衡型号 |
| Anthropic Claude Sonnet 5 | $2.00 | $0.20 缓存命中 | $10.00 | 能力与成本较均衡 |
| Anthropic Claude Sonnet 4.6 | $3.00 | $0.30 缓存命中 | $15.00 | 较早分词器,标准价格更高 |
| Google Gemini 3.5 Flash | $1.50 | $0.15 | $9.00 | 思考 Token 计入输出费用 |
| DeepSeek Chat | $0.27 缓存未命中 | $0.07 | $1.10 | 低成本对话模型,需核对可用性与合规要求 |
| DeepSeek Reasoner | $0.55 缓存未命中 | $0.14 | $2.19 | 推理模型,缓存命中价格独立 |
所有价格对比背后的计算公式
一次基础文本请求的预计费用,等于输入 Token 数乘以输入单价,再加上输出 Token 数乘以输出单价,两个结果都除以 100 万。例如处理 10 万输入 Token 和 2.5 万输出 Token,模型输入价为 1 美元、输出价为 6 美元,则预计费用为 0.10 美元加 0.15 美元,共 0.25 美元。
生产账单往往不只包含输入框里看得到的文字。系统指令、消息历史、检索文档、图片或音频 Token、工具 Schema、内部思考 Token、缓存写入与存储、联网搜索和区域处理都可能增加费用。简单计算器应当作为规划基线,之后还要用有代表性的测试与厂商用量报表校准。
- 统计完整请求,不只计算最后一条用户消息。
- 单独估算输出,因为输出单价通常更高。
- 把缓存命中、缓存写入和缓存存储分开计算。
- 为失败重试和超时重发预留预算。
- Prompt 超过长上下文门槛时重新核对价格。
四家厂商的计价结构有什么不同
OpenAI 将标准输入、缓存输入和输出分开计价,同时提供 Batch 等服务模式。交互式产品应先以标准价格为基准;只有任务允许延迟、并且符合批处理规则时,才能把 Batch 的折扣纳入预算。
Anthropic 会列出基础输入、不同缓存写入时长、缓存命中和输出价格。重复的 Prompt 前缀在缓存后可能更省,但写缓存本身并非免费。Claude 工具调用还会加入系统 Prompt Token,因此 Agent 请求的真实输入量可能大于聊天窗口中可见的文字。
Google 为 Gemini 提供标准、批处理、Flex、Priority 和缓存存储等不同条款,Gemini 3.5 Flash 的思考 Token 计入输出费用。DeepSeek 则明确区分缓存命中与未命中的输入单价,重复上下文和缓存策略对估算结果影响明显。不同服务档位不能直接混用,必须对照实际调用的端点。
三种工作负载会得出完全不同的选择
短文本分类通常输入多、输出极少,例如输入 2,000 Token,只返回 50 Token。此时输入价格和延迟更重要,小型快速模型往往更合适。客服对话会携带越来越长的历史记录,每轮输出数百 Token,历史摘要和稳定指令缓存会更有价值。研究或编程 Agent 还会发送工具定义、检索文件、命令输出与长推理内容,输出价格和工具开销可能成为主要成本。
不存在适用于所有任务的“绝对最便宜模型”,因为不同模型并不保证同等质量。价格低但需要更多重试、更长提示词或第二次验证的模型,每个成功任务的真实费用可能更高。更合理的指标是每个被接受结果的成本,例如正确分类一张工单、生成一份可用回答或完成一次通过测试的代码修改。
| 工作负载 | 主要成本来源 | 可行优化 |
|---|---|---|
| 分类与信息提取 | 重复输入 | 缩短 Schema、使用小模型、适合时批处理 |
| 客服对话 | 历史消息 | 摘要历史、缓存稳定指令、限制回答长度 |
| 研究与编程 Agent | 工具与长输出 | 任务路由、限制检索上下文、监控重试 |
把 Token 单价转换成月度预算的可靠方法
先采集真实样本,不要从最乐观的平均值开始。至少记录普通、很短和异常长任务的输入与输出 Token,并观察中位数、P90 和最大值,避免少量超长请求拖高账单。用每次请求成本乘以预计成功请求量,再独立加入重试、评测、内部测试与开发流量。
为每个模型保存价格、官方来源和核对日期。不要在没有限定工作负载的情况下写死“每次永远不到一分钱”之类的宣传。厂商侧设置账单提醒,应用侧设置单请求限制。若产品允许上传任意文档,上线前必须限制文件大小、抽取文本长度、最大输出 Token 和自动重试次数。
- 分别记录输入与输出 Token 的 P50、P90 和最大值。
- 把正常流量、重试、评测和内部测试分开预算。
- 同时设置月度厂商限额和单请求应用限额。
- 按固定周期检查模型与价格变化。
- 扩大流量前,用真实账单校准估算。
按业务价值选模型,而不是只看单价
从自己的真实任务中抽取一组小型基准,统一评估回答质量、结构化输出稳定性、延迟、安全要求、区域可用性、速率限制和总成本。让候选模型处理相同样本,再计算每个被接受结果的费用,才能看清价格与质量的权衡,避免拿不适用的服务档位宣传价做决定。
RunAIToolkit 估算器适合完成第一轮比较,因为样本文本留在浏览器本地,并且输入与预计输出分开计算。但它仍是规划值:厂商分词器和隐藏请求组件可能不同。确定模型前,建议再使用厂商 Token 统计接口和账单面板复核。
常见问题
这些价格包含 ChatGPT、Claude 或 Gemini 订阅吗?
不包含。个人或团队订阅与开发者 API 是不同产品,本文只比较部分开发者文本 API 价格。
为什么输出 Token 通常更贵?
模型需要逐个生成输出 Token,厂商通常因此设置更高的输出费率,具体比例因模型而异。
Prompt 缓存一定省钱吗?
不一定。缓存写入与存储可能收费,只有足够多内容在厂商规则内重复使用时,缓存才可能降低总成本。
所有任务都能直接选最便宜的模型吗?
不能。质量失败、额外重试与二次验证可能抵消单价优势,应比较每个成功结果的总成本。
官方来源
价格可能变化,请在制定预算前重新核对以下页面。