7 月
2026 国产大模型 API 价格对比:五家官方报价与成本选型
先说结论:只看官方按量价,在本文的统一负载下,MiniMax M 2.7 的人民币账单最低;DeepSeek V 4-Flash 的官方美元账单也很低。但这不是“闭眼选最便宜”的排行榜。Qwen 3.7、GLM-5.2、Kimi K 3 和 DeepSeek V 4 提供约 1 M 上下文,MiniMax M 2.7 为 204,800;缓存、输出占比、部署地域和质量门槛都会改变最终选择。正确做法是先筛掉能力或合规不达标的模型,再比较同一业务样本的有效任务成本。
本文只采用厂商官方定价、模型与 API 文档,检索截止 2026 年 7 月 25 日。价格按每百万 Token 列示,保留厂商原币种,不包含税费、企业合同折扣、赠送额度或汇率换算,也不代表我们亲测过模型效果。若你还要比较代码能力与开源路线,可先看国产代码模型能力与场景横评。
五家官方 API 价格放在一张表里
下表是可复核的公开按量价。Qwen 3.7 与 DeepSeek V 4 都不是单一 SKU,因此必须写清模型 ID;把 Plus、Max、Flash、Pro 混成一个“品牌价格”,会直接算错预算。
| 厂商与模型 ID | 普通输入/缓存未命中 | 缓存命中或读取 | 缓存写入 | 输出 | 官方上下文 |
|---|---|---|---|---|---|
qwen3.7-max-2026-06-08 | ¥12 / 1 M | 以百炼缓存规则为准 | 官方价格表未单列 | ¥36 / 1 M | 1 M |
qwen3.7-plus-2026-05-26(≤256 K) | ¥2 / 1 M | 以百炼缓存规则为准 | 官方价格表未单列 | ¥8 / 1 M | 最高 1 M;超过 256 K 输入进入更高阶梯 |
glm-5.2 | ¥8 / 1 M | ¥2 / 1 M | 官方价格页未单列 | ¥28 / 1 M | 1 M |
kimi-k3 | ¥20 / 1 M | ¥2 / 1 M | 官方定价页未单列 | ¥100 / 1 M | 1,048,576 |
MiniMax-M2.7 | ¥2.1 / 1 M | ¥0.42 / 1 M | ¥2.625 / 1 M | ¥8.4 / 1 M | 204,800 |
deepseek-v4-flash | $0.14 / 1 M | $0.0028 / 1 M | 官方价格页未单列 | $0.28 / 1 M | 1 M |
deepseek-v4-pro | $0.435 / 1 M | $0.003625 / 1 M | 官方价格页未单列 | $0.87 / 1 M | 1 M |
数字分别来自阿里云百炼模型价格、智谱产品价格、Kimi K 3 官方定价、MiniMax 按量计费和DeepSeek Models & Pricing。Qwen 的浮动别名可能显示限时折扣,本文用固定快照的标准价做成本情景,避免把促销当成长期预算。
这张表还揭示了一个容易忽视的事实:输出 Token 往往比普通输入贵。 Kimi K 3 的输出单价是缓存未命中输入的 5 倍,GLM-5.2 是 3.5 倍。因此,缩短冗长回复、限制推理输出和复用静态上下文,可能比换供应商更先见效。
一条可复用的大模型 API 成本公式
按月核算时,不要用“总 Token × 一个单价”。把计费项拆开:
月成本 =
普通输入Token / 1,000,000 × 普通输入单价
+ 缓存读取Token / 1,000,000 × 缓存读取单价
+ 缓存写入Token / 1,000,000 × 缓存写入单价
+ 输出Token / 1,000,000 × 输出单价
+ 工具调用费、文件处理费等附加费用
如果厂商未单列缓存写入价,就不要自行填 0;应查对应缓存文档或以控制台账单为准。没有启用缓存时,可使用简式:
无缓存成本 = 输入百万Token数 × 输入单价 + 输出百万Token数 × 输出单价
更适合业务决策的指标是“每个成功任务成本”:
每个成功任务成本 = 总API成本 ÷ 达到验收标准的任务数
一个模型单次调用便宜 50%,如果为了修错平均多调用两次,真实成本反而更高。质量验收率、平均输出长度和重试率应与 Token 账单一起记录。
同一负载要花多少钱:100 M 输入 + 20 M 输出
假设一个月产生 1 亿普通输入 Token、2000 万输出 Token,缓存命中为 0,不计税费、工具费与折扣。按上表可直接复算:
| 模型 | 计算 | 月度成本 |
|---|---|---|
| Qwen 3.7 Max 固定快照 | 100×¥12 + 20×¥36 | ¥1,920 |
| Qwen 3.7 Plus(每次输入不超过 256 K) | 100×¥2 + 20×¥8 | ¥360 |
| GLM-5.2 | 100×¥8 + 20×¥28 | ¥1,360 |
| Kimi K 3 | 100×¥20 + 20×¥100 | ¥4,000 |
| MiniMax M 2.7 | 100×¥2.1 + 20×¥8.4 | ¥378 |
| DeepSeek V 4-Flash | 100×$0.14 + 20×$0.28 | $19.60 |
| DeepSeek V 4-Pro | 100×$0.435 + 20×$0.87 | $60.90 |
人民币与美元没有强行换算,因为 DeepSeek 官方页以美元报价,任何人民币结果都会引入另一个时间点的汇率假设。这个情景也不是采购报价:真实账单还会受 Qwen 地域和长输入阶梯、缓存命中率、Batch、套餐、账户级折扣及税费影响。
Qwen 3.7:适合需要同一生态内分层路由的团队
阿里云百炼文本模型文档列出 Qwen 3.7 Max 与 Plus,并提供思考模式、Function Calling 和长上下文能力。它的价值不只是一款模型,而是能在同一平台把高复杂任务路由到 Max,把常规任务路由到 Plus。
适合:已经使用阿里云、需要国内云资源与模型服务统一管理;请求难度分层明显;需要 Batch 或上下文缓存继续压缩成本。
不适合:团队只想维护一个固定价 SKU;业务跨多个部署地域却不愿逐区核价;会把浮动别名的限时促销直接写入长期预算。
GLM-5.2:适合长上下文与长程任务优先的场景
GLM-5.2 官方文档给出的上下文是 1 M,最大输出 128 K,并支持思考、工具调用、缓存与结构化输出。官方按量价为输入 ¥8、输出 ¥28、缓存命中 ¥2/百万 Token。
适合:大型代码库、长文档处理、需要持续工具调用的 Agent;希望在 1 M 上下文与人民币计费之间取得平衡的团队。
不适合:主要是短问答或分类任务;无需旗舰能力却让所有流量固定走 glm-5.2;把“可容纳 1 M”误解为每次都应该塞满上下文。
Kimi K 3:适合高价值长程任务,不适合纯低价批处理
Kimi K 3 模型介绍明确其模型 ID 为 kimi-k3,支持约 1 M 上下文、视觉理解、工具调用和多档推理强度。官方定价页已经公开 K 3 数字:缓存命中 ¥2、未命中输入 ¥20、输出 ¥100/百万 Token。
适合:长程编程、端到端知识工作、多模态材料分析;单个成功任务价值高,愿意为旗舰推理和较长输出付费。
不适合:大规模低价值摘要、标签分类或短客服回复;输出量远高于输入量且没有严格 max_tokens 与预算上限;账户尚未满足官方访问条件。
MiniMax M 2.7:适合成本敏感的 Agent 与编码流量
MiniMax 文本生成文档将 M 2.7 定位于编程、工具调用、搜索和办公等生产力场景,上下文为 204,800。它在本文人民币无缓存情景中成本最低,且官方同时公开缓存读取与写入价,便于精细核算。
适合:上下文低于约 200 K、调用量大、价格敏感的编码或 Agent 工作流;静态系统提示、工具定义可被频繁复用。
不适合:单次请求确实需要 1 M 上下文;只比较价格而没有用自己的验收集验证成功率;需要更高速度却误把标准版价格套到 MiniMax-M2.7-highspeed。
DeepSeek V 4:Flash 管吞吐,Pro 管高难任务
DeepSeek 官方把 V 4 分为 deepseek-v4-flash 与 deepseek-v4-pro,两者均提供 1 M 上下文;V 4 官方发布页同时说明 API 已可用。定价页使用美元,并把缓存命中与未命中输入分开。
适合:能接受美元计费、希望用 Flash 承接高吞吐任务并把难题升级到 Pro;静态上下文复用率高;需要 OpenAI 或 Anthropic 兼容接口。
不适合:采购流程必须锁定人民币预算;数据地域、合同或合规要求尚未审查;代码仍依赖已于 2026 年 7 月 24 日停止的旧模型名而未完成迁移。
成本选型按这四步走
- 先设质量门槛。 从真实业务抽取 50–200 个任务,定义正确率、格式合规率、工具调用成功率和人工返工时间。
- 再设硬约束。 排除上下文不足、数据地域不合适、并发不够或合同条款不满足的候选。
- 计算有效成本。 用实际
usage统计输入、缓存、输出和重试次数,再算每个成功任务成本,而不是只看挂牌价。 - 做分层路由。 低难任务走低价模型,高难或失败任务升级到旗舰;设置单请求 Token 上限、月预算告警和异常输出熔断。
通常最省钱的方案不是“一家模型包打天下”,而是用便宜模型覆盖大多数可预测请求,再为少量高价值任务保留更强模型。价格变化很快,建议把单价放进配置表而不是写死在业务代码中,并按月复核官方页面。
FAQ
哪个国产大模型 API 最便宜?
没有脱离口径的唯一答案。在本文“100 M 无缓存输入 + 20 M 输出”情景中,人民币模型里 MiniMax M 2.7 为 ¥378,Qwen 3.7 Plus 为 ¥360,但 Plus 仅按每次输入不超过 256 K 的第一阶梯计算;DeepSeek 使用美元,不能在没有汇率日期的情况下直接并列人民币排名。最终应比较每个成功任务成本。
缓存命中率如何影响账单?
影响可能很大。例如 Kimi K 3 官方缓存命中输入价为 ¥2/百万 Token,未命中输入为 ¥20;但只有可复用前缀真正命中时才有折扣。应从 API 返回的缓存 Token 字段取数,不要用主观命中率制作采购预算。
1 M 上下文是否意味着一次调用就该放入 1 M Token?
不是。上下文上限代表可容纳范围,不代表最佳成本或质量。更长输入会增加费用和延迟,也可能稀释关键信息。优先做检索、去重、结构化摘要和上下文预算,确有跨文档或大型代码库需求时再扩展。
Coding Plan、Token Plan 能与按量 API 直接比较吗?
不能直接比较。订阅通常按请求额度、时间窗口、席位或模型倍率限制,按量 API 则按实际 Token 计费。只有把团队真实请求分布、限速和超额规则带入,才能计算等效成本;本文表格只比较官方按量价。
Kimi K 3 和 DeepSeek V 4 的价格是第三方估算吗?
不是。本文的 Kimi K 3 数字来自 Kimi API 官方定价页,DeepSeek V 4 Flash/Pro 数字来自 DeepSeek API 官方 Models & Pricing 页。若后续官方页面撤下或无法确认某个数字,智盒会将对应项改为“官方页面未给出/需以控制台为准”,不会用 Reddit、代理商或媒体价格补表。
来源、更新与透明度
本文为公开资料的结构化成本比较,不构成采购承诺。厂商可随时调价;上线前与每次预算评审时,请重新打开上述官方页面,并以账户控制台和最终账单为准。智盒的团队与内容治理信息见关于智盒和智盒编辑政策。
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。






