2026年LLM API定价全景对比:算上输出占比、缓存价和分时计价,哪款性价比最高?

先说我怎么被单价骗了一次

第一次批量接模型时,我盯着各家输入价挑了最便宜的。跑了一周看账单,比按单价估算的高了 60%。

后来翻日志才明白:我的任务输出 tokens 是输入的 3 倍,而输出价是输入的 2-4 倍——单价最低的方案,账单可能不是最低

这篇把 2026 年 8 月 25 日核验的四家国产模型官方价格和统一入口价格放在一起,用同一个任务量算真实账单,再给一套”从单价推账单”的估算方法。价格都标了日期,可以直接对照。

单价表里看不到的四个因素

官方定价页都只给”输入 X 元 / 输出 Y 元 / 缓存 Z 元”,但真正决定账单的是下面四个因素:

1. 输出占比。 输出价通常是输入的 2-4 倍。翻译、代码生成、长文总结这类任务,输出 tokens 往往是输入的 2-3 倍。一个”输入便宜”的模型,可能因为输出贵反而更费钱。

2. 缓存命中率。 缓存命中价可以低到离谱:DeepSeek V4 的缓存命中输入只要 ¥0.05-0.10/百万(未命中的 1/30),GLM-5.2 缓存 ¥2(原价 1/4),MiniMax M3 缓存 ¥0.42(原价 1/5)。系统提示词、固定模板、知识库前缀这类重复内容占比高的任务,缓存决定账单量级。

3. 分时计价。 DeepSeek 从 2026 年 8 月起按高峰/空闲分时计价,工作日 9-12、14-18 是高峰,价格是空闲的 2 倍。同样一批任务,白天跑和晚上跑,账单差一倍。

4. 计费口径。 智谱 GLM 按输入+输出合并计费,和分列计费的表直接比会算错;思考模式、多模态输入、计费单位(/1K 还是 /1M)也各有各的写法。

同任务量账单测算

假设一个月跑:输入 1000 万 tokens、输出 3000 万 tokens(输出是输入的 3 倍),40% 的输入走缓存命中,调用集中在工作日白天(DeepSeek 按高峰价计)。价格核验日期 2026-08-25,单位 ¥/百万 tokens。

方案 输入账单 输出账单 月账单合计
DeepSeek V4-Flash 官方(高峰价) 600万×3.0 + 400万×0.1 = ¥18.4 3000万×9.0 = ¥270 ¥288
DeepSeek V4-Flash 官方(空闲价) 600万×1.5 + 400万×0.05 = ¥9.2 3000万×4.5 = ¥135 ¥144
Tokeness V4-Flash(模型广场价) 600万×3.08 + 400万×0.1 = ¥18.9 3000万×9.24 = ¥277 ¥296
MiniMax-M3 官方(永久五折价) 600万×2.1 + 400万×0.42 = ¥14.3 3000万×8.4 = ¥252 ¥266
qwen3.7-max 官方(限时5折价) 600万×6 + 400万×缓存折扣 = ¥36+ 3000万×18 = ¥540 ¥576+
GLM-5.2 官方 600万×8 + 400万×2 = ¥56 3000万×28 = ¥840 ¥896

几个直接能用的结论:

  1. 同一任务,账单从 ¥144 到 ¥896,差 6 倍。 但单价排名和账单排名完全不一样——GLM-5.2 和 qwen3.7-max 单价看起来差不多,账单差 300 多,因为输出价差 10 元/百万。
  2. DeepSeek 分时计价影响巨大:白天跑 ¥288,改到晚上跑 ¥144。能用批处理的任务,错峰能省一半。
  3. 缓存命中是隐藏折扣:DeepSeek 缓存命中输入 ¥0.1 对比未命中 ¥3.0,30 倍价差。固定 system prompt 和知识库前缀的任务,缓存命中率轻松到 40% 以上。
  4. 统一入口价格≈官方价口径(上表 Tokeness V4-Flash ¥296 vs 官方高峰 ¥288),省的是多 Key 管理和对账成本,不是靠低价竞争。

三步从单价推账单

任何平台、任何模型,拿到单价后花三分钟估算真实账单:

第一步:估输出占比。 按你的任务类型:纯问答 1:1,翻译/总结 2:1,代码生成/长文 3:1,Agent 多轮任务 4:1 甚至更高。

第二步:估缓存命中率。 固定 system prompt、模板、知识库前缀占比高的任务往 40-60% 估;每次都是新对话的任务按 0-10% 估。

第三步:按时段加权。 用 DeepSeek 这类分时计价模型,白天跑的任务按高峰价、晚上按空闲价,分别算。

把这三步代进公式:月账单 = 输入tokens×(1-缓存率)×输入价 + 输入tokens×缓存率×缓存价 + 输出tokens×输出价,比直接比单价靠谱得多。

哪些场景适合用什么

按上面的账单结构,给四类典型场景一个粗略结论(价格以 8-25 核验为准):

结论

2026 年国产模型的定价已经从”一个数”变成”一组口径”:输入、输出、缓存、分时、折扣五层叠在一起。比价时先统一口径(同一模型 ID、同一日期、同一计费单位),再按”输出占比 + 缓存命中率 + 调用时段”估账单,最后才谈”哪款性价比最高”。

价格数据核验日期 2026-08-25,来源:DeepSeek 官方定价页智谱 BigModel 定价页阿里云百炼模型计费页MiniMax 按量计费文档Tokeness 模型广场。折扣和价格随时会变,下单前以各平台当前页面为准。


演示账单为按统一假设(输入1000万/输出3000万 tokens、缓存命中40%、工作日白天调用)的测算,不是任何平台的承诺账单。实际金额以你的用量结构和平台当日价格为准。