从官方 API 换到统一入口两个月:如何核对成本和稳定性
先说踩过的坑
接入多模型的第一个月,我犯了三个典型错误,先把它们写出来,后面再讲怎么避免:
- 只看了输入价就充了值。某平台把
deepseek-v4-flash输入价标得很低,我没看输出价和缓存价就批量跑了一周,结果输出 tokens 是输入的 3 倍,实际账单比预估高了 60%。 - 用余额变化估算成本。平台没有逐条请求日志,月底我只能看到”余额少了 ¥200”,根本回溯不出是哪个模型、哪个任务花的。
- 在晚高峰测了一次延迟就下结论。周三晚上 9 点测出 TTFT 6 秒,我以为平台不行;后来同一模型在上午测只有 1.8 秒。一次请求说明不了任何问题。
第二个月我改成”每请求都落日志”,才把成本真正对上。这篇记录的就是这套方法。
为什么写这篇
团队开始接入多个模型后,真正麻烦的通常不是写第一段调用代码,而是后续的配置、Key、账单和错误排查:
- 每家平台的 Base URL 和模型 ID 不同
- 输入、输出、缓存价格容易看混
- 同一个任务换模型后,很难回溯到底花了多少钱
- 只看一次请求,无法判断晚高峰是否稳定
所以这篇不做平台价格排名,重点记录一套两个月都能重复使用的核对方法。
先确认模型和价格口径
价格比较前,先固定四件事:模型精确 ID、输入/输出方向、计费单位和采集日期。以下是 2026-08-01 从 Tokeness 模型广场核验的国产模型示例,单位为 ¥/1M tokens:
| 模型 ID | 输入 | 输出 | 缓存命中 | 官方输入参考 |
|---|---|---|---|---|
deepseek-v4-flash |
¥0.559 | ¥1.117 | ¥0.012 | ¥1.00 |
deepseek-v4-pro |
¥1.806 | ¥3.612 | ¥0.021 | ¥3.00 |
glm-5.2 |
¥6.09 | ¥18.90 | ¥1.09 | ¥8.00 |
qwen3.7-max |
¥10.50 | ¥31.50 | ¥2.10 | ¥12.00 |
来源:https://tokeness.io/pricing,核验日期 2026-08-01。官方输入参考价来自对应模型官方报价页;正式购买时以模型广场和官方页面实时价格为准。注意 deepseek-v4-flash 输入价已从 07-27 的 ¥0.504 调整为 ¥0.559,其余模型未变——价格表必须标注核验日期,旧文直接复用价格是不可靠的。
同名模型的版本、路由和缓存策略可能不同。不要把历史稿中的废止模型名和旧报价继续当作当前价格。
用量和账单怎么核对
以一个月的请求日志为准,不要凭余额变化估算。每条记录至少保留:
时间、模型 ID、输入 tokens、输出 tokens、缓存 tokens、请求状态、费用
例如,假设一个批处理任务使用 deepseek-v4-flash,每月 80M input + 20M output,按 2026-08-01 核验价计算:
80 × ¥0.559 + 20 × ¥1.117 = ¥44.72 + ¥22.34 = ¥67.06
这只是价格示例,不是个人账单承诺。实际金额还要看缓存命中、失败重试、模型切换和平台当日价格。
稳定性不要只看一次请求
我会把测试拆成两个时间窗口,并把条件写入日志:
| 字段 | 记录内容 |
|---|---|
| 日期和时区 | 例如 2026-08-01,Asia/Shanghai |
| 线路 | 家庭宽带、云服务器或公司网络 |
| 模型 ID | 精确到平台展示的模型名 |
| 请求量 | 每个模型的总请求数和并发数 |
| 成功率 | HTTP 成功且返回完整结果的比例 |
| 延迟 | TTFT、总耗时,注明平均值或 P95 |
| 错误 | 状态码、错误类型、是否重试 |
只有样本量、地区、并发和统计口径都公开时,成功率和毫秒数才有可比性。没有原始日志时,只能写个人体验,不能写成平台 SLA。
没有自己的实测数据时,怎么引用公开数据
如果你暂时没有条件自己压测,可以引用第三方公开实测,但必须写清出处和口径,不要包装成”我测的”。以 Artificial Analysis 对 kimi-k3 的供应商横向实测为例(2026-08-01 抓取):
| 供应商类型 | 吞吐 | 首 chunk 延迟 |
|---|---|---|
| 官方直连 | 35 t/s | 3.94 s |
| 第三方最快 | 172 t/s | 1.25 s |
| 第三方次快 | 164 t/s | 1.13 s |
来源:https://artificialanalysis.ai/models/kimi-k3/providers。这组数据的正确用法是说明”同一模型,不同供应商的速度可以差 5 倍,所以选中转站不能只看价格”。它不能用来证明任何一家平台对你一定更快——你的地区、时段、并发和任务长度都会影响结果。
Token 计费有没有偏差
不要用 GPT-4 tokenizer 去判断所有模型。不同模型的 tokenizer 和缓存规则可能不同。更稳妥的步骤是:
- 读取模型响应中的
usage字段 - 使用该模型官方 tokenizer(如果提供)交叉核对
- 用输入、输出和缓存价格分别计算费用
- 用短文本、中文、长文本各跑几组
- 保存原始 JSON、账单记录和计算表
如果只能看到余额变化,无法拿到 usage 或价格明细,就不要给出“注水百分比”结论。
统一入口的实际收益
Tokeness 文档提供 OpenAI-compatible Base URL:
https://n.tokeness.io/v1
使用统一入口的收益主要是:
- 部分 OpenAI-compatible 客户端可以复用
- 模型 ID、请求量和费用可以集中记录
- 切换已接入模型时,业务代码改动较少
这不等于所有模型、所有原生功能都兼容。代码上线前,仍要检查模型广场的当前状态、协议类型和返回字段。
我的使用建议
- 先用非敏感数据小额测试
- 把模型 ID、价格日期和请求日志保存下来
- 在目标地区和目标时段分别测试
- 为生产系统保留备用入口
- 每次模型或价格变更后重新计算账单
价格示例基于 2026-08-01 页面核验,模型、价格和服务能力以实时官方页面为准。第三方实测数据来自 Artificial Analysis,为公开引用,不代表本平台性能承诺。本文提供核对方法,不构成任何平台的固定性能或节省承诺。