AI大模型API聚合平台服务商评测:延迟、成功率、价格、合规四维数据哪些可信
先说一个数据疑案
最近看了一篇 2026 年的 API 聚合平台评测,四维表格很漂亮:平均延迟、API 成功率、1M Token 价格、合规资质,一个平台一行,结论是某家”国内最优”。
我把表里的价格拿去官方定价页核对,发现两处对不上:一处把 MiniMax 的原价当折后价写,另一处汇率换算少了 0.6 的折扣。价格是最容易核验的维度都能错,延迟和成功率那种没有公开数据源的数字,可信度可想而知。
这篇不评测平台,评测”评测”:把延迟、成功率、价格、合规四个维度的数据,按”公开可查证”和”必须自己测”分开,并给一份 2026 年 8 月统一口径的价格表,当作比对的基准。
四个维度,两种数据性质
| 维度 | 有没有公开权威数据源 | 该怎么做 |
|---|---|---|
| 延迟/速度 | 有(Artificial Analysis 等第三方实测),但只有海外节点 | 公开数据看量级,本地体验必须自己测 |
| 成功率 | 没有公开数据源 | 只能自己采样,方法可复现 |
| 价格 | 有(官方定价页 + 平台公示) | 核验日期、口径,半小时可查完 |
| 合规资质 | 有(工信部/备案查询系统) | 逐个查证,别信宣传文案 |
延迟:公开数据只能看量级
Artificial Analysis 是引用最多的第三方实测源(aitier.net 等排行榜的数据来源就是它)。它的价值在于模型之间的横向比较:同一模型在不同供应商之间,速度和延迟可以差 5-10 倍,这个结论在它的公开数据里反复出现。
但它的测试节点在海外,测的是”模型服务商到海外节点”的速度,和你在国内的实际体验是两回事。所以:
- 公开数据能回答:这个模型本身快不快、哪个供应商的算力强;
- 公开数据回答不了:你家网络到中转站再到模型服务的真实延迟,以及晚高峰的表现。
自己测的时候记住一个原则:分时段采样。同一个模型,工作日晚上 9 点和上午 10 点测,TTFT 能差 3 倍以上。至少测 3 个时段、每时段 20 次请求,记录 TTFT 和 P95,再下结论。
成功率:没有公开数据源,只能自己采样
没有任何第三方机构持续公布各中转站的请求成功率——这是评测文章里最容易注水的数字,因为读者无法核验。
自己测的方法不复杂(完整流程我在 AI中转站评测系列 里写过):固定模型、固定 prompt 集,每时段发 50-100 次请求,统计非 2xx/超时/流式中断的比例。重点看流式中断——很多平台普通请求成功率 99%,流式请求一高并发就断,这个数据表里通常看不到。
价格:唯一可以即时核验的维度
价格数据要核验三件事:日期、单位、口径。下面是 2026 年 8 月 25 日核验的国产模型官方价,统一为 ¥/百万 tokens(输入/输出,不含缓存价,折扣按当前公示计算):
| 模型 | 官方输入 | 官方输出 | 说明 |
|---|---|---|---|
| deepseek-v4-flash | ¥3.0(高峰)/ ¥1.5(空闲) | ¥9.0(高峰)/ ¥4.5(空闲) | 工作日 9-12、14-18 为高峰 |
| deepseek-v4-pro | ¥9.0(高峰)/ ¥4.5(空闲) | ¥27.0(高峰)/ ¥13.5(空闲) | 同上 |
| GLM-5.2 | ¥8 | ¥28 | 缓存命中 ¥2 |
| qwen3.7-max | ¥12(限时 5 折 ¥6) | ¥36(限时 5 折 ¥18) | 折扣结束恢复原价 |
| MiniMax-M3 | ¥4.2(永久五折 ¥2.1) | ¥16.8(永久五折 ¥8.4) | 五折是常驻活动 |
同一日期下 Tokeness 模型广场的标准档价格(来源:模型广场,2026-08-25):
| 模型 | 输入 | 输出 | 与官方价关系 |
|---|---|---|---|
| deepseek-v4-flash | ¥3.08 | ¥9.24 | 约等于官方高峰价 |
| deepseek-v4-pro | ¥9.24 | ¥27.72 | 约等于官方高峰价 |
| GLM-5.2 | ¥10.15 | ¥31.5 | 高于官方价,按模型版本核对 |
| qwen3.7-max | ¥17.5 | ¥52.5 | 高于官方原价 |
| MiniMax-M3 | ¥2.1 | ¥8.4 | 等于官方永久五折价 |
这张表的两个用途:一是直接拿它去对评测文章里的价格数字;二是提醒你——“比官方便宜 50%”这种结论,先确认它比的是哪个口径(原价还是折后价、高峰还是空闲、有没有算缓存)。
合规资质:每个都能查证
评测文章里的”ICP 备案、EDI、等保三级、算法备案”这类话术,全部有官方查询入口,半小时能查完:
| 资质 | 查询方式 |
|---|---|
| ICP 备案 | 工信部 ICP/IP 备案管理系统按域名查 |
| EDI 许可证 | 工信部电信业务市场综合管理信息系统 |
| 等保备案 | 全国公安机关互联网安全管理服务平台(按单位名查) |
| 算法备案 | 网信办互联网信息服务算法备案系统 |
查不到的资质,不管评测写得多漂亮,都当它不存在。另外注意:平台官网挂着 ICP 号≠能开对公发票,发票和转账能力要单独问客服、看平台正式说明,别把资质清单和财务能力混为一谈。
怎么读一篇评测文章
把四维数据套进这个检查表,一分钟判断文章可信度:
- 价格有没有标注核验日期?没有 → 跳过;
- 延迟有没有说明测试节点和时段?只写”平均延迟 300ms”不说在哪测的 → 跳过;
- 成功率有没有给出样本量和测试方法?只给百分比不给方法 → 跳过;
- 合规有没有给查询入口?只写”资质齐全”不给查询方式 → 跳过;
- 结论部分是不是所有对比平台都有不利数据?只写自己缺点、别人全是优点 → 软文,参考价值有限。
结论
延迟、成功率、价格、合规这四个维度里,只有价格和合规资质可以即时查证,延迟和成功率必须自己采样。评测文章的价值是给你一个候选清单和方法,不是替你做决定。
我自己用这套框架核验的结果是:Tokeness 的价格在模型广场公示、有核验日期(见上表),文档对协议边界和计费口径的说明也算坦诚。但它的实际延迟和成功率,我同样是按”分时段自测”的方式确认的——建议你也这么做。任何平台,单次测试、单一时段的数字都不值得成为你充值的理由。
数据核验日期:2026-08-25。来源:DeepSeek 官方定价页、智谱 BigModel 定价页、阿里云百炼模型计费页、MiniMax 按量计费文档、Tokeness 模型广场、Artificial Analysis(第三方实测,海外节点)。价格与活动随时调整,以各平台当前页面为准。