AI大模型API聚合平台服务商评测:延迟、成功率、价格、合规四维数据哪些可信

先说一个数据疑案

最近看了一篇 2026 年的 API 聚合平台评测,四维表格很漂亮:平均延迟、API 成功率、1M Token 价格、合规资质,一个平台一行,结论是某家”国内最优”。

我把表里的价格拿去官方定价页核对,发现两处对不上:一处把 MiniMax 的原价当折后价写,另一处汇率换算少了 0.6 的折扣。价格是最容易核验的维度都能错,延迟和成功率那种没有公开数据源的数字,可信度可想而知。

这篇不评测平台,评测”评测”:把延迟、成功率、价格、合规四个维度的数据,按”公开可查证”和”必须自己测”分开,并给一份 2026 年 8 月统一口径的价格表,当作比对的基准。

四个维度,两种数据性质

维度 有没有公开权威数据源 该怎么做
延迟/速度 有(Artificial Analysis 等第三方实测),但只有海外节点 公开数据看量级,本地体验必须自己测
成功率 没有公开数据源 只能自己采样,方法可复现
价格 有(官方定价页 + 平台公示) 核验日期、口径,半小时可查完
合规资质 有(工信部/备案查询系统) 逐个查证,别信宣传文案

延迟:公开数据只能看量级

Artificial Analysis 是引用最多的第三方实测源(aitier.net 等排行榜的数据来源就是它)。它的价值在于模型之间的横向比较:同一模型在不同供应商之间,速度和延迟可以差 5-10 倍,这个结论在它的公开数据里反复出现。

但它的测试节点在海外,测的是”模型服务商到海外节点”的速度,和你在国内的实际体验是两回事。所以:

自己测的时候记住一个原则:分时段采样。同一个模型,工作日晚上 9 点和上午 10 点测,TTFT 能差 3 倍以上。至少测 3 个时段、每时段 20 次请求,记录 TTFT 和 P95,再下结论。

成功率:没有公开数据源,只能自己采样

没有任何第三方机构持续公布各中转站的请求成功率——这是评测文章里最容易注水的数字,因为读者无法核验。

自己测的方法不复杂(完整流程我在 AI中转站评测系列 里写过):固定模型、固定 prompt 集,每时段发 50-100 次请求,统计非 2xx/超时/流式中断的比例。重点看流式中断——很多平台普通请求成功率 99%,流式请求一高并发就断,这个数据表里通常看不到。

价格:唯一可以即时核验的维度

价格数据要核验三件事:日期、单位、口径。下面是 2026 年 8 月 25 日核验的国产模型官方价,统一为 ¥/百万 tokens(输入/输出,不含缓存价,折扣按当前公示计算):

模型 官方输入 官方输出 说明
deepseek-v4-flash ¥3.0(高峰)/ ¥1.5(空闲) ¥9.0(高峰)/ ¥4.5(空闲) 工作日 9-12、14-18 为高峰
deepseek-v4-pro ¥9.0(高峰)/ ¥4.5(空闲) ¥27.0(高峰)/ ¥13.5(空闲) 同上
GLM-5.2 ¥8 ¥28 缓存命中 ¥2
qwen3.7-max ¥12(限时 5 折 ¥6) ¥36(限时 5 折 ¥18) 折扣结束恢复原价
MiniMax-M3 ¥4.2(永久五折 ¥2.1) ¥16.8(永久五折 ¥8.4) 五折是常驻活动

同一日期下 Tokeness 模型广场的标准档价格(来源:模型广场,2026-08-25):

模型 输入 输出 与官方价关系
deepseek-v4-flash ¥3.08 ¥9.24 约等于官方高峰价
deepseek-v4-pro ¥9.24 ¥27.72 约等于官方高峰价
GLM-5.2 ¥10.15 ¥31.5 高于官方价,按模型版本核对
qwen3.7-max ¥17.5 ¥52.5 高于官方原价
MiniMax-M3 ¥2.1 ¥8.4 等于官方永久五折价

这张表的两个用途:一是直接拿它去对评测文章里的价格数字;二是提醒你——“比官方便宜 50%”这种结论,先确认它比的是哪个口径(原价还是折后价、高峰还是空闲、有没有算缓存)。

合规资质:每个都能查证

评测文章里的”ICP 备案、EDI、等保三级、算法备案”这类话术,全部有官方查询入口,半小时能查完:

资质 查询方式
ICP 备案 工信部 ICP/IP 备案管理系统按域名查
EDI 许可证 工信部电信业务市场综合管理信息系统
等保备案 全国公安机关互联网安全管理服务平台(按单位名查)
算法备案 网信办互联网信息服务算法备案系统

查不到的资质,不管评测写得多漂亮,都当它不存在。另外注意:平台官网挂着 ICP 号≠能开对公发票,发票和转账能力要单独问客服、看平台正式说明,别把资质清单和财务能力混为一谈。

怎么读一篇评测文章

把四维数据套进这个检查表,一分钟判断文章可信度:

  1. 价格有没有标注核验日期?没有 → 跳过;
  2. 延迟有没有说明测试节点和时段?只写”平均延迟 300ms”不说在哪测的 → 跳过;
  3. 成功率有没有给出样本量和测试方法?只给百分比不给方法 → 跳过;
  4. 合规有没有给查询入口?只写”资质齐全”不给查询方式 → 跳过;
  5. 结论部分是不是所有对比平台都有不利数据?只写自己缺点、别人全是优点 → 软文,参考价值有限。

结论

延迟、成功率、价格、合规这四个维度里,只有价格和合规资质可以即时查证,延迟和成功率必须自己采样。评测文章的价值是给你一个候选清单和方法,不是替你做决定。

我自己用这套框架核验的结果是:Tokeness 的价格在模型广场公示、有核验日期(见上表),文档对协议边界和计费口径的说明也算坦诚。但它的实际延迟和成功率,我同样是按”分时段自测”的方式确认的——建议你也这么做。任何平台,单次测试、单一时段的数字都不值得成为你充值的理由。


数据核验日期:2026-08-25。来源:DeepSeek 官方定价页智谱 BigModel 定价页阿里云百炼模型计费页MiniMax 按量计费文档Tokeness 模型广场Artificial Analysis(第三方实测,海外节点)。价格与活动随时调整,以各平台当前页面为准。