智能路由评测

此页面正文由服务端预渲染,实时数据随后从公开只读接口加载。

路由评测

智能路由评测

报告只发布通过自动评审与人工抽检的数据;未审核完成的季度不展示分数。

评测方法论

四步流程,每一步的产物都随报告公开。

1

标准提示词集

覆盖编程、写作、推理、翻译四类任务,每类 100–300 条标准提示词,不含任何用户数据。

2

交叉盲评

同一输入分别调用 auto-chat 与当期旗舰固定模型,隐藏模型名交叉盲评。

3

Judge 初筛 + 人工复核

强模型 Judge 初筛加人工复核;争议样本剔除并保留说明,不静默丢弃。

4

成本口径

成本使用请求时不可变报价与最终结算,不用目录当前价格反推历史。

当前状态

尚未发布——当前没有通过人工抽检的季度报告,因此不展示推测分数或成本优势。

下一报告周期审核中

通过人工抽检后,完整数据将在此发布。

发布时将包含

  • 数据集版本
  • 提示词摘要
  • 路由策略版本
  • Judge 配置
  • 人工抽检比例
  • 聚合脚本校验值

口径说明

服务健康降级或未分配样本单独列出,不并入质量分。 分数反映的是正常服务窗口内的路由质量,不用健康样本掩盖降级时段。

报告发布时通知你

只发送评测报告发布通知,不发送营销内容。