评测方法
写清楚口径,比写清楚结论重要。这一页说明分数是怎么来的。
题目构成
| 类别 | 题量 | 权重 | 判分 | 更新节奏 |
|---|---|---|---|---|
| 推理 | 420 | 30% | 精确匹配 + 人工复核争议项 | 每两周 |
| 代码 | 300 | 20% | 单元测试通过率 | 每两周 |
| 数学 | 260 | 20% | 最终答案精确匹配 | 每月 |
| 多语言 | 240 | 15% | 母语者盲评,双人交叉 | 每季度 |
| 长文本 | 80 | 15% | 512K 上下文内关键信息召回率 | 每月 |
调用参数
- 全部通过各厂商公开 API 调用,不接灰度、不接内测通道。
- 温度取默认值,不做提示词调优,不加思维链诱导,不开启工具调用与联网。
- 同一道题对同一模型只取一次结果;失败不计零分,而是重试最多三次后剔除该题。
- 单题最大输出 8K token,超长截断按未完成处理。
复核流程
每两周抽 15% 的题重新跑一遍。新旧结果差异超过 2 分的模型会全量重跑,重跑后仍不一致的 在页面上标注不稳定。本期复核替换了 18 道题,其中 11 道是因为题目本身被公开题库收录。
关于污染。静态题库迟早会进训练数据。这是所有公开榜单的共同问题,我们能做的
只是提高换题频率,以及不公开原始题目。看到分数异常整齐的模型,请怀疑题目泄露。
不做什么
- 不做「最好模型」的结论。不同任务的最优解不一样。
- 不接商业合作,不接受厂商提交自有题目。
- 不评测安全性、越狱抵抗与价值观对齐,这些需要另一套方法。