通用大模型排行榜
面向中文真实使用场景的评测榜单。五类任务加权后得到综合分,满分 100。
| # | 模型 | 机构 | 综合 | 推理 | 代码 | 数学 | 多语言 | 更新 |
|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 91.4 | 93.1 | 92.8 | 94.2 | 86.7 | 09-12 |
| 2 | Claude Opus 4.5 | Anthropic | 90.8 | 92.4 | 94.1 | 91.0 | 85.9 | 09-12 |
| 3 | Gemini 3 Pro | 89.6 | 91.7 | 89.3 | 92.5 | 87.4 | 09-11 | |
| 4 | DeepSeek-V4 | DeepSeek | 87.2 | 90.2 | 89.8 | 92.1 | 79.4 | 09-14 |
| 5 | Qwen3.5-Max | 阿里通义 | 86.5 | 88.6 | 87.4 | 89.7 | 84.2 | 09-14 |
| 6 | Grok 5 | xAI | 85.1 | 87.9 | 84.2 | 88.4 | 80.1 | 09-10 |
| 7 | Kimi K2.5 | 月之暗面 | 84.3 | 86.1 | 85.7 | 86.9 | 78.8 | 09-15 |
| 8 | GLM-5 | 智谱 AI | 83.7 | 85.4 | 84.9 | 86.2 | 77.6 | 09-15 |
| 9 | Llama 5 405B | Meta | 82.0 | 84.3 | 83.1 | 84.0 | 78.2 | 09-08 |
| 10 | MiniMax M2.5 | MiniMax | 81.2 | 83.0 | 82.4 | 84.1 | 76.3 | 09-13 |
| 11 | ERNIE 5.0 | 百度 | 80.4 | 82.1 | 80.9 | 83.5 | 78.0 | 09-09 |
| 12 | Mistral Large 3 | Mistral | 79.6 | 81.4 | 81.0 | 82.2 | 75.8 | 09-07 |
怎么读这张表。综合分不是各项的算术平均:推理与代码合计占 50%,
数学 20%,多语言 15%,长文本 15%。分数只代表这批题目的表现,不构成选型建议。
本期变化
- DeepSeek-V4 与 Qwen3.5-Max 同期上线,数学项同时进入 90 分区间,前四名位次因此重排。
- 多语言项新增越南语与印尼语两套题,非英语系模型的分数普遍下滑 1–3 分。
- 长文本项从 128K 提到 512K,两个模型因中途截断被扣分,明细见评测方法页。
局限
静态题库会随时间被污染,分数也会随推理参数、系统提示和采样温度漂移。我们只公布题目 类别与配比,不公开原始题目;所有模型使用公开 API 与默认温度调用,不做提示词调优。