canx.me 评测

通用大模型排行榜

面向中文真实使用场景的评测榜单。五类任务加权后得到综合分,满分 100。

# 模型 机构 综合 推理 代码 数学 多语言 更新
1GPT-5.2 OpenAI 91.493.192.894.286.709-12
2Claude Opus 4.5Anthropic 90.892.494.191.085.909-12
3Gemini 3 Pro Google 89.691.789.392.587.409-11
4DeepSeek-V4 DeepSeek 87.290.289.892.179.409-14
5Qwen3.5-Max 阿里通义 86.588.687.489.784.209-14
6Grok 5 xAI 85.187.984.288.480.109-10
7Kimi K2.5 月之暗面 84.386.185.786.978.809-15
8GLM-5 智谱 AI 83.785.484.986.277.609-15
9Llama 5 405B Meta 82.084.383.184.078.209-08
10MiniMax M2.5 MiniMax 81.283.082.484.176.309-13
11ERNIE 5.0 百度 80.482.180.983.578.009-09
12Mistral Large 3Mistral79.681.481.082.275.809-07

最近更新:2026-09-15 · 榜单每两周复核一次 · 上次复核共替换 18 道题

怎么读这张表。综合分不是各项的算术平均:推理与代码合计占 50%, 数学 20%,多语言 15%,长文本 15%。分数只代表这批题目的表现,不构成选型建议。

本期变化

局限

静态题库会随时间被污染,分数也会随推理参数、系统提示和采样温度漂移。我们只公布题目 类别与配比,不公开原始题目;所有模型使用公开 API 与默认温度调用,不做提示词调优。