TL;DR
数据快照:2026-07-10 至 2026-08-06 各榜交叉验证。综合智能第一是 Anthropic Claude Fable 5(2026-06-09 发布,AA 智能指数 64.9 分、GDPval-AA Elo 1932),LMArena 文本榜前五被 Claude 系列包揽;代码能力第一是 Kimi K3(LMArena Coding Arena 1529);按真实调用量算,DeepSeek V4 Flash 已是全球第一(OpenRouter 单日约 84% 的 token 量)。国产模型与海外第一梯队差距已收窄到约 5 分以内(SuperCLUE 2026-05 口径)。
LMArena 文本榜(2026-07-10)
| 排名 | 模型 | 综合得分(Elo) | 说明 |
|---|---|---|---|
| 1 | Claude Fable 5 | 1509±9 | Anthropic 2026-06-09 发布;API 价 $10/$50 每百万 token |
| 2–5 | Claude 系列(Opus 4.8 / Opus 4.7 等) | — | 前五名全部为 Claude 系,真人盲测偏好优势明显 |
| 国内第 1(2026-01 快照) | ERNIE-5.0-0110(百度) | 1460 | 全球第 8、中国第 1;数学榜全球第 2(2026-01-15) |
代码与综合智能榜(2026-07/08)
| 榜单(数据日期) | 第一 | 得分/数值 |
|---|---|---|
| LMArena Coding Arena(2026-07-16) | Kimi K3(月之暗面) | Elo 1529 |
| Artificial Analysis 智能指数(2026-07) | Claude Fable 5 | 64.9 分,领先 GPT-5.5 约 5 分;Opus 4.8 第 2 |
| AA GDPval-AA(真实工作任务,2026-07) | Claude Fable 5 | Elo 1932(前纪录 Opus 4.8) |
| SWE-bench Verified(2026-06 官方自报) | Claude Fable 5 | 95.0%(Opus 4.8 为 88.6%) |
| OpenRouter 模型调用量(2026-08-06) | DeepSeek V4 Flash | 全球第一,单日约 7.5T token 中占 6.3T(约 84%) |
与上期对比(2026-01 → 2026-08)
| 变化点 | 2026-01 快照 | 2026-08 快照 |
|---|---|---|
| LMArena 文本榜第一 | GLM-4.7 / ERNIE-5.0 进前十 | Claude Fable 5,前五全为 Claude |
| 中国模型在 LMArena 文本榜 | ERNIE-5.0-0110 全球第 8 | 暂无中国模型进前十 |
| 代码榜 | Claude/GPT 领先 | Kimi K3(1529)登顶 |
| 调用量第一 | — | DeepSeek V4 Flash(价格战红利兑现) |
| 中文综合(SuperCLUE 2026-05) | — | Gemini 3.1 Pro 第 1;DeepSeek-V4-Pro / Qwen3.7-Max / 豆包 Seed-2.0-pro 与第一梯队差距 <5 分 |
按用途怎么选(2026-08 建议)
| 场景 | 首选 | 备选 | 理由 |
|---|---|---|---|
| 综合智能/复杂推理 | Claude Fable 5 | GPT-5.5 / Opus 4.8 | AA 指数第一,长程 agent 任务(GDPval-AA 1932)断层领先 |
| 编程/代码工程 | Kimi K3 / Claude 系 | DeepSeek V4 | 代码榜第一;SWE-bench Verified Fable 5 达 95.0% |
| 中文场景 | Gemini 3.1 Pro | DeepSeek V4 / Qwen3.7-Max | SuperCLUE 中文第 1;国产差距已 <5 分 |
| 性价比/大批量调用 | DeepSeek V4 Flash | V4 Pro | 输出 2 元/百万 token(2026-08-06 现价),调用量全球第一 |
| 私有化部署/开源 | DeepSeek V4 / Qwen3.7-Max | Kimi K3 | 开源可私有化,数据不出境 |
摘要要点
- Anthropic 在真人盲测(LMArena)与综合智能(AA)双榜形成集团优势;Fable 5 与 Mythos 5 同源,后者仅限 Project Glasswing 合作方使用(无安全分类器版本);
- 国产模型分化:Kimi K3 拿下代码榜第一,DeepSeek V4 Flash 拿下调用量第一,但文本榜前十仍无国产模型(ERNIE-5.0 曾在 2026-01 排名全球第 8);
- 榜单口径差异大:LMArena 是真人盲测偏好、AA 是基准综合指数、OpenRouter 是真实调用量、SuperCLUE 是中文专项,引用时务必标注榜单与数据日期;
- DeepSeek 8/6 公告将上调 API 价格,V4-Flash 的性价比优势未来可能收窄,选型前留意官方新定价。
常见问题
2026 年哪个 AI 模型综合最强?
按 2026-07 的 Artificial Analysis 智能指数,综合第一是 Anthropic Claude Fable 5(64.9 分,领先 GPT-5.5 约 5 分);LMArena 真人盲测文本榜第一也是它(Elo 1509±9)。不同榜单口径不同,中文场景 SuperCLUE 第一是 Gemini 3.1 Pro。
哪个模型写代码最强?
LMArena Coding Arena(2026-07-16)第一是 Kimi K3(Elo 1529);官方基准上 Claude Fable 5 的 SWE-bench Verified 达 95.0%、SWE-bench Pro 80.0%,适合长程代码工程任务。选型看具体任务:算法题看 LMArena Coding,真实仓库改 bug 看 SWE-bench。
国产大模型现在什么水平?
国产模型已进入第一梯队边缘:Kimi K3 代码榜第一、DeepSeek V4 Flash 全球调用量第一;SuperCLUE 2026-05 显示 DeepSeek-V4-Pro、Qwen3.7-Max、豆包 Seed-2.0-pro 与海外第一梯队差距已收窄到 5 分以内。但在 LMArena 文本榜前十中暂无国产模型。
DeepSeek V4 Flash 为什么调用量全球第一?
核心是性价比:2026-08-06 现价输出仅 2 元/百万 token(高峰 4 元),约为 Claude/GPT 旗舰的几十分之一,且能力接近第一梯队;OpenRouter 2026-08-05 单日约 7.5T token 中 V4 Flash 占约 6.3T(84%)。注意 DeepSeek 8/6 已公告将上调 API 价格,涨幅待公布。
AI 模型榜单去哪里查最权威?
常用五个口径:LMArena(真人盲测 Elo)、Artificial Analysis(综合基准指数)、SuperCLUE(中文专项)、OpenRouter(真实调用量)、SWE-bench(代码工程)。同一模型在不同榜单名次可能不同,引用时写清「榜单 + 数据日期」,例如「LMArena 文本榜 2026-07-10」。
来源
- LMArena Text/Coding Arena(2026-07-10 / 2026-07-16)
- Artificial Analysis Intelligence Index 与官方评测文章(Claude Fable 5,2026-07)
- Anthropic 官方模型文档与发布页(Fable 5 / Mythos 5 定价与基准,2026-06-09)
- 快科技(ERNIE-5.0-0110 LMArena 1460 分全球第 8,2026-01-15)
- OpenRouter 调用量数据与网易/知乎转载(DeepSeek V4 Flash 登顶,2026-08-06)
- SuperCLUE 2026-05 中文大模型测评(SegmentFault 综述,2026-06)
- DeepSeek 官方公告与科创板日报(API 调价预告,2026-08-06)