TL;DR

数据快照:2026-07-10 至 2026-08-06 各榜交叉验证。综合智能第一是 Anthropic Claude Fable 5(2026-06-09 发布,AA 智能指数 64.9 分、GDPval-AA Elo 1932),LMArena 文本榜前五被 Claude 系列包揽;代码能力第一是 Kimi K3(LMArena Coding Arena 1529);按真实调用量算,DeepSeek V4 Flash 已是全球第一(OpenRouter 单日约 84% 的 token 量)。国产模型与海外第一梯队差距已收窄到约 5 分以内(SuperCLUE 2026-05 口径)。

LMArena 文本榜(2026-07-10)

排名模型综合得分(Elo)说明
1Claude Fable 51509±9Anthropic 2026-06-09 发布;API 价 $10/$50 每百万 token
2–5Claude 系列(Opus 4.8 / Opus 4.7 等)前五名全部为 Claude 系,真人盲测偏好优势明显
国内第 1(2026-01 快照)ERNIE-5.0-0110(百度)1460全球第 8、中国第 1;数学榜全球第 2(2026-01-15)

代码与综合智能榜(2026-07/08)

榜单(数据日期)第一得分/数值
LMArena Coding Arena(2026-07-16)Kimi K3(月之暗面)Elo 1529
Artificial Analysis 智能指数(2026-07)Claude Fable 564.9 分,领先 GPT-5.5 约 5 分;Opus 4.8 第 2
AA GDPval-AA(真实工作任务,2026-07)Claude Fable 5Elo 1932(前纪录 Opus 4.8)
SWE-bench Verified(2026-06 官方自报)Claude Fable 595.0%(Opus 4.8 为 88.6%)
OpenRouter 模型调用量(2026-08-06)DeepSeek V4 Flash全球第一,单日约 7.5T token 中占 6.3T(约 84%)

与上期对比(2026-01 → 2026-08)

变化点2026-01 快照2026-08 快照
LMArena 文本榜第一GLM-4.7 / ERNIE-5.0 进前十Claude Fable 5,前五全为 Claude
中国模型在 LMArena 文本榜ERNIE-5.0-0110 全球第 8暂无中国模型进前十
代码榜Claude/GPT 领先Kimi K3(1529)登顶
调用量第一DeepSeek V4 Flash(价格战红利兑现)
中文综合(SuperCLUE 2026-05)Gemini 3.1 Pro 第 1;DeepSeek-V4-Pro / Qwen3.7-Max / 豆包 Seed-2.0-pro 与第一梯队差距 <5 分

按用途怎么选(2026-08 建议)

场景首选备选理由
综合智能/复杂推理Claude Fable 5GPT-5.5 / Opus 4.8AA 指数第一,长程 agent 任务(GDPval-AA 1932)断层领先
编程/代码工程Kimi K3 / Claude 系DeepSeek V4代码榜第一;SWE-bench Verified Fable 5 达 95.0%
中文场景Gemini 3.1 ProDeepSeek V4 / Qwen3.7-MaxSuperCLUE 中文第 1;国产差距已 <5 分
性价比/大批量调用DeepSeek V4 FlashV4 Pro输出 2 元/百万 token(2026-08-06 现价),调用量全球第一
私有化部署/开源DeepSeek V4 / Qwen3.7-MaxKimi K3开源可私有化,数据不出境

摘要要点

常见问题

2026 年哪个 AI 模型综合最强?

按 2026-07 的 Artificial Analysis 智能指数,综合第一是 Anthropic Claude Fable 5(64.9 分,领先 GPT-5.5 约 5 分);LMArena 真人盲测文本榜第一也是它(Elo 1509±9)。不同榜单口径不同,中文场景 SuperCLUE 第一是 Gemini 3.1 Pro。

哪个模型写代码最强?

LMArena Coding Arena(2026-07-16)第一是 Kimi K3(Elo 1529);官方基准上 Claude Fable 5 的 SWE-bench Verified 达 95.0%、SWE-bench Pro 80.0%,适合长程代码工程任务。选型看具体任务:算法题看 LMArena Coding,真实仓库改 bug 看 SWE-bench。

国产大模型现在什么水平?

国产模型已进入第一梯队边缘:Kimi K3 代码榜第一、DeepSeek V4 Flash 全球调用量第一;SuperCLUE 2026-05 显示 DeepSeek-V4-Pro、Qwen3.7-Max、豆包 Seed-2.0-pro 与海外第一梯队差距已收窄到 5 分以内。但在 LMArena 文本榜前十中暂无国产模型。

DeepSeek V4 Flash 为什么调用量全球第一?

核心是性价比:2026-08-06 现价输出仅 2 元/百万 token(高峰 4 元),约为 Claude/GPT 旗舰的几十分之一,且能力接近第一梯队;OpenRouter 2026-08-05 单日约 7.5T token 中 V4 Flash 占约 6.3T(84%)。注意 DeepSeek 8/6 已公告将上调 API 价格,涨幅待公布。

AI 模型榜单去哪里查最权威?

常用五个口径:LMArena(真人盲测 Elo)、Artificial Analysis(综合基准指数)、SuperCLUE(中文专项)、OpenRouter(真实调用量)、SWE-bench(代码工程)。同一模型在不同榜单名次可能不同,引用时写清「榜单 + 数据日期」,例如「LMArena 文本榜 2026-07-10」。

来源

最后更新:2026-08-09