Ladder · 2026-09 快照
AI 天梯图
56 个大模型 × 8 大领域评分天梯。聚合 Arena 盲测、权威基准与第三方评测,一图看清谁在哪个山头。
56 个模型在册
8 大领域榜单
数据截至 2026-09-07
每周随盲测票数刷新
梯队总览 · Arena Elo
领域天梯 · 点击切换
格局解读
🏛 Anthropic 的王朝时刻
Arena Elo 前三(Mythos 5 / Fable 5 / Opus 5)全部来自 Anthropic,数学榜前三同样是 Claude 系;编码平衡分 Opus 5 以 99.14 断层领先。Mythos 5 延续限量受邀策略,Fable 5 则全面开放——「天花板」与「出货量」两条腿走路。
🧮 OpenAI 双线作战
GPT-5.6 Sol 以综合指数 56.8 与 $4/$20 促销价同时压住「最强」与「最值」两个心智;GPT-5.6 Terra(118 t/s)卡位生产主力。GPT-6 Astra 已官宣在途,但受网安评级限制仅限量放行。
🇨🇳 中国开源集团军
OpenRouter 周度数据显示中国模型全球调用量连续 19 周第一(56.72 万亿 Token,约为美国 models 的三倍)。Kimi K3 以 Elo 1500 成为开源阵营新旗舰;编码榜 DeepSeek V4 Pro 与 Qwen3.8 Max 仅差 0.14 分并驾齐驱;Hy4 preview 单周调用量暴涨 379%。
⚡ 性价比革命
DeepSeek V4 Pro 用 $0.66/$1.98 的价格拿到 89 综合质量,Value 指数 67.4 断层领跑;百灵 Ling-3.0-Flash(124B/5.1B)与 Qwen3.8-27B(4-bit 约 17GB 显存)让家用显卡也能跑进前沿区间。
口径说明:各榜单来源与统计口径互不相同——Arena Elo 来自真实用户匿名盲测(每周随票数重排名),Math Arena 为其数学子赛道;综合能力指数为跨基准聚合的 TrueSkill 保守评分;编码平衡分按 SWE-bench 30% · Terminal-Bench 20% · Vibe Code 20% · LiveCodeBench 20% · IOI 10% 加权。细分榜相互独立,不宜跨榜直接比较。Elo 榜单存在 ±10~30 的置信区间,名次接近的模型实质上难分高下。数据为第三方评测聚合,非官方口径,检于 2026-09-07/09-08。相关新闻背景见 AI 新闻前沿。