API 同步 高可信
LMArena Text Style Control
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
- 指标
- 风格控制后的 Arena rating,越高越好
- 频率
- 每 30 分钟从官方 latest split 同步。
覆盖综合大语言模型、图片、视频、Coding、音频、OCR/文档和视觉模型的实用榜单页。优先使用公开 API 与 raw CSV,需要 Key 的来源只作交叉参考。
| 排名 | 模型 | 机构 | 分数 | 开放状态 | 证据 |
|---|---|---|---|---|---|
| 1 | claude-fable-5 Arena rating ↑ | anthropic | 1,334 | Proprietary | 7,946 票 来源 |
| 2 | claude-opus-5-high Arena rating ↑ | anthropic | 1,325 | Proprietary | 2,858 票 来源 |
| 3 | qwen3.8-max Arena rating ↑ | alibaba | 1,318 | Proprietary | 5,038 票 来源 |
| 4 | claude-opus-4-7-thinking Arena rating ↑ | anthropic | 1,317 | Proprietary | 19,973 票 来源 |
| 5 | claude-opus-4-6-thinking Arena rating ↑ | anthropic | 1,315 | Proprietary | 19,846 票 来源 |
| 6 | claude-opus-4-7 Arena rating ↑ | anthropic | 1,315 | Proprietary | 20,368 票 来源 |
| 7 | claude-opus-4-6 Arena rating ↑ | anthropic | 1,312 | Proprietary | 24,111 票 来源 |
| 8 | gemini-3.5-flash-medium Arena rating ↑ | 1,307 | Proprietary | 5,086 票 来源 | |
| 9 | gemini-3.6-flash Arena rating ↑ | 1,307 | Proprietary | 707 票 来源 | |
| 10 | muse-spark Arena rating ↑ | meta | 1,307 | Proprietary | 5,583 票 来源 |
每个来源都标注同步方式和可信度,方便 Codex 后续决定哪些自动抓取、哪些只做参考。
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
适合交叉核对综合智能、价格与速度;官方 API 需要 Key,且必须只放在服务端。
适合作为开闭源混合图片生成排行的主同步源。
补充图片编辑模型,例如 GPT Image、Gemini 图像、Seedream 等。
文生视频主同步源,覆盖字节、快手、xAI、Google 等厂商。
图生视频工作流的补充同步源。
真实 GitHub issue 修复类 Agent Coding 的最佳结构化来源。
补充 SWE-bench,覆盖网页开发偏好排行。
语音识别强来源;音频生成榜单仍需要二级人工/解析来源补充。
适合 OCR 和文字密集视觉理解;建议同步到 D1 后做中等可信展示。
中文 OCR 与文档理解补充榜单。
文档类多模态任务的可同步来源。
通用视觉推理和多模态模型对比。
公开质量较高,但 HTML 解析比 benchmark API 更脆弱。
覆盖 C++、Go、Java、JavaScript、Python、Rust 的代码编辑榜单,但暂未发现稳定 JSON。