API 同步 高可信
LMArena Text Style Control
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
- 指标
- 风格控制后的 Arena rating,越高越好
- 频率
- 每 30 分钟从官方 latest split 同步。
覆盖综合大语言模型、图片、视频、Coding、音频、OCR/文档和视觉模型的实用榜单页。优先使用公开 API 与 raw CSV,需要 Key 的来源只作交叉参考。
| 排名 | 模型 | 机构 | 分数 | 开放状态 | 证据 |
|---|---|---|---|---|---|
| 1 | gemini-omni-flash Arena rating ↑ | 1,513 | Proprietary | 14,571 票 来源 | |
| 2 | dreamina-seedance-2.0-720p Arena rating ↑ | bytedance | 1,479 | Proprietary | 47,067 票 来源 |
| 3 | muse-video Arena rating ↑ | meta | 1,458 | Proprietary | 2,160 票 来源 |
| 4 | minimax-h3 Arena rating ↑ | minimax | 1,455 | minimax-h3-community-license-agreement | 1,060 票 来源 |
| 5 | happyhorse-1.0 Arena rating ↑ | aorizon | 1,428 | Proprietary | 21,979 票 来源 |
| 6 | sora-2-pro Arena rating ↑ | openai | 1,365 | Proprietary | 44,543 票 来源 |
| 7 | veo-3.1-audio Arena rating ↑ | 1,364 | Proprietary | 13,687 票 来源 | |
| 8 | veo-3.1-audio-1080p Arena rating ↑ | 1,363 | Proprietary | 24,846 票 来源 | |
| 9 | veo-3.1-fast-audio Arena rating ↑ | 1,362 | Proprietary | 39,301 票 来源 | |
| 10 | veo-3.1-fast-audio-1080p Arena rating ↑ | 1,358 | Proprietary | 25,637 票 来源 |
每个来源都标注同步方式和可信度,方便 Codex 后续决定哪些自动抓取、哪些只做参考。
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
适合交叉核对综合智能、价格与速度;官方 API 需要 Key,且必须只放在服务端。
适合作为开闭源混合图片生成排行的主同步源。
补充图片编辑模型,例如 GPT Image、Gemini 图像、Seedream 等。
文生视频主同步源,覆盖字节、快手、xAI、Google 等厂商。
图生视频工作流的补充同步源。
真实 GitHub issue 修复类 Agent Coding 的最佳结构化来源。
补充 SWE-bench,覆盖网页开发偏好排行。
语音识别强来源;音频生成榜单仍需要二级人工/解析来源补充。
适合 OCR 和文字密集视觉理解;建议同步到 D1 后做中等可信展示。
中文 OCR 与文档理解补充榜单。
文档类多模态任务的可同步来源。
通用视觉推理和多模态模型对比。
公开质量较高,但 HTML 解析比 benchmark API 更脆弱。
覆盖 C++、Go、Java、JavaScript、Python、Rust 的代码编辑榜单,但暂未发现稳定 JSON。