API 同步 高可信
LMArena Text Style Control
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
- 指标
- 风格控制后的 Arena rating,越高越好
- 频率
- 每 30 分钟从官方 latest split 同步。
覆盖综合大语言模型、图片、视频、Coding、音频、OCR/文档和视觉模型的实用榜单页。优先使用公开 API 与 raw CSV,需要 Key 的来源只作交叉参考。
| 排名 | 模型 | 机构 | 分数 | 开放状态 | 证据 |
|---|---|---|---|---|---|
| 1 | deepreinforce-ai/Ornith-1.0-397B Resolved % ↑ | DeepReinforce | 82.40 | Mixed / see source | 未验证 来源 |
| 2 | deepseek-ai/DeepSeek-V4-Pro Resolved % ↑ | DeepSeek | 80.60 | Mixed / see source | 未验证 来源 |
| 3 | MiniMaxAI/MiniMax-M3 Resolved % ↑ | MiniMax | 80.50 | Mixed / see source | 未验证 来源 |
| 4 | moonshotai/Kimi-K2.6 Resolved % ↑ | Moonshot AI | 80.20 | Mixed / see source | 未验证 来源 |
| 5 | thinkingmachines/Inkling-Small Resolved % ↑ | Thinking Machines Lab | 80.20 | Mixed / see source | 未验证 来源 |
| 6 | deepseek-ai/DeepSeek-V4-Flash Resolved % ↑ | DeepSeek | 79 | Mixed / see source | 未验证 来源 |
| 7 | XiaomiMiMo/MiMo-V2.5-Pro Resolved % ↑ | Xiaomi MiMo | 78.90 | Mixed / see source | 未验证 来源 |
| 8 | tencent/Hy3 Resolved % ↑ | Tencent | 78 | Mixed / see source | 未验证 来源 |
| 9 | zai-org/GLM-5 Resolved % ↑ | Z.ai | 77.80 | Mixed / see source | 未验证 来源 |
| 10 | mistralai/Mistral-Medium-3.5-128B Resolved % ↑ | Mistral AI_ | 77.60 | Mixed / see source | 未验证 来源 |
每个来源都标注同步方式和可信度,方便 Codex 后续决定哪些自动抓取、哪些只做参考。
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
适合交叉核对综合智能、价格与速度;官方 API 需要 Key,且必须只放在服务端。
适合作为开闭源混合图片生成排行的主同步源。
补充图片编辑模型,例如 GPT Image、Gemini 图像、Seedream 等。
文生视频主同步源,覆盖字节、快手、xAI、Google 等厂商。
图生视频工作流的补充同步源。
真实 GitHub issue 修复类 Agent Coding 的最佳结构化来源。
补充 SWE-bench,覆盖网页开发偏好排行。
语音识别强来源;音频生成榜单仍需要二级人工/解析来源补充。
适合 OCR 和文字密集视觉理解;建议同步到 D1 后做中等可信展示。
中文 OCR 与文档理解补充榜单。
文档类多模态任务的可同步来源。
通用视觉推理和多模态模型对比。
公开质量较高,但 HTML 解析比 benchmark API 更脆弱。
覆盖 C++、Go、Java、JavaScript、Python、Rust 的代码编辑榜单,但暂未发现稳定 JSON。