API 同步 高可信
LMArena Text Style Control
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
- 指标
- 风格控制后的 Arena rating,越高越好
- 频率
- 每 30 分钟从官方 latest split 同步。
覆盖综合大语言模型、图片、视频、Coding、音频、OCR/文档和视觉模型的实用榜单页。优先使用公开 API 与 raw CSV,需要 Key 的来源只作交叉参考。
| 排名 | 模型 | 机构 | 分数 | 开放状态 | 证据 |
|---|---|---|---|---|---|
| 1 | Audio8/ARK-ASR-3B Average WER ↓ | Audio8 | 4.76 | Mixed / see source | 未验证 来源 |
| 2 | OpenMOSS-Team/MOSS-Transcribe-preview-2B Average WER ↓ | OpenMOSS | 4.87 | Mixed / see source | 未验证 来源 |
| 3 | OpenMOSS-Team/MOSS-Transcribe-Diarize Average WER ↓ | OpenMOSS | 5.17 | Mixed / see source | 未验证 来源 |
| 4 | CohereLabs/cohere-transcribe-03-2026 Average WER ↓ | Cohere Labs | 5.42 | Mixed / see source | 未验证 来源 |
| 5 | Audio8/ARK-ASR-0.6B Average WER ↓ | Audio8 | 5.53 | Mixed / see source | 未验证 来源 |
| 6 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M Average WER ↓ | SoundsGoodAI | 5.56 | Mixed / see source | 未验证 来源 |
| 7 | Qwen/Qwen3-ASR-1.7B Average WER ↓ | Qwen | 5.76 | Mixed / see source | 未验证 来源 |
| 8 | microsoft/Phi-4-multimodal-instruct Average WER ↓ | Microsoft | 6.02 | Mixed / see source | 未验证 来源 |
| 9 | nvidia/parakeet-tdt-0.6b-v2 Average WER ↓ | NVIDIA | 6.05 | Mixed / see source | 未验证 来源 |
| 10 | nvidia/parakeet-tdt-0.6b-v3 Average WER ↓ | NVIDIA | 6.32 | Mixed / see source | 未验证 来源 |
每个来源都标注同步方式和可信度,方便 Codex 后续决定哪些自动抓取、哪些只做参考。
开闭源混合大模型主榜;Style Control 用于降低回答格式和语气带来的人类偏好偏差。
适合交叉核对综合智能、价格与速度;官方 API 需要 Key,且必须只放在服务端。
适合作为开闭源混合图片生成排行的主同步源。
补充图片编辑模型,例如 GPT Image、Gemini 图像、Seedream 等。
文生视频主同步源,覆盖字节、快手、xAI、Google 等厂商。
图生视频工作流的补充同步源。
真实 GitHub issue 修复类 Agent Coding 的最佳结构化来源。
补充 SWE-bench,覆盖网页开发偏好排行。
语音识别强来源;音频生成榜单仍需要二级人工/解析来源补充。
适合 OCR 和文字密集视觉理解;建议同步到 D1 后做中等可信展示。
中文 OCR 与文档理解补充榜单。
文档类多模态任务的可同步来源。
通用视觉推理和多模态模型对比。
公开质量较高,但 HTML 解析比 benchmark API 更脆弱。
覆盖 C++、Go、Java、JavaScript、Python、Rust 的代码编辑榜单,但暂未发现稳定 JSON。