刚刚,千问正式推出其迄今最强的旗舰模型——Qwen3.8-Max。这款模型以 2.4 万亿参数的 MoE 架构、原生多模态能力(支持文本、图像及视频)和百万级上下文窗口,迅速在广受关注的 AI评测平台 Arena.ai 上交出了亮眼答卷。
Arena.ai(前身为 LMArena)以真实用户的匿名对战投票著称,其榜单通常被业界视为衡量模型实际可用性的重要参考。Qwen 团队发布模型后,Arena 官方随即更新了相关榜单数据。
1. Vision Arena(视觉任务)——高居第二
Qwen3.8-Max 以 1305 分的成绩位列第 2,仅次于 Claude Fable 5 (High) 的 1318 分,双方差距仅在 13 分左右。在如今竞争白热化的多模态视觉理解赛道,能紧咬顶级闭源模型不放,足以说明其原生多模态实力已迈入第一梯队。

2. Frontend Code Arena(前端代码任务)——稳居第四
得分 1668 分,排名第 4。仅落后于 Claude Opus 5 (Max) 的 1705 分和 Kimi K3 (Max) 的 1676 分,与 Claude Opus 5 (High) 几乎并驾齐驱。
其细分领域的表现相当突出:
- 消费产品:第 2 名
- 品牌营销、参考设计、游戏、内容创作工具等:多项第 3 名
- 数据与分析:第 4 名
- 模拟类:第 5 名
这意味着,它在真实前端工程、UI 实现乃至产品级代码生成上,已具备了很强的竞争力。

3. Text Arena(文本任务)——成功闯入前五
综合得分 1496 分,排名第 5(此为初步数据)。在职业与领域类目的细分中,它的身手尤为矫健:
- 医学与医疗:第 1 名
- 生命/物理/社会科学:第 4 名
- 数学:第 7 名
- 软件与 IT 服务:第 9 名
- 创意写作:第 3 名
- 多轮对话、高难度提示:第 6 名
- 指令遵循:第 9 名
- 编码:第 10 名
总的来看,Qwen3.8-Max 在通用对话、专业知识问答和长程任务处理上都展现出了扎实的基本功。

Qwen3.8-Max 的发布,又一次证明了中国大模型在前沿能力上,正快速追平甚至在某些局部超越部分国际顶级闭源模型。尤其在视觉和前端代码这两个实用性极强的方向上,它已经站到了一个非常靠前的位置。
当然,Arena 榜单的排名还会随着投票量的累积而产生波动。后续,我们仍需结合 SWE-bench、真实工程化落地等更多维度的独立评测,才能对其进行更全面的观察。你对 Qwen3.8-Max 这次的跑分表现怎么看?不妨去 云栈社区 的开发者广场聊聊你的实测体验。
|