找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4135

积分

0

好友

537

主题
发表于 1 小时前 | 查看: 3| 回复: 0

刚刚,千问正式推出其迄今最强的旗舰模型——Qwen3.8-Max。这款模型以 2.4 万亿参数的 MoE 架构、原生多模态能力(支持文本、图像及视频)和百万级上下文窗口,迅速在广受关注的 AI评测平台 Arena.ai 上交出了亮眼答卷。

Arena.ai(前身为 LMArena)以真实用户的匿名对战投票著称,其榜单通常被业界视为衡量模型实际可用性的重要参考。Qwen 团队发布模型后,Arena 官方随即更新了相关榜单数据。

1. Vision Arena(视觉任务)——高居第二
Qwen3.8-Max 以 1305 分的成绩位列第 2,仅次于 Claude Fable 5 (High) 的 1318 分,双方差距仅在 13 分左右。在如今竞争白热化的多模态视觉理解赛道,能紧咬顶级闭源模型不放,足以说明其原生多模态实力已迈入第一梯队。

Vision Arena模型排名:Qwen3.8-Max以1305分位列第二

2. Frontend Code Arena(前端代码任务)——稳居第四
得分 1668 分,排名第 4。仅落后于 Claude Opus 5 (Max) 的 1705 分和 Kimi K3 (Max) 的 1676 分,与 Claude Opus 5 (High) 几乎并驾齐驱。

其细分领域的表现相当突出:

  • 消费产品:第 2 名
  • 品牌营销、参考设计、游戏、内容创作工具等:多项第 3 名
  • 数据与分析:第 4 名
  • 模拟类:第 5 名

这意味着,它在真实前端工程、UI 实现乃至产品级代码生成上,已具备了很强的竞争力。

Arena AI前端代码模型排行榜:Qwen3.8-Max以1668分位列第四

3. Text Arena(文本任务)——成功闯入前五
综合得分 1496 分,排名第 5(此为初步数据)。在职业与领域类目的细分中,它的身手尤为矫健:

  • 医学与医疗:第 1 名
  • 生命/物理/社会科学:第 4 名
  • 数学:第 7 名
  • 软件与 IT 服务:第 9 名
  • 创意写作:第 3 名
  • 多轮对话、高难度提示:第 6 名
  • 指令遵循:第 9 名
  • 编码:第 10 名

总的来看,Qwen3.8-Max 在通用对话、专业知识问答和长程任务处理上都展现出了扎实的基本功。

文本任务模型排行榜:Qwen3.8-Max以1496分位列第五

Qwen3.8-Max 的发布,又一次证明了中国大模型在前沿能力上,正快速追平甚至在某些局部超越部分国际顶级闭源模型。尤其在视觉和前端代码这两个实用性极强的方向上,它已经站到了一个非常靠前的位置。

当然,Arena 榜单的排名还会随着投票量的累积而产生波动。后续,我们仍需结合 SWE-bench、真实工程化落地等更多维度的独立评测,才能对其进行更全面的观察。你对 Qwen3.8-Max 这次的跑分表现怎么看?不妨去 云栈社区 的开发者广场聊聊你的实测体验。




上一篇:铠侠发布CM10系列企业级PCIe 6.0 SSD:首次采用第十代BiCS闪存
下一篇:Joe Liemandt 谈 Founders School:百万美元保证背后的家长教育与早期采用者
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-4 03:27 , Processed in 1.099846 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表