找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4320

积分

0

好友

562

主题
发表于 2 小时前 | 查看: 4| 回复: 0

半个月前,用预览版把大伙儿钓成翘嘴的阿里 Qwen3.8-Max,终于在今天正式发布了。

这次,满血版的 Qwen3.8-Max 在大模型竞技场 Arena 上的表现很不错。其中,文本排名第二,编程排名第三,视觉排名第二,可以说是在一众闭源模型中成功杀出重围。

左右滑动查看更多排名

Text Arena 总体排名截图,Qwen3.8-Max排名第二
Code Arena | WebDev 排名截图,Qwen3.8-Max排名第三
Vision Arena 多模态模型排名截图,Qwen3.8-Max排名第二

在社交媒体上,有不少人反馈 Qwen3.8-Max 在代码方面体验较好,生成速度快。

比如 OpenCode 团队就表示,“ Qwen3.8-Max 给我的第一印象就是非常快,它几乎能完美解决所有编程任务。” 国内知名在线原型设计平台墨刀的技术负责人也表示,Qwen3.8在 HTML 编辑、简单 React/Vue 编辑及 Vue 综合需求覆盖上表现更好;在公司的实际 HTML 原型业务场景中,是一个非常能打的模型。

用户评价卡片:OpenCode团队称赞其速度快,墨刀技术负责人认可其前端开发表现

从榜单表现到实际体验,Qwen3.8 正式版的提升已经有了很直观的体现。而这些提升背后的原因,我们也在阿里 Qwen3.8 的技术博客里找到了答案。

先看基本盘。Qwen3.8-Max 总参数量达到了 2.4 万亿,激活参数 95B,原生支持视觉理解,上下文窗口扩展到 100 万 Token。

和之前不一样的是,Qwen3.8 把长文本、图像理解和 Agent 能力都合进了同一套系统,这样模型就能做到既能一次读尽大型代码仓库、长文档和界面截图,也能在连续调用工具时,尽可能保住完整的任务状态。

从官方跑分图来看,Qwen3.8 在代码、Agent 和多模态理解等核心项目上整体进入第一梯队,文本、视觉等多项指标都较预览版和上一代明显提升,和 Fable5、GPT-5.6-Sol 打得有来有回。

向上滑动查看更多 Benchmark 结果

Qwen3.8-Max 多类别性能基准测试结果表格

不过,在浏览博客的过程中我们发现,这次比跑分更值得关注的,是 Qwen3.8-Max 进行了一次长达 16 天的自主编程实验。

这 16 天中,Qwen3.8-Max 独立使用 TypeScript 开发出了代码 Agent 工具 “oh-my-cli”。目前,公开仓库已有 428 次提交,包含会话恢复、上下文压缩、撤销重做、任务监控、权限审批和安全治理等功能实现。

而这种长时间自主编程,生产级成果直接交付,才是当下模型在真实工作流中最重要的能力。它需要模型在长达数天的任务中记住目标、拆解需求、连续修改代码,并在遇到报错、需求变化、上下文膨胀时及时调整,这些恰恰是真实软件开发中每天都在面临的难题。

oh-my-cli GitHub仓库页面截图,由Qwen Code构建的自主代码Agent CLI

在实测中,我们感觉复杂开发任务确实是 Qwen3.8 的强项。

首先,我们给模型提供了一份具体的产品需求书,目的是实现一个网页版 PS。里面包含一些基础的裁剪、旋转、调色等功能,也有模糊、马赛克、涂抹修复等高级功能。

向上滑动查看完整开发需求书

"PS 网页工具开发需求书(V1.0)"的文档截图,包含产品概述和详细功能需求

只要二十分钟左右,Qwen3.8-Max 就给出了一个完全可用的网页,功能齐全。

比如调色:

在网页版PS中运用滑块对人像进行调色操作的界面截图

文字框:

网页版PS中图片添加文字“双击编辑文字”和“hi”的演示界面

或者只是用涂抹功能点掉脸上的一颗痣:

一位金发女性在车内大笑,面部有光斑

最终,这款网页版 PS 的功能达成率在 95% 以上,表明模型在多步骤、跨模块的复杂工程任务中,依然保持了较好的目标一致性与执行连续性。

不过,这次测试还不止于此。在项目交付之后,我们又把原来的工程重新交给 Qwen3.8-Max,要求它增加套索选区功能。

这次,模型没有推倒重来,而是在完全理解现有代码结构的基础上,继续修改画布交互、状态管理和工具栏逻辑,把新功能无缝接进了原来的系统。

任务列表页面截图,展示了为现有项目添加"选区工具"功能的开发计划

这意味着,和模型做项目不再是一句话生成用完即止,只要不断提出新需求、反馈问题、调整细节,它还能沿着已有工程持续迭代,在一轮轮交互中不断补齐能力,无限地进化下去。

图像编辑软件界面,带有图层蒙版,最后一帧出现虚线选区轮廓覆盖人物头部及肩部

可以说,Qwen3.8-Max 极大提升了开发的效率。像这样一个网页 PS 软件,在过去的开发流程中可能要一个团队合作一周,而现在只要半小时不到。

而这个结果真正体现的,是 Qwen3.8-Max 对复杂需求的理解和连续执行能力。它能把调色、文字编辑、局部修复等不同功能准确落实为可运行模块,并在多个功能并行开发时保持界面、状态和交互逻辑的一致。

在开发过程中,Qwen3.8-Max 能不断发现自身代码中的错误或效果偏差,并根据运行反馈继续修改,最终把一份产品需求书推进成完成度较高的可用原型。

代码讨论页面截图,展示了修复 openFile 函数中图像尺寸获取 bug 的过程

在实际体验中,这款网页 PS 的各项功能运行较为流畅,从图片上传、编辑处理到最终导出,整个流程均未出现明显异常,整体完成度已经接近可直接使用的产品原型。

接下来,我们将测试的重点转向 Qwen3.8-Max 的原生视觉理解能力。

创建可交互Three.js场景的任务描述截图

在没有图纸、尺寸数据和三维模型的情况下,仅凭一段视频,它能否识别房屋主体的空间结构,并将视频中的二维画面还原为一个可自由交互的 3D 房屋模型?
最终,Qwen3.8-Max 给出的结果同样超出了我们的预期。

现代住宅沙盘交互模型的3D展示画面

Qwen3.8-Max 不仅还原出了房屋主体的三维结构,还为模型加入了丰富的交互与参数调节功能。

从白天到夜晚,用户可以实时改变建筑所处环境的外部光照,直观观察不同时段下的采光、阴影和整体氛围;也可以分别控制房屋内外不同区域的局部灯光,模拟各个空间在实际使用中的照明效果:

同一住宅3D模型在昼夜变化不同光照下的效果对比

甚至连墙面、屋顶、门窗等建筑局部的颜色与材质表现,也能随时修改:

交互界面中拖动滑块改变建筑外墙颜色的过程截图

对于建筑设计行业而言,这意味着设计师可以从现场视频快速生成并实时调整三维方案,将原本跨岗位、反复建模和渲染的流程压缩到同一界面中,大幅降低建模门槛并缩短方案确认周期。

随后,我们进一步测试了 Qwen3.8-Max 的专业分析能力:将苹果于 7 月 30 日发布的最新财报交给模型,由其自主提取核心财务数据,梳理经营亮点与潜在风险,并生成一份投资要点汇报 PPT。

十分钟不到,Qwen3.8-Max 就按照专业投研框架完成了财报分析,输出了一份 8 页的精炼 PPT。

PPT 中不止把原本分散的数据整理成了一张表格,还提炼出了四条核心投资逻辑。

苹果公司FY26 Q3核心财务数据损益表全景
标题为"投资要点与结论"的PPT页面,列有四大投资要点和三项关键跟踪指标

更值得关注的是,模型还分析出了苹果服务业务的高毛利优势、AI 研发投入的长期价值,以及关税退款对当期利润率的阶段性影响。

同时,它也主动提示了存货增长、存储芯片涨价、监管诉讼和搜索分成等风险,并给出后续需要持续跟踪的成本、需求、政策与法律指标。

标题为"风险提示:供应链、监管与贸易政策三重压力"的PPT页面

整体来看,这份 PPT 已接近一份结构完整、逻辑清晰、观点明确的专业投研简报。

综合测试下来,Qwen3.8-Max 给我们的主要体验并不在于某一项能力特别突出,而是综合能力较强,能在真实环境里接住真实需求。

而这种综合能力,已经开始进入科研与产业的真实工作流。

在前沿科研领域,中国科学院大学团队将 Qwen3.8-Max 用于微机电芯片的智能设计。面对结构、物理约束和性能指标高度耦合的问题,模型能够连续完成文献总结、参数提取、结构还原、仿真调用、异常诊断和迭代优化,将原本分散在多个专业工具和环节中的任务连接起来。

到了软件工程场景,这种端到端能力体现得更加直接。菜鸟表示,Qwen3.8-Max 已经能够自主完成从设计、编码、审查到部署的全链路交付,将过去需要多名工程师协同盯守的流程压缩为一次启动、自动闭环。

Qoder 的内部测试则显示,其代码保留率和工具稳定性优于 Opus4.8,中英文混合场景下 Token 效率领先 60%,等效推理速度高出 28%。

结合各种反馈与本次实测,可以说 Qwen3.8-Max 在代码、多模态和长程 Agent 等方面,展现出了全球第一梯队模型的综合实力。

价格方面,Qwen3.8-Max API 每百万 Token 输入 2 美元、输出 6 美元,隐式缓存输入仅需 0.25 美元。放在旗舰模型中,这套定价一定程度上降低了高频调用和长任务运行的成本,也让模型大规模接入真实业务成为可能。

更重磅的是,阿里官方还宣布,下周将在 HuggingFace 和 ModelScope 开放模型权重,这是 Qwen 首次开源 Max 级旗舰模型。

同时,备受开源社区期待的 27B 小尺寸模型也将于下周发布。尽管参数规模小,但社区已经对它寄予厚望,有开发者甚至期待 Qwen3.8-27B 能在部分任务中挑战 Opus 4.7/4.8。

社交媒体上关于Qwen3.8-27B将本地运行的讨论截图

当旗舰性能、可控成本与开放权重同时落地,希望接入我们真实工作流的 Qwen3.8-Max,能把 token 转化成真正的生产力。


黑色背景图,有文字“下面这些按钮,懂我意思吧。”




上一篇:马斯克宣布Grok上线视频分析:36秒破译陶哲轩死磕的科拉茨猜想
下一篇:多Agent代码审查流水线:规划者、执行者、审查者三方协作
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-4 04:46 , Processed in 0.919572 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表