Qwen3.8-Flash,现已正式上线模力方舟。

真实研发场景里的 Agent ,核心不是单次问答,而是反复试错的高频长循环(Agentic Loop):读文件、跑测试、抓报错、调代码。多轮交互下来,旗舰模型往往太慢,轻量模型又容易卡在幻觉死循环中。
Qwen3.8-Flash 正是为此而来。
作为通义千问披露的下一代 Qwen4 架构前瞻之作,它采用极小激活 MoE 架构——在 125B 总参数规模下,单 Token 激活参数仅约 6B,同时原生支持 1M 超长上下文与多模态理解。
它的核心目标非常直接:打破高频 Agent 循环的吞吐瓶颈,以极低延迟和扎实工程能力,让多轮自动化试错真正跑得起来。
核心底座:提前预览 Qwen4 架构

为什么它能兼顾极高吞吐与扎实工程能力?关键在于其下一代架构解法:
- 6B 极小激活 MoE:125B 总参数下单 Token 仅激活约 6B(激活比低于 5%),既有小模型的毫秒级响应与高吞吐,又保留了大模型的通用知识;
- 全新混合注意力:融合 QSA 稀疏注意力(Qwen Sparse Attention)与 Gated DeltaNet(GDN),引入门控残差,长上下文计算效率大幅跃升;
- 1M 上下文与原生多模态:原生支持 262K,通过 YaRN 扩展至 1M(100 万 Tokens),原生支持文本、代码与 GUI 界面理解。
基准实测:小身板扛住真实工程任务
对工程团队而言,极致的响应速度必须建立在能干活的前提下。根据官方公布的多项权威基准测试,Qwen3.8-Flash 与主流模型的表现对比如下:
| 评估基准 / 维度 |
评估重点领域 |
Qwen3.8-Flash(6B 激活) |
Qwen3.8-Max(2.4T 旗舰) |
DeepSeek V4 Flash |
| SWE-bench Pro |
真实生产环境复杂代码 Issue 解决 |
62.5 |
67.7 |
54.4* |
| CoWorkBench |
跨工具多步骤协同与任务拆解 |
73.9 |
- |
- |
| AndroidWorld |
移动端 GUI 自动化操作与执行 |
84.5 |
86.1 |
- |
| 上下文窗口 |
大型代码仓库与长日志理解 |
1M |
1M |
1M |
- 注:以上数据整理自各官方公布的模型卡与开源基准评测。
在考验代码修复与真实工具链能力的 SWE-bench Pro 上,Qwen3.8-Flash 拿下 62.5 的高分,紧咬 2.4T 旗舰 Qwen3.8-Max(67.7)。在移动端环境交互测试 AndroidWorld 中,也取得了 84.5 的优异成绩。
这证明在常见的代码定位、函数级修改、终端命令调用与报错反馈处理上,Qwen3.8-Flash 已经具备稳定可靠的工程执行基线。
选型建议:别让 Max 干 Flash 的活
我们始终建议团队克制评估、按需分流:
- 优先交给 Qwen3.8-Flash:高频多轮 Agent 试错、CI/CD 自动化审代码、单元测试生成、全仓依赖扫描与实时代码补全;
- 依然交给 Qwen3.8-Max:跨越数十个子系统的顶层架构重构、前沿算法推导等长周期零容错攻坚任务。
日常让 Flash 铺满高频长循环,关键硬仗再呼叫 Max。
立即在模力方舟体验
无需自备多卡算力,无需折腾复杂的推理引擎编译,开箱即用。
目前,Qwen3.8-Flash 已正式在模力方舟上线。欢迎登录控制台获取 API 密钥,把你的 Agent 与自动化工作流接入新一代高吞吐基座。云栈社区后续也会持续关注这类高吞吐模型在真实开发场景中的落地表现。
🔗 在线体验链接:
https://moark.com/serverless-api?model=qwen3.8-flash
|