算泥社区是集 “AI 大模型开发服务 + 算法 + 算力” 于一体的开源生态社区,欢迎关注!
Qwen3.8-27B 杀疯了!
阿里 Qwen 团队开源 Qwen3.8-27B,上线 2 天登顶 Hugging Face 全球大模型趋势榜,下载破百万(包括 FP8),unsloth 量化版更是接近 3 百万下载量。

海外开发者对比实测后,送了个外号,叫“本地 Opus4.6”。
人工智能分析指数中,一个不足 30B 参数的模型,性能超过 4 个月前发布的所有模型,包括 Opus4.6。


性能被评定为与 DeepSeek V4-Pro 和 GPT 5.6 Luna 相当。这是首次有本地模型达到顶尖模型的水平。

量化后,塞进 17GB 内存的电脑就能跑。
它还是原生多模态 Dense(稠密)模型,能看图、识视频,262K 原生上下文,YaRN 外推到 1M,Apache 2.0 协议放开商用。
编程和 Agent,摊开看
SWE-bench Pro 真实修代码拿 61.7 分,Opus4.6 Max 为 53.4 分。
DeepSWE 1.1 拿 42.2,约是前代 13.3 的 3 倍。除了少数几个性能非常接近 Opus4.6 Max,其余所有均超越 Opus4.6 Max。
完整文本性能表如下:

Agent 和办公行同样稳。CoWorkBench 长时办公任务 70.7 分,压过 Opus4.6 Max 的 68.2。
JobBench 专业任务 33.4 分。Agents' Last Exam 的 Pass@1 拿 20.4,接近前代 10.6 的两倍。
指令遵循 IFBench 79.5 分,竞赛编程 LiveCodeBench v6 90.3 分,都是全列最高。
一个 27B 稠密模型,能和一众 max 版、high 版大模型坐同一张桌。
眼睛,原生的
多模态长在架构里。Qwen3.8-27B 天生懂图像和视频,上到 STEM 图表、文档,下到小时级视频,都能直接读。
多模态完整跑分如下:

OSWorld-Verified 电脑操作 84.3 分,高出 Opus4.6 Max 11.6 分。
AndroidWorld 手机操作 81.9 分。
WebArena-Verified 浏览器操作 64.8 分,比前代高 9.5 分。
视觉推理项里,不算工具辅助,MathVision 90.0 分对 65.5 分,BabyVision 65.7 分对 12.6 分,CharXiv 图表分析 83.7 分对 66.0 分,Opus4.6 Max 三项全输。
读截图、点按钮、填表格、操作浏览器和手机,配上前面的代码能力,电脑操作 Agent 的闭环齐了。
家里,跑得动
27B 如今是社区最欢迎的尺寸,量化后能装进笔记本,消费级显卡就能跑。
Unsloth 量化后,17GB 内存的配置就能跑起来。

通过 Atomic Dynamic GGUF 模型压缩,从 8 位的 28.9GB 到 1 位的 8.5GB 都有。

SGLang、Ollama、vLLM 等当天就跟进。

有开发者惊叹:我们已经生活在一个新的世界。我们的桌子上摆放着无限且免费使用的超级智能设备。

只需要一台 RTX 5090 显卡,就能拥有相当于 Opus 4.8 级别的智能水平。
全球开发者都玩疯了,Simon Willison 表示已经记不清上次如此愉快地玩一个在自家电脑上运行的本地模型是什么时候了。

模型思考模式默认开,可以按请求关掉,reasoning_effort(推理强度)调深度,preserve_thinking(保留历史思考)留下历史推理。
Simon Willison 上手发现,默认 reasoning_effort 是 xhigh,模型想得太多。他的建议先从 low 或无推理起步。
Qwen3.8-27B 把代码和 Agent 跑分拉到 Opus 档位,权重、思考深度、数据安全的钥匙一并交给了你。
下载,跑起来,让它干活。
参考资料:
https://huggingface.co/Qwen/Qwen3.8-27B
https://modelscope.cn/models/Qwen/Qwen3.8-27B
https://github.com/AlibabaCloud-Official/Qwen3.8-27B
https://simonw.substack.com/p/qwen-38-27b-is-excellent-but-it-defaults
END