一、Qwen3.8-27B 介绍
Qwen3.8-27B 是阿里巴巴千问团队在 2026-08-14 开源的 27B Dense 原生多模态大模型,属于当前 Qwen 开源模型家族中能力最强的一代。它基于 Qwen3.5 架构演进而来,在编程能力、智能体执行和多模态理解等多个维度都实现了明显提升。
下面先看官方公布的评测结果。
文本性能

VL 性能


从官方公布的评测结果来看,Qwen3.8-27B 相比 Qwen3.6-27B 在主流智能体编程基准上提升显著:
| 基准测试 |
Qwen3.6-27B |
Qwen3.8-27B |
提升幅度 |
| Terminal Bench 2.1(Terminus) |
63.4 |
73.0 |
+15% |
| SWE-bench Pro |
53.5 |
61.7 |
+15% |
| DeepSWE 1.1 |
13.3 |
42.2 |
+217% |
| QwenSWEBench |
49.3 |
79.0 |
+60% |
| NL2Repo-Bench |
36.2 |
42.3 |
+17% |
| CoWorkBench |
61.0 |
70.7 |
+16% |
| JobBench |
21.8 |
33.4 |
+53% |
Qwen3.8-27B 原生支持多模态能力(图像和视频理解),上下文长度为 262,144 tokens,可扩展至 1,000,000 tokens。思考模式默认开启,支持通过 reasoning_effort 参数调节推理深度(low / medium / xhigh),并且默认启用 preserve_thinking 保留历史推理上下文,这一点对长对话场景下的智能体任务尤其重要。
此前我们介绍过 Claude Code 结合 Qwen3.6-27B 私有化模型做开发任务的做法,而 Qwen3.8-27B 给出了更好的能力表现。把常规的代码补全、重构、文档生成等任务交给本地私有化部署的 Qwen3.8-27B,既能节省 Token 成本,又能获得接近收费模型的编程体验。
因此本文重点介绍 Qwen3.8-27B 的本地私有化部署过程,以及如何让 Claude Code 指向私有化部署的模型做开发测试。整体模型部署采用 vLLM 引擎。
下面是本次实验的主要依赖版本:
torch==2.10.0
vllm>=0.17.0
transformers==4.57.6
modelscope==1.34.0
其中由于 Claude Code 默认使用 Anthropic 协议,而 vLLM 从 0.17.0 版本才集成 Anthropic 协议,所以 vLLM 的版本必须大于等于 v0.17.0。
二、vLLM 私有化部署 Qwen3.8-27B
2.1 部署 vLLM
安装 vLLM,并让它自动安装对应的 torch:
uv pip install "vllm>=0.17.0" --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly
2.2 下载 Qwen3.8-27B 模型
这里使用 modelscope 快速下载模型到本地:
modelscope download --model="Qwen/Qwen3.8-27B" --local_dir Qwen3.8-27B

下载完成后的目录内容如下:

2.3 部署并运行模型
使用 vLLM 启动 API 服务:
export CUDA_VISIBLE_DEVICES=0,1
vllm serve "Qwen3.8-27B" \
--host 0.0.0.0 \
--port 8000 \
--dtype bfloat16 \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.8 \
--api-key token-abc123 \
--enable-prefix-caching \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--trust-remote-code
关键参数说明如下:
| 参数 |
说明 |
export CUDA_VISIBLE_DEVICES=0,1 |
指定使用的 GPU 设备,根据实际 GPU 数量配置,这里使用两块 GPU |
dtype |
数据类型,bfloat16 为 16 位浮点数 |
tensor-parallel-size |
Tensor 并行的数量,多 GPU 分布式推理时使用,建议和 GPU 的数量一致 |
gpu-memory-utilization |
设置 GPU 内存利用率的上限 |
api-key |
API 认证密钥 |
enable-prefix-caching |
启用前缀缓存减少重复计算 |
reasoning-parser |
指定推理解析器 |
enable-auto-tool-choice |
启用自动工具选择 |
tool-call-parser |
工具调用解析器 |

启动后的显存占用情况如下:

如果启动时显存不足,可以根据实际设备情况调整 gpu-memory-utilization,或者添加 max-model-len 参数;也可以通过 cpu-offload-gb 将部分模型权重卸载到内存中,不过这样会影响运行效率。
2.4 curl 访问测试
先用 OpenAI 协议格式访问测试:
curl http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer token-abc123" \
-d '{
"model": "Qwen3.8-27B",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "你是谁,你认识小毕超吗?"}
]
}'
运行结果:

再用 Anthropic 协议测试:
curl http://127.0.0.1:8000/v1/messages \
-H "Content-Type: application/json" \
-H "Authorization: Bearer token-abc123" \
-d '{
"model": "Qwen3.8-27B",
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "你是谁,你认识小毕超吗?"}
],
"max_tokens": 1024
}'
运行结果:

2.5 Python OpenAI 连接测试
使用 Python 的 OpenAI SDK 进行连接测试:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:8000/v1/",
api_key="token-abc123"
)
chat_response = client.chat.completions.create(
model="Qwen3.8-27B",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "你是谁,你认识小毕超吗?"}
],
max_tokens=1024,
temperature=0.7,
top_p=0.8,
presence_penalty=1.5,
extra_body={
"top_k": 20,
"chat_template_kwargs": {"enable_thinking": False},
},
)
print("Chat response:", chat_response)

2.6 Cherry Studio 连接测试
在 Cherry Studio 中添加一个 OpenAI 类型提供商,配置 API 地址和密钥,然后点击管理增加模型:

选用该模型进行问答:

2.7 图片交互测试
发送一张评测图片,让模型分析内容:



三、Claude Code 连接模型并使用
3.1 Claude Code 连接私有模型
在 cmd 控制台中输入以下指令,配置系统环境变量:
setx ANTHROPIC_BASE_URL "http://127.0.0.1:8000"
setx ANTHROPIC_AUTH_TOKEN "token-abc123"
setx ANTHROPIC_MODEL "Qwen3.8-27B"
setx ANTHROPIC_SMALL_FAST_MODEL "Qwen3.8-27B"
然后关闭当前 cmd,重新打开 cmd 并进入 claude,测试连接是否正常:

如果看到当前使用的是 Qwen3.8-27B 模型,并且可以正常问答,就说明环境配置成功了。
3.2 应用测试:开发一个 3D 地球数据可视化页面
输入提示词:
在tmp目录下,创建一个 3D 地球数据可视化页面,单个 HTML 文件实现,要求:
1. 使用 Three.js 渲染 3D 地球模型
2. 地球可以鼠标拖拽旋转、滚轮缩放
3. 在地球表面标注主要城市(北京、上海、纽约、伦敦等)
4. 城市之间显示连接线(模拟数据传输路径)
5. 连接线有动画效果(光点流动)
6. 暗色科技风格,添加星空背景

实现完成:

运行一切正常,所有需求都实现了,动画效果也非常流畅。整个流程走下来,本地私有化部署的 Qwen3.8-27B 配合 Claude Code 已经能够胜任这类前端可视化页面的完整开发任务,而且省去了外部 API 调用成本,是一次相当顺畅的落地实践。