找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4565

积分

0

好友

595

主题
发表于 2 小时前 | 查看: 4| 回复: 0

一、Qwen3.8-27B 介绍

Qwen3.8-27B 是阿里巴巴千问团队在 2026-08-14 开源27B Dense 原生多模态大模型,属于当前 Qwen 开源模型家族中能力最强的一代。它基于 Qwen3.5 架构演进而来,在编程能力、智能体执行和多模态理解等多个维度都实现了明显提升。

下面先看官方公布的评测结果。

文本性能

Qwen3.8-27B 与其他模型文本性能评测对比表

VL 性能

Qwen3.8-27B 与其他模型VL多模态性能对比表

Qwen3.8-27B 与其他模型通用多模态评测对比表

从官方公布的评测结果来看,Qwen3.8-27B 相比 Qwen3.6-27B 在主流智能体编程基准上提升显著:

基准测试 Qwen3.6-27B Qwen3.8-27B 提升幅度
Terminal Bench 2.1(Terminus) 63.4 73.0 +15%
SWE-bench Pro 53.5 61.7 +15%
DeepSWE 1.1 13.3 42.2 +217%
QwenSWEBench 49.3 79.0 +60%
NL2Repo-Bench 36.2 42.3 +17%
CoWorkBench 61.0 70.7 +16%
JobBench 21.8 33.4 +53%

Qwen3.8-27B 原生支持多模态能力(图像和视频理解),上下文长度为 262,144 tokens,可扩展至 1,000,000 tokens。思考模式默认开启,支持通过 reasoning_effort 参数调节推理深度(low / medium / xhigh),并且默认启用 preserve_thinking 保留历史推理上下文,这一点对长对话场景下的智能体任务尤其重要。

此前我们介绍过 Claude Code 结合 Qwen3.6-27B 私有化模型做开发任务的做法,而 Qwen3.8-27B 给出了更好的能力表现。把常规的代码补全、重构、文档生成等任务交给本地私有化部署的 Qwen3.8-27B,既能节省 Token 成本,又能获得接近收费模型的编程体验。

因此本文重点介绍 Qwen3.8-27B 的本地私有化部署过程,以及如何让 Claude Code 指向私有化部署的模型做开发测试。整体模型部署采用 vLLM 引擎。

下面是本次实验的主要依赖版本:

torch==2.10.0
vllm>=0.17.0
transformers==4.57.6
modelscope==1.34.0

其中由于 Claude Code 默认使用 Anthropic 协议,而 vLLM0.17.0 版本才集成 Anthropic 协议,所以 vLLM 的版本必须大于等于 v0.17.0

二、vLLM 私有化部署 Qwen3.8-27B

2.1 部署 vLLM

安装 vLLM,并让它自动安装对应的 torch

uv pip install "vllm>=0.17.0" --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly

2.2 下载 Qwen3.8-27B 模型

这里使用 modelscope 快速下载模型到本地:

modelscope download --model="Qwen/Qwen3.8-27B" --local_dir Qwen3.8-27B

modelscope 下载 Qwen3.8-27B 模型进度日志

下载完成后的目录内容如下:

Qwen3.8-27B 模型文件目录列表

2.3 部署并运行模型

使用 vLLM 启动 API 服务:

export CUDA_VISIBLE_DEVICES=0,1

vllm serve "Qwen3.8-27B" \
  --host 0.0.0.0 \
  --port 8000 \
  --dtype bfloat16 \
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.8 \
  --api-key token-abc123 \
  --enable-prefix-caching \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --trust-remote-code

关键参数说明如下:

参数 说明
export CUDA_VISIBLE_DEVICES=0,1 指定使用的 GPU 设备,根据实际 GPU 数量配置,这里使用两块 GPU
dtype 数据类型,bfloat16 为 16 位浮点数
tensor-parallel-size Tensor 并行的数量,多 GPU 分布式推理时使用,建议和 GPU 的数量一致
gpu-memory-utilization 设置 GPU 内存利用率的上限
api-key API 认证密钥
enable-prefix-caching 启用前缀缓存减少重复计算
reasoning-parser 指定推理解析器
enable-auto-tool-choice 启用自动工具选择
tool-call-parser 工具调用解析器

vLLM 启动 API 服务日志

启动后的显存占用情况如下:

NVIDIA-SMI GPU 显存占用监控

如果启动时显存不足,可以根据实际设备情况调整 gpu-memory-utilization,或者添加 max-model-len 参数;也可以通过 cpu-offload-gb 将部分模型权重卸载到内存中,不过这样会影响运行效率。

2.4 curl 访问测试

先用 OpenAI 协议格式访问测试:

curl http://127.0.0.1:8000/v1/chat/completions \
    -H "Content-Type: application/json" \
    -H "Authorization: Bearer token-abc123" \
    -d '{
        "model": "Qwen3.8-27B",
        "messages": [
            {"role": "system", "content": "You are a helpful assistant."},
            {"role": "user", "content": "你是谁,你认识小毕超吗?"}
        ]
    }'

运行结果:

curl OpenAI 协议接口测试结果

再用 Anthropic 协议测试:

curl http://127.0.0.1:8000/v1/messages \
    -H "Content-Type: application/json" \
    -H "Authorization: Bearer token-abc123" \
    -d '{
        "model": "Qwen3.8-27B",
        "system": "You are a helpful assistant.",
        "messages": [
            {"role": "user", "content": "你是谁,你认识小毕超吗?"}
        ],
        "max_tokens": 1024
    }'

运行结果:

curl Anthropic 协议接口测试结果

2.5 Python OpenAI 连接测试

使用 Python 的 OpenAI SDK 进行连接测试:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1/",
    api_key="token-abc123"
)

chat_response = client.chat.completions.create(
    model="Qwen3.8-27B",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "你是谁,你认识小毕超吗?"}
    ],
    max_tokens=1024,
    temperature=0.7,
    top_p=0.8,
    presence_penalty=1.5,
    extra_body={
        "top_k": 20,
        "chat_template_kwargs": {"enable_thinking": False},
    },
)
print("Chat response:", chat_response)

Python OpenAI SDK 连接测试输出

2.6 Cherry Studio 连接测试

在 Cherry Studio 中添加一个 OpenAI 类型提供商,配置 API 地址和密钥,然后点击管理增加模型:

Cherry Studio 配置 API 地址和模型

选用该模型进行问答:

Cherry Studio 对话测试 Qwen3.8-27B

2.7 图片交互测试

发送一张评测图片,让模型分析内容:

Qwen3.8-27B 图片理解对话测试

Qwen3.8-27B 评测报告分析

Qwen3.8-27B 图片评测总结输出

三、Claude Code 连接模型并使用

3.1 Claude Code 连接私有模型

cmd 控制台中输入以下指令,配置系统环境变量:

setx ANTHROPIC_BASE_URL "http://127.0.0.1:8000"
setx ANTHROPIC_AUTH_TOKEN "token-abc123"
setx ANTHROPIC_MODEL "Qwen3.8-27B"
setx ANTHROPIC_SMALL_FAST_MODEL "Qwen3.8-27B"

然后关闭当前 cmd,重新打开 cmd 并进入 claude,测试连接是否正常:

Claude Code 连接 Qwen3.8-27B 欢迎界面

如果看到当前使用的是 Qwen3.8-27B 模型,并且可以正常问答,就说明环境配置成功了。

3.2 应用测试:开发一个 3D 地球数据可视化页面

输入提示词:

在tmp目录下,创建一个 3D 地球数据可视化页面,单个 HTML 文件实现,要求:
1. 使用 Three.js 渲染 3D 地球模型
2. 地球可以鼠标拖拽旋转、滚轮缩放
3. 在地球表面标注主要城市(北京、上海、纽约、伦敦等)
4. 城市之间显示连接线(模拟数据传输路径)
5. 连接线有动画效果(光点流动)
6. 暗色科技风格,添加星空背景

Claude Code 开发 3D 地球数据可视化页面过程

实现完成:

Claude Code 实现 3D 地球页面效果

运行一切正常,所有需求都实现了,动画效果也非常流畅。整个流程走下来,本地私有化部署的 Qwen3.8-27B 配合 Claude Code 已经能够胜任这类前端可视化页面的完整开发任务,而且省去了外部 API 调用成本,是一次相当顺畅的落地实践。




上一篇:DeepSeek Harness 从0到1全解析:插件化 Agent 框架与 Cordis 内核
下一篇:Java 对象命名搞不清?PO、VO、BO、DTO、DAO、POJO 区别一次讲透
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-17 03:31 , Processed in 0.874778 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表