过去想让 Agent 调用工具帮忙干活,多少都得是上百亿参数的大模型才行。
而就在前几天,这条规矩被打破了。科大讯飞全资子公司「词元星火」开源了两款端侧模型,分别是 Spark-X2.5-1.7B 和 Spark-X2.5-4B,直接把 Agent 能力装进了小模型里。
从官方的评测得分来看,多项能力远超同尺寸的开源模型,尤其是 Agent 任务这块断层领先。

另外模型还原生支持 100 万 Token 上下文,整个大项目丢进去都装得下,Agent 跑长任务也不容易断片。
说实话,一开始我看到这个尺寸的小模型,对它真实的能力并没有抱太大期待。结果经过一圈测试下来,发现将它离线跑在一台笔记本电脑里,所能干的活还真不少。
趁着这次实测,顺便也跟大家介绍一下,我是如何在自己本地电脑部署和使用这些端侧模型的。
话不多说,下面可以跟着我上手部署和使用。
一句话,让 AI 把模型部署到本地
在开始部署前,我先了解到模型兼容 SGLang、vLLM、llama.cpp 这些主流推理框架。
同时还需要找到模型权重的开源地址,一般都是在 Hugging Face 或者 ModelScope 上。
然后选择自己熟悉的 Agent 工具,可以是 Claude Code 或者 Codex,只需发送一句话:
帮我在本地部署这个开源模型 https://huggingface.co/XHToken/Spark-X2.5-1.7B,按 README 用 llama.cpp 方式,跑通后起一个本地服务

然后 AI 会先检查我们的电脑配置和环境,给出判断这台机器适不适合部署这个模型。
如果适合,就会继续去下载模型、编译、并部署启动服务,全程都不需要我插手。
不用多久部署完成,可以将模型接入任何兼容 OpenAI 或 Anthropic 协议的工具。

另外 llama.cpp 自带 WebUI,打开浏览器访问服务地址,就能直接使用模型。前面我部署的是 Spark-X2.5-1.7B 模型,试了下每秒能吐 28 个 token,比我预想的流畅。

顺手挂到翻译工具上,白嫖一个翻译引擎
模型支持了 200 多种语言,部署完成时我第一反应,就是想把它接到我电脑里的翻译工具。
配置不复杂,服务商选 OpenAI,请求地址就填本地服务地址,模型名对上,API Key 随便填一个就行。

随手从 Spark-X2.5 的开源项目 README 文件里,拿一段英文介绍文案扔给它。翻译结果几乎瞬间出来,而且质量还很高,关键是不用花一分钱,还能本地离线使用。

把 Codex 的大脑,换成本地 4B
接着将 4B 模型接入到 Codex,这里我会用到 CC Switch 工具,方便切换而且简单。
如果想接入到 Claude Code 同样也是可以的,步骤上跟 Codex 差不多,我就不一一演示。打开 CC Switch 切换到 Codex,再点击右边加号「新添加供应商」,主要填入以下信息。
供应商名称和 API Key 可以随便填,其中「API 请求地址」是自己本地部署的服务地址。

再滑下去「默认模型」填自己部署的模型 ID,上游格式选择「Responses(原生)」。
至于模型映射里的上下文窗口,根据自己部署时设置的长度进行填写,这些有不懂的都可以问 AI。

回到 CC Switch 主页的时候,记得将新增的供应商启用,也可以顺便测试一下连接是否正常。
接着到终端里启动 Codex,在模型那个位置上看到是 Spark-X2.5-4B,就说明可以使用它了。

先试个简单的活,让它了解一整个开源项目,指令上我只发项目的 GitHub 地址给它。它自己调用工具,把项目拉到本地,读取项目代码,查看 README 文件介绍。最后为我总结出这个项目是干嘛的、有什么特性、以及怎么安装使用。

接着上难度。前不久跟大家介绍过的画图技能 Archify,产出的架构图刚好是 HTML 文件。我就想可以测试它,能否正常调用 Agent 工具的技能,以及编写代码的能力。
直接发送一句话,让它使用 Archify 技能给项目生成一张架构图,接着我便观察它的过程。
可以看到它先读取技能的使用说明,然后再查看项目核心文件,确保细节以及画图的准确性。了解完项目后,再调用技能开始撰写代码生成架构图,整个过程步骤相当多。

作为一个仅仅只有 4B 参数的模型来说,这个表现真的有点出乎我的意料。
最后看一下 HTML 文件的架构图效果,整体信息量很多,看完基本对项目有了解。也说实话,仔细看还是有点小问题,比如字体太小、部分组件位置放错,还有少了一些动效。但我觉得对于 Spark-X2.5-4B 这种端侧模型来说,做到这效果已经很好了。

写在最后
过去大部分人脑子里,可能都会觉得小模型就是一个简单的对话玩具。但这次 Spark-X2.5-4B 模型的表现,不仅能读完整个项目代码,还能调用工具使用技能。
这不就是,那些所谓的大模型才有的 Agent 能力吗?现在一个 4B 模型跑在本地就能做到。
在我看来,真正卡住 AI 进入很多行业的,从来不是模型能力,而是自己的数据不能外出。就如医疗、法务、金融这些对数据极其敏感的行业,AI 需求一直在,卡的就是这一条。
当模型的 Agent 能力可以装进端侧本地运行,这些行业的应用场景将会大量落地。接下来一两年,端侧模型在这些数据敏感的行业里落地的案例,将会比云端 Agent 更快。
目前,模型权重已毫无保留的开源到了 HuggingFace 和魔搭,大家都能直接下载部署。另外 GitHub 仓库里也有完整的部署文档,感兴趣的朋友可以自己跑一个试试。
不想折腾本地部署的,讯飞星辰 MaaS 平台也有对应的 API 调用,而且目前限时免费。
资源地址汇总:
今天的分享到此结束,感谢大家抽空阅读,我们下期再见。