
做 AI 应用的人,迟早会撞上同一堵墙:通用大模型什么都懂一点,却不懂你的业务。
想让它学会你公司的客服话术、你的行业黑话、你的代码规范,最直接的路子就是微调。可一打开微调教程——LoRA、QLoRA、DPO、PPO、GaLore、PiSSA……名词比代码还多;换一个模型,配置文件全部重写;想跑一个 7B 模型全参微调,一看显存要求 48G 起步,直接劝退。
今天要介绍的项目,就是来拆这堵墙的:LLaMA-Factory。它在 GitHub 上有 74,841 Star,ACL 2024 论文被引超过 1000 次,Amazon、NVIDIA、阿里云都在用。
01 它到底解决了什么问题
微调的门槛高,不是高在算法,而是高在“杂”。
第一杂是模型杂。 Llama、Qwen、DeepSeek、Gemma、GLM、MiniCPM……每个模型的对话模板、数据格式、分词器都不一样,官方教程各写各的,换个模型等于重新学一遍。
第二杂是方法杂。 全参微调、Freeze、LoRA、QLoRA、DoRA、PiSSA,训练阶段又分预训练、SFT、DPO、KTO、ORPO、SimPO……组合起来几十种可能,哪个适合自己,文档要看三天。
第三杂是显存吓人。 全参微调 7B 模型要 48G 显存起步,普通人根本没有入场资格。
LLaMA-Factory 的一句话定位是:“统一、高效地微调 100+ 个大模型和视觉模型”。所有模型一套模板,所有方法一个配置文件,消费级显卡也能跑。
02 怎么解决的:三板斧
第一板斧:统一模板。 100 多个模型——包括 Llama 4、Qwen3.6、DeepSeek R1、GPT-OSS、GLM-4.5 这些最新旗舰——全部收敛到同一套数据格式和训练接口下。你从 Qwen 切换到 DeepSeek,只需要改配置文件里一个模型名字符串。新模型发布时它做到“Day-0 支持”:Qwen3、Gemma 3、GLM-4.1V 发布当天就能训练。
第二板斧:显存民主化。 靠 QLoRA 低比特量化(支持 2/3/4/5/6/8-bit),7B 模型 4-bit 微调只要 6GB 显存——一张游戏卡就够了;70B 模型 2-bit 量化后 24G 显存装得下。更激进的是配合 KTransformers,用两张 4090 加 CPU 就能微调 1000B 级别的模型。
第三板斧:零代码 WebUI。 运行 llamafactory-cli webui,打开浏览器,在 LlamaBoard 界面里选模型、选数据集、拖参数、点开始,全程不写一行代码。训练过程还可以接入 TensorBoard、Wandb、MLflow、SwanLab 监控。
03 技术栈与开发语言
纯 Python 项目,Apache-2.0 开源协议。底层站在巨人肩膀上:训练靠 PyTorch + Transformers + PEFT + TRL,加速靠 FlashAttention-2、Liger Kernel、Unsloth 集成,推理后端支持 vLLM 和 SGLang,并提供 OpenAI 风格的 API 服务。WebUI 用 Gradio 搭建,国产 NPU 和 AMD ROCm 都有专门适配。
04 怎么安装
推荐源码安装:
git clone --depth 1 https://github.com/hiyouga/LlamaFactory.git
cd LlamaFactory
pip install -e ".[torch,metrics]"
国内用户加一句 export USE_MODELSCOPE_HUB=1,模型权重直接从魔搭下载,不用科学上网。Docker 党直接拉 hiyouga/llamafactory:latest,Windows 用户也有官方支持文档。
05 怎么使用:三条命令走天下
装好之后,整个微调工作流就三条命令:
# 第一步:训练(用官方示例配置,LoRA微调Qwen3)
llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml
# 第二步:边测边聊(和微调中的模型对话)
llamafactory-cli chat examples/inference/qwen3_lora.yaml
# 第三步:合并导出(把LoRA权重合并进基座模型)
llamafactory-cli export examples/merge_lora/qwen3_lora.yaml
所有复杂度都在 YAML 配置文件里,而官方 examples 目录里预置了上百份现成配置,从 Qwen3 的 LoRA 微调到 DeepSeek 的 DPO 对齐,找到最接近的那份改几个字段就能跑。数据准备上,配合开源的 Easy Dataset、DataFlow、GraphGen 可以自动生成合成训练数据,中文生态友好。
06 写在最后
微调这件事,正在从“算法工程师的专利”变成“应用开发者的日常操作”。LLaMA-Factory 的 74,841 个 Star 说明了一件事:降低门槛的项目,永远不缺用户。
如果你手里有一张游戏显卡,又想让大模型学会你自己的数据,从这个项目开始,成本最低。
项目地址:https://github.com/hiyouga/LlamaFactory