查看: 79|回复: 59

[相关教程] 用LoRA微调Qwen3-7B:从数据准备到部署上线手记

[复制链接]

96

主题

5

回帖

951

积分

UID
2
贡献
9 点
钻石
7 个
C币
993 个
发表于 2026-3-2 14:45:59 | 显示全部楼层 |阅读模式
为什么是LoRA不是全参

业务要个垂直领域的问答模型,base选Qwen3-7B。全参微调7B要8张A100跑12小时,成本4000元。LoRA只训adapter,单张3090跑4小时,成本50元,效果差3个点,性价比完胜。记录从数据到部署的流程。


  • 数据准备:收集2万条业务问答对,格式JSONL,每条 {"instruction":"","input":"","output":""}。清洗去重,把长度超1024的截断。
  • LoRA配置:rank=16, alpha=32, target_modules 选 q_proj、k_proj、v_proj、o_proj、gate_proj,dropout=0.05。
  • 训练:LLaMA-Factory框架,单卡命令见代码块,bs=4, grad_accum=8, epoch=3, lr=2e-4。
  • 合并:训完的adapter用peft merge到base,导出完整权重,方便部署。


训练命令
  1. llamafactory-cli train \
  2.   --model_name_or_path Qwen/Qwen3-7B \
  3.   --dataset qa_data \
  4.   --finetuning_type lora \
  5.   --lora_rank 16 --lora_alpha 32 \
  6.   --lora_target q_proj,k_proj,v_proj,o_proj,gate_proj \
  7.   --output_dir ./qwen3-7b-lora \
  8.   --per_device_train_batch_size 4 \
  9.   --gradient_accumulation_steps 8 \
  10.   --num_train_epochs 3 \
  11.   --learning_rate 2e-4 \
  12.   --bf16 True
复制代码

部署

合并后用vLLM起服务,--port 8000,单卡3090显存24G够。QPS在我们业务上能到8,p99延迟1.2秒。如果显存不够可以量化到INT8,损失1.5个点准确率但显存砍一半。

最大坑是数据质量。2万条里一开始有3000条问答不对应(问A答B),训出来模型答非所问。清洗规则:问题去重、答案长度50到500字、问和答的余弦相似度大于0.3。清洗完剩1.6万条,效果反而更好。

温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
回复

使用道具 举报

匿名  发表于 2026-9-17 18:32:15
路过的帮顶
回复

使用道具

0

主题

389

回帖

53

积分

UID
990420
贡献
0 点
钻石
0 个
C币
1 个
发表于 2026-9-17 18:37:29 | 显示全部楼层
我试过几个同类工具,效果差别挺大的,关键看数据和场景匹配度。
回复

使用道具 举报

0

主题

387

回帖

0

积分

UID
314575
贡献
0 点
钻石
0 个
C币
0 个
发表于 2026-9-17 18:45:40 | 显示全部楼层
开源方案胜在可控,闭源胜在省事,取舍看团队能力。这套方案在数据量大的时候表现如何?
回复

使用道具 举报

0

主题

387

回帖

50

积分

UID
767379
贡献
0 点
钻石
0 个
C币
0 个
发表于 2026-9-17 18:47:59 | 显示全部楼层
推理成本算下来并不低,规模化之前得先把这块压下去。
回复

使用道具 举报

0

主题

377

回帖

54

积分

UID
655918
贡献
0 点
钻石
0 个
C币
0 个
发表于 2026-9-17 18:50:17 | 显示全部楼层
真正跑通的案例里,投入的人力成本往往被忽略不计了。这套方案在数据量大的时候表现如何?
回复

使用道具 举报

0

主题

402

回帖

49

积分

UID
407261
贡献
0 点
钻石
0 个
C币
0 个
发表于 2026-9-17 18:52:46 | 显示全部楼层
最容易被忽略的是评估环节,没有好的评测集根本没法优化。你们的延迟和成本大概什么水平?
回复

使用道具 举报

0

主题

382

回帖

52

积分

UID
413472
贡献
0 点
钻石
0 个
C币
0 个
发表于 2026-9-17 18:54:40 | 显示全部楼层
延迟和成本这两项是硬指标,演示好看但扛不住量。有对比过同类的其他方案吗?
回复

使用道具 举报

0

主题

378

回帖

36

积分

UID
501439
贡献
0 点
钻石
0 个
C币
1 个
发表于 2026-9-17 18:57:10 | 显示全部楼层
冷启动阶段最难,没有历史数据就没法做效果对比。有没有踩过什么比较大的坑?
回复

使用道具 举报

0

主题

383

回帖

0

积分

UID
354622
贡献
0 点
钻石
0 个
C币
0 个
发表于 2026-9-17 18:59:59 | 显示全部楼层
评估标准不统一的话,各家都说自己效果好,没法比。有没有踩过什么比较大的坑?
回复

使用道具 举报

温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
您需要登录后才可以回帖 登录 | 立即加入

本版积分规则

QQ客服返回顶部