咨询发布 发表于 2026-8-20 15:38:12

用Ollama本地部署Qwen3-4B:量化到API的完整流程

上周在公司一台3060 12G的机器上跑通了Qwen3-4B的本地部署,全程用Ollama搞定,记录一下踩的坑。

第一步装Ollama,直接去官网拉安装脚本就行。装完先拉模型,Qwen3-4B有官方的GGUF格式,直接ollama pull qwen3:4b就下来了,大约4.7GB。但默认拉的是FP16精度,12G显存勉强够用但推理速度只有15 tokens/s左右。后来换成了Q4_K_M量化版,ollama pull qwen3:4b-q4_K_M,速度直接到38 tokens/s,显存占用3.2G,剩出来的还能开个窗。

https://www.metk.cn/img/posts/ollama_local_deploy_01.jpg

然后是API这块,Ollama自带了OpenAI兼容接口,默认在11434端口。但有个坑:Qwen3默认是思维链模式,每次回答前面会跟一长串思考过程。生产用的话要在Modelfile里加一行PARAMETER think false,或者API请求里传enable_thinking: false,不然前端拿到一堆思考过程用户体验很差。

最后配了个SearXNG做检索增强,用LangChain把检索结果拼到prompt里,整体延迟在2秒以内,效果比直接调云端API省太多了,一个月电费几十块搞定。配置步骤如下:


[*]安装Ollama:curl -fsSL https://ollama.com/install.sh | sh
[*]拉模型:ollama pull qwen3:4b-q4_K_M
[*]创建Modelfile关闭思维链:FROM qwen3:4b-q4_K_M 然后换行写 PARAMETER think false
[*]调用API:curl http://localhost:11434/v1/chat/completions -d "{\"model\":\"qwen3\",\"messages\":[{\"role\":\"user\",\"content\":\"hello\"}]}"

发表于 2026-9-17 18:33:41

呵呵。。。

一苇 发表于 2026-9-17 18:42:56

延迟和成本这两项是硬指标,演示好看但扛不住量。想请教下你们实际用下来最不满意的是什么?

阿澈10 发表于 2026-9-17 18:47:24

我拿它跑过类似任务,前几版效果一般,调完提示词才像样。

有点困慢半拍 发表于 2026-9-17 18:50:10

关键还是数据质量,模型再强喂垃圾也是白搭。

野渡 发表于 2026-9-17 18:53:39

从我们实际用下来看,最大的收益是省了重复劳动而不是替代人。

浅夏杂谈 发表于 2026-9-17 18:56:12

把工作流拆细之后,能自动化的比例其实没有想象中高。

野渡的猫 发表于 2026-9-17 18:59:27

说实话投入产出比得看行业,我们做传统制造的算下来还不如人工。

有点困看海 发表于 2026-9-17 19:01:42

有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。

半夏听雨 发表于 2026-9-17 19:04:44

效果好不好很看业务理解,纯技术视角容易跑偏。
页: [1] 2 3 4 5
查看完整版本: 用Ollama本地部署Qwen3-4B:量化到API的完整流程