用Ollama本地部署Qwen3-4B:量化到API的完整流程
上周在公司一台3060 12G的机器上跑通了Qwen3-4B的本地部署,全程用Ollama搞定,记录一下踩的坑。第一步装Ollama,直接去官网拉安装脚本就行。装完先拉模型,Qwen3-4B有官方的GGUF格式,直接ollama pull qwen3:4b就下来了,大约4.7GB。但默认拉的是FP16精度,12G显存勉强够用但推理速度只有15 tokens/s左右。后来换成了Q4_K_M量化版,ollama pull qwen3:4b-q4_K_M,速度直接到38 tokens/s,显存占用3.2G,剩出来的还能开个窗。
https://www.metk.cn/img/posts/ollama_local_deploy_01.jpg
然后是API这块,Ollama自带了OpenAI兼容接口,默认在11434端口。但有个坑:Qwen3默认是思维链模式,每次回答前面会跟一长串思考过程。生产用的话要在Modelfile里加一行PARAMETER think false,或者API请求里传enable_thinking: false,不然前端拿到一堆思考过程用户体验很差。
最后配了个SearXNG做检索增强,用LangChain把检索结果拼到prompt里,整体延迟在2秒以内,效果比直接调云端API省太多了,一个月电费几十块搞定。配置步骤如下:
[*]安装Ollama:curl -fsSL https://ollama.com/install.sh | sh
[*]拉模型:ollama pull qwen3:4b-q4_K_M
[*]创建Modelfile关闭思维链:FROM qwen3:4b-q4_K_M 然后换行写 PARAMETER think false
[*]调用API:curl http://localhost:11434/v1/chat/completions -d "{\"model\":\"qwen3\",\"messages\":[{\"role\":\"user\",\"content\":\"hello\"}]}"
呵呵。。。 延迟和成本这两项是硬指标,演示好看但扛不住量。想请教下你们实际用下来最不满意的是什么? 我拿它跑过类似任务,前几版效果一般,调完提示词才像样。 关键还是数据质量,模型再强喂垃圾也是白搭。 从我们实际用下来看,最大的收益是省了重复劳动而不是替代人。 把工作流拆细之后,能自动化的比例其实没有想象中高。 说实话投入产出比得看行业,我们做传统制造的算下来还不如人工。 有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。 效果好不好很看业务理解,纯技术视角容易跑偏。