Ollama本地部署大模型:数据不出电脑的方案
不想把数据发给云端 API?用 Ollama 在本地跑大模型,数据不出你的电脑。一、安装
Mac 和 Linux:curl -fsSL https://ollama.com/install.sh | sh
Windows:官网下载安装包,双击装
二、拉模型
ollama pull qwen2.5:7b # 中文最好的开源7B模型
ollama pull llama3.1:8b # Meta的8B模型
ollama pull deepseek-r1:7b # DeepSeek推理模型
7B 模型需要约 5GB 显存。8GB 内存的 Mac 可以跑,但速度一般。有 GPU 的话速度会快很多。
三、运行和对话
ollama run qwen2.5:7b
# 进入交互对话,直接输入问题回车
四、API 调用
Ollama 启动后默认监听 11434 端口,提供 OpenAI 兼容 API:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'
任何支持 OpenAI API 的客户端都能对接。把 base_url 改成 http://localhost:11434/v1 就行。
五、实用配置
[*]修改监听地址:设 OLLAMA_HOST=0.0.0.0 让局域网其他设备也能访问
[*]修改模型存储路径:设 OLLAMA_MODELS=/your/path 避免占满 C 盘
[*]多 GPU 支持:设 CUDA_VISIBLE_DEVICES=0,1 用多卡推理
六、模型选择建议
[*]4GB 显存:qwen2.5:1.5b 或 llama3.2:3b,速度极快但能力有限
[*]8GB 显存:qwen2.5:7b,日常使用足够
[*]16GB 显存:qwen2.5:14b 或 codellama:13b,效果好很多
[*]24GB+ 显存:qwen2.5:32b 或 deepseek-v2:16b,接近 GPT-3.5 水平
https://www.metk.cn/img/posts/ollama_deploy.jpg 有个细节想确认,你说的这个数据是实验室环境还是生产环境跑出来的? 成本这块还可以再拆细一点,隐性的人力投入其实占大头。 说实话这个投入产出比确实得看行业,我们做传统制造的,算下来还不如人工。 同意楼主,但落地的时候一定要考虑老系统的兼容,改造成本容易被低估。 有个坑提醒一下,接口一变整套流程都得跟着改,最好提前做抽象层。 感谢分享,正卡在这个问题上,你的经验省了我不少时间。 同感。这东西不是不能用,是很多人把它当万能药了,场景不对就是白花钱。 这个结论我保留意见,至少在我们行业不太成立,可能跟样本有关。 看完想补充一点:数据合规这块千万别忽略,我们就是因为这个卡了很久。