咨询发布 发表于 2026-2-8 22:07:48

Ollama本地部署大模型:数据不出电脑的方案

不想把数据发给云端 API?用 Ollama 在本地跑大模型,数据不出你的电脑。

一、安装
Mac 和 Linux:curl -fsSL https://ollama.com/install.sh | sh
Windows:官网下载安装包,双击装

二、拉模型
ollama pull qwen2.5:7b    # 中文最好的开源7B模型
ollama pull llama3.1:8b   # Meta的8B模型
ollama pull deepseek-r1:7b # DeepSeek推理模型

7B 模型需要约 5GB 显存。8GB 内存的 Mac 可以跑,但速度一般。有 GPU 的话速度会快很多。

三、运行和对话
ollama run qwen2.5:7b
# 进入交互对话,直接输入问题回车

四、API 调用
Ollama 启动后默认监听 11434 端口,提供 OpenAI 兼容 API:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'

任何支持 OpenAI API 的客户端都能对接。把 base_url 改成 http://localhost:11434/v1 就行。

五、实用配置

[*]修改监听地址:设 OLLAMA_HOST=0.0.0.0 让局域网其他设备也能访问
[*]修改模型存储路径:设 OLLAMA_MODELS=/your/path 避免占满 C 盘
[*]多 GPU 支持:设 CUDA_VISIBLE_DEVICES=0,1 用多卡推理


六、模型选择建议

[*]4GB 显存:qwen2.5:1.5b 或 llama3.2:3b,速度极快但能力有限
[*]8GB 显存:qwen2.5:7b,日常使用足够
[*]16GB 显存:qwen2.5:14b 或 codellama:13b,效果好很多
[*]24GB+ 显存:qwen2.5:32b 或 deepseek-v2:16b,接近 GPT-3.5 水平


https://www.metk.cn/img/posts/ollama_deploy.jpg

有点困 发表于 2026-2-10 18:59:08

有个细节想确认,你说的这个数据是实验室环境还是生产环境跑出来的?

寻梅柚子 发表于 2026-2-11 03:19:35

成本这块还可以再拆细一点,隐性的人力投入其实占大头。

听风62 发表于 2026-2-11 20:00:29

说实话这个投入产出比确实得看行业,我们做传统制造的,算下来还不如人工。

长夏旧巷 发表于 2026-2-12 21:01:50

同意楼主,但落地的时候一定要考虑老系统的兼容,改造成本容易被低估。

流浪铺子 发表于 2026-2-14 06:23:39

有个坑提醒一下,接口一变整套流程都得跟着改,最好提前做抽象层。

老猫散记 发表于 2026-2-16 00:05:55

感谢分享,正卡在这个问题上,你的经验省了我不少时间。

竹里51 发表于 2026-2-18 02:08:38

同感。这东西不是不能用,是很多人把它当万能药了,场景不对就是白花钱。

秋刀小筑 发表于 2026-2-20 12:31:48

这个结论我保留意见,至少在我们行业不太成立,可能跟样本有关。

半夏的猫 发表于 2026-2-23 07:15:26

看完想补充一点:数据合规这块千万别忽略,我们就是因为这个卡了很久。
页: [1] 2 3 4
查看完整版本: Ollama本地部署大模型:数据不出电脑的方案