用Ollama在旧笔记本上跑量化大模型的完整踩坑记录
手头有台五年前的游戏本,i7 加 16G 内存加 2060 显卡 6G 显存,本来打算吃灰,上周末心血来潮装了 Ollama 折腾大模型,居然跑通了,把踩的坑记一下。显存只有 6G 是最大的坑。直接拉 7B 的完整模型直接爆内存,后来改用 q4 量化的版本,占 5G 左右显存,刚好塞下,速度大概每秒十几个 token,日常问答完全可用。14B 的模型勉强能跑但会溢出到内存,速度掉到每秒两三个字,等得心焦。另外一定要去设置里让 Ollama 用独显,默认装完它有时候走核显,我盯着任务栏看了半天才反应过来。
下载模型记得配镜像源,不然几十 GB 的进度条能让人崩溃。再给个实用建议:模型装好后先用命令行进去问几个固定问题测速度,没问题再用 API 接到自己的小工具里玩,我把它接到了本地笔记软件上做摘要,体验已经超出预期了。老笔记本别扔,还有救。
https://www.metk.cn/img/posts/ollama_laptop.jpg
页:
[1]