本地跑Llama3-70B量化版:消费级显卡用llama.cpp跑通完整教程
https://www.metk.cn/img/posts/llama3_local_deploy.jpg折腾了三天终于在一张RTX 3090上把Llama3-70B跑起来了,记录一下过程给想省API钱的兄弟们参考。
70B模型全精度要140G显存,消费级显卡肯定装不下。用llama.cpp的GGUF格式Q4_K_M量化,模型文件压到了40G左右。3090有24G显存,全装进显存不够,llama.cpp支持部分卸载到内存,设n_gpu_layers为40左右,速度大概每秒4到5个token,凑合能用。
具体步骤:先拉模型,HuggingFace上搜Meta-Llama-3-70B-Instruct-GGUF,选Q4_K_M的文件,大概40G。下完之后编llama.cpp,clone下来make一下就行。跑的时候命令是这个:
./main -m llama-3-70b-instruct-q4_k_m.gguf -p 你的问题 -n 512 -t 8 -gqa -ngl 40 -c 4096
ngl 40是往显存里放40层,剩下的走内存。t是CPU线程数,gqa是Llama3需要的分组注意力的参数。上下文窗口c设4096,太大会爆显存。
跑起来之后CPU占用百分之七十多,GPU占用百分之九十。生成速度4.5 token每秒,比调API慢但不用花钱。如果你有两张3090或者用4090 24G,可以ngl拉到60以上,速度能到8到10 token每秒,体验就好很多了。
页:
[1]