咨询发布 发表于 2026-9-18 09:11:23

GGUF量化模型实测:Q4_K_M和Q5_K_M的差距比想的小

手头一张24G的卡,想在本地跑Qwen3-32B,原版精度肯定放不下,就认真测了一下GGUF各个量化档位。Q4_K_M大概19G,Q5_K_M是22G多,都能塞进去。

拿一套50道题的测试集跑分,Q4_K_M对了41道,Q5_K_M对了43道,差距在一个点上下,但Q4的速度快了差不多四成。肉眼对比两个版本的回答,大多数场景真的分不出来,只有长推理链的任务Q5会稳一点。

结论就是消费级显卡优先Q4_K_M,性价比最高,显存富余再上Q6_K。那些一口气拉满fp16跑的,除了心理安慰真没多少收益,省下来的显存多开一路并发更实在。

https://www.metk.cn/img/posts/gguf_quant_test_01.jpg
页: [1]
查看完整版本: GGUF量化模型实测:Q4_K_M和Q5_K_M的差距比想的小