|
查看: 21|回复: 0
|
[相关教程]
GGUF量化模型实测:Q4_K_M和Q5_K_M的差距比想的小
[复制链接]
|

UID2
贡献9 点
钻石7 个
C币993 个
|
手头一张24G的卡,想在本地跑Qwen3-32B,原版精度肯定放不下,就认真测了一下GGUF各个量化档位。Q4_K_M大概19G,Q5_K_M是22G多,都能塞进去。
拿一套50道题的测试集跑分,Q4_K_M对了41道,Q5_K_M对了43道,差距在一个点上下,但Q4的速度快了差不多四成。肉眼对比两个版本的回答,大多数场景真的分不出来,只有长推理链的任务Q5会稳一点。
结论就是消费级显卡优先Q4_K_M,性价比最高,显存富余再上Q6_K。那些一口气拉满fp16跑的,除了心理安慰真没多少收益,省下来的显存多开一路并发更实在。
 |
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
|
|
|
|
|
|
|
|
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!