咨询发布 发表于 2026-9-18 09:11:23

Whisper本地语音转文字部署手记:显卡精度和速度的取舍

最近要把一堆会议录音转成文字稿,云服务按小时收费算下来不便宜,就试了本地部署Whisper。1080Ti跑large-v3模型,fp16精度下一小时音频大概四分钟转完,显存刚好卡在10G出头。

实际用下来对中文的准确率比想象中好,专业名词错的少,标点也会自动加。换faster-whisper这个包用CTranslate2后端之后,同模型速度翻了一倍多,显存还能再省三成,这个是必装的。

有几个坑说一下:长音频要开vad过滤切分,不然会幻觉出重复句子;人名和专有名词可以在initial_prompt里给示例。总之手头有6G以上显存的卡,这工具闭眼装,转写敏感内容本地跑也放心。

https://www.metk.cn/img/posts/whisper_asr_local_01.jpg
页: [1]
查看完整版本: Whisper本地语音转文字部署手记:显卡精度和速度的取舍