查看: 30|回复: 0

[相关教程] 用Python脚本批量清洗训练语料,中文乱码一次搞定

[复制链接]

96

主题

5

回帖

951

积分

UID
2
贡献
9 点
钻石
7 个
C币
993 个
发表于 2026-9-19 09:19:18 | 显示全部楼层 |阅读模式
前阵子帮朋友清洗一批论坛爬下来的中文语料准备做微调,四十多万条文本,乱码、繁简混杂、全半角混乱什么毛病都有,写了个脚本一次跑完,把关键处理记下来。

乱码的头号来源是编码不一致,文件里有 UTF-8 也有 GBK 也有 GB18030,我先用编码探测库逐个文件识别再按结果读入,读入后统一转 UTF-8 存新文件。第二类问题是全角标点和不可见字符,比如不换行空格、零宽字符,肉眼看不见但模型会当正常 token 学进去,用正则统一替换成对应半角并清掉控制字符。第三类是繁简混杂,用 opencc 全量转成简体,这步别省,混着训练出来的模型说话会突然蹦繁体字。

另外两条经验:去重不能只靠整条文本相等,长文本要抽句做指纹,不然爬虫带来的重复段落漏得一塌糊涂;清洗前一定先留一份原始备份,我的脚本第一版正则写猛了把正常内容也洗掉了,幸好有备份能重跑。整个流水线四十万条文本跑下来二十分钟,最终丢掉约一成脏数据,训练出来的模型明显比没清洗的版本稳。

温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
回复

使用道具 举报

温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
您需要登录后才可以回帖 登录 | 立即加入

本版积分规则

QQ客服返回顶部