软件测试 发表于 2026-8-3 18:56:00

语音朗读(给孩子报听写用)- 个人修改版(更新v2.5.14)

上个星期逛论坛发现了这个帖子(见下文),功能实用,适合小朋友,但发现跟我的需求有所欠缺,变自己动手改了改,做了些优化。

本修改版主要增加了图片、PDF、Wrod 的原文阅读的能力。

因为我的使用场景是拍小朋友的课文或上传PDF版教材朗读,能看到原文更方便小朋友跟读。

其他的修改就不值一提了,感兴趣的自己去发现哈。

关于本地模型

最初曾计划在 App 内集成离线模型引擎,但受限于原有技术栈版本较低,所支持的模型引擎只能处理纯文本、不支持多模态(看图/图片识别),无法承担拍照与文档 OCR 类任务。

随后尝试把整体技术栈升级到当前最新稳定版本再接入引擎,支持的模型依旧有限且效果不理想;

故再次尝试升级到开发版,但因问题太多,无法成功编译,无奈放弃,以后有空再换架构重写吧。

如有大佬感兴趣,欢迎继续完善,搞定模型引擎。

仓库地址 https://github.com/EasongChung/speak_reader

20260807更新

完成文本型PDF文件直接点击原文语句直接朗读改句子的功能

非文本型PDF文件可以使用福昕之类带坐标返回的OCR工具,做一次OCR识别,再传到手机上使用,即可使用该功能

暂时还没找到适合手机上免费开源的带坐标返回OCR识别组件,有知道的可以告知一下。

下一步计划增加个机械翻译组件。

关于PC端暂时不考虑,PC端已经有很多支持PDF朗读的工具了。

版本: v2.5.14

架构: arm64-v8a

大小:23MB

下载地址:https://wwbki.lanzouv.com/ihT794108wfg   密码:6u80

Speak Reader Android APK

版本: v2.5.7

架构: arm64-v8a

大小:23MB

下载地址:https://wwbki.lanzouv.com/iH3AW40c6eob   密码:d2iq

测试截图:  ( 注 图1显示的本地模型为测试版,已放弃,仅用于图片识别测试 )

半盏 发表于 2026-8-6 00:36:25

这种一手经验的分享比二手转述有价值多了。

听风 发表于 2026-8-6 22:11:24

楼主说得挺实在,比那些空谈概念的强。

半盏笔记 发表于 2026-8-7 13:24:49

思路很清晰,逻辑上也能自洽。想请教下有没有推荐的上手路径?

沐雨57 发表于 2026-8-8 10:13:33

收藏了,正好最近在研究相关的。有遇到类似情况的吗?想听听别人的做法。

南山铺子 发表于 2026-8-9 10:41:58

这几条经验很实用,尤其是最后那点。有没有后续?想蹲一个更新。

慢半拍慢半拍 发表于 2026-8-10 07:07:34

整体框架挺好,细节上还能再展开。想请教下有没有推荐的上手路径?

晚风随笔 发表于 2026-8-10 23:30:22

这个角度之前没想过,记下来了。有没有后续?想蹲一个更新。

林间寒山 发表于 2026-8-11 16:39:25

分析得挺到位,把关键因素都点出来了。有遇到类似情况的吗?想听听别人的做法。

微光不太冷 发表于 2026-8-12 10:11:35

这篇值得慢慢看,我准备再读第二遍。想请教下有没有推荐的上手路径?
页: [1] 2 3 4 5 6
查看完整版本: 语音朗读(给孩子报听写用)- 个人修改版(更新v2.5.14)