【学习工作】EdgeCaption —— 离线实时翻译与字幕工具 Demo 补充贴

简介

EdgeCaption 是一款面向学习和工作场景的端侧 AI 实时翻译与字幕App。通过本地语音识别、实时字幕生成、翻译增强、录音记录和字幕导出能力,让用户在课堂、会议、讲座、外语学习和跨语言沟通中,更快理解语音内容,并把听到的信息沉淀为可回顾、可整理、可导出的笔记。

当前 Demo 主要提供以下能力:

- 实时录音转写:录音过程中生成文本字幕和句段时间轴。

- 录音历史记录:保存每次录音,支持回看、播放、重命名和删除。

- SRT 字幕导出:将录音内容导出为字幕文件,方便后续剪辑、复习和整理。

- 面对面翻译以及文本翻译功能。

创作思路

我最初做 EdgeCaption,是因为在学习和工作中经常遇到一个问题:语音内容很重要,但它很难被及时整理。课堂、会议、讲座、播客、外语资料和跨语言沟通里,很多信息都是一闪而过的。只录音不够,后续回听成本很高;只靠在线工具又会受到网络、隐私和使用场景限制。

所以这个 Demo 的核心思路是:把“听到的内容”尽可能在移动端直接转成文字、字幕和可整理的记录。相比单纯的语音转文字工具,EdgeCaption 更强调完整链路:听到语音 → 实时字幕 → 保存记录 → 翻译增强 → 导出字幕 / 复习材料。这也是它和报名帖创意的对应关系:报名阶段描述的是“离线 AI 翻译与实时字幕工具”的方向,Demo 阶段则把它落到了一个可以安装体验的 Android App 中。

Demo 体验地址

APK 下载地址:

体验 Demo内置 SenseVoice模型和Bergamot系列中英互译模型,无需下载即可体验。
由于当前模型下载需要科学上网,为了方便体验,所以内置了模型,有些功能例如翻译增强、说话人识别、高级 ASR引擎、更多的语言等无法体验。

预览视频和图片:

Trae实践过程

在了解到这个比赛之前,这个项目框架和流程已经使用 Codex跑通,但是有一些细节问题,比如 asr识别过程中,SenseVoice模型仅支持离线识别,需要借助 VAD进行语音切割,并逐段交给 SenseVoice模型识别,整个流程精确度和实时性很难控制,Codex反复调整许多次后仍未能解决。在尝试使用 Trae进行深入分析后,Trae给了我很详细的分析过程以及调整方案,对我也有了一定的启发,很快就调试出一版效果还不错的流程,准确性和实时性都得到了保障。后面又使用 Trae设计优化性能分析面板,来帮助分析资源消耗情况和延迟耗时分析,将资源消耗降低 40%,端侧识别延迟降到 2s以内。

.1528737189082307:e5540d5c989db973abc07205558917f5_6a475bd0c34a1e8383ecef53.6a475cddc34a1e8383ecef57.6a475cdca7ab1f2728cd6ddd:Trae CN.T(2026/7/3 14:55:25)

.1528737189082307:d3799fea4388bd08d763c2536af113ae_6a4a42374811f8696ddb3015.6a4a42d24811f8696ddb3018.6a4a42d283b01f420b3d282a:Trae CN.T(2026/7/5 19:41:06)

.1528737189082307:d89dd216dd06c3c41a7c1c30f2eabad3_6a4a573a4811f8696ddb31a9.6a4a578c4811f8696ddb31ab.6a4a578c83b01f420b3d282e:Trae CN.T(2026/7/5 21:09:32)

报名帖: 【学习工作】EdgeCaption —— 离线实时翻译与字幕工具

小结

EdgeCaption 当前还是 Demo,但已经跑通了“模型准备 → 实时录音转写 → 记录保存 → 翻译增强 → SRT 字幕导出”的核心闭环。