什么是语音转文字(STT)?

语音转文字(STT),也称自动语音识别(ASR),是一种把口语转换成书面文字的技术。它支撑着转写、自动字幕、语音输入和语音助手。准确率主要取决于音频质量、口音和词汇。在 wawie 上,语音转文字驱动着自动字幕功能,你可以编辑、翻译字幕,并导出用于 YouTube、TikTok 或 Instagram。

免费创建账户 赠送 5,000 免费积分,无需信用卡。

更新于 2026年9月27日

语音转文字是如何工作的?

语音转文字首先把音频转换成一幅紧凑的、表示频率随时间变化的图像,通常是频谱图。一个用大量已转写语音训练出来的神经网络,会把这些特征映射为可能的发音、词片段或字符。语言模型(内置于网络中,或附加在其后)会利用上下文挑选最有可能的字词,让系统能够区分同音词,例如中文里的权利和权力。随后的后处理会添加标点、大小写和数字格式,并为字词或短语加上时间戳。制作字幕时,文本会被切分成与语音同步的简短字幕行,并导出为 SRT 或 VTT 等格式。

语音转文字有哪些用途?

凡是需要把口语变成可搜索、可阅读的文字时,都会用到语音转文字。视频创作者用它生成字幕,帮助不开声音观看的观众,也让聋人和听障人士能够获取内容。团队转写会议、访谈和讲座,以便搜索和引用。作者和专业人士用语音输入代替打字。语音转文字也是 AI 译制配音的第一步:转写稿先被翻译,然后重新配音。转写稿还为搜索引擎和 AI 助手提供了可以索引的文字。

哪些因素会影响语音转文字的准确率?

语音转文字的准确率通常用词错误率(WER)来衡量,也就是与正确的转写稿相比,出错、遗漏或多出的字词所占的比例;中文识别则常用字错误率(CER)。离麦克风近、只有一位说话者的干净音频效果最好。背景噪声、音乐、回声、多人抢话、模型很少听过的口音,以及品牌名、医学术语或行话等专业词汇,都会降低准确率。语速过快和低质量的录音也会增加错误。凡是要发布的内容,导出字幕前都请审核转写稿,修正人名和关键术语。

语音转文字的例子

常见问题

语音转文字和文字转语音有什么区别?

两者的方向正好相反。语音转文字(STT)聆听语音并把它写下来,生成转写稿或字幕。文字转语音(TTS)则把书面文字用合成声音朗读出来。语音转文字关乎理解语音,而文字转语音关乎生成语音。两者经常结合使用,例如在 AI 译制配音中,视频先被转写、翻译,然后用另一种语言重新配音。

语音转文字有多准确?

在支持广泛的语言中,对于清晰的语音,现代语音转文字的准确率很高,剩下的错误大多涉及人名、行话、数字和多人重叠说话。背景噪声、音乐、回声、语速过快和不熟悉的口音都会降低准确率。准确率用词错误率(WER)衡量:数值越低越好。已发布视频的字幕都应该经过审核。在 wawie 上,每一条字幕在导出前都可以编辑,你还可以用赠送的 5,000 积分免费测试,无需信用卡。

SRT 和 VTT 字幕文件是什么?

SRT(SubRip)和 VTT(WebVTT)是最常见的两种字幕文件格式。两者都是纯文本文件,包含一系列字幕条目,每条都有开始时间、结束时间和要显示的文字。几乎所有视频平台和编辑器都支持 SRT。WebVTT 是 HTML5 视频的网页标准,支持额外的样式和位置设置。你可以把任一文件与视频一起上传,让观众自行开启或关闭字幕。

英文里的 captions 和 subtitles 有什么区别?

在美国,captions 通常指同一语言的文字,面向听不到音频的观众,因此还会描述音乐或笑声等相关声音,并可能标明说话者。subtitles 通常只指对白的转写或翻译,面向能听到声音的观众。在英国,subtitles 一词常常同时指这两者,中文里两者一般都叫字幕。隐藏式字幕(closed captions)可以关闭,而开放式字幕或压制字幕是视频画面的一部分,始终可见。

相关术语

免费创建账户 赠送 5,000 免费积分,无需信用卡。