什么是人声分离?
人声分离是把人声从录音中的其他一切(例如背景噪声、音乐和房间回声)中分离出来、只留下干净语音的过程。它是一种音频源分离,如今通常由经过训练、能区分语音和其他声音的神经网络完成。它可以帮助清理嘈杂的采访、播客和视频音频。
免费创建账户 赠送 5,000 免费积分,无需信用卡。
更新于 2026年9月27日
人声分离是如何工作的?
传统降噪会估算一个稳定的噪声特征,例如嗡嗡声或嘶嘶声,再从整个信号中减去它。这对持续的噪声有效,但难以应对变化的声音,例如车流声、音乐或狗叫声,还可能留下单薄、发虚的声音。AI 人声分离采用不同的方法。一个用大量混有噪声的干净语音样本训练出来的神经网络,会学会判断音频中哪些部分属于人声。然后,它把人声单独提取出来,通常还会同时减少房间回声。有些工具还会把去除的背景声作为单独的音轨返回。
人声分离有哪些用途?
人声分离用于挽救那些原本无法使用的录音。播客主用它清理在嘈杂房间里或网络不佳时录制的节目。视频创作者和记者用它修复在街头、咖啡馆或车流附近拍摄的采访。人声分离也是使用其他 AI 工具前很有用的准备步骤:干净的语音转写更准确、译制配音更干净,作为声音克隆的样本效果也更好。在音乐领域,同样的技术可以把人声从歌曲中分离出来,用于混音、采样或卡拉 OK,前提是你拥有这首曲目的权利。修复陈旧或受损的录音也会用到它。
人声分离有哪些局限?
人声分离无法找回从未被清晰录下的内容。当噪声比人声还响,或与人声占据相同的频段时,结果可能听起来单薄、发闷或像机器人。录音电平过高导致的削波和失真无法被完全消除。两个人同时说话时,通常会被保留在一起,因为把一个人的声音与另一个人分开,是另一项更难的任务,称为说话人分离。强烈的房间回声可以减弱,但不一定能完全去除。最好的效果仍然来自良好的录音习惯,以及导出前的快速试听。
- 让麦克风靠近说话者
- 在有软装的安静房间里录音
- 设置好电平,让最响的时刻也不会削波
- 导出前先试听清理后的音轨
人声分离的例子
- 一位播客主从一段采访中去除了空调的嗡嗡声和空房间的回声。
- 一位记者清理了一段街头采访,让说话者的声音在车流声中也能听清。
- 一位创作者在生成字幕前先分离出 vlog 中的人声,让转写更准确。
- 一位用户在克隆之前先清理了一段简短的语音样本,以获得更逼真的克隆。
常见问题
人声分离和降噪有什么区别?
降噪会在整段录音中降低不需要的声音,通常是嘶嘶声、嗡嗡声或风扇声这类稳定的噪声。人声分离更进一步:它提取出人声,丢弃一切不是人声的内容,包括音乐、车流声、键盘敲击声或狗叫声这类变化的声音。传统降噪依靠滤波器和噪声特征,而现代人声分离使用经过训练、能识别语音的 AI 模型。在实际使用中,面对背景不断变化的真实杂乱音频,人声分离的表现更好。
人声分离能去除回声和混响吗?
能,在很大程度上可以。AI 人声分离模型通常会在去除背景噪声的同时减少房间回声和混响,让在厨房或空办公室里录制的声音听起来更近、更干。非常强烈的混响,例如在教堂或楼梯间里,更难完全去除,可能会留下轻微的处理感。请务必试听结果;对于重要的录音,尽可能选择一个有软装的小房间。
人声分离能把同时说话的两个人分开吗?
通常不能。人声分离的设计目标是把语音与一切非语音内容分开,所以重叠的人声在输出中通常会保留在一起。把一位说话者与另一位分开是另一个问题,称为说话人分离,当人们互相抢话时会困难得多。如果你需要每个人的声音都在单独的音轨上,最可靠的办法仍然是为每位说话者使用单独的麦克风录音。
我可以免费试用人声分离吗?
可以。在 wawie 上,你可以创建一个免费账户,一次性获得 5,000 积分,无需信用卡,上传一段音频或视频录音,就能拿回分离出的人声,进行试听和下载。如果是视频,wawie 会先提取音频。干净的音轨可以直接送去做字幕、译制配音或放进视频编辑器,无需离开 wawie。需要更多额度时,付费套餐每月 4.99 欧元起。
相关术语
- 语音转文字(STT): 语音转文字把语音转换成书面文字,支撑着转写稿、自动字幕、语音输入和语音助手。
- 声音克隆: 声音克隆根据录音构建某个特定人物声音的合成副本,从而可以用这个声音生成新的语音。
- AI 译制配音: AI 译制配音会把视频中的语音翻译成另一种语言并重新配音,与原片时间轴对齐,还可以选择使用原声。
免费创建账户 赠送 5,000 免费积分,无需信用卡。