Что такое распознавание речи (speech to text)?
Распознавание речи (STT, speech to text), или автоматическое распознавание речи (ASR), представляет собой технологию преобразования устной речи в письменный текст. На ней работают транскрибация, автоматические субтитры, диктовка и голосовые ассистенты. Точность в основном зависит от качества звука, акцентов и лексики. В wawie распознавание речи лежит в основе автоматических субтитров, которые можно редактировать, переводить и экспортировать для YouTube, TikTok или Instagram.
Создать бесплатный аккаунт 5 000 бесплатных кредитов. Карта не нужна.
Обновлено 27 сентября 2026
Как работает распознавание речи?
Сначала распознавание речи превращает аудио в компактную картину частот во времени, обычно в спектрограмму. Нейросеть, обученная на большом объёме расшифрованной речи, сопоставляет эти признаки с вероятными звуками, частями слов или символами. Языковая модель, встроенная в сеть или добавленная после неё, использует контекст, чтобы выбрать наиболее вероятные слова, поэтому система отличает, например, «компанию» от «кампании». Затем постобработка расставляет знаки препинания, заглавные буквы и форматирует числа, а также привязывает метки времени к словам или фразам. Для субтитров текст делится на короткие строки, синхронизированные с речью, и экспортируется в форматах вроде SRT или VTT.
Для чего используется распознавание речи?
Распознавание речи используется везде, где устные слова нужно превратить в текст, который можно читать и искать. Авторы видео создают с его помощью субтитры, которые помогают зрителям, смотрящим без звука, и делают контент доступным для глухих и слабослышащих людей. Команды расшифровывают встречи, интервью и лекции, чтобы искать по ним и цитировать их. Авторы текстов и специалисты пользуются диктовкой, чтобы набирать текст голосом. Распознавание речи также является первым шагом ИИ-дубляжа, где расшифровка переводится, прежде чем её снова озвучат. Кроме того, расшифровка даёт поисковым системам и ИИ-ассистентам текст для индексации.
- Субтитры для YouTube, TikTok и Instagram
- Расшифровки встреч, интервью и лекций
- Диктовка и голосовой ввод
- Первый шаг ИИ-дубляжа
От чего зависит точность распознавания речи?
Точность распознавания речи обычно измеряют показателем WER (word error rate), то есть долей слов, которые распознаны неверно, пропущены или добавлены по сравнению с правильной расшифровкой. Лучший результат даёт чистый звук одного говорящего, находящегося близко к микрофону. Точность падает из-за фонового шума, музыки, эха, людей, говорящих одновременно, акцентов, которые модель слышала редко, и специальной лексики, например названий брендов, медицинских терминов или жаргона. Быстрая речь и некачественные записи тоже добавляют ошибок. Для всего, что вы публикуете, проверяйте расшифровку и исправляйте имена и ключевые термины перед экспортом субтитров.
Примеры распознавания речи
- Ютубер создаёт субтитры для туториала, исправляет два названия продуктов и экспортирует файл SRT.
- Автор в TikTok впечатывает стилизованные субтитры в короткое видео для зрителей, которые смотрят без звука.
- Исследователь расшифровывает записанные интервью, чтобы искать по ним и цитировать их в отчёте.
- Функция диктовки в телефоне набирает сообщение, пока вы говорите.
Частые вопросы
Чем распознавание речи отличается от синтеза речи?
Они работают в противоположных направлениях. Распознавание речи (STT) слушает устную речь и записывает её, создавая расшифровку или субтитры. Синтез речи (TTS) берёт письменный текст и читает его вслух синтетическим голосом. Распознавание речи нужно, чтобы понимать речь, а синтез речи нужен, чтобы её создавать. Эти технологии часто сочетаются, например в ИИ-дубляже, где видео расшифровывается, переводится, а затем снова озвучивается на другом языке.
Насколько точно распознавание речи?
На чёткой речи в широко поддерживаемых языках современное распознавание речи очень точно, а большинство оставшихся ошибок связаны с именами, жаргоном, числами и перекрывающейся речью. Точность снижается из-за фонового шума, музыки, эха, быстрой речи и непривычных акцентов. Её измеряют показателем WER: чем он ниже, тем лучше. Субтитры к публикуемым видео всегда стоит проверять. В wawie каждую строку субтитров можно отредактировать перед экспортом, а протестировать это можно бесплатно с 5 000 кредитов без карты.
Что такое файлы субтитров SRT и VTT?
SRT (SubRip) и VTT (WebVTT) являются двумя самыми распространёнными форматами файлов субтитров. Оба представляют собой простые текстовые файлы со списком фрагментов субтитров, у каждого из которых есть время начала, время окончания и текст для показа. SRT поддерживают почти все видеоплатформы и редакторы. WebVTT является веб-стандартом для видео HTML5 и поддерживает дополнительное оформление и позиционирование. Любой из этих файлов загружается вместе с видео, чтобы зрители могли включать и выключать субтитры.
Чем субтитры для глухих (captions) отличаются от обычных субтитров?
В США словом captions обычно называют текст на языке оригинала для зрителей, которые не слышат звук, поэтому такие субтитры описывают и важные звуки, например музыку или смех, и могут указывать, кто говорит. Словом subtitles обычно называют расшифровку или перевод только диалогов для зрителей, которые слышат. В Великобритании слово subtitles часто используют в обоих значениях, а по-русски и то, и другое обычно называют субтитрами. Скрытые субтитры (closed captions) можно выключить, а открытые, или впечатанные, субтитры являются частью изображения и видны всегда.
Связанные термины
- Синтез речи (TTS): Синтез речи превращает письменный текст в естественно звучащую речь и используется для озвучки, дикторского текста, доступности и голосовых ассистентов.
- ИИ-дубляж: ИИ-дубляж переводит речь в видео и заново озвучивает её на другом языке, в исходном тайминге и при желании исходным голосом.
- Выделение голоса: Выделение голоса отделяет голос от фонового шума, музыки и эха помещения, оставляя чистую речь для публикации, расшифровки или дубляжа.
Создать бесплатный аккаунт 5 000 бесплатных кредитов. Карта не нужна.