Что такое распознавание речи (speech to text)?

Распознавание речи (STT, speech to text), или автоматическое распознавание речи (ASR), представляет собой технологию преобразования устной речи в письменный текст. На ней работают транскрибация, автоматические субтитры, диктовка и голосовые ассистенты. Точность в основном зависит от качества звука, акцентов и лексики. В wawie распознавание речи лежит в основе автоматических субтитров, которые можно редактировать, переводить и экспортировать для YouTube, TikTok или Instagram.

Создать бесплатный аккаунт 5 000 бесплатных кредитов. Карта не нужна.

Обновлено 27 сентября 2026

Как работает распознавание речи?

Сначала распознавание речи превращает аудио в компактную картину частот во времени, обычно в спектрограмму. Нейросеть, обученная на большом объёме расшифрованной речи, сопоставляет эти признаки с вероятными звуками, частями слов или символами. Языковая модель, встроенная в сеть или добавленная после неё, использует контекст, чтобы выбрать наиболее вероятные слова, поэтому система отличает, например, «компанию» от «кампании». Затем постобработка расставляет знаки препинания, заглавные буквы и форматирует числа, а также привязывает метки времени к словам или фразам. Для субтитров текст делится на короткие строки, синхронизированные с речью, и экспортируется в форматах вроде SRT или VTT.

Для чего используется распознавание речи?

Распознавание речи используется везде, где устные слова нужно превратить в текст, который можно читать и искать. Авторы видео создают с его помощью субтитры, которые помогают зрителям, смотрящим без звука, и делают контент доступным для глухих и слабослышащих людей. Команды расшифровывают встречи, интервью и лекции, чтобы искать по ним и цитировать их. Авторы текстов и специалисты пользуются диктовкой, чтобы набирать текст голосом. Распознавание речи также является первым шагом ИИ-дубляжа, где расшифровка переводится, прежде чем её снова озвучат. Кроме того, расшифровка даёт поисковым системам и ИИ-ассистентам текст для индексации.

От чего зависит точность распознавания речи?

Точность распознавания речи обычно измеряют показателем WER (word error rate), то есть долей слов, которые распознаны неверно, пропущены или добавлены по сравнению с правильной расшифровкой. Лучший результат даёт чистый звук одного говорящего, находящегося близко к микрофону. Точность падает из-за фонового шума, музыки, эха, людей, говорящих одновременно, акцентов, которые модель слышала редко, и специальной лексики, например названий брендов, медицинских терминов или жаргона. Быстрая речь и некачественные записи тоже добавляют ошибок. Для всего, что вы публикуете, проверяйте расшифровку и исправляйте имена и ключевые термины перед экспортом субтитров.

Примеры распознавания речи

Частые вопросы

Чем распознавание речи отличается от синтеза речи?

Они работают в противоположных направлениях. Распознавание речи (STT) слушает устную речь и записывает её, создавая расшифровку или субтитры. Синтез речи (TTS) берёт письменный текст и читает его вслух синтетическим голосом. Распознавание речи нужно, чтобы понимать речь, а синтез речи нужен, чтобы её создавать. Эти технологии часто сочетаются, например в ИИ-дубляже, где видео расшифровывается, переводится, а затем снова озвучивается на другом языке.

Насколько точно распознавание речи?

На чёткой речи в широко поддерживаемых языках современное распознавание речи очень точно, а большинство оставшихся ошибок связаны с именами, жаргоном, числами и перекрывающейся речью. Точность снижается из-за фонового шума, музыки, эха, быстрой речи и непривычных акцентов. Её измеряют показателем WER: чем он ниже, тем лучше. Субтитры к публикуемым видео всегда стоит проверять. В wawie каждую строку субтитров можно отредактировать перед экспортом, а протестировать это можно бесплатно с 5 000 кредитов без карты.

Что такое файлы субтитров SRT и VTT?

SRT (SubRip) и VTT (WebVTT) являются двумя самыми распространёнными форматами файлов субтитров. Оба представляют собой простые текстовые файлы со списком фрагментов субтитров, у каждого из которых есть время начала, время окончания и текст для показа. SRT поддерживают почти все видеоплатформы и редакторы. WebVTT является веб-стандартом для видео HTML5 и поддерживает дополнительное оформление и позиционирование. Любой из этих файлов загружается вместе с видео, чтобы зрители могли включать и выключать субтитры.

Чем субтитры для глухих (captions) отличаются от обычных субтитров?

В США словом captions обычно называют текст на языке оригинала для зрителей, которые не слышат звук, поэтому такие субтитры описывают и важные звуки, например музыку или смех, и могут указывать, кто говорит. Словом subtitles обычно называют расшифровку или перевод только диалогов для зрителей, которые слышат. В Великобритании слово subtitles часто используют в обоих значениях, а по-русски и то, и другое обычно называют субтитрами. Скрытые субтитры (closed captions) можно выключить, а открытые, или впечатанные, субтитры являются частью изображения и видны всегда.

Связанные термины

Создать бесплатный аккаунт 5 000 бесплатных кредитов. Карта не нужна.