Speech to text это перевод речи в текст: загрузил аудио или видео, через пару минут читаешь готовую расшифровку. Термин английский, задача понятная любому, у кого скопились голосовые, записи созвонов и интервью, которые некогда переслушивать.
Ниже без лишней теории: чем speech to text отличается от соседних аббревиатур ASR и TTS, чем распознавание готового файла отличается от потокового и как подключить всё это через API. Кому нужно просто прогнать запись, для того тоже будут шаги.
Что такое speech to text: STT, ASR и TTS
Speech to text (спич ту текст) дословно «речь в текст». Это про результат: даёшь сервису аудио или видео, получаешь письменный текст того, что в записи сказано. Дальше по нему можно искать по тексту, цитировать и собирать конспект.
Рядом ходят ещё две аббревиатуры, их легко перепутать. ASR (automatic speech recognition) это сам движок распознавания, техника под капотом: как звук режется на кусочки и превращается в слова. Speech to text описывает задачу целиком, а ASR отвечает за её сердцевину. TTS (text to speech) это обратная дорога: из готового текста синтезируется голос. Шöпот идёт только в одну сторону, из речи в текст, озвучку он не делает.
Готовый файл или поток
В speech to text различают два режима, и устроены они по-разному.
Распознавание готового файла это когда запись уже есть целиком: диктофон, экспорт из созвона, голосовое из мессенджера. Ты отдаёшь файл сервису, он обрабатывает его разом и возвращает полную расшифровку от начала до конца. Для звонков, лекций и интервью подходит именно этот путь.
Потоковое распознавание это когда звук идёт непрерывно и текст нужен прямо по ходу речи, как в живых субтитрах. Такой сценарий обычно живёт внутри продукта, а не в ручной загрузке.
Шöпот работает с готовыми записями: файл с диска или ссылка, обработка целиком, полная расшифровка со спикерами и тайм-кодами. Когда таких записей не одна, а постоянный поток, их удобно гнать через API.
Как прогнать запись через speech to text
Ручной путь простой и без установки:
- Зарегистрируйся на app.shopot.ai: каждый месяц открывается пробный запас минут, привязывать банковскую карту не требуется.
- Перетащи любой аудио- или видеофайл с компьютера или телефона либо вставь ссылку на YouTube, VK, Rutube, Dzen или веб-страницу. Дорожку по ссылке сервис скачает сам.
- Подожди, пока запись обработается: час звука разбирается примерно за шесть минут, а короткое голосовое на пару минут отдаётся за 10-15 секунд.
- Скачай готовый текст файлом TXT или DOCX, а к видео рядом лежат субтитры в форматах SRT и VTT.
Сайт при этом не обязателен: боту в Телеграме или МАКС можно отправить любой аудио- или видеофайл с устройства, не только голосовое, и ответным сообщением придёт расшифровка.
Speech to text через API
Если распознавание нужно не разово, а внутри своего продукта, у Шöпота есть API на api.shopot.ai. Отправляешь запись запросом, получаешь расшифровку в ответе. Под капотом тот же движок, что и в веб-версии, так что speech to text встраивается в свой сервис, бота или внутреннюю обработку. Это путь для разработчиков, когда записи идут потоком и разбирать их руками уже некогда.
Что приходит на выходе, одинаково в API и в вебе: текст с разбивкой по спикерам и тайм-кодами, рядом AI-саммари и тезисы, а по содержимому записи можно задать вопрос в AI-чате. На вход идут mp3, mp4, wav, aac, mov, ogg, flac, wma. Полный обзор возможностей собран в гиде по транскрибации аудио и видео.
Русский, английский и серверы в РФ
Speech to text в Шöпоте одинаково работает с русским и английским в одном сервисе, переключать инструменты не нужно. Всего поддерживается 60+ языков, а язык записи определяется автоматически: заранее выбирать, на чём говорят на дорожке, не надо. Важный нюанс: это распознавание речи, а не перевод. Английская запись останется английским текстом, русская русским.
Все мощности размещены в РФ, поэтому речь распознаётся напрямую, без VPN, и около 99% обработки не покидает контур Шöпота. Готовые расшифровки и саммари лежат в российских дата-центрах бессрочно, сами звуковые файлы хранятся ограниченный срок по тарифу, а по запросу любые данные стираются.
FAQ
Что такое speech to text простыми словами?
Это распознавание речи в текст: даёшь программе аудио или видео, получаешь письменную расшифровку сказанного. По-русски ту же задачу называют «речь в текст» или «расшифровка».
Это распознавание речи в текст: даёшь программе аудио или видео, получаешь письменную расшифровку сказанного. По-русски ту же задачу называют «речь в текст» или «расшифровка».
Чем speech to text отличается от text to speech?
Это противоположные задачи. Speech to text (STT) превращает голос в текст, а text to speech (TTS) наоборот синтезирует голос из текста. Шöпот делает только первое, из речи в текст, озвучку не создаёт.
Это противоположные задачи. Speech to text (STT) превращает голос в текст, а text to speech (TTS) наоборот синтезирует голос из текста. Шöпот делает только первое, из речи в текст, озвучку не создаёт.
На каких языках работает speech to text?
Русский и английский идут в одном сервисе, всего поддерживается 60+ языков, язык записи определяется сам. Это распознавание на языке оригинала, а не перевод на другой язык.
Русский и английский идут в одном сервисе, всего поддерживается 60+ языков, язык записи определяется сам. Это распознавание на языке оригинала, а не перевод на другой язык.
Есть ли у speech to text API?
Да. Распознавание доступно через API на api.shopot.ai: отправляешь запись запросом и получаешь расшифровку в ответе, чтобы встроить speech to text в свой продукт или пайплайн.
Да. Распознавание доступно через API на api.shopot.ai: отправляешь запись запросом и получаешь расшифровку в ответе, чтобы встроить speech to text в свой продукт или пайплайн.
Нужен ли VPN?
Нет. Серверы стоят в РФ, обработка идёт на собственных мощностях Шöпота, доступ работает напрямую без VPN.
Нет. Серверы стоят в РФ, обработка идёт на собственных мощностях Шöпота, доступ работает напрямую без VPN.
Готов попробовать?
Загрузи первую запись бесплатно на app.shopot.ai: файл с диска или ссылку. Через пару минут увидишь, как speech to text превращает твою речь в текст с разбивкой по спикерам и готовым конспектом. А нужен API, ключ доступен там же в кабинете.