howtoКоманда АльфаPDF3 мин чтения

Как перевести голосовое сообщение в текст: без приложений и подписок

Пятиминутное голосовое из Телеграма, запись созвона или лекция с диктофона — разбираем, как превратить их в текст онлайн, что влияет на качество и где границы.

Голосовые сообщения удобны тому, кто их отправляет, и неудобны тому, кто получает. Пять минут чужого монолога нельзя пробежать глазами, из них не скопировать адрес или сумму, их не найти потом поиском по чату. То же с диктофонными записями: лекция, планёрка, разговор с подрядчиком — всё это лежит мёртвым грузом, пока не превратится в текст.

Раньше расшифровка была услугой: либо человек с наушниками и терпением, либо подписка на сервис с оплатой за минуту. Сейчас распознавание речи делает нейросеть, и делает быстро — задача свелась к «загрузить файл и подождать пару минут».

Что понадобится

Сам аудиофайл. Подойдёт практически любой формат:

1

Голосовое из мессенджера

В Телеграме откройте чат на компьютере, нажмите на голосовое правой кнопкой — «Сохранить как». Получится файл OGG, его можно загружать как есть, перекодировать ничего не нужно.

Compressing…69%~2 seconds remaining
2

Запись с диктофона

Диктофоны телефонов пишут в M4A или AAC — оба формата поддерживаются. Перекиньте файл с телефона любым способом.

Compressing…69%~2 seconds remaining
3

Обычные аудиофайлы

MP3, WAV, FLAC, Opus — всё, что играет плеер, распознаётся и здесь. Лимит один: файл до 20 МБ и запись до 15 минут.

Compressing…69%~2 seconds remaining

Как это работает

Откройте инструмент «Аудио в текст», перетащите файл, выберите язык — или оставьте автоопределение, оно почти не ошибается. Дальше работает нейросеть Whisper: она слушает запись, расставляет знаки препинания и собирает текст.

На выходе — не сырая простыня, а свёрстанный PDF: текст разбит на абзацы по паузам в речи. Если включить таймкоды, каждый абзац начнётся с метки вида [02:15] — удобно вернуться к нужному месту записи и переслушать, что там было на самом деле.

~2×
Скорость: десять минут записи — около четырёх-пяти минут распознавания
15 мин
Максимальная длительность одной записи
1 час
Через столько файл и расшифровка удаляются с сервера
0 ₽
Стоимость — как у всех инструментов АльфаPDF

От чего зависит качество

Нейросеть распознаёт то, что слышно. Отсюда простые правила:

Хорошо распознаётся: речь одного человека в телефон или микрофон, голосовые из мессенджеров, надиктованные заметки, спокойные созвоны. В таких записях ошибки — единичные, обычно в фамилиях и редких терминах.

Распознаётся с огрехами: разговор нескольких людей одновременно, запись из зала с эхом, речь на фоне музыки или дороги. Текст получится, но вычитать его перед отправкой кому-то стоит обязательно.

Не разделяется по голосам: если говорили двое, текст пойдёт единым потоком — инструмент делит его по паузам, а не по собеседникам.

Почему это безопасно

Частый вопрос к сервисам расшифровки — куда уходит запись. Здесь ответ короткий: никуда. Распознавание работает на сервере АльфаPDF, без обращений к внешним сервисам, и через час файл вместе с расшифровкой удаляется автоматически. Рабочие созвоны и личные голосовые не становятся чьими-то обучающими данными.

Обратная задача

Есть и зеркальный инструмент — «Озвучить PDF»: он превращает текст документа в MP3 русским голосом. Сорокастраничный отчёт можно не читать с экрана, а слушать в дороге. Вместе эти два инструмента закрывают дорогу в обе стороны: голос → текст и текст → голос.

Коротко

Скачайте голосовое или запись, откройте «Аудио в текст», загрузите файл и подождите пару минут. Получите PDF с разбитым на абзацы текстом — его можно читать, искать по нему и пересылать. Бесплатно, без регистрации, файл удаляется через час.

Команда АльфаPDF

Команда АльфаPDF — приватные онлайн-инструменты для PDF: сжатие, конвертация, OCR, подпись и защита. Файлы удаляются через 1 час. О нас →

Читайте также