Как расшифровать аудио нейросетью: транскрипция с точностью до 98%

Расшифровка аудио в текст через Whisper, Yandex SpeechKit и Salute Speech: точность 90-98%, саммари встреч, диаризация спикеров и юридические риски.

Илья Лочканов · · 10 мин чтения
Обложка: Как расшифровать аудио нейросетью

Современные нейросети расшифровывают час аудио в текст за три-пять минут. Точность на русском языке — 90-98% в зависимости от качества записи и выбранного инструмента. Это означает, что часовая планёрка, полуторачасовое интервью или двухчасовое судебное заседание превращаются в читаемый текст быстрее, чем вы допьёте кофе.

Ещё два года назад такая задача решалась только одним способом: нанять расшифровщика, заплатить ему 1500-3000 рублей за час аудио и ждать пару дней. Сегодня это делает нейросеть за копейки и почти мгновенно. Разберёмся, какие инструменты доступны, насколько они точны и что можно сделать с полученным текстом дальше.

Что именно умеет ИИ при расшифровке аудио

Давайте сразу отделим три разных сценария — потому что от них зависит выбор инструмента и ожидаемая точность.

Сценарий 1: Чистая речь с одного микрофона. Диктофонная запись интервью, голосовое сообщение в мессенджере, начитка текста. Здесь точность максимальная — 95-98%. Любой из трёх инструментов справится. На таком качестве можно вообще не вычитывать расшифровку, разве что пробежаться глазами по именам и цифрам.

Сценарий 2: Разговор нескольких человек в переговорке. Планёрка, созвон в Zoom, мозговой штурм. Точность падает до 85-92%: микрофоны ловят эхо, люди перебивают друг друга, кто-то говорит тише, кто-то — из дальнего угла. Здесь к расшифровке нужно добавить диаризацию — разметку «кто именно сказал эту фразу». Без неё текст сливается в сплошной поток без авторства, и пользы от него мало.

Сценарий 3: Телефонный разговор или запись с сильным шумом. Запись звонка, уличное интервью, стройплощадка на фоне. Точность — 75-85%. Это нижняя планка, при которой расшифровка всё ещё осмысленна. Ниже — уже нужна ручная работа.

Важный нюанс: все три сценария требуют разного инструмента. Whisper от OpenAI отлично справляется с чистой речью, но «плывёт» на телефонных записях. Yandex SpeechKit натренирован именно на российские реалии — звонки клиентов, колл-центры, шумные офисы. Salute Speech от Сбера — бюджетный универсал, который закрывает базовые потребности.

В моей практике

Я перевёл на нейросетевую расшифровку четыре процесса в компании. Расскажу про каждый — с цифрами.

Интервью для статей и курса. Раньше я записывал часовые разговоры с экспертами на диктофон, потом садился и два-три часа переслушивал, конспектируя. Сейчас: загружаю аудио в Whisper, через четыре минуты получаю текст на 20-25 тысяч знаков, затем прошу Claude Code (это инструмент для разработчиков, но я использую его и для текстовых задач) сделать саммари на 2000 знаков и выделить пять самых сильных цитат. Весь процесс — десять минут вместо трёх часов.

Планёрки команды. У нас еженедельный часовой созвон в Zoom. Раньше я вёл заметки вручную, и к концу недели половина договорённостей терялась. Теперь запись автоматически уходит в SpeechKit, расшифровывается с диаризацией, и мой ИИ-агент извлекает action items: кто, что и к какому сроку. Точность — около 90%, но этого достаточно, чтобы ничего не забыть. Стоимость — примерно 5 рублей за встречу на базовой модели DeepSeek V4 Pro.

Клиентские звонки. Мы подключили расшифровку к CRM: каждый входящий звонок автоматически превращается в текст и сохраняется в карточку клиента. Менеджер не тратит время на заполнение полей после разговора — он только проверяет, всё ли верно записалось. Это сэкономило нам примерно 40 минут в день на сотрудника.

Стенограмма для юриста. Один из наших партнёров попросил расшифровать трёхчасовую аудиозапись для арбитражного дела. Мы прогнали через SpeechKit, затем вручную выверили спорные места (в основном — цифры и фамилии) и проставили таймкоды. Суд принял расшифровку как приложение к аудиозаписи. Общее время — полтора часа против шести-восьми часов ручной работы.

Главный вывод из этого опыта: нейросеть не заменяет человека там, где цена ошибки высока. Но она срезает 80% рутинной работы, оставляя вам только верификацию.

Как настроить: пошаговая инструкция

Разберу три инструмента — от самого простого к самому гибкому. Для каждого дам конкретные команды и настройки, чтобы вы могли повторить это самостоятельно.

Шаг 1: Выберите инструмент под задачу.

Whisper от OpenAI — если у вас чистый звук с хорошего микрофона и вы готовы запускать модель локально или через API. Whisper доступен в нескольких размерах: tiny (быстрый, но слабый), base, small, medium и large-v3 (самый точный, но требует мощного компьютера). Для русского языка рекомендую минимум medium — на tiny точность падает до 70%.

Yandex SpeechKit — если работаете с русским языком, телефонными записями или вам нужна готовая интеграция с экосистемой Яндекса (почта, диск, CRM). У SpeechKit есть три модели: general (общая), phone (заточенная под телефонные звонки) и pre-talk (самая точная, но дороже). Для большинства задач берите general — баланс цены и качества.

Salute Speech от Сбера — если бюджет минимален, а задачи простые: расшифровка голосовых сообщений, коротких созвонов, заметок. Точность ниже конкурентов на сложных записях, но для бытовых сценариев более чем достаточно.

Шаг 2: Подготовьте аудио.

Перед загрузкой проверьте формат. MP3, WAV и OGG принимают все три сервиса. FLAC и M4A — только Whisper и SpeechKit. Оптимальный битрейт — 128-256 кбит/с: ниже даёт шумы и снижает точность, выше не даёт прироста, но увеличивает размер файла.

Уберите длинные паузы в начале и конце записи — они увеличивают время обработки, не добавляя полезного текста. Если запись длиннее двух часов, нарежьте её на части по 30-40 минут: так скорость обработки будет выше, а риск ошибки на стыках фрагментов ниже. Для нарезки подойдёт любой аудиоредактор или утилита ffmpeg одной командой: ffmpeg -i long_recording.mp3 -f segment -segment_time 1800 -c copy chunk_%03d.mp3.

Шаг 3: Загрузите и запустите расшифровку.

У каждого сервиса свой интерфейс. Whisper можно запустить локально через Python — достаточно установить библиотеку командой pip install openai-whisper и выполнить скрипт из пяти строк. Локальный запуск бесплатный, но требует видеокарту с 8+ гигабайтами памяти. Если видеокарты нет — используйте API OpenAI: загружаете файл, получаете текст, платите 0,6 цента за минуту.

SpeechKit — через личный кабинет Яндекс.Облака. Создаёте каталог, получаете API-ключ, настраиваете язык (ru-RU), модель (general) и опционально — фильтр ненормативной лексики и кастомный словарь для редких терминов. SpeechKit поддерживает и потоковое распознавание (речь идёт прямо сейчас), и синхронное (загрузили файл — получили результат). Для постфактум-расшифровки используйте синхронный режим — он точнее.

Salute Speech — через платформу SmartMarket от Сбера. Интерфейс простой: загрузили аудио, выбрали язык, нажали «Распознать». Никаких API-ключей и консольных команд. Подходит, если вы делаете это впервые и не хотите разбираться в технических деталях.

Шаг 4: Включите диаризацию, если спикеров больше одного.

Это критично для планёрок и интервью. Базовая расшифровка выдаёт сплошной текст — кто что сказал, непонятно. Диаризация размечает реплики: «Спикер 1: …», «Спикер 2: …». В SpeechKit она встроена и работает «из коробки» — достаточно поставить галочку в настройках. В Whisper диаризация требует отдельного модуля pyannote.audio, который нужно устанавливать и настраивать отдельно — это дополнительный порог входа. Salute Speech поддерживает диаризацию в платной версии.

Качество диаризации напрямую зависит от того, насколько голоса спикеров отличаются друг от друга. Если в комнате двое мужчин с похожими тембрами — модель будет ошибаться чаще. Если мужчина и женщина — точность близка к 95%.

Шаг 5: Отправьте текст на постобработку ИИ-агенту.

Голая расшифровка — это сырой материал. Дальше её можно пропустить через ИИ-агента, который сделает осмысленный документ. Что именно можно получить:

  • Краткое саммари встречи на полстраницы — вместо 20 страниц сырой расшифровки.
  • Список договорённостей с ответственными и сроками — «кому что делать».
  • Выделение ключевых тем обсуждения — «о чём вообще говорили».
  • Поиск противоречий — когда один участник говорит одно в начале встречи, а через полчаса утверждает обратное.
  • Автоматическую разбивку по темам — «сначала обсуждали бюджет, потом перешли к найму, затем к срокам».

Именно этот шаг превращает «просто текст» в рабочий инструмент. Я писал об этом подробнее в статье про делегирование рабочей рутины ИИ-агенту. Если коротко: агент берёт расшифровку, прогоняет через большую языковую модель и возвращает структурированный документ, готовый для рассылки команде.

Сравнение: ИИ против ручной расшифровки

Давайте сравним в цифрах — час аудиозаписи.

Человек-расшифровщик: 4-6 часов работы, стоимость 1500-3000 рублей, точность 98-99% (если специалист опытный), результат через 1-2 дня. Плюс — понимает контекст, различает акценты и нестандартную лексику. Минус — дорого, долго, не масштабируется (десять часов аудио — это неделя работы).

Нейросеть: 3-5 минут работы, стоимость 5-15 рублей на базовой модели, точность 90-98%, результат почти мгновенно. Плюс — скорость и цена. Минус — путает омофоны («код» и «кот»), плохо распознаёт редкие имена и аббревиатуры, нуждается в постобработке для юридически значимых документов.

Оптимальная схема, к которой я пришёл: нейросеть делает черновик, человек — финальную выверку. На выходе получается точность 99%, а время сокращается в четыре-пять раз по сравнению с полностью ручной работой. Если вы работаете с большими объёмами аудио, разница становится критичной: расшифровка 20 часов записей — это неделя ручного труда или час работы нейросети плюс два часа проверки.

Во сколько это обходится

Стоимость зависит от выбранного сервиса и объёмов.

Whisper через API OpenAI: $0,006 за минуту аудио. Час — примерно 36 центов или 30 рублей. Локальный запуск (на своём компьютере) — бесплатно, но требует видеокарты с 8+ ГБ памяти и навыков работы с терминалом.

Yandex SpeechKit: потоковое распознавание — 0,60 ₽ за минуту для pre-talk модели, синхронное — от 0,40 ₽ за минуту. Час записи — 24-36 рублей. При объёмах от 100 000 минут в месяц цена падает до 0,15-0,20 ₽ за минуту. Есть бесплатный порог — первые 1000 минут в месяц.

Salute Speech: от 0,10 ₽ за минуту в базовом тарифе. Час аудио — 6 рублей. Самый бюджетный вариант, но с оговорками по точности на сложных записях.

Для сравнения: конспект часовой встречи у «Моего агента» стоит примерно 5 рублей на базовой модели DeepSeek V4 Pro. Туда уже входит и расшифровка, и саммари. Если выбрать более тяжёлую модель вроде Claude или GPT-5, стоимость вырастет в 3-5 раз.

Важный момент: все цены выше — это стоимость «сырой» расшифровки. Постобработка (саммари, action items, диаризация) оплачивается отдельно: либо токенами API, либо как задача ИИ-агента. Мой агент в Telegram, например, берёт на себя полный цикл: от получения аудио до готового структурированного конспекта.

Ограничения: что нейросеть пока не делает

Честно скажу о том, с чем я столкнулся.

Омофоны и контекст. Нейросеть не понимает смысла — она предсказывает наиболее вероятную последовательность слов. Поэтому «ключ» может стать «ключ» (правильно), а может — «ключ» (если модель перепутала ударение). В юридических и медицинских текстах это критично.

Редкие имена и термины. «Абдулазиз», «ООО Рога и Копыта», «ст. 159 УК РФ» — модель часто ошибается, заменяя редкое на похожее частое. Решение: загружать кастомный словарь (SpeechKit это поддерживает) или выверять такие фрагменты вручную.

Эмоции и интонации. Нейросеть не отличает сарказм от серьёзного утверждения, вопрос от риторического вопроса. Если спикер сказал «конечно, мы успеем к дедлайну» с иронией — в тексте это будет выглядеть как уверенное заявление.

Наслоение голосов. Когда трое говорят одновременно, ни одна модель не справляется. Текст превращается в кашу из обрывков фраз. Единственное решение — организационное: вести встречи так, чтобы говорили по очереди.

Длинные записи без разбивки. Модели вроде Whisper имеют ограничение на длину обрабатываемого фрагмента (обычно 25 МБ). Записи длиннее нужно резать, а на стыках фрагментов возможны потери нескольких слов. SpeechKit в потоковом режиме тоже ограничивает сессию 30 секундами — для длинных записей нужно использовать синхронный API, который обрабатывает файл целиком.

Закрытые экосистемы. Важный нюанс для тех, кто работает с чувствительными данными: все три сервиса отправляют аудио на свои сервера. Whisper через API OpenAI уходит на сервера в США, SpeechKit — в дата-центры Яндекса в России, Salute Speech — на сервера Сбера. Если вы расшифровываете врачебную тайну, адвокатские записи или внутренние документы с NDA — это нужно учитывать. Whisper можно запустить полностью локально, без отправки данных наружу, но это требует технической подготовки.

Что дальше

Расшифровка аудио — это только первый шаг. Когда у вас накоплен корпус текстов встреч за месяц, квартал или год, открываются новые возможности. ИИ-агент может проанализировать все планёрки за месяц и показать: какие темы обсуждаются чаще всего, какие вопросы возвращаются раз за разом без решения, кто из участников систематически берёт на себя задачи и не выполняет их.

Это уже не просто транскрипция — это управленческая аналитика. И она становится доступной не только корпорациям с бюджетом на BI-системы, но и небольшим командам. Если тема интересна — посмотрите, как собрать личного ИИ-помощника в Telegram за один вечер и подключить к нему обработку аудио. А если хотите разобраться, чем отличается работа с агентом от классического программирования, у меня есть статья про переход от «сделай мне реферат» к «создай сервис».


Автор: Илья Лочканов, основатель школы «Разговорное программирование» и создатель сервиса «Мой агент». Разбираюсь в ИИ без технического образования и помогаю предпринимателям, маркетологам и руководителям внедрять нейросети в ежедневную работу — без программирования и VPN.

Подписывайтесь на блог razgovornoe-programmirovanie.ru — каждую неделю выходят новые статьи о том, как делегировать рутину ИИ.

Часто задаваемые вопросы

Какая нейросеть точнее всего расшифровывает русскую речь?

На русском языке лучшие результаты дают Yandex SpeechKit (95-98%) и Whisper large-v3 от OpenAI (90-95%). SpeechKit лучше работает с телефонными записями, фоновым шумом и специфической терминологией. Whisper выигрывает при расшифровке студийных записей и поддерживает автоопределение языка — полезно для bilingual-разговоров. Salute Speech от Сбера дешевле, но точность на сложных аудио падает до 85-90%.

Можно ли использовать ИИ-расшифровку как доказательство в суде?

Стенограмма нейросети не самостоятельное доказательство, а приложение к аудиозаписи. Суд принимает её как письменную расшифровку, если аудио получено законно: с предупреждением о записи или согласием сторон в гражданском процессе. Ключевое — прикладывайте и аудиофайл, и расшифровку, указывайте таймкоды для каждого фрагмента. Это даёт суду возможность верифицировать текст по оригинальной записи.

А что с этим делать

Соберите свой первый IT-сервис
через разговор с ИИ

На курсе «Разговорное программирование» за 2 недели соберёшь работающий сайт, бота или автоматизацию — без знания кода. Курс входит в подписку на «Мой агент» (990 ₽/мес).

Записаться на бесплатный мини-урок →
Илья Лочканов

Илья Лочканов

Автор курса

100% гуманитарий. 12 IT-сервисов, собранных через разговор с ИИ за 4 месяца, без знания кода. Преподаёт то, как делать такое самостоятельно.

ИП Лочканов Илья Дмитриевич · ИНН 312330060380

О компании →