Расшифровка аудио в текст через Whisper, Yandex SpeechKit и Salute Speech: точность 90-98%, саммари встреч, диаризация спикеров и юридические риски.
Современные нейросети расшифровывают час аудио в текст за три-пять минут. Точность на русском языке — 90-98% в зависимости от качества записи и выбранного инструмента. Это означает, что часовая планёрка, полуторачасовое интервью или двухчасовое судебное заседание превращаются в читаемый текст быстрее, чем вы допьёте кофе.
Ещё два года назад такая задача решалась только одним способом: нанять расшифровщика, заплатить ему 1500-3000 рублей за час аудио и ждать пару дней. Сегодня это делает нейросеть за копейки и почти мгновенно. Разберёмся, какие инструменты доступны, насколько они точны и что можно сделать с полученным текстом дальше.
Давайте сразу отделим три разных сценария — потому что от них зависит выбор инструмента и ожидаемая точность.
Сценарий 1: Чистая речь с одного микрофона. Диктофонная запись интервью, голосовое сообщение в мессенджере, начитка текста. Здесь точность максимальная — 95-98%. Любой из трёх инструментов справится. На таком качестве можно вообще не вычитывать расшифровку, разве что пробежаться глазами по именам и цифрам.
Сценарий 2: Разговор нескольких человек в переговорке. Планёрка, созвон в Zoom, мозговой штурм. Точность падает до 85-92%: микрофоны ловят эхо, люди перебивают друг друга, кто-то говорит тише, кто-то — из дальнего угла. Здесь к расшифровке нужно добавить диаризацию — разметку «кто именно сказал эту фразу». Без неё текст сливается в сплошной поток без авторства, и пользы от него мало.
Сценарий 3: Телефонный разговор или запись с сильным шумом. Запись звонка, уличное интервью, стройплощадка на фоне. Точность — 75-85%. Это нижняя планка, при которой расшифровка всё ещё осмысленна. Ниже — уже нужна ручная работа.
Важный нюанс: все три сценария требуют разного инструмента. Whisper от OpenAI отлично справляется с чистой речью, но «плывёт» на телефонных записях. Yandex SpeechKit натренирован именно на российские реалии — звонки клиентов, колл-центры, шумные офисы. Salute Speech от Сбера — бюджетный универсал, который закрывает базовые потребности.
Я перевёл на нейросетевую расшифровку четыре процесса в компании. Расскажу про каждый — с цифрами.
Интервью для статей и курса. Раньше я записывал часовые разговоры с экспертами на диктофон, потом садился и два-три часа переслушивал, конспектируя. Сейчас: загружаю аудио в Whisper, через четыре минуты получаю текст на 20-25 тысяч знаков, затем прошу Claude Code (это инструмент для разработчиков, но я использую его и для текстовых задач) сделать саммари на 2000 знаков и выделить пять самых сильных цитат. Весь процесс — десять минут вместо трёх часов.
Планёрки команды. У нас еженедельный часовой созвон в Zoom. Раньше я вёл заметки вручную, и к концу недели половина договорённостей терялась. Теперь запись автоматически уходит в SpeechKit, расшифровывается с диаризацией, и мой ИИ-агент извлекает action items: кто, что и к какому сроку. Точность — около 90%, но этого достаточно, чтобы ничего не забыть. Стоимость — примерно 5 рублей за встречу на базовой модели DeepSeek V4 Pro.
Клиентские звонки. Мы подключили расшифровку к CRM: каждый входящий звонок автоматически превращается в текст и сохраняется в карточку клиента. Менеджер не тратит время на заполнение полей после разговора — он только проверяет, всё ли верно записалось. Это сэкономило нам примерно 40 минут в день на сотрудника.
Стенограмма для юриста. Один из наших партнёров попросил расшифровать трёхчасовую аудиозапись для арбитражного дела. Мы прогнали через SpeechKit, затем вручную выверили спорные места (в основном — цифры и фамилии) и проставили таймкоды. Суд принял расшифровку как приложение к аудиозаписи. Общее время — полтора часа против шести-восьми часов ручной работы.
Главный вывод из этого опыта: нейросеть не заменяет человека там, где цена ошибки высока. Но она срезает 80% рутинной работы, оставляя вам только верификацию.
Разберу три инструмента — от самого простого к самому гибкому. Для каждого дам конкретные команды и настройки, чтобы вы могли повторить это самостоятельно.
Шаг 1: Выберите инструмент под задачу.
Whisper от OpenAI — если у вас чистый звук с хорошего микрофона и вы готовы запускать модель локально или через API. Whisper доступен в нескольких размерах: tiny (быстрый, но слабый), base, small, medium и large-v3 (самый точный, но требует мощного компьютера). Для русского языка рекомендую минимум medium — на tiny точность падает до 70%.
Yandex SpeechKit — если работаете с русским языком, телефонными записями или вам нужна готовая интеграция с экосистемой Яндекса (почта, диск, CRM). У SpeechKit есть три модели: general (общая), phone (заточенная под телефонные звонки) и pre-talk (самая точная, но дороже). Для большинства задач берите general — баланс цены и качества.
Salute Speech от Сбера — если бюджет минимален, а задачи простые: расшифровка голосовых сообщений, коротких созвонов, заметок. Точность ниже конкурентов на сложных записях, но для бытовых сценариев более чем достаточно.
Шаг 2: Подготовьте аудио.
Перед загрузкой проверьте формат. MP3, WAV и OGG принимают все три сервиса. FLAC и M4A — только Whisper и SpeechKit. Оптимальный битрейт — 128-256 кбит/с: ниже даёт шумы и снижает точность, выше не даёт прироста, но увеличивает размер файла.
Уберите длинные паузы в начале и конце записи — они увеличивают время обработки, не добавляя полезного текста. Если запись длиннее двух часов, нарежьте её на части по 30-40 минут: так скорость обработки будет выше, а риск ошибки на стыках фрагментов ниже. Для нарезки подойдёт любой аудиоредактор или утилита ffmpeg одной командой: ffmpeg -i long_recording.mp3 -f segment -segment_time 1800 -c copy chunk_%03d.mp3.
Шаг 3: Загрузите и запустите расшифровку.
У каждого сервиса свой интерфейс. Whisper можно запустить локально через Python — достаточно установить библиотеку командой pip install openai-whisper и выполнить скрипт из пяти строк. Локальный запуск бесплатный, но требует видеокарту с 8+ гигабайтами памяти. Если видеокарты нет — используйте API OpenAI: загружаете файл, получаете текст, платите 0,6 цента за минуту.
SpeechKit — через личный кабинет Яндекс.Облака. Создаёте каталог, получаете API-ключ, настраиваете язык (ru-RU), модель (general) и опционально — фильтр ненормативной лексики и кастомный словарь для редких терминов. SpeechKit поддерживает и потоковое распознавание (речь идёт прямо сейчас), и синхронное (загрузили файл — получили результат). Для постфактум-расшифровки используйте синхронный режим — он точнее.
Salute Speech — через платформу SmartMarket от Сбера. Интерфейс простой: загрузили аудио, выбрали язык, нажали «Распознать». Никаких API-ключей и консольных команд. Подходит, если вы делаете это впервые и не хотите разбираться в технических деталях.
Шаг 4: Включите диаризацию, если спикеров больше одного.
Это критично для планёрок и интервью. Базовая расшифровка выдаёт сплошной текст — кто что сказал, непонятно. Диаризация размечает реплики: «Спикер 1: …», «Спикер 2: …». В SpeechKit она встроена и работает «из коробки» — достаточно поставить галочку в настройках. В Whisper диаризация требует отдельного модуля pyannote.audio, который нужно устанавливать и настраивать отдельно — это дополнительный порог входа. Salute Speech поддерживает диаризацию в платной версии.
Качество диаризации напрямую зависит от того, насколько голоса спикеров отличаются друг от друга. Если в комнате двое мужчин с похожими тембрами — модель будет ошибаться чаще. Если мужчина и женщина — точность близка к 95%.
Шаг 5: Отправьте текст на постобработку ИИ-агенту.
Голая расшифровка — это сырой материал. Дальше её можно пропустить через ИИ-агента, который сделает осмысленный документ. Что именно можно получить:
Именно этот шаг превращает «просто текст» в рабочий инструмент. Я писал об этом подробнее в статье про делегирование рабочей рутины ИИ-агенту. Если коротко: агент берёт расшифровку, прогоняет через большую языковую модель и возвращает структурированный документ, готовый для рассылки команде.
Давайте сравним в цифрах — час аудиозаписи.
Человек-расшифровщик: 4-6 часов работы, стоимость 1500-3000 рублей, точность 98-99% (если специалист опытный), результат через 1-2 дня. Плюс — понимает контекст, различает акценты и нестандартную лексику. Минус — дорого, долго, не масштабируется (десять часов аудио — это неделя работы).
Нейросеть: 3-5 минут работы, стоимость 5-15 рублей на базовой модели, точность 90-98%, результат почти мгновенно. Плюс — скорость и цена. Минус — путает омофоны («код» и «кот»), плохо распознаёт редкие имена и аббревиатуры, нуждается в постобработке для юридически значимых документов.
Оптимальная схема, к которой я пришёл: нейросеть делает черновик, человек — финальную выверку. На выходе получается точность 99%, а время сокращается в четыре-пять раз по сравнению с полностью ручной работой. Если вы работаете с большими объёмами аудио, разница становится критичной: расшифровка 20 часов записей — это неделя ручного труда или час работы нейросети плюс два часа проверки.
Стоимость зависит от выбранного сервиса и объёмов.
Whisper через API OpenAI: $0,006 за минуту аудио. Час — примерно 36 центов или 30 рублей. Локальный запуск (на своём компьютере) — бесплатно, но требует видеокарты с 8+ ГБ памяти и навыков работы с терминалом.
Yandex SpeechKit: потоковое распознавание — 0,60 ₽ за минуту для pre-talk модели, синхронное — от 0,40 ₽ за минуту. Час записи — 24-36 рублей. При объёмах от 100 000 минут в месяц цена падает до 0,15-0,20 ₽ за минуту. Есть бесплатный порог — первые 1000 минут в месяц.
Salute Speech: от 0,10 ₽ за минуту в базовом тарифе. Час аудио — 6 рублей. Самый бюджетный вариант, но с оговорками по точности на сложных записях.
Для сравнения: конспект часовой встречи у «Моего агента» стоит примерно 5 рублей на базовой модели DeepSeek V4 Pro. Туда уже входит и расшифровка, и саммари. Если выбрать более тяжёлую модель вроде Claude или GPT-5, стоимость вырастет в 3-5 раз.
Важный момент: все цены выше — это стоимость «сырой» расшифровки. Постобработка (саммари, action items, диаризация) оплачивается отдельно: либо токенами API, либо как задача ИИ-агента. Мой агент в Telegram, например, берёт на себя полный цикл: от получения аудио до готового структурированного конспекта.
Честно скажу о том, с чем я столкнулся.
Омофоны и контекст. Нейросеть не понимает смысла — она предсказывает наиболее вероятную последовательность слов. Поэтому «ключ» может стать «ключ» (правильно), а может — «ключ» (если модель перепутала ударение). В юридических и медицинских текстах это критично.
Редкие имена и термины. «Абдулазиз», «ООО Рога и Копыта», «ст. 159 УК РФ» — модель часто ошибается, заменяя редкое на похожее частое. Решение: загружать кастомный словарь (SpeechKit это поддерживает) или выверять такие фрагменты вручную.
Эмоции и интонации. Нейросеть не отличает сарказм от серьёзного утверждения, вопрос от риторического вопроса. Если спикер сказал «конечно, мы успеем к дедлайну» с иронией — в тексте это будет выглядеть как уверенное заявление.
Наслоение голосов. Когда трое говорят одновременно, ни одна модель не справляется. Текст превращается в кашу из обрывков фраз. Единственное решение — организационное: вести встречи так, чтобы говорили по очереди.
Длинные записи без разбивки. Модели вроде Whisper имеют ограничение на длину обрабатываемого фрагмента (обычно 25 МБ). Записи длиннее нужно резать, а на стыках фрагментов возможны потери нескольких слов. SpeechKit в потоковом режиме тоже ограничивает сессию 30 секундами — для длинных записей нужно использовать синхронный API, который обрабатывает файл целиком.
Закрытые экосистемы. Важный нюанс для тех, кто работает с чувствительными данными: все три сервиса отправляют аудио на свои сервера. Whisper через API OpenAI уходит на сервера в США, SpeechKit — в дата-центры Яндекса в России, Salute Speech — на сервера Сбера. Если вы расшифровываете врачебную тайну, адвокатские записи или внутренние документы с NDA — это нужно учитывать. Whisper можно запустить полностью локально, без отправки данных наружу, но это требует технической подготовки.
Расшифровка аудио — это только первый шаг. Когда у вас накоплен корпус текстов встреч за месяц, квартал или год, открываются новые возможности. ИИ-агент может проанализировать все планёрки за месяц и показать: какие темы обсуждаются чаще всего, какие вопросы возвращаются раз за разом без решения, кто из участников систематически берёт на себя задачи и не выполняет их.
Это уже не просто транскрипция — это управленческая аналитика. И она становится доступной не только корпорациям с бюджетом на BI-системы, но и небольшим командам. Если тема интересна — посмотрите, как собрать личного ИИ-помощника в Telegram за один вечер и подключить к нему обработку аудио. А если хотите разобраться, чем отличается работа с агентом от классического программирования, у меня есть статья про переход от «сделай мне реферат» к «создай сервис».
Автор: Илья Лочканов, основатель школы «Разговорное программирование» и создатель сервиса «Мой агент». Разбираюсь в ИИ без технического образования и помогаю предпринимателям, маркетологам и руководителям внедрять нейросети в ежедневную работу — без программирования и VPN.
Подписывайтесь на блог razgovornoe-programmirovanie.ru — каждую неделю выходят новые статьи о том, как делегировать рутину ИИ.
На русском языке лучшие результаты дают Yandex SpeechKit (95-98%) и Whisper large-v3 от OpenAI (90-95%). SpeechKit лучше работает с телефонными записями, фоновым шумом и специфической терминологией. Whisper выигрывает при расшифровке студийных записей и поддерживает автоопределение языка — полезно для bilingual-разговоров. Salute Speech от Сбера дешевле, но точность на сложных аудио падает до 85-90%.
Стенограмма нейросети не самостоятельное доказательство, а приложение к аудиозаписи. Суд принимает её как письменную расшифровку, если аудио получено законно: с предупреждением о записи или согласием сторон в гражданском процессе. Ключевое — прикладывайте и аудиофайл, и расшифровку, указывайте таймкоды для каждого фрагмента. Это даёт суду возможность верифицировать текст по оригинальной записи.
А что с этим делать
На курсе «Разговорное программирование» за 2 недели соберёшь работающий сайт, бота или автоматизацию — без знания кода. Курс входит в подписку на «Мой агент» (990 ₽/мес).
Записаться на бесплатный мини-урок →
Илья Лочканов
Автор курса
100% гуманитарий. 12 IT-сервисов, собранных через разговор с ИИ за 4 месяца, без знания кода. Преподаёт то, как делать такое самостоятельно.
ИП Лочканов Илья Дмитриевич · ИНН 312330060380
О компании →