Распознавайте речь. Работайте со смыслом.

Превращайте аудио в транскрипты, итоги встреч и отчёты с источниками. Собственные речевые модели, понятные настройки и контроль обработки — в облаке или в вашем контуре.

Русский, казахский, кыргызский, узбекский и таджикский. Также английский. Проверьте качество в облачном сервисе на своих записях.

Попробовать бесплатно Обсудить внедрение Подключить API

1 000 кредитов после подтверждения регистрации. Без привязки карты.

Поговорить с ассистентом — без регистрации

Нужно разобрать встречу или интервью? Посмотрите примеры

Свои модели. Поддержка нескольких языков.

В основе Speech Expert — собственные модели распознавания для русского и других языков. Подбираем модель под язык и тип записи; состав решения для вашего контура согласуем на пилоте.

Модели и маршрут обработки по языкам
  • Русский: собственная разработка SpeechExpert-STT-RU, GigaAM Multilingual или серверный Whisper для файлов; отдельный профиль для потока.
  • Казахский и кыргызский: файловый GigaAM Multilingual и потоковое распознавание в контуре Speech Expert.
  • Узбекский: SpeechExpert-STT-UZ для файлов и потока в контуре Speech Expert.
  • Таджикский: потоковый профиль в контуре Speech Expert; обычные файлы — через внешние Gemini 3.5 Transcribe или ElevenLabs Scribe v2.
  • Английский: Parakeet-EN, SpeechExpert-STT-EN или серверный Whisper для файлов; отдельный профиль для потока.

Внешние Gemini 3.5 Transcribe через Google API и ElevenLabs Scribe v2 распознают файлы на всех шести языках. Выбранная модель и маршрут обработки видны до запуска. При выборе модели в контуре Speech Expert аудио не передаётся внешнему STT-провайдеру.

Выберите режим под запись

Во всех трёх режимах доступны русский, английский, казахский, кыргызский, узбекский и таджикский. Язык выбирается перед запуском.

Возможности файлового и потоковых режимов
РежимРезультатУсловия
Обычный файл до 500 МБТекст, разделение участников, коррекция и отчёты по выбранным опциям.До 20 участников; у Gemini — до 8 и запись до 30 минут. Возможности зависят от модели.
Длинный аудиофайл до 10 ГБТекст и таймкоды по мере обработки, экспорт. Ручная нарезка не нужна.Без разделения участников, автоматической коррекции и отчётов во время потока. Вкладка остаётся открытой; фоновой обработки и возобновления нет. После обрыва запуск начинается заново.
Живой потокПредварительный текст и финалы фраз во время речи.Все шесть языков в контуре Speech Expert. Без разделения участников, коррекции и отчётов во время потока.

В потоковых режимах для казахского, кыргызского, узбекского и таджикского таймкоды относятся к аудиофрагментам, а не к отдельным словам. Для длинного файла кредиты списываются за уже обработанную длительность.

Распознать свою запись

Речевые модели в контуре заказчика

Разместим модели Speech Expert в вашей инфраструктуре и подключим к рабочим системам. На пилоте согласуем языки, состав моделей, требования к оборудованию и критерии качества на ваших записях.

Обсудить размещение Обсудить API-интеграцию Свой speech-инженер или готовый сервис

Разметка пользовательских данных

По договорённости поможем с разметкой ваших данных на русском и языках СНГ: казахском, кыргызском, узбекском и таджикском.

Языки разметки: русский, казахский, кыргызский, узбекский и таджикский.

Состав разметки, объём, требования к результату, сроки и стоимость согласуем под вашу задачу.

Обсудить разметку

Выберите задачу

  • Расшифровка и анализ: текст с участниками, решения встречи, статья по вебинару или исследовательский отчёт по серии из 2–20 сохранённых интервью.
  • Перевод и дубляж: переведённые реплики, субтитры и готовая аудио- или видеодорожка.
  • Озвучка текста: длинный текст одним голосом или диалог по ролям.

Разработчикам: распознавание и синтез через API.

Посмотрите, что получается на выходе

Синтетический пример показывает транскрипт с участниками и таймкодами, исследовательский отчёт, итоги встречи, контент-пакет и структурированный JSON.

Ключевые выводы, решения и задачи можно проверить по подтверждающим цитатам. Когда данные доступны, источник показывает спикера и таймкод. Язык саммари можно выбрать отдельно, полный перевод сохранить рядом с исходным транскриптом.

Открыть пример отчёта без регистрации

Эмоциональная динамика русской речи

Вероятностные эмоциональные эпизоды связаны с таймкодом, репликой и, при однозначной атрибуции, спикером. Это сигнал для ручной проверки исходного аудио, а не оценка состояния или намерений человека. Его нельзя использовать как основание кадровых, медицинских, кредитных или страховых решений.

«Но ведь расшифровать можно бесплатно?»

Можно. Можно даже собрать всё из бесплатных сервисов.

Главное — не оказаться единственной платной частью этой схемы.

Если собирать всё по частям: получить текст в боте, попросить другую нейросеть сделать выводы, найти подтверждающие реплики, сопоставить интервью, собрать результат для коллег.

Speech Expert связывает эти шаги: расшифровку, итоги встречи, исследовательский отчёт и подтверждающие цитаты. Несколько интервью можно объединить в общий анализ.

«А откуда такой вывод?»

«Нейросеть так решила» — не ссылка на источник. Откройте исходную реплику и её контекст, чтобы проверить, подтверждают ли они вывод.

«А что повторяется в интервью?»

От 2 до 20 сохранённых интервью — в одном исследовательском отчёте. Сопоставляйте общие темы, барьеры и выводы с источниками.

«А что мне переслать коллегам?»

Итоги разговора: резюме, решения, задачи и подтверждающие фрагменты. Скачайте отчёт по записи в PDF или DOCX, с полной расшифровкой или без неё.

Из реплики — в поручение в работе · Условный пример · вымышленные данные

1 Исходная реплика

Анна · 18:42

«Да, расчёт я возьму на себя. В четверг пришлю».

2 Проверка черновика

Требует проверки

Отправить расчёт

Исполнитель
Анна
Срок
Четверг

Ваше действие: Проверить и подтвердить

3 Поручение в списке

После подтверждения и смены статуса

Отправить расчёт

Исполнитель
Анна
Срок
Четверг

Статус: В работе

Исходная реплика · 18:42

После подтверждения поручение остаётся в списке ваших договорённостей: с исполнителем, сроком, статусом и ссылкой на исходную реплику.

Возьмите запись, с которой вам ещё предстоит поработать. Посмотрите, сколько этой работы можно не делать вручную.

Посмотреть, что получится после расшифровки Разобрать свою запись

Спикеры и таймкоды отображаются, когда они доступны в выбранном режиме. Прослушивание фрагментов — при сохранённом аудио.

Для компаний: распознавание по API и собственные модели в вашем контуре.

Тарифы облачного сервиса

Стоимость размещения в контуре заказчика рассчитываем отдельно — по составу моделей, нагрузке и инфраструктуре.

  • Интервью на русском, 60 минут — 19,08 ₽. SpeechExpert-STT-RU с разделением участников. Отчёт по готовой расшифровке пока без дополнительного списания.
  • Интервью на казахском, кыргызском или узбекском, 60 минут — 30 ₽. С разделением участников. GigaAM для казахского и кыргызского; SpeechExpert-STT-UZ для узбекского.
  • Длинная лекция на русском, 120 минут — 33,60 ₽. Потоковый профиль для русского, 7 кредитов за минуту. Текст и таймкоды без разделения участников.

Примеры относятся к указанным моделям и опциям. Один кредит — 0,04 ₽. Операции округляются до начатой секунды; итоговая ставка видна до запуска.

Ставки моделей и дополнительных опций
  • SpeechExpert-STT-RU для файлов — 4,2 кредита, около 0,17 ₽ за минуту без разделения участников.
  • GigaAM для русского, казахского и кыргызского и SpeechExpert-STT-UZ для узбекского — 8,75 кредита, 0,35 ₽ за минуту без разделения участников.
  • Разделение участников для моделей без встроенной разметки — ещё 3,75 кредита, 0,15 ₽ за минуту.
  • ElevenLabs Scribe v2 и Gemini 3.5 Transcribe — около 1,17 ₽ за минуту; нативное разделение участников включено.
  • Русский потоковый профиль — 7 кредитов, 0,28 ₽ за минуту.
  • Озвучка — около 0,17 ₽ за минуту готовой речи.

Отчёты по готовой расшифровке пока не требуют отдельного списания кредитов. Дополнительные текстовые этапы и внешние модели выбираются отдельно.

Перевод и дубляж аудио и видео

Загрузите аудио, видео или публичную ссылку. Speech Expert разделит речь по спикерам, переведёт реплики и озвучит их по подходящим голосовым образцам из записи с учётом исходного тайминга.

Источники: YouTube, VK Видео, VK Play, RuTube, Яндекс Видео, Дзен, Одноклассники и Vimeo; доступность зависит от площадки.

Редактируйте текст, спикера и тайминг, передублируйте изменённый фрагмент. Скачивайте WAV, переведённые SRT/VTT, двуязычный транскрипт и MP4, если у источника доступен видеоряд. Если для спикера недостаточно подходящего голосового фрагмента, его исходная реплика сохраняется без дубляжа.

Для запуска нужно подтвердить право использовать и клонировать голоса участников.

Перевести аудио или видео Как работает перевод

Озвучьте текст или диалог по ролям

Вставьте до 40 000 символов, выберите один голос или назначьте голоса ролям. Speech Expert разделит текст по фразам и соберёт единый WAV с выбранными паузами.

Порядок реплик, прогресс и частичный результат сохраняются на сервере. Используйте свой голос или голос спикера, который дал согласие.

Открыть синтез по ролям

Вы выбираете, где обрабатывать данные

Для обработки в инфраструктуре организации доступно размещение моделей в контуре заказчика. Состав решения и внешние интеграции согласуем отдельно. В облачном сервисе вы управляете хранением и выбираете маршрут обработки.

В приватном режиме результат не добавляется в архив, а временные данные обработки удаляются после завершения. Google API или ElevenLabs получают аудио только при выборе соответствующей внешней STT-модели.

Коррекция, извлечение сущностей, отчёты и перевод могут передавать текст настроенному LLM-провайдеру. В приватном режиме эти этапы выключены до отдельного разрешения. Для обычной записи аудио можно удалить отдельно, сохранив транскрипт и готовые материалы.

Распознавание и синтез речи через API

Начните с одного аудиофайла: создайте ключ, скопируйте запрос и получите текст. Для приложений на OpenAI SDK используйте адрес Speech Expert и нашу модель.

  1. Создайте API-ключ. Подтвердите email, войдите и откройте «Управление → API ключи».
  2. Отправьте аудиофайл. Замените <API_KEY> своим ключом, а interview.wav — путём к короткой записи на русском.
  3. Получите текст. API вернёт JSON с расшифровкой.

Получить API-ключ Быстрый старт

1 000 кредитов после подтверждения регистрации. Без привязки карты.

curl -X POST "https://speech-expert.ru/api/v1/audio/transcriptions" \
  -H "Authorization: Bearer <API_KEY>" \
  -F "model=SpeechExpert-STT-RU" \
  -F "language=ru" \
  -F "file=@interview.wav"

Пример cURL для macOS и Linux; вариант для Windows есть в быстром старте.

Ответ API · пример:

{"text": "Добрый день! Начинаем встречу."}

REST, SSE, WebSocket и gRPC; OpenAI- и SpeechKit-совместимые методы. Файловое распознавание и живой поток доступны для русского, английского, казахского, кыргызского, узбекского и таджикского.

Все методы API Обсудить API-интеграцию

Частые вопросы

Можно ли разместить модели в контуре заказчика?

Да. Собственные модели Speech Expert можно разместить в инфраструктуре заказчика. На пилоте согласуем языки, состав моделей, требования к оборудованию и интеграцию. Внешние STT- и LLM-сервисы обсуждаем отдельно: они не становятся локальными при размещении наших моделей.

Какие языки поддерживает распознавание?

Русский, казахский, кыргызский, узбекский, таджикский и английский — для обычных файлов, длинных записей и живого потока. Таджикские файлы в обычном режиме распознаются внешними Gemini 3.5 Transcribe или ElevenLabs Scribe v2; таджикский поток работает в контуре Speech Expert. Выберите язык и проверьте маршрут до запуска.

Какие форматы поддерживаются?

WAV с PCM- и IEEE Float-сэмплами, MP3, M4A, OGG, WebM, FLAC, MP4, MOV и MKV. Обычный файл — до 500 МБ; длинный аудиофайл в потоковом режиме — до 10 ГБ.

Можно ли распознать многочасовую диктофонную запись?

Да. Потоковый режим принимает один аудиофайл до 10 ГБ на любом из шести языков. Текст и таймкоды появляются по мере обработки. Участники, автоматическая коррекция и отчёты во время потока недоступны. Вкладку нужно оставить открытой; фоновой обработки и возобновления нет, после обрыва запуск начинается заново. Для казахского, кыргызского, узбекского и таджикского таймкоды относятся к аудиофрагментам.

Насколько точно разделяются участники?

В обычном файловом режиме для большинства mono-моделей можно указать до 20 участников; Gemini определяет до 8 и принимает записи до 30 минут. Шум, микрофоны и одновременная речь влияют на результат. Разделение участников недоступно в потоковых режимах.

Какие данные передаются внешним провайдерам?

Google API или ElevenLabs получают аудио при выборе соответствующей внешней STT-модели; коррекция, извлечение сущностей, отчёты и перевод могут передавать текст настроенному LLM-провайдеру. В приватном режиме текстовые этапы требуют отдельного разрешения.

Можно ли удалить исходное аудио?

Да. Можно удалить только аудио, сохранив транскрипт, источники, отчёты и готовые материалы, либо удалить запись полностью.

Есть ли API?

Да. Доступны REST, SSE, WebSocket и gRPC; поддерживаются OpenAI- и SpeechKit-совместимые методы. Файлы и живой поток — на всех шести языках.

Как рассчитываются кредиты?

Один кредит — 0,04 ₽. Примеры: 60 минут русского интервью с участниками на SpeechExpert-STT-RU — 19,08 ₽; казахского или кыргызского на GigaAM либо узбекского на SpeechExpert-STT-UZ — 30 ₽. Два часа русской лекции в потоковом режиме без участников — 33,60 ₽. Отчёты по готовой расшифровке пока без дополнительного списания. Ставка зависит от модели и опций и видна до запуска.

Сколько можно обработать бесплатно после регистрации?

После подтверждения регистрации начислим 1 000 кредитов без привязки карты. Этого хватит примерно на 238 минут SpeechExpert-STT-RU без разделения участников или до пяти интервью по 25 минут с разделением. Это альтернативные примеры расходования одного бонуса.

Можно ли обработать серию интервью?

Да. В один исследовательский отчёт можно объединить от 2 до 20 сохранённых транскриптов.

Можно ли работать от юридического лица?

Да. Условия пилота, размещения в контуре заказчика и API-интеграции можно согласовать через форму связи: напишите нам.

Проверьте наши модели на своих записях

1 000 кредитов после подтверждения регистрации. Без привязки карты.

Попробовать бесплатно Обсудить размещение Документация Новости