«А откуда такой вывод?»
«Нейросеть так решила» — не ссылка на источник. Откройте исходную реплику и её контекст, чтобы проверить, подтверждают ли они вывод.
Превращайте аудио в транскрипты, итоги встреч и отчёты с источниками. Собственные речевые модели, понятные настройки и контроль обработки — в облаке или в вашем контуре.
Русский, казахский, кыргызский, узбекский и таджикский. Также английский. Проверьте качество в облачном сервисе на своих записях.
Попробовать бесплатно Обсудить внедрение Подключить API
1 000 кредитов после подтверждения регистрации. Без привязки карты.
В основе Speech Expert — собственные модели распознавания для русского и других языков. Подбираем модель под язык и тип записи; состав решения для вашего контура согласуем на пилоте.
Внешние Gemini 3.5 Transcribe через Google API и ElevenLabs Scribe v2 распознают файлы на всех шести языках. Выбранная модель и маршрут обработки видны до запуска. При выборе модели в контуре Speech Expert аудио не передаётся внешнему STT-провайдеру.
Во всех трёх режимах доступны русский, английский, казахский, кыргызский, узбекский и таджикский. Язык выбирается перед запуском.
| Режим | Результат | Условия |
|---|---|---|
| Обычный файл до 500 МБ | Текст, разделение участников, коррекция и отчёты по выбранным опциям. | До 20 участников; у Gemini — до 8 и запись до 30 минут. Возможности зависят от модели. |
| Длинный аудиофайл до 10 ГБ | Текст и таймкоды по мере обработки, экспорт. Ручная нарезка не нужна. | Без разделения участников, автоматической коррекции и отчётов во время потока. Вкладка остаётся открытой; фоновой обработки и возобновления нет. После обрыва запуск начинается заново. |
| Живой поток | Предварительный текст и финалы фраз во время речи. | Все шесть языков в контуре Speech Expert. Без разделения участников, коррекции и отчётов во время потока. |
В потоковых режимах для казахского, кыргызского, узбекского и таджикского таймкоды относятся к аудиофрагментам, а не к отдельным словам. Для длинного файла кредиты списываются за уже обработанную длительность.
Разместим модели Speech Expert в вашей инфраструктуре и подключим к рабочим системам. На пилоте согласуем языки, состав моделей, требования к оборудованию и критерии качества на ваших записях.
Обсудить размещение Обсудить API-интеграцию Свой speech-инженер или готовый сервис
По договорённости поможем с разметкой ваших данных на русском и языках СНГ: казахском, кыргызском, узбекском и таджикском.
Языки разметки: русский, казахский, кыргызский, узбекский и таджикский.
Состав разметки, объём, требования к результату, сроки и стоимость согласуем под вашу задачу.
Разработчикам: распознавание и синтез через API.
Синтетический пример показывает транскрипт с участниками и таймкодами, исследовательский отчёт, итоги встречи, контент-пакет и структурированный JSON.
Ключевые выводы, решения и задачи можно проверить по подтверждающим цитатам. Когда данные доступны, источник показывает спикера и таймкод. Язык саммари можно выбрать отдельно, полный перевод сохранить рядом с исходным транскриптом.
Открыть пример отчёта без регистрации
Вероятностные эмоциональные эпизоды связаны с таймкодом, репликой и, при однозначной атрибуции, спикером. Это сигнал для ручной проверки исходного аудио, а не оценка состояния или намерений человека. Его нельзя использовать как основание кадровых, медицинских, кредитных или страховых решений.
«Но ведь расшифровать можно бесплатно?»
Можно. Можно даже собрать всё из бесплатных сервисов.
Если собирать всё по частям: получить текст в боте, попросить другую нейросеть сделать выводы, найти подтверждающие реплики, сопоставить интервью, собрать результат для коллег.
Speech Expert связывает эти шаги: расшифровку, итоги встречи, исследовательский отчёт и подтверждающие цитаты. Несколько интервью можно объединить в общий анализ.
«Нейросеть так решила» — не ссылка на источник. Откройте исходную реплику и её контекст, чтобы проверить, подтверждают ли они вывод.
От 2 до 20 сохранённых интервью — в одном исследовательском отчёте. Сопоставляйте общие темы, барьеры и выводы с источниками.
Итоги разговора: резюме, решения, задачи и подтверждающие фрагменты. Скачайте отчёт по записи в PDF или DOCX, с полной расшифровкой или без неё.
Анна · 18:42
«Да, расчёт я возьму на себя. В четверг пришлю».
Требует проверки
Отправить расчёт
Ваше действие: Проверить и подтвердить
После подтверждения и смены статуса
Отправить расчёт
Статус: В работе
После подтверждения поручение остаётся в списке ваших договорённостей: с исполнителем, сроком, статусом и ссылкой на исходную реплику.
Возьмите запись, с которой вам ещё предстоит поработать. Посмотрите, сколько этой работы можно не делать вручную.
Посмотреть, что получится после расшифровки Разобрать свою запись
Спикеры и таймкоды отображаются, когда они доступны в выбранном режиме. Прослушивание фрагментов — при сохранённом аудио.
Для компаний: распознавание по API и собственные модели в вашем контуре.
Стоимость размещения в контуре заказчика рассчитываем отдельно — по составу моделей, нагрузке и инфраструктуре.
Примеры относятся к указанным моделям и опциям. Один кредит — 0,04 ₽. Операции округляются до начатой секунды; итоговая ставка видна до запуска.
Отчёты по готовой расшифровке пока не требуют отдельного списания кредитов. Дополнительные текстовые этапы и внешние модели выбираются отдельно.
Загрузите аудио, видео или публичную ссылку. Speech Expert разделит речь по спикерам, переведёт реплики и озвучит их по подходящим голосовым образцам из записи с учётом исходного тайминга.
Источники: YouTube, VK Видео, VK Play, RuTube, Яндекс Видео, Дзен, Одноклассники и Vimeo; доступность зависит от площадки.
Редактируйте текст, спикера и тайминг, передублируйте изменённый фрагмент. Скачивайте WAV, переведённые SRT/VTT, двуязычный транскрипт и MP4, если у источника доступен видеоряд. Если для спикера недостаточно подходящего голосового фрагмента, его исходная реплика сохраняется без дубляжа.
Для запуска нужно подтвердить право использовать и клонировать голоса участников.
Вставьте до 40 000 символов, выберите один голос или назначьте голоса ролям. Speech Expert разделит текст по фразам и соберёт единый WAV с выбранными паузами.
Порядок реплик, прогресс и частичный результат сохраняются на сервере. Используйте свой голос или голос спикера, который дал согласие.
Для обработки в инфраструктуре организации доступно размещение моделей в контуре заказчика. Состав решения и внешние интеграции согласуем отдельно. В облачном сервисе вы управляете хранением и выбираете маршрут обработки.
В приватном режиме результат не добавляется в архив, а временные данные обработки удаляются после завершения. Google API или ElevenLabs получают аудио только при выборе соответствующей внешней STT-модели.
Коррекция, извлечение сущностей, отчёты и перевод могут передавать текст настроенному LLM-провайдеру. В приватном режиме эти этапы выключены до отдельного разрешения. Для обычной записи аудио можно удалить отдельно, сохранив транскрипт и готовые материалы.
Начните с одного аудиофайла: создайте ключ, скопируйте запрос и получите текст. Для приложений на OpenAI SDK используйте адрес Speech Expert и нашу модель.
Получить API-ключ Быстрый старт
1 000 кредитов после подтверждения регистрации. Без привязки карты.
curl -X POST "https://speech-expert.ru/api/v1/audio/transcriptions" \
-H "Authorization: Bearer <API_KEY>" \
-F "model=SpeechExpert-STT-RU" \
-F "language=ru" \
-F "file=@interview.wav"
Пример cURL для macOS и Linux; вариант для Windows есть в быстром старте.
Ответ API · пример:
{"text": "Добрый день! Начинаем встречу."}
REST, SSE, WebSocket и gRPC; OpenAI- и SpeechKit-совместимые методы. Файловое распознавание и живой поток доступны для русского, английского, казахского, кыргызского, узбекского и таджикского.
Да. Собственные модели Speech Expert можно разместить в инфраструктуре заказчика. На пилоте согласуем языки, состав моделей, требования к оборудованию и интеграцию. Внешние STT- и LLM-сервисы обсуждаем отдельно: они не становятся локальными при размещении наших моделей.
Русский, казахский, кыргызский, узбекский, таджикский и английский — для обычных файлов, длинных записей и живого потока. Таджикские файлы в обычном режиме распознаются внешними Gemini 3.5 Transcribe или ElevenLabs Scribe v2; таджикский поток работает в контуре Speech Expert. Выберите язык и проверьте маршрут до запуска.
WAV с PCM- и IEEE Float-сэмплами, MP3, M4A, OGG, WebM, FLAC, MP4, MOV и MKV. Обычный файл — до 500 МБ; длинный аудиофайл в потоковом режиме — до 10 ГБ.
Да. Потоковый режим принимает один аудиофайл до 10 ГБ на любом из шести языков. Текст и таймкоды появляются по мере обработки. Участники, автоматическая коррекция и отчёты во время потока недоступны. Вкладку нужно оставить открытой; фоновой обработки и возобновления нет, после обрыва запуск начинается заново. Для казахского, кыргызского, узбекского и таджикского таймкоды относятся к аудиофрагментам.
В обычном файловом режиме для большинства mono-моделей можно указать до 20 участников; Gemini определяет до 8 и принимает записи до 30 минут. Шум, микрофоны и одновременная речь влияют на результат. Разделение участников недоступно в потоковых режимах.
Google API или ElevenLabs получают аудио при выборе соответствующей внешней STT-модели; коррекция, извлечение сущностей, отчёты и перевод могут передавать текст настроенному LLM-провайдеру. В приватном режиме текстовые этапы требуют отдельного разрешения.
Да. Можно удалить только аудио, сохранив транскрипт, источники, отчёты и готовые материалы, либо удалить запись полностью.
Да. Доступны REST, SSE, WebSocket и gRPC; поддерживаются OpenAI- и SpeechKit-совместимые методы. Файлы и живой поток — на всех шести языках.
Один кредит — 0,04 ₽. Примеры: 60 минут русского интервью с участниками на SpeechExpert-STT-RU — 19,08 ₽; казахского или кыргызского на GigaAM либо узбекского на SpeechExpert-STT-UZ — 30 ₽. Два часа русской лекции в потоковом режиме без участников — 33,60 ₽. Отчёты по готовой расшифровке пока без дополнительного списания. Ставка зависит от модели и опций и видна до запуска.
После подтверждения регистрации начислим 1 000 кредитов без привязки карты. Этого хватит примерно на 238 минут SpeechExpert-STT-RU без разделения участников или до пяти интервью по 25 минут с разделением. Это альтернативные примеры расходования одного бонуса.
Да. В один исследовательский отчёт можно объединить от 2 до 20 сохранённых транскриптов.
Да. Условия пилота, размещения в контуре заказчика и API-интеграции можно согласовать через форму связи: напишите нам.
1 000 кредитов после подтверждения регистрации. Без привязки карты.
Попробовать бесплатно Обсудить размещение Документация Новости