Перейти к содержанию

Быстрый старт

Создайте API-ключ и распознайте короткую запись на русском. Первый запрос использует OpenAI-совместимый метод и возвращает текст в JSON.

1. Получите API-ключ

  1. Откройте регистрацию Speech Expert и укажите email и пароль.
  2. Подтвердите email по ссылке из письма.
  3. Войдите с теми же email и паролем.
  4. В меню Управление → API ключи нажмите Создать ключ. Можно также открыть страницу ключей после входа.
  5. Задайте имя, например first-request, нажмите Создать и скопируйте ключ.

Ключ создаётся отдельно от регистрации. Он доступен в кабинете; храните его как секрет и передавайте только своему серверному приложению. Начальный баланс и списания можно посмотреть в разделе Личный кабинет.

2. Подготовьте запись и ключ

Положите короткую запись русской речи audio.wav в текущую папку терминала. Подойдёт также MP3: тогда замените имя файла в примере на audio.mp3. Вместо YOUR_API_KEY укажите созданный ключ. Переменная ниже действует в текущем терминале.

$env:SPEECH_EXPERT_API_KEY = "YOUR_API_KEY"
export SPEECH_EXPERT_API_KEY="YOUR_API_KEY"

3. Отправьте первый запрос

Для cURL и Python используется один и тот же метод: POST https://speech-expert.ru/api/v1/audio/transcriptions. Модель SpeechExpert-STT-RU распознаёт русский файл, language=ru задаёт язык, а response_format=json выбирает JSON-ответ.

На Windows вызывайте curl.exe. Для переноса строки в PowerShell используется обратная кавычка; после неё не должно быть пробелов.

curl.exe --fail-with-body --request POST "https://speech-expert.ru/api/v1/audio/transcriptions" `
  --header "Authorization: Bearer $env:SPEECH_EXPERT_API_KEY" `
  --form "file=@audio.wav" `
  --form "model=SpeechExpert-STT-RU" `
  --form "language=ru" `
  --form "response_format=json"
curl --fail-with-body --request POST "https://speech-expert.ru/api/v1/audio/transcriptions" \
  --header "Authorization: Bearer $SPEECH_EXPERT_API_KEY" \
  --form "file=@audio.wav" \
  --form "model=SpeechExpert-STT-RU" \
  --form "language=ru" \
  --form "response_format=json"

В том же терминале, где задана переменная SPEECH_EXPERT_API_KEY, установите клиент:

python -m pip install openai

Сохраните пример в transcribe.py рядом с audio.wav:

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://speech-expert.ru/api/v1",
    api_key=os.environ["SPEECH_EXPERT_API_KEY"],
)

with open("audio.wav", "rb") as audio:
    result = client.audio.transcriptions.create(
        model="SpeechExpert-STT-RU",
        file=audio,
        language="ru",
        response_format="json",
    )

print(result.text)

Запустите:

python transcribe.py

Проверьте результат

Успешный cURL-запрос возвращает HTTP 200 и объект с полем text. Например, для записи с соответствующей фразой:

{
  "text": "Привет! Это проверка распознавания речи."
}

Python-пример выводит распознанную фразу через print(result.text). Содержание ответа зависит от вашей записи. Этот запрос возвращает только текст; для таймкодов и разделения участников используйте STT v1.

Если запрос завершился ошибкой, проверьте код ответа:

Код Что проверить
401 Ключ скопирован целиком, активен и передан в заголовке Authorization
402 На аккаунте достаточно кредитов для распознавания
400 Формат файла, язык и модель соответствуют параметрам метода

Полные параметры и ответы описаны в OpenAI-совместимом API.

Следующий шаг

  • Другие языки и модели — выберите совместимые model и language; язык сам по себе не переключает модель.
  • Фоновое распознавание — загрузите файл, получите ID операции и опрашивайте её статус с тем же API-ключом.
  • Живой поток — передавайте аудио через WebSocket или gRPC и получайте текст по мере речи.
  • Синтез речи — получите аудио из текста через OpenAI-совместимый метод.