Быстрый старт¶
Создайте API-ключ и распознайте короткую запись на русском. Первый запрос использует OpenAI-совместимый метод и возвращает текст в JSON.
1. Получите API-ключ¶
- Откройте регистрацию Speech Expert и укажите email и пароль.
- Подтвердите email по ссылке из письма.
- Войдите с теми же email и паролем.
- В меню Управление → API ключи нажмите Создать ключ. Можно также открыть страницу ключей после входа.
- Задайте имя, например
first-request, нажмите Создать и скопируйте ключ.
Ключ создаётся отдельно от регистрации. Он доступен в кабинете; храните его как секрет и передавайте только своему серверному приложению. Начальный баланс и списания можно посмотреть в разделе Личный кабинет.
2. Подготовьте запись и ключ¶
Положите короткую запись русской речи audio.wav в текущую папку терминала.
Подойдёт также MP3: тогда замените имя файла в примере на audio.mp3.
Вместо YOUR_API_KEY укажите созданный ключ. Переменная ниже действует в
текущем терминале.
3. Отправьте первый запрос¶
Для cURL и Python используется один и тот же метод:
POST https://speech-expert.ru/api/v1/audio/transcriptions.
Модель SpeechExpert-STT-RU распознаёт русский файл, language=ru
задаёт язык, а response_format=json выбирает JSON-ответ.
На Windows вызывайте curl.exe. Для переноса строки в PowerShell
используется обратная кавычка; после неё не должно быть пробелов.
В том же терминале, где задана переменная SPEECH_EXPERT_API_KEY,
установите клиент:
Сохраните пример в transcribe.py рядом с audio.wav:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://speech-expert.ru/api/v1",
api_key=os.environ["SPEECH_EXPERT_API_KEY"],
)
with open("audio.wav", "rb") as audio:
result = client.audio.transcriptions.create(
model="SpeechExpert-STT-RU",
file=audio,
language="ru",
response_format="json",
)
print(result.text)
Запустите:
Проверьте результат¶
Успешный cURL-запрос возвращает HTTP 200 и объект с полем text.
Например, для записи с соответствующей фразой:
Python-пример выводит распознанную фразу через print(result.text).
Содержание ответа зависит от вашей записи. Этот запрос возвращает только
текст; для таймкодов и разделения участников используйте
STT v1.
Если запрос завершился ошибкой, проверьте код ответа:
| Код | Что проверить |
|---|---|
401 |
Ключ скопирован целиком, активен и передан в заголовке Authorization |
402 |
На аккаунте достаточно кредитов для распознавания |
400 |
Формат файла, язык и модель соответствуют параметрам метода |
Полные параметры и ответы описаны в OpenAI-совместимом API.
Следующий шаг¶
- Другие языки и модели — выберите совместимые
modelиlanguage; язык сам по себе не переключает модель. - Фоновое распознавание — загрузите файл, получите ID операции и опрашивайте её статус с тем же API-ключом.
- Живой поток — передавайте аудио через WebSocket или gRPC и получайте текст по мере речи.
- Синтез речи — получите аудио из текста через OpenAI-совместимый метод.