Мультимодальные возможности зависят от выбранной модели. Подтвердите текущие доступные мультимодальные модели через GET /v1/models или страницу цен в консоли.
Изображения
Генерация изображений в стиле OpenAI:
curl https://llmoxy.com/v1/images/generations \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "dall-e-3",
"prompt": "A clean product icon for an LLM gateway",
"size": "1024x1024",
"response_format": "url"
}'
LLMoxy также пересылает специфичные для модели параметры изображений, если выбранная модель их поддерживает.
Маршруты редактирования изображений:
POST /v1/images/edits
POST /v1/edits
Аудио
Преобразование текста в речь:
curl https://llmoxy.com/v1/audio/speech \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"input": "Hello from LLMoxy.",
"voice": "alloy",
"response_format": "mp3"
}' \
--output speech.mp3
Транскрипция и перевод аудио используют загрузку через multipart-форму:
POST /v1/audio/transcriptions
POST /v1/audio/translations
Видео
Генерация видео, совместимая с OpenAI:
curl https://llmoxy.com/v1/videos \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
-F model=sora-2 \
-F prompt="cute cat dance" \
-F seconds=8
Запрос статуса:
curl "https://llmoxy.com/v1/videos/$TASK_ID" \
-H "Authorization: Bearer <LLMOXY_API_KEY>"
Скачивание контента:
curl "https://llmoxy.com/v1/videos/$TASK_ID/content" \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
--output output.mp4
LLMoxy также поддерживает JSON-интерфейс генерации видео POST /v1/video/generations, а также маршруты в стиле поставщиков, такие как Kling и Jimeng. Конкретные поддерживаемые модели см. в списке моделей консоли.
Realtime
Realtime использует WebSocket-эндпоинт:
wss://llmoxy.com/v1/realtime?model=gpt-4o-realtime-preview
Клиенты на стороне сервера могут использовать стандартные заголовки аутентификации при рукопожатии; браузерные клиенты могут использовать формат ключа подпротокола в стиле OpenAI.
