logo

Multimodal

Les capacités multimodales dépendent du modèle sélectionné. Confirmez les modèles multimodaux actuellement disponibles via GET /v1/models ou la page de tarification de la console.

Images

Génération d'images de style OpenAI :

curl https://llmoxy.com/v1/images/generations \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "dall-e-3",
    "prompt": "A clean product icon for an LLM gateway",
    "size": "1024x1024",
    "response_format": "url"
  }'

LLMoxy transmet également les paramètres d'image spécifiques au modèle, tant que le modèle sélectionné les prend en charge.

Routes de modification d'images :

POST /v1/images/edits
POST /v1/edits

Audio

Synthèse vocale :

curl https://llmoxy.com/v1/audio/speech \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1",
    "input": "Hello from LLMoxy.",
    "voice": "alloy",
    "response_format": "mp3"
  }' \
  --output speech.mp3

La transcription et la traduction audio utilisent un téléchargement de formulaire multipart :

POST /v1/audio/transcriptions
POST /v1/audio/translations

Vidéo

Génération vidéo compatible OpenAI :

curl https://llmoxy.com/v1/videos \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  -F model=sora-2 \
  -F prompt="cute cat dance" \
  -F seconds=8

Interroger l'état :

curl "https://llmoxy.com/v1/videos/$TASK_ID" \
  -H "Authorization: Bearer <LLMOXY_API_KEY>"

Télécharger le contenu :

curl "https://llmoxy.com/v1/videos/$TASK_ID/content" \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  --output output.mp4

LLMoxy prend également en charge l'interface de génération vidéo JSON POST /v1/video/generations, ainsi que les routes de style fournisseur telles que Kling et Jimeng. Consultez la liste de modèles de la console pour les modèles spécifiques pris en charge.

Realtime

Realtime utilise un point de terminaison WebSocket :

wss://llmoxy.com/v1/realtime?model=gpt-4o-realtime-preview

Les clients côté serveur peuvent utiliser les en-têtes d'authentification standard lors de la poignée de main ; les clients navigateur peuvent utiliser le format de clé de sous-protocole de style OpenAI.