logo

マルチモーダル

マルチモーダル機能は選択したモデルに依存します。現在利用可能なマルチモーダルモデルは GET /v1/models またはコンソールの価格ページで確認してください。

画像

OpenAI スタイルの画像生成:

curl https://llmoxy.com/v1/images/generations \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "dall-e-3",
    "prompt": "A clean product icon for an LLM gateway",
    "size": "1024x1024",
    "response_format": "url"
  }'

LLMoxy は、選択したモデルが対応していれば、モデル固有の画像パラメーターも転送します。

画像編集ルート:

POST /v1/images/edits
POST /v1/edits

音声

テキスト読み上げ:

curl https://llmoxy.com/v1/audio/speech \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1",
    "input": "Hello from LLMoxy.",
    "voice": "alloy",
    "response_format": "mp3"
  }' \
  --output speech.mp3

音声文字起こしと翻訳は multipart フォームアップロードを使用します:

POST /v1/audio/transcriptions
POST /v1/audio/translations

動画

OpenAI 互換の動画生成:

curl https://llmoxy.com/v1/videos \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  -F model=sora-2 \
  -F prompt="cute cat dance" \
  -F seconds=8

状態を照会:

curl "https://llmoxy.com/v1/videos/$TASK_ID" \
  -H "Authorization: Bearer <LLMOXY_API_KEY>"

コンテンツをダウンロード:

curl "https://llmoxy.com/v1/videos/$TASK_ID/content" \
  -H "Authorization: Bearer <LLMOXY_API_KEY>" \
  --output output.mp4

LLMoxy は POST /v1/video/generations の JSON 動画生成インターフェースや、Kling、Jimeng などのベンダースタイルルートもサポートしています。具体的な対応モデルはコンソールのモデルリストを確認してください。

Realtime

Realtime は WebSocket エンドポイントを使用します:

wss://llmoxy.com/v1/realtime?model=gpt-4o-realtime-preview

サーバーサイドクライアントはハンドシェイク時に標準認証ヘッダーを使用できます。ブラウザクライアントは OpenAI スタイルのサブプロトコルキー形式を使用できます。