マルチモーダル機能は選択したモデルに依存します。現在利用可能なマルチモーダルモデルは GET /v1/models またはコンソールの価格ページで確認してください。
画像
OpenAI スタイルの画像生成:
curl https://llmoxy.com/v1/images/generations \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "dall-e-3",
"prompt": "A clean product icon for an LLM gateway",
"size": "1024x1024",
"response_format": "url"
}'
LLMoxy は、選択したモデルが対応していれば、モデル固有の画像パラメーターも転送します。
画像編集ルート:
POST /v1/images/edits
POST /v1/edits
音声
テキスト読み上げ:
curl https://llmoxy.com/v1/audio/speech \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"input": "Hello from LLMoxy.",
"voice": "alloy",
"response_format": "mp3"
}' \
--output speech.mp3
音声文字起こしと翻訳は multipart フォームアップロードを使用します:
POST /v1/audio/transcriptions
POST /v1/audio/translations
動画
OpenAI 互換の動画生成:
curl https://llmoxy.com/v1/videos \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
-F model=sora-2 \
-F prompt="cute cat dance" \
-F seconds=8
状態を照会:
curl "https://llmoxy.com/v1/videos/$TASK_ID" \
-H "Authorization: Bearer <LLMOXY_API_KEY>"
コンテンツをダウンロード:
curl "https://llmoxy.com/v1/videos/$TASK_ID/content" \
-H "Authorization: Bearer <LLMOXY_API_KEY>" \
--output output.mp4
LLMoxy は POST /v1/video/generations の JSON 動画生成インターフェースや、Kling、Jimeng などのベンダースタイルルートもサポートしています。具体的な対応モデルはコンソールのモデルリストを確認してください。
Realtime
Realtime は WebSocket エンドポイントを使用します:
wss://llmoxy.com/v1/realtime?model=gpt-4o-realtime-preview
サーバーサイドクライアントはハンドシェイク時に標準認証ヘッダーを使用できます。ブラウザクライアントは OpenAI スタイルのサブプロトコルキー形式を使用できます。
