API reference
API説明
申込で発行された API キーで認証する、テキスト・非ストリーミングの推論APIです。OpenAI形式の Chat Completions の一部に対応しています(完全互換ではありません)。
認証
Authorization: Bearer <API キー> ヘッダーで送ります。URLのクエリにキーを含めないでください。
エンドポイント
| Method / Path | 認証 | 内容 |
|---|---|---|
GET /v1/models | 必要 | 公開プロファイル一覧 |
POST /v1/chat/completions | 必要 | 非ストリーミング推論 |
GET /healthz | 不要 | プロセスの生存確認 |
GET /readyz | 必要 | 推論を受け付けられる状態か(停止中は 503)。詳細は返しません |
モデル
sei-mini-v0— SEI Mini: 軽量モデルを中心とした、短い文章処理・会話向けプロファイルsei-standard-v0— SEI Standard: 依頼の内容に応じて、より強い推論設定・モデルまで選択するプロファイル
モデルIDは処理プロファイルの名前です。同じ依頼でも内部の処理方式は変わることがあります。
リクエスト
| フィールド | 条件 |
|---|---|
model | 必須。上記のモデルID |
messages | 必須。1〜32件。role は system / developer / user / assistant。content は空でない文字列のみ。最後は user。system / developer は会話より前に置く |
max_completion_tokens | 任意。64〜4096の整数(既定 2048)。推論用のトークンも含む上限です。考える必要のある依頼で小さく指定すると、推論だけで上限に達し、本文が空のまま finish_reason: length で返ることがあります |
stream | 省略または false のみ |
n | 省略または 1 のみ |
上記以外のフィールド(temperature、top_p、max_tokens、stop、tools、response_format など)は無視せず 400 で拒否します。messages をJSON化したサイズは UTF-8 で 24000 bytes 以下です。
レスポンス
chat.completion 形式で返します。usage は回答生成のトークン数で、取得できなかった場合は省略します。finish_reason が length の場合は出力上限で打ち切られています。回答が拒否された場合は message.refusal に理由が入り、content は null になることがあります。全レスポンスに X-Request-ID ヘッダーが付きます。
エラー
| HTTP | code | 状況 |
|---|---|---|
| 400 | invalid_request / unsupported_parameter / model_not_found | 未対応のフィールド・型・role・model |
| 401 | invalid_api_key | キーがない・誤り・失効 |
| 413 | request_too_large | 本文サイズ超過 |
| 415 | unsupported_media_type | JSON以外の Content-Type、非対応の Content-Encoding |
| 429 | rate_limit_exceeded / daily_limit_exceeded / concurrency_limit_exceeded | 回数・同時実行の上限。可能な場合 Retry-After を返します。日次上限は UTC 基準 |
| 500 | internal_error | 運営側の不具合 |
| 502 | upstream_response_error | 処理結果を正しく扱えなかった |
| 503 | service_unavailable / upstream_unavailable / upstream_busy | 停止中、または処理先が利用できない・混雑 |
| 504 | upstream_timeout | 期限切れ |
再試行は新しいリクエストとして上限を消費します。冪等な再送・回答の再取得は保証していません。コード例では自動再試行を無効にしています。