すべてのモデルに宛先はひとつ
コードはゲートウェイを呼ぶだけです。どのプロバイダーが応じるかはゲートウェイが決め、何が起きたかを記録します。
ゲートウェイが肩代わりするもの
二つ目のモデル、二つ目のプロバイダー、二つ目のチームが加わった瞬間に発生する作業です。
切り替えはこちらの仕事
プロバイダーが遅くなるか失敗すると、ポリシー上の次の候補がデプロイなしで引き取ります。
効く支出上限
チーム単位・キー単位の上限をゲートウェイで強制します。請求書で気づくのでは遅すぎます。
プロバイダーの鍵は一か所に
アプリが持つのはゲートウェイの鍵だけ。プロバイダーの資格情報はゲートウェイから出ません。
同じ作業は二度課金されない
同一のリクエストはキャッシュから返り、ヒット率が費用の隣に表示されます。
ゲートウェイが対応する範囲
- プロバイダー
- Anthropic、OpenAI、Google、Mistral、および自社で運用する OpenAI 互換エンドポイント。
- ルーティング
- 重み付け、コスト、レイテンシ、リージョン固定の各ポリシーと、順序付きのフェイルオーバー。
- 上限
- キー単位・チーム単位・モデル単位のレートおよび支出の上限。
- キャッシュ
- 完全一致とプロンプト前方一致。ルートごとに設定できます。
- 記録
- すべてのリクエストをモデル、トークン、費用、レイテンシ、呼び出し元とともに保持します。
本番をここに通す前に
すべてのモデル呼び出しの前段に単一の部品が立つとき、プラットフォームチームが確認することです。