Skip to main content
AI 推論向けに特化して設計された GPU エラスティックコンテナ製品です。コンテナイメージのアドレスを指定し、ビジネスシナリオに応じて簡単な設定を行うだけで、AI 推論サービスをすばやくデプロイできます。

機能

  • エラスティックスケーリング機能により、ビジネストラフィックのピーク時には自動的にスケールアップし、トラフィックが少ない時間帯にはスケールダウンします。サービスの安定性を確保しながら、可能な限りコストを削減します。
  • 組み込みの効率的なロードバランシングにより、リクエスト負荷が各 GPU コンテナインスタンスへ均等に分散されます。
  • 課金は秒単位で正確に行われ、GPU コンテナインスタンスの実際の実行時間に対してのみ課金されます。
  • GPU コンテナインスタンスの予約、イメージのプリヒート、高性能ハードウェアなどの技術により、秒単位のコールドスタートを実現し、トラフィックピークにも容易に対応できます。
  • 完全なログパネルにより、リアルタイムのログストリームをクエリでき、潜在的な問題をすばやく特定して解決するのに役立ちます。

用語

  • コンテナイメージアドレス: Docker コンテナイメージのアドレスを指し、現在は 「パブリックイメージ」「プライベートイメージ」 をサポートしています。
  • Serverless Endpoint: GPU エラスティックコンテナインスタンスを表します。workerload balancerelastic scaler などのコンポーネントが含まれます。
  • Worker: serverless endpoint が特定のリクエストを処理するために使用する GPU コンテナインスタンスです。1 つの Worker は 1 つの GPU コンテナインスタンスに対応します。
  • Scale Policy: トラフィックピーク時に自動的にスケールアップし、トラフィックが少ない時間帯にスケールダウンするロジックを制御するために使用されます。
  • Health Check Path: 組み込みのロードバランサーはこのパスを通じてヘルスチェックを実行し、返されたステータスコードが 200 であるかどうかに基づいて、リクエストを Worker に転送するかどうかを判断します。
最終更新日 2026年5月15日