> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 概要

**AI 推論**向けに特化して設計された GPU エラスティックコンテナ製品です。コンテナイメージのアドレスを指定し、ビジネスシナリオに応じて簡単な設定を行うだけで、AI 推論サービスをすばやくデプロイできます。

## 機能

* **エラスティックスケーリング**機能により、ビジネストラフィックのピーク時には自動的にスケールアップし、トラフィックが少ない時間帯にはスケールダウンします。サービスの安定性を確保しながら、可能な限りコストを削減します。
* 組み込みの効率的な**ロードバランシング**により、リクエスト負荷が各 GPU コンテナインスタンスへ均等に分散されます。
* 課金は**秒単位で正確**に行われ、GPU コンテナインスタンスの実際の実行時間に対してのみ課金されます。
* GPU コンテナインスタンスの予約、イメージのプリヒート、高性能ハードウェアなどの技術により、**秒単位のコールドスタート**を実現し、トラフィックピークにも容易に対応できます。
* 完全な**ログパネル**により、リアルタイムのログストリームをクエリでき、潜在的な問題をすばやく特定して解決するのに役立ちます。

## 用語

* **コンテナイメージアドレス**: Docker コンテナイメージのアドレスを指し、現在は **「パブリックイメージ」** と **「プライベートイメージ」** をサポートしています。
* **Serverless Endpoint**: GPU エラスティックコンテナインスタンスを表します。**worker**、**load balancer**、**elastic scaler** などのコンポーネントが含まれます。
* **Worker**: serverless endpoint が特定のリクエストを処理するために使用する GPU コンテナインスタンスです。1 つの Worker は 1 つの GPU コンテナインスタンスに対応します。
* **Scale Policy**: トラフィックピーク時に自動的にスケールアップし、トラフィックが少ない時間帯にスケールダウンするロジックを制御するために使用されます。
* **Health Check Path**: 組み込みのロードバランサーはこのパスを通じてヘルスチェックを実行し、返されたステータスコードが `200` であるかどうかに基づいて、リクエストを Worker に転送するかどうかを判断します。
