StarSling が Novita Agent Sandbox で自己改善型 CI を構築する方法

StarSling が Novita Agent Sandbox で自己改善型 CI を構築する方法

StarSling は、GitHub Actions パイプラインが重いビルド負荷、長い待ち時間、複雑なテストワークフローに直面している研究開発チーム向けの AI ネイティブ CI プラットフォームです。その目標は、単に高速な CI だけではなく、自己改善を続ける CI です。つまり、実行を分析し、最適化を提案し、安全にテストし、成功した変更を本番環境に対応したプルリクエストに変えます。このループを実用的にするために、StarSling は Novita Agent Sandbox を実行レイヤーとして使用し、分離された microVM、伸縮自在なコンピューティング、エージェントの実験、再現可能な評価を実現しています。

この組み合わせが重要なのは、CI 最適化が本質的に実験的だからです。キャッシュ、並列化、テストシャーディング、ワークフロー構造への変更は、あるリポジトリには役立っても別のリポジトリには悪影響を与える可能性があります。StarSling には、顧客システムを危険にさらさずに実際の条件で変更を試す方法が必要です。Novita Agent Sandbox は各実験に制御されたワークスペースを提供し、昇格の判断は証拠とレビューに委ねます。

このケーススタディでは、CI 最適化の自動化が難しい理由、StarSling がエージェントループをどのように実行するか、分離された実行が何を変えるか、そして同じアーキテクチャを他の AI ワークフローにどのように適用できるかを説明します。

CI 最適化の自動化が難しい理由

多くのエンジニアリングチームは、遅い CI が何をもたらすかすでに知っています。マージの遅延、無駄なレビューサイクル、フィードバックの遅れ、プロダクト作業の時間減少です。一般的な修正方法もよく知られています。依存関係のキャッシュ、テストのシャーディング、ジョブの並列化、冗長な作業の削減、不安定なチェックの削除、重要なフィードバックが早く得られるようにパイプラインを再構築することです。

難しいのは、これらのアイデアを挙げることではありません。特定のリポジトリに対してどの変更が安全で効果的かを証明することです。ワークフローファイルには、履歴的な制約、組織の好み、タイミングの前提、ログだけでは明らかでない依存関係がエンコードされています。同様のビルド時間を持つ 2 つのチームでも、必要な修正は異なる場合があります。一方にはより良いキャッシュが必要で、もう一方にはテスト分離、より多くの並列化、またはより小さなクリティカルパスが必要かもしれません。

手動最適化も、多くのリポジトリや顧客にまたがってうまくスケールしません。誰かがログを調査し、仮説を立て、ワークフローを編集し、ジョブを再実行し、結果を比較し、繰り返す必要があります。このプロセスは専門家の時間を消費し、パイプラインが進化するにつれて、うまくいったことを維持するのが難しくなります。

ここで AI エージェントが役立ちますが、それは安全な実行境界がある場合に限ります。StarSling のエージェントはワークフローとテレメトリを調査し、最適化の変更を生成し、提案する前にそれらの変更をテストします。そのループを本番 CI 内で直接実行すると、実験が危険で制御しにくくなります。エージェントは、運用上の危険を引き起こすことなく、行動し、失敗し、再試行し、測定する必要があります。

StarSling が最適化ループを実行する方法

StarSling は CI を、自己を観察し改善できるシステムとして扱います。ワークフローは証拠から始まります。ビルド時間、テストの動作、ログ、リソース使用量、パイプライン構造です。その証拠から、StarSling は候補となるボトルネックを特定できます。たとえば、繰り返されるセットアップ作業、不適切にシャーディングされたテスト、不要な直列化、必要以上に時間を費やすワークフローステップなどです。

次の段階は実験です。StarSling は提案された最適化を生成し、それが実際にパイプラインを改善するかどうかを確認します。実時間を短縮するか?コストを下げるか?正しさを維持するか?条件が変わったときにきれいに失敗するか?これらの問いには実行が必要であり、静的解析だけでは不十分です。

実験が成功すると、その結果はレビュー用の具体的な変更になります。ワークフローの更新、キャッシュの調整、テストシャーディングの変更、または別のパイプライン改善です。その出力をプルリクエストに保つことで、本番環境に到達する前にエンジニアが確認できる明確な成果物が得られます。

StarSling によると、顧客は CI が最大 6 倍高速化し、最大 13 倍安価になったと報告しています。これらは顧客の結果であり、普遍的な保証ではありません。結果はリポジトリの形状、テストスイート、インフラストラクチャ、存在するボトルネックの種類によって異なります。それでも、このパターンは有用です。自動化と測定を組み合わせることで、改善は推測ではなく、観測されたパイプラインの動作によって裏付けられます。

Novita Agent Sandbox が提供するもの

Novita Agent Sandbox は、StarSling にエージェントワークロード用の分離された microVM を提供します。顧客の CI システムや内部サービスと実行を直接共有する代わりに、各エージェント実行は独自の制御された環境を持つことができます。この分離により、探索的なコマンド、依存関係、失敗した実験が他の作業に干渉する可能性が低くなります。

2 番目の特性は伸縮性です。CI 最適化実験はバースト的です。調査中は多くの実行があり、変更がレビューの準備ができると少なくなります。サンドボックス化されたコンピューティングにより、StarSling は必要なときに実験を実行でき、すべての顧客実装が制約された内部リソースを待つことを避けられます。

3 番目の特性は再現性です。実験を再現することは、実際の改善とノイズを区別するのに役立ちます。分離された環境により、StarSling は一貫した条件でエージェントのアクションを評価し、変更を検証し、最適化をより自信を持って進める準備ができたときを判断できます。

これらの特性が組み合わさることで、エージェントループは場当たり的なスクリプトではなく、実用的な製品ワークフローになります。サンドボックスは人間の判断が消える場所ではありません。有用な判断を下すのに十分安全に候補をテストできる場所です。

AI ネイティブ CI の成果

このアプローチは 3 つの関連する利点を生み出します。

より迅速な最適化実験。StarSling は、ボトルネックを特定してから修正を出荷するまでの時間を短縮できます。手動調査サイクルを待つ代わりに、候補の変更は提案、実行、測定、レビューという構造化されたループを進みます。

安定したエージェント実行。エージェントベースの自動化がスケールするにつれて、分離された環境は運用リスクを低減します。エージェントは繰り返し実行し、安全に失敗できます。これは、ワークフロー自体が CI への変更をテストする責任がある場合に不可欠です。

より簡単なマルチ顧客スケール。Novita Agent Sandbox は、AI 最適化を実際の CI パイプラインに展開する障壁を下げます。StarSling は、新しいリポジトリやユースケースごとに実行基盤を再構築することなく、より多くの顧客をサポートできます。

Daniel Worku(StarSling CTO)は運用上の効果を次のように説明しています:

「Novita Sandbox は、CI ワークロードを安全かつ再現可能に大規模実行するための分離環境を提供してくれました。同社のエンジニアは世界クラスで、私たちが求めるものは数週間ではなく数日で提供してくれます。」

この引用はより広い教訓を示しています。エージェントインフラストラクチャは、エージェント型自動化が有用になる前に信頼性が高くなければなりません。分離、伸縮性、再現性は実装の詳細ではなく、AI ワークフローが本番システムの近くで動作できるようにする条件です。

このアーキテクチャを適用する方法

実際のシステムを安全に変更する必要があるあらゆるエージェントワークフローに、このパターンを再利用できます。

まず、分析プレーンと実行プレーンを分離します。ログとメトリクスは候補の変更に情報を提供できますが、変更は本番環境に到達する前に境界のある環境でテストする必要があります。

次に、レビュー対象の成果物を定義します。CI 最適化では、通常はワークフローの差分または設定変更です。コード生成では、パッチかもしれません。データ作業では、クエリ、ノートブック、またはレポートかもしれません。レビュー可能な成果物は、エージェントの作業を監査可能にします。

3 番目に、前後を測定します。CI では、所要時間、コスト、失敗率、不安定なテスト、キュー時間、フィードバックまでの時間を追跡します。単一の速度数値は、他の場所でのリグレッションを隠す可能性があります。

4 番目に、権限を狭く保ちます。最適化エージェントには、無制限のネットワークアクセス、本番シークレット、マージ権限は必要ありません。実験を実行して証拠を生成するために必要な最小限のアクセス権を与えます。

5 番目に、昇格のための人間のゲートを維持します。サンドボックスは、変更がテスト条件下で期待どおりに動作したことを検証できます。その変更が本番環境に適切かどうかは、依然として人間と既存のレビュープロセスが判断すべきです。

よくある質問

StarSling とは?

StarSling は AI ネイティブ CI プラットフォームです。CI ワークロードを分析し、キャッシュ、並列化、テストシャーディングなどの改善を提案し、エンジニアリングチーム向けに最適化プルリクエストを生成します。

StarSling は Novita Agent Sandbox をどのように使用しますか?

StarSling は Novita Agent Sandbox を使用して、分離された microVM でエージェントワークフローを実行し、繰り返し実験のために伸縮自在なコンピューティングにアクセスし、再現可能な条件で CI 最適化の変更を評価します。

6 倍の高速化はすべての CI パイプラインに適用されますか?

いいえ。StarSling によると、一部の顧客は CI が最大 6 倍高速化し、最大 13 倍安価になったと報告しています。結果はパイプライン、テストスイート、リポジトリ構造、関連するボトルネックによって異なります。

CI 最適化エージェントにサンドボックスが必要なのはなぜですか?

サンドボックスは、エージェントが顧客の CI システムや共有インフラストラクチャに直接干渉することなく、コマンドを実行して変更をテストする場所を提供します。また、実験間のよりクリーンな比較を可能にします。

おすすめ記事

出典