一般的な Stable Diffusion 1.5 ベースモデルの画像は、12 の「clip」レイヤーを通過します。これらは精緻化のレベルを表しています。初期のレイヤーは非常に大まかで、後半のレイヤーほど、より明瞭で具体的な画像を生成します。一部のベースモデル、特に Danbooru タグに基づくモデルでは、試行錯誤の結果、特定のレイヤーをスキップすることでより良い画像につながる場合があることが示されています。大まかな clip レイヤーが不要なノイズを持ち込むことがあるためです。文字どおりレイヤーをスキップすることで、GPU 時間を節約し、より良いアートを得られます。「a cow」の画像が欲しい場合、テキストモデルが持っているかもしれない「cow」のサブカテゴリには関心がないかもしれません。特に、それらの品質にはばらつきがあるためです。つまり「a cow」が欲しいのであって、「an Aberdeen Angus bull」は望んでいないかもしれません。(全文はこのページの下部にあります。)CLIP Skip は、「テキストモデルにどれほど正確であってほしいか」を設定するものだと考えることができます。実際に試してみると、各 clip 段階が説明の観点でより多くの定義を追加していることがわかります。たとえば、野原に立っている若い男性についての詳細なプロンプトがある場合、低い clip 段階では「a man standing」の画像が得られ、より深い段階では「a young man standing」や「a young man standing in a forest」などが得られるでしょう。CLIP Skip は、「1girl」タグがそのメインタグに結びついた多数のサブタグへ分解されるような、特定の構造を持つモデルを使用する場合に特に効果的です。