Skip to main content
Clip Skip は、画像生成プロセスの一部を文字どおりスキップする機能で、その結果として出力がわずかに変化します。これにより、画像のレンダリングも高速になります。

しかし、なぜ拡散プロセスの一部をスキップしたいのでしょうか?

一般的な Stable Diffusion 1.5 ベースモデルの画像は、12 の「clip」レイヤーを通過します。これらは精緻化のレベルを表しています。初期のレイヤーは非常に大まかで、後半のレイヤーほど、より明瞭で具体的な画像を生成します。一部のベースモデル、特に Danbooru タグに基づくモデルでは、試行錯誤の結果、特定のレイヤーをスキップすることでより良い画像につながる場合があることが示されています。大まかな clip レイヤーが不要なノイズを持ち込むことがあるためです。文字どおりレイヤーをスキップすることで、GPU 時間を節約し、より良いアートを得られます。 「a cow」の画像が欲しい場合、テキストモデルが持っているかもしれない「cow」のサブカテゴリには関心がないかもしれません。特に、それらの品質にはばらつきがあるためです。つまり「a cow」が欲しいのであって、「an Aberdeen Angus bull」は望んでいないかもしれません。(全文はこのページの下部にあります。) CLIP Skip は、「テキストモデルにどれほど正確であってほしいか」を設定するものだと考えることができます。実際に試してみると、各 clip 段階が説明の観点でより多くの定義を追加していることがわかります。たとえば、野原に立っている若い男性についての詳細なプロンプトがある場合、低い clip 段階では「a man standing」の画像が得られ、より深い段階では「a young man standing」や「a young man standing in a forest」などが得られるでしょう。CLIP Skip は、「1girl」タグがそのメインタグに結びついた多数のサブタグへ分解されるような、特定の構造を持つモデルを使用する場合に特に効果的です。

必要ですか?

これは、品質に強いこだわりを持つ熱心なユーザーにのみ推奨される小さな最適化です。anime や semi-realism に取り組んでいる場合は、試してみる価値があります。

制限事項

スキップするレイヤー数 一般的に、1 層または 2 層をスキップすると良い結果が得られることがあります。ただし、2 層を超えてスキップすると、guidance が低いように見える画像が生成される可能性があります。 互換性の不安定さ Clip Skip は、多くの人が一度設定してそのままにしておくことを好む、「シートベルトを締める」ような安全なデフォルトの一つになっています。しかし、このやり方は賢明ではありません。この機能は、LoRAs や Textual Inversions などの他の技術と併用した場合にも、予測不能な結果を生むことがあります。本来レイヤーが期待される場所でレイヤーが欠けていると、画像品質が低下したり、まったく効果がなかったりする場合があります。 結果を比較するより、単に試してみるほうが速いこともよくあります。違いを正確に評価するために、seed、guidance、concept、sampler も必ず固定してください。
最終更新日 2026年5月15日