Skip to main content
Clip Skip es una función que literalmente omite parte del proceso de generación de imágenes, lo que da como resultado salidas ligeramente diferentes. Esto también hace que la renderización de imágenes sea más rápida.

Pero ¿por qué alguien querría omitir una parte del proceso de difusión?

Una imagen típica de un modelo base Stable Diffusion 1.5 pasa por 12 capas “clip”, que representan niveles de refinamiento. Las primeras capas son muy generales, mientras que las capas posteriores producen imágenes más claras y específicas. En el caso de algunos modelos base, especialmente aquellos basados en etiquetas de Danbooru, el ensayo y error ha demostrado que omitir ciertas capas puede llevar a mejores imágenes, ya que las capas clip generales pueden introducir ruido no deseado. Literalmente puedes omitir capas, ahorrando tiempo de GPU y logrando mejor arte. Si quieres una imagen de “una vaca”, puede que no te importen las subcategorías de “vaca” que el modelo de texto pueda tener. Especialmente porque estas pueden variar en calidad. Así que si quieres “una vaca”, quizá no quieras “un toro Aberdeen Angus”. (La publicación completa está al final de esta página). Puedes pensar en CLIP Skip como un ajuste para “qué tan preciso quieres que sea el modelo de texto”. Puedes probarlo y ver que cada etapa clip añade más definición en términos de descripción. Por ejemplo, si tienes un prompt detallado sobre un joven de pie en un campo, con etapas clip más bajas obtendrías una imagen de “un hombre de pie”, mientras que etapas más profundas producirían “un joven de pie” o “un joven de pie en un bosque”, y así sucesivamente. CLIP Skip se vuelve particularmente eficaz cuando se usan modelos que están estructurados de una manera específica, donde la etiqueta “1girl” puede descomponerse en muchas subetiquetas conectadas a esa etiqueta principal.

¿Lo necesito?

Es una optimización menor recomendada solo para entusiastas hardcore obsesionados con la calidad. Si estás trabajando en anime o semirrealismo, vale la pena probarlo.

Limitaciones

Cuántas capas omitir En general, omitir 1 o 2 capas puede dar buenos resultados. Sin embargo, omitir más de 2 capas puede producir imágenes que parezcan tener una guía baja. Compatibilidad inconsistente Clip Skip se ha convertido en uno de esos valores predeterminados seguros del tipo “ponte el cinturón de seguridad”, donde muchas personas prefieren configurarlo y olvidarse de ello. Este enfoque no es prudente. La función también puede producir resultados impredecibles cuando se usa con otras tecnologías, como LoRAs y Textual Inversions. La ausencia de capas donde se esperan capas puede degradar la calidad de la imagen o no tener ningún efecto. A menudo es más rápido simplemente probarlo que comparar resultados. Solo asegúrate de bloquear también la seed, la guía, el concepto y el sampler para evaluar con precisión las diferencias.
Última modificación el 15 de mayo de 2026