> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Conseils pour le légendage des images d’entraînement

### Préparation

Selon la manière dont vous entraînez et ce que vous entraînez, vous devrez peut-être recadrer les photos à une largeur et une hauteur spécifiques. D’autres types d’entraînement peuvent catégoriser les images selon différentes tailles et ne nécessitent pas de recadrage. Renseignez-vous sur ce qui est requis pour la méthode d’entraînement que vous utilisez, le modèle que vous entraînez et le programme que vous utilisez pour entraîner votre modèle.

### Légendage – Notes générales

#### Éviter le légendage automatisé

* BLIP et deepbooru sont prometteurs, mais il est encore un peu tôt pour eux.

* BLIP et deepbooru ont du mal avec le contexte et l’importance relative.

* Il est plus rapide de légender manuellement que de corriger les erreurs faites par BLIP ou deepbooru tout en devant malgré tout légender manuellement.

#### Légendez de la même manière que vous écrivez vos prompts

* Le légendage et la rédaction de prompts sont liés.

* Identifiez la manière dont vous rédigez généralement vos prompts. Utilisez-vous des phrases verbeuses ? Des descriptions courtes ? Des prompts vagues ou détaillés ?

* Légendez dans un style et avec un niveau de détail similaires à ceux que vous utilisez habituellement dans vos prompts.

#### Suivre une structure définie par concept

* Suivre une structure sera bénéfique pour le processus d’apprentissage.

* Vous pourriez avoir une structure pour les photographies et une autre pour les illustrations. Toutefois, essayez d’éviter de mélanger les structures lorsque vous légendez un même dataset.

#### Les légendes sont comme des variables que vous pouvez utiliser dans vos prompts

Tout ce que vous décrivez dans une légende peut être considéré comme une variable que vous pouvez manipuler dans votre prompt. Cela a deux implications :

1. Vous voulez décrire autant de détails que possible sur tout ce qui n’est pas le concept que vous essayez d’enseigner implicitement. Autrement dit, décrivez tout ce que vous voulez voir devenir une variable. Par exemple, si vous enseignez un visage précis mais souhaitez pouvoir modifier la couleur des cheveux, vous devez décrire la couleur des cheveux dans chaque image afin que "hair color" devienne l’une de vos variables.

2. Vous ne voulez rien décrire (au-delà d’une description au niveau de la classe) que vous souhaitez enseigner implicitement. Autrement dit, la chose que vous essayez d’enseigner ne doit pas devenir une variable. Par exemple, si vous enseignez un visage précis, vous ne devez pas le décrire comme ayant un gros nez. Vous ne voulez pas que la taille du nez soit variable, car alors il ne s’agit plus de ce visage précis. Cependant, vous pouvez tout de même légender "face" si vous le souhaitez, ce qui fournit du contexte au modèle que vous entraînez. Cela a certaines implications décrites au point suivant.

#### Exploiter les classes comme tags

* Il y a deux concepts ici.

1. L’utilisation de tags de classe génériques orientera toute cette classe vers vos données d’entraînement. Cela peut être souhaité ou non selon vos objectifs.

2. L’utilisation de tags de classe génériques fournit du contexte au processus d’apprentissage. Conceptuellement, il est plus facile d’apprendre ce qu’est un "face" lorsque le modèle possède déjà une approximation raisonnable de "face".

* Si vous souhaitez orienter toute la classe de votre modèle vers vos images d’entraînement, utilisez des tags de classe larges plutôt que spécifiques. Par exemple, si vous voulez enseigner à votre modèle que chaque homme doit ressembler à Brad Pitt, vos légendes doivent contenir le tag "man", mais ne doivent pas être plus spécifiques que cela. Cela influence votre modèle pour produire un homme ressemblant à Brad Pitt chaque fois que vous utilisez le mot "man" dans votre prompt. Cela permet également à votre modèle de s’appuyer sur ce qu’il sait déjà du concept de "man" et de l’exploiter pendant l’entraînement.

* Si vous voulez réduire l’impact de votre entraînement sur l’ensemble de la classe, incluez des tags spécifiques et minimisez les tags de classe. Par exemple, si vous voulez enseigner à votre modèle que seul "ohwxman" doit ressembler à Brad Pitt, et que vous ne voulez pas que chaque "man" ressemble à Brad Pitt, vous n’utiliseriez pas "man" comme tag, mais seulement "ohwxman". Cela réduit l’impact de vos images d’entraînement sur le tag "man" et associe fortement vos images d’entraînement à "ohwxman". Votre modèle s’appuiera sur ce qu’il sait de "ohwxman", ce qui est pratiquement rien (voir note), construisant ainsi ses connaissances presque uniquement à partir de vos images d’entraînement, ce qui crée une association très forte.

* **Note :** Ceci est simplifié pour faciliter la compréhension. En réalité, cela serait tokenisé en deux tokens, "ohwx" et "man", mais ces tokens seraient fortement corrélés à des fins d’entraînement, ce qui devrait tout de même réduire l’impact sur la classe globale de "man" par rapport à un entraînement avec "man" comme token dans la légende. Les mathématiques impliquées sont assez complexes et dépassent largement le cadre de ce document.

#### Légendage cohérent

* Utilisez des légendes cohérentes tout au long de votre entraînement. Cela vous aidera à invoquer votre concept de manière cohérente lors de la rédaction de prompts.

* L’utilisation de tags incohérents dans votre dataset rendra le concept que vous essayez d’enseigner plus difficile à saisir pour le modèle, car vous le forcez essentiellement à apprendre à la fois le concept et les différentes formulations de ce concept. Il est bien préférable de lui faire apprendre uniquement le concept sous un seul terme.

* Par exemple, vous ne voulez probablement pas avoir à la fois "legs raised in air" et "raised legs" si vous essayez d’enseigner un seul concept d’une personne ayant les jambes en l’air. Vous voulez pouvoir invoquer cette pose de manière cohérente dans votre prompt, alors choisissez une seule manière de la légender.

#### Éviter la répétition

* Essayez d’éviter la répétition autant que possible. Comme pour les prompts, répéter des mots augmente le poids de ces mots.

* Par exemple, si nous répétons trop le mot "background", nous pouvons avoir trois tags qui disent "background" (par exemple, simple background, white background, lamp in background). Même si nous voulons que l’arrière-plan ait un poids faible, nous avons involontairement augmenté ce poids de façon significative. Il serait préférable de les combiner ou de les reformuler (par exemple, simple white background with a lamp).

#### Tenir compte de l’ordre

* Là encore, comme avec les prompts, l’ordre compte pour le poids relatif des tags.

* Avoir une structure ou un ordre spécifique que vous utilisez généralement pour les légendes peut vous aider à maintenir les poids relatifs des tags entre les images de votre dataset, ce qui devrait profiter au processus d’entraînement.

* Avoir un ordre standardisé accélère tout le processus de légendage à mesure que vous vous familiarisez avec le légendage dans cette structure.

#### Utiliser les connaissances existantes de votre modèle à votre avantage

* Votre modèle produit déjà des résultats corrects et comprend raisonnablement ce que vous lui demandez dans vos prompts. Tirez-en parti en légendant avec des mots qui fonctionnent déjà bien dans vos prompts.

* Vous voulez utiliser des mots descriptifs, mais si vous utilisez des mots trop obscurs ou trop spécialisés, vous ne pourrez probablement pas exploiter beaucoup les connaissances existantes. Par exemple, vous pourriez dire "sarcastic" ou "mordacious". Le modèle a une certaine idée de ce que "sarcastic" évoque, mais il n’a probablement aucune idée de ce que signifie "mordacious".

* Vous pouvez également voir cela sous l’angle opposé. Si vous essayiez d’enseigner le concept de "mordacious", vous pourriez avoir un dataset rempli d’images qui évoquent "sarcastic" et les légender avec les deux tags "sarcastic" et "mordacious" côte à côte (afin qu’ils soient proches en poids relatif).

### Légendage – Structure

Ceci concerne principalement les personnes ou les personnages ; cela pourrait donc ne pas s’appliquer aussi bien à quelque chose comme des paysages fantastiques, mais peut-être que cela pourra fournir un peu d’inspiration.

#### Format général

#### Associations libres

* C’est ici que nous plaçons toutes les dernières associations libres que nous avons avec l’image.

* Cela peut être tout ce qui nous vient à l’esprit, généralement des « sentiments » que nous ressentons en regardant l’image ou des concepts qui nous semblent représentés ; en réalité, tout peut aller ici tant que cela existe dans l’image.

* Gardez à l’esprit qu’il s’agit d’associations libres. Si l’image représente très clairement un certain sentiment, nous pourrions vouloir le taguer plus près du début de la légende pour lui donner un poids plus élevé.

* Par exemple : happy, sad, joyous, hopeful, lonely, sombre

#### EXEMPLE COMPLET D’UNE IMAGE UNIQUE

Voici un exemple de la manière dont nous légenderions une seule image prise sur safebooru. Nous supposerons que je veux entraîner le style de cette image et l’associer au tag "ohwxStyle", et nous supposerons que nous avons de nombreuses images dans ce style au sein de notre dataset.

Image d’exemple : [https://safebooru.org/index.php?page=post\&s=view\&id=3887414](https://safebooru.org/index.php?page=post\&s=view\&id=3887414)

* Globaux : ohwxStyle

* Type ou perspective d’une : anime, drawing, of a young woman, full body shot, from side

* Mots d’action : sitting, looking at viewer, smiling, head tilt, holding a phone, eyes closed

* Description du sujet : short brown hair, pale pink dress with dark edges, stuffed animal in lap, brown slippers

* Détails notables : sunlight through windows as lighting source

* Arrière-plan ou lieu : brown couch, red patterned fabric on couch, wooden floor, white water-stained paint on walls, refrigerator in background, coffee machine sitting on a countertop, table in front of couch, bananas and coffee pot on table, white board on wall, clock on wall, stuffed animal chicken on floor

* Associations libres : dreary environment

Tout ensemble : ohwxStyle, anime, drawing, of a young woman, full body shot, from side, sitting, looking at viewer, smiling, head tilt, holding a phone, eyes closed, short brown hair, pale pink dress with dark edges, stuffed animal in lap, brown slippers, sunlight through windows as lighting source, brown couch, red patterned fabric on couch, wooden floor, white water-stained paint on walls, refrigerator in background, coffee machine sitting on a countertop, table in front of couch, bananas and coffee pot on table, white board on wall, clock on wall, stuffed animal chicken on floor, dreary environment
