Accueil · Bloc 1 Comprendre la machine · T1.2
L'entraînement : d'où vient ce que le modèle « sait »
Pré-entraînement, réglage fin, RLHF : comment un modèle passe de générateur de texte brut à assistant utilisable.
L'essentiel
- L'entraînement d'un réseau de neurones ajuste ses paramètres par rétropropagation du gradient : le modèle compare sa prédiction à la réponse attendue, calcule une mesure d'erreur (fonction de perte), puis remonte cette erreur couche par couche pour déterminer dans quel sens corriger chaque paramètre — c'est ce mécanisme, répété des milliards de fois, qui fait qu'un réseau « apprend ». Fait de mécanisme stable. Source : IBM.
- Le pré-entraînement (pretraining) consiste à exposer le modèle à d'immenses volumes de texte (pages web, livres, code, articles) en lui faisant deviner, à très grande échelle, le token manquant ou suivant d'un passage tronqué — la phase la plus coûteuse en calcul, celle qui construit l'essentiel de ce que le modèle « sait » au sens statistique.
- Un modèle seulement pré-entraîné complète du texte de façon plausible mais pas nécessairement utile, sûre ou conforme à des consignes — les étapes suivantes (réglage fin, RLHF, méthodes propriétaires) l'ajustent pour suivre des instructions et respecter des principes.
- Le RLHF (apprentissage par renforcement à partir de retours humains) consiste à faire classer par des humains plusieurs réponses possibles du modèle selon leur qualité ; ce classement sert à entraîner un modèle de récompense, qui guide ensuite un réglage du modèle principal par renforcement. Anthropic a documenté cette méthode sur des modèles allant de 10 à 52 milliards de paramètres. Source : Anthropic, « Training a Helpful and Harmless Assistant with RLHF », 2022.
- Anthropic complète le RLHF par une méthode qu'elle nomme IA constitutionnelle (Constitutional AI) : le modèle critique et révise ses propres réponses en les comparant à un texte de principes écrits, ce qui réduit la dépendance à une évaluation humaine exhaustive de chaque exemple. Source : Anthropic, « Constitutional AI: Harmlessness from AI Feedback ».
- [Vérifié 20/07/2026] Anthropic a publié une nouvelle version de la constitution de Claude le 22/01/2026 ; selon Anthropic, ce texte sert notamment à Claude lui-même pour générer des données d'entraînement synthétiques alignées avec ses principes (conversations, réponses, classements). Source : anthropic.com, « Claude's new constitution », 22/01/2026.
- Ce que le modèle « sait » est figé à la date de constitution de son corpus d'entraînement (sa « date de coupure » ou knowledge cutoff) : un évènement postérieur à cette date ne peut pas être connu du modèle, sauf s'il lui est fourni explicitement dans sa fenêtre de contexte (cf. T1.3).
- « Fine-tuning » (réglage fin) désigne, au sens large, tout réentraînement complémentaire et ciblé d'un modèle déjà pré-entraîné sur un jeu de données plus restreint — RLHF et IA constitutionnelle en sont des variantes orientées « alignement » du comportement, mais on peut aussi affiner un modèle pré-entraîné sur un domaine métier spécifique, indépendamment de tout objectif d'alignement.
- La qualité et le filtrage des données d'entraînement (déduplication, retrait de contenus de mauvaise qualité) sont documentés comme au moins aussi déterminants que leur volume brut — un plus grand nombre de tokens de mauvaise qualité peut dégrader un modèle plutôt que l'améliorer.
- Le pré-entraînement puise dans plusieurs familles de sources documentées par la littérature technique générale : pages web collectées à grande échelle (dont des archives ouvertes comme CommonCrawl), livres, articles académiques et code source — un mélange, pas une seule catégorie de contenu, avec des poids relatifs propres à chaque éditeur et le plus souvent non publiés en détail pour les modèles fermés récents (renvoi point 8, T1.1).
- Le pré-entraînement produit un modèle fixe une fois terminé : un modèle en production ne réentraîne pas ses paramètres à chaque conversation, quel que soit le volume d'usage — seul un nouveau cycle d'entraînement décidé par l'éditeur (nouvelle version) modifie ce que le modèle « sait » au sens de ce point.
Le modèle apprend d'abord à compléter du texte de façon plausible, pas toujours sûre — un réglage complémentaire l'ajuste ensuite avant qu'il devienne l'assistant déployé.
Repères clés
| Donnée | Valeur | Date | Source |
|---|---|---|---|
| Échelle des modèles RLHF documentée par Anthropic (papier fondateur) | 10 à 52 milliards de paramètres | papier 2022 | Anthropic, « Training a Helpful and Harmless Assistant with RLHF » |
| Nouvelle constitution de Claude | publiée | 22/01/2026 | anthropic.com/news/claude-new-constitution |
| Transparence sur les données/paramètres d'entraînement des modèles fermés | non publiés en détail | constat au 20/07/2026 | cf. Sources T1.1 (Forbes, LifeArchitect) |
| Exemple illustratif de corpus de pré-entraînement ouvert (« The Pile ») | ≈ 800 Go, 22 sources documentées (web, livres, code, articles...) | publié 2020-2021 | EleutherAI — illustratif d'une pratique de l'époque, pas une donnée sur un modèle fermé actuel |
Idées reçues
- « Le modèle est entraîné une fois pour toutes et n'évolue plus jamais » — l'entraînement se déroule par étapes (pré-entraînement puis réglages successifs) et les éditeurs publient régulièrement de nouvelles versions ; mais un modèle déjà déployé ne change pas tout seul entre deux mises à jour officielles.
- « L'IA constitutionnelle signifie qu'il existe une loi qui encadre l'IA » — non : chez Anthropic, la « constitution » est un texte de principes rédigé par l'entreprise elle-même pour orienter l'entraînement (palier 2, source déclarative de l'éditeur) — à ne pas confondre avec un texte réglementaire comme l'AI Act (palier 1, cf. README §5).
- « Plus il y a de données d'entraînement, plus le modèle est forcément fiable » — la curation (filtrage, déduplication) compte au moins autant que le volume brut (point 9) ; un grand corpus bruité peut dégrader la qualité du modèle.
- « Le réglage fin (fine-tuning) part de zéro, comme un nouvel entraînement » — non : il part toujours d'un modèle déjà pré-entraîné (point 2) et l'affine sur un jeu de données plus restreint ; c'est justement ce qui le rend beaucoup moins coûteux qu'un pré-entraînement complet.
Le modèle ne sait rien de ce qui s'est passé après la fin de son entraînement — sauf si on le lui donne explicitement dans la conversation.
Questions fréquentes de débutants
Réponds mentalement avant d'ouvrir : c'est l'effort de rappel qui ancre, pas la relecture.
Le modèle peut-il apprendre pendant qu'on discute avec lui ?
Non par défaut : ses paramètres restent figés pendant une conversation ; ce qu'il semble « retenir » pendant l'échange provient de sa fenêtre de contexte (cf. T1.3), pas d'un réapprentissage de ses paramètres.
Qui décide de ce qui entre dans les données d'entraînement ?
Chaque éditeur définit et filtre son propre corpus ; le détail exhaustif des sources retenues et exclues n'est le plus souvent pas publié intégralement pour les modèles fermés récents. à vérifier
RLHF et IA constitutionnelle, est-ce la même chose ?
Apparentées mais distinctes : le RLHF s'appuie sur des comparaisons de réponses faites par des humains, l'IA constitutionnelle fait critiquer et réviser le modèle par lui-même à partir d'un texte de principes, avec un usage humain direct réduit (points 4-5).
Entraîner un modèle de pointe, ça coûte cher ?
Le pré-entraînement d'un modèle frontière mobilise des ressources à l'échelle d'un centre de données (calcul, énergie, refroidissement) sur une durée prolongée — un ordre de grandeur sans rapport avec le coût d'une seule génération de réponse (inférence), qui reste marginal par usage. à vérifier
Pièges & points de vigilance
- Ne pas confondre « entraînement » (modifie durablement les paramètres, coûteux, ponctuel) et « prompt/contexte » (ne modifie aucun paramètre, propre à chaque conversation) — confusion la plus fréquente sur ce sujet, creusée en T1.3.
- « Apprentissage automatique »/« apprentissage profond » sont le vocabulaire technique standard du domaine (README §6) — ce n'est pas de l'anthropomorphisme ; en revanche, dire qu'un modèle « a retenu la leçon » au sens moral déborde du vocabulaire technique.
- Un chiffre de taille de corpus d'entraînement circulant pour un modèle fermé récent est, sauf déclaration explicite et datée de l'éditeur, une estimation tierce à traiter avec la même prudence que les estimations de paramètres (cf. T1.1 point 8).
- La composition exacte d'un corpus de pré-entraînement (point 10) reste largement non publiée pour les modèles fermés récents : les catégories générales citées ici (web, livres, code) sont documentées au niveau de la pratique du secteur, pas comme la recette exacte d'un modèle nommé précis.
Sources
- What is Backpropagation? — IBM, consulté le 20/07/2026
- What is Gradient Descent? — IBM, consulté le 20/07/2026
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback — Anthropic, 2022, consulté le 20/07/2026
- Constitutional AI: Harmlessness from AI Feedback — Anthropic, consulté le 20/07/2026
- Claude's new constitution — Anthropic, publié 22/01/2026
- Claude's Constitution (texte intégral) — Anthropic, consulté le 20/07/2026
- What Is LLM Training? — IBM, consulté le 20/07/2026 (catégories de données de pré-entraînement, point 10)