PROTOTYPE INTERNE · démonstration interne · aucune donnée collectée · extraits « Tech Café » (droits Vendé, pré-accord)
L'École de la Techcomprendre, pas subir

Accueil · Bloc 1 Comprendre la machine · T1.2

T1.2MatièreModule 2 sur 4

L'entraînement : d'où vient ce que le modèle « sait »

Pré-entraînement, réglage fin, RLHF : comment un modèle passe de générateur de texte brut à assistant utilisable.

Statut du contenu : matière pédagogique sourcée, en cours de vérification finale — la leçon rédigée, enrichie des extraits du podcast Tech Café, arrive ensuite.

L'essentiel

  1. L'entraînement d'un réseau de neurones ajuste ses paramètres par rétropropagation du gradient : le modèle compare sa prédiction à la réponse attendue, calcule une mesure d'erreur (fonction de perte), puis remonte cette erreur couche par couche pour déterminer dans quel sens corriger chaque paramètre — c'est ce mécanisme, répété des milliards de fois, qui fait qu'un réseau « apprend ». Fait de mécanisme stable. Source : IBM.
  2. Le pré-entraînement (pretraining) consiste à exposer le modèle à d'immenses volumes de texte (pages web, livres, code, articles) en lui faisant deviner, à très grande échelle, le token manquant ou suivant d'un passage tronqué — la phase la plus coûteuse en calcul, celle qui construit l'essentiel de ce que le modèle « sait » au sens statistique.
  3. Un modèle seulement pré-entraîné complète du texte de façon plausible mais pas nécessairement utile, sûre ou conforme à des consignes — les étapes suivantes (réglage fin, RLHF, méthodes propriétaires) l'ajustent pour suivre des instructions et respecter des principes.
  4. Le RLHF (apprentissage par renforcement à partir de retours humains) consiste à faire classer par des humains plusieurs réponses possibles du modèle selon leur qualité ; ce classement sert à entraîner un modèle de récompense, qui guide ensuite un réglage du modèle principal par renforcement. Anthropic a documenté cette méthode sur des modèles allant de 10 à 52 milliards de paramètres. Source : Anthropic, « Training a Helpful and Harmless Assistant with RLHF », 2022.
  5. Anthropic complète le RLHF par une méthode qu'elle nomme IA constitutionnelle (Constitutional AI) : le modèle critique et révise ses propres réponses en les comparant à un texte de principes écrits, ce qui réduit la dépendance à une évaluation humaine exhaustive de chaque exemple. Source : Anthropic, « Constitutional AI: Harmlessness from AI Feedback ».
  6. [Vérifié 20/07/2026] Anthropic a publié une nouvelle version de la constitution de Claude le 22/01/2026 ; selon Anthropic, ce texte sert notamment à Claude lui-même pour générer des données d'entraînement synthétiques alignées avec ses principes (conversations, réponses, classements). Source : anthropic.com, « Claude's new constitution », 22/01/2026.
  7. Ce que le modèle « sait » est figé à la date de constitution de son corpus d'entraînement (sa « date de coupure » ou knowledge cutoff) : un évènement postérieur à cette date ne peut pas être connu du modèle, sauf s'il lui est fourni explicitement dans sa fenêtre de contexte (cf. T1.3).
  8. « Fine-tuning » (réglage fin) désigne, au sens large, tout réentraînement complémentaire et ciblé d'un modèle déjà pré-entraîné sur un jeu de données plus restreint — RLHF et IA constitutionnelle en sont des variantes orientées « alignement » du comportement, mais on peut aussi affiner un modèle pré-entraîné sur un domaine métier spécifique, indépendamment de tout objectif d'alignement.
  9. La qualité et le filtrage des données d'entraînement (déduplication, retrait de contenus de mauvaise qualité) sont documentés comme au moins aussi déterminants que leur volume brut — un plus grand nombre de tokens de mauvaise qualité peut dégrader un modèle plutôt que l'améliorer.
  10. Le pré-entraînement puise dans plusieurs familles de sources documentées par la littérature technique générale : pages web collectées à grande échelle (dont des archives ouvertes comme CommonCrawl), livres, articles académiques et code source — un mélange, pas une seule catégorie de contenu, avec des poids relatifs propres à chaque éditeur et le plus souvent non publiés en détail pour les modèles fermés récents (renvoi point 8, T1.1).
  11. Le pré-entraînement produit un modèle fixe une fois terminé : un modèle en production ne réentraîne pas ses paramètres à chaque conversation, quel que soit le volume d'usage — seul un nouveau cycle d'entraînement décidé par l'éditeur (nouvelle version) modifie ce que le modèle « sait » au sens de ce point.
Pré-entraîner, puis régler
texte brutweb, livres, codepré-entraînementmodèle qui complètepas toujours sûrréglage finmodèle déployéretours humains, principes

Le modèle apprend d'abord à compléter du texte de façon plausible, pas toujours sûre — un réglage complémentaire l'ajuste ensuite avant qu'il devienne l'assistant déployé.

Repères clés

DonnéeValeurDateSource
Échelle des modèles RLHF documentée par Anthropic (papier fondateur)10 à 52 milliards de paramètrespapier 2022Anthropic, « Training a Helpful and Harmless Assistant with RLHF »
Nouvelle constitution de Claudepubliée22/01/2026anthropic.com/news/claude-new-constitution
Transparence sur les données/paramètres d'entraînement des modèles fermésnon publiés en détailconstat au 20/07/2026cf. Sources T1.1 (Forbes, LifeArchitect)
Exemple illustratif de corpus de pré-entraînement ouvert (« The Pile »)≈ 800 Go, 22 sources documentées (web, livres, code, articles...)publié 2020-2021EleutherAI — illustratif d'une pratique de l'époque, pas une donnée sur un modèle fermé actuel

Idées reçues

  1. « Le modèle est entraîné une fois pour toutes et n'évolue plus jamais » — l'entraînement se déroule par étapes (pré-entraînement puis réglages successifs) et les éditeurs publient régulièrement de nouvelles versions ; mais un modèle déjà déployé ne change pas tout seul entre deux mises à jour officielles.
  2. « L'IA constitutionnelle signifie qu'il existe une loi qui encadre l'IA » — non : chez Anthropic, la « constitution » est un texte de principes rédigé par l'entreprise elle-même pour orienter l'entraînement (palier 2, source déclarative de l'éditeur) — à ne pas confondre avec un texte réglementaire comme l'AI Act (palier 1, cf. README §5).
  3. « Plus il y a de données d'entraînement, plus le modèle est forcément fiable » — la curation (filtrage, déduplication) compte au moins autant que le volume brut (point 9) ; un grand corpus bruité peut dégrader la qualité du modèle.
  4. « Le réglage fin (fine-tuning) part de zéro, comme un nouvel entraînement » — non : il part toujours d'un modèle déjà pré-entraîné (point 2) et l'affine sur un jeu de données plus restreint ; c'est justement ce qui le rend beaucoup moins coûteux qu'un pré-entraînement complet.
La date de coupure
tempsconnu du modèleinconnu du modèle(sauf via le contexte)date de coupure

Le modèle ne sait rien de ce qui s'est passé après la fin de son entraînement — sauf si on le lui donne explicitement dans la conversation.

Questions fréquentes de débutants

Réponds mentalement avant d'ouvrir : c'est l'effort de rappel qui ancre, pas la relecture.

Le modèle peut-il apprendre pendant qu'on discute avec lui ?

Non par défaut : ses paramètres restent figés pendant une conversation ; ce qu'il semble « retenir » pendant l'échange provient de sa fenêtre de contexte (cf. T1.3), pas d'un réapprentissage de ses paramètres.

Qui décide de ce qui entre dans les données d'entraînement ?

Chaque éditeur définit et filtre son propre corpus ; le détail exhaustif des sources retenues et exclues n'est le plus souvent pas publié intégralement pour les modèles fermés récents. à vérifier

RLHF et IA constitutionnelle, est-ce la même chose ?

Apparentées mais distinctes : le RLHF s'appuie sur des comparaisons de réponses faites par des humains, l'IA constitutionnelle fait critiquer et réviser le modèle par lui-même à partir d'un texte de principes, avec un usage humain direct réduit (points 4-5).

Entraîner un modèle de pointe, ça coûte cher ?

Le pré-entraînement d'un modèle frontière mobilise des ressources à l'échelle d'un centre de données (calcul, énergie, refroidissement) sur une durée prolongée — un ordre de grandeur sans rapport avec le coût d'une seule génération de réponse (inférence), qui reste marginal par usage. à vérifier

Pièges & points de vigilance

  1. Ne pas confondre « entraînement » (modifie durablement les paramètres, coûteux, ponctuel) et « prompt/contexte » (ne modifie aucun paramètre, propre à chaque conversation) — confusion la plus fréquente sur ce sujet, creusée en T1.3.
  2. « Apprentissage automatique »/« apprentissage profond » sont le vocabulaire technique standard du domaine (README §6) — ce n'est pas de l'anthropomorphisme ; en revanche, dire qu'un modèle « a retenu la leçon » au sens moral déborde du vocabulaire technique.
  3. Un chiffre de taille de corpus d'entraînement circulant pour un modèle fermé récent est, sauf déclaration explicite et datée de l'éditeur, une estimation tierce à traiter avec la même prudence que les estimations de paramètres (cf. T1.1 point 8).
  4. La composition exacte d'un corpus de pré-entraînement (point 10) reste largement non publiée pour les modèles fermés récents : les catégories générales citées ici (web, livres, code) sont documentées au niveau de la pratique du secteur, pas comme la recette exacte d'un modèle nommé précis.

Sources