FR
Leçon 1.1

Comment fonctionnent vraiment les LLM : tokens, context windows et le performance cliff

Un modèle mental correct des tokens, des context windows et de la raison pour laquelle les longs prompts se dégradent, pour bien piloter chaque modèle

22 minFondations - De zéro à votre première app en ligneDisponible

Ce que tu apprends

  • Ce qu'est un token et pourquoi on vous facture et vous limite en tokens, pas en mots
  • Comment fonctionne un context window et ce qui se passe vraiment quand il se remplit
  • Pourquoi la qualité du modèle baisse sur de longues entrées - le performance cliff - et comment l'éviter

Vue d'ensemble

Un grand modèle de langage fait une chose remarquablement bien : il prédit le prochain token à partir de tout ce qu'il a vu jusque-là. Dès que vous comprenez les tokens, le context window et le performance cliff sur les longues entrées, chaque décision ultérieure - quel modèle prendre, comment le prompter et comment faire tourner les agents - cesse de ressembler à un pari. Cette leçon vous donne ce modèle mental en langage clair, avec les quelques chiffres qui comptent vraiment en 2026.

Ce que vous allez apprendre

Vous allez apprendre ce qu'est un token, pourquoi vous payez et êtes limité au token et non au mot, comment le context window contient toute la conversation, et pourquoi verser plus de texte dans un modèle rend souvent les réponses moins bonnes plutôt que meilleures. À la fin, vous saurez lire la fiche technique d'un modèle et prédire son comportement avant de dépenser le moindre centime.

Prérequis

Aucun. Vous n'avez pas besoin de savoir coder ni d'avoir déjà utilisé un outil d'IA. Si vous avez déjà tapé un message dans ChatGPT, Claude ou Gemini, vous avez tout le bagage nécessaire. Les bases plus profondes sur le terminal et Git, nous les lierons plus tard, quand vous en aurez vraiment besoin.

Le problème

La plupart des gens traitent un LLM comme un moteur de recherche ou comme un humain. Ils collent un document énorme, posent une question vague et sont surpris quand la réponse est plate, fausse ou passe à côté de la moitié du contenu collé. Le modèle n'est pas devenu paresseux. Il a heurté des limites inscrites dans son fonctionnement. Sans modèle mental des tokens et du contexte, vous reprocherez sans cesse à l'outil un comportement parfaitement prévisible.

Des tokens, pas des mots

Un modèle ne voit jamais de lettres ni de mots comme vous. Avant que quoi que ce soit ne se produise, votre texte est découpé en tokens - des blocs de caractères fréquents. Un token, c'est grossièrement quatre caractères ou environ trois quarts d'un mot anglais. Les mots courants tiennent en un seul token ; les mots rares, les symboles de code et les autres langues coûtent davantage. Deux choses se mesurent en tokens : le prix que vous payez et la quantité qu'un modèle peut tenir à la fois. Voilà pourquoi un modèle « bon marché » peut devenir cher sur de longs documents, et pourquoi un prompt en français ou en code coûte plus de tokens que la même idée en anglais simple.

  • 1 token vaut environ 4 caractères ou 0,75 mot anglais.
  • 1 000 tokens font grossièrement 750 mots, soit à peu près une page et demie de texte.
  • Le prix s'exprime par million de tokens, réparti entre l'input (ce que vous envoyez) et l'output (ce que le modèle réécrit). L'output coûte le plus souvent plusieurs fois l'input.
  • On vous facture TOUTE la conversation à chaque tour, car le modèle relit tout à chaque fois avant de répondre.

Le context window

Le context window est le nombre maximal de tokens qu'un modèle peut prendre en compte à la fois : vos instructions, les fichiers collés, l'historique de la conversation et la réponse qu'il est en train d'écrire, le tout additionné. En 2026, un modèle solide typique a un context window d'environ 200 000 tokens, certains annoncent 1 000 000 ou plus. Voyez-le comme le bureau du modèle. Tout ce qui est pertinent doit tenir sur le bureau en même temps. Si le bureau est plein, quelque chose doit en tomber, et le modèle l'oublie de fait. Voilà pourquoi un long chat perd le fil des instructions données au début : ces tokens sont tombés du bureau.

Le performance cliff

Maintenant la partie que presque personne n'explique aux débutants : plus de contexte n'égale pas de meilleures réponses. À mesure que vous remplissez un context window, la qualité du modèle baisse bien avant d'atteindre la limite dure. Les modèles prêtent le plus attention au début et à la fin d'une longue entrée et deviennent flous au milieu - un schéma souvent appelé « lost in the middle ». Un fenêtre de 1 000 000 de tokens sonne formidable, mais en pratique la qualité de réponse sur une fenêtre saturée peut être nettement inférieure à celle d'un prompt court et bien choisi de 20 000 tokens. C'est le performance cliff. La leçon est claire : la pertinence bat la quantité. Un prompt court avec exactement le bon contexte bat un prompt géant à chaque fois.

  • La qualité est la plus haute quand la fenêtre est presque vide et que chaque token mérite sa place.
  • La qualité chute à mesure que la fenêtre se remplit, surtout pour l'information enfouie au milieu.
  • Les fenêtres géantes annoncées (1M+) livrent rarement leur pleine qualité à leur limite - traitez-les comme une marge de sécurité, pas comme une surface de travail.
  • Dans le doute, démarrez une conversation fraîche plutôt que d'empiler sur une longue.

Pas à pas : voyez-le vous-même

Vous pouvez développer une intuition en dix minutes, sans écrire de code. Ouvrez n'importe quel modèle de chat et faites cette petite expérience. Le but est de sentir comment les tokens, la fenêtre et le cliff apparaissent dans de vraies réponses.

  • Demandez au modèle : « De combien de tokens est composé le mot internationalization, et pourquoi ? » Remarquez qu'il se décompose en plusieurs tokens, parce qu'il est long et rare.
  • Collez un long article (quelques milliers de mots) et posez une question sur une phrase située exactement au milieu. Posez ensuite la même question sur la première phrase. La réponse sur le milieu est généralement plus faible.
  • Dans un chat très long, demandez au modèle de répéter une instruction donnée tout en haut. Regardez-le peiner ou inventer - ces premiers tokens sont tombés du bureau.
  • Lancez un tout nouveau chat, collez seulement le paragraphe pertinent et redemandez. La réponse est plus nette. C'est la pertinence qui bat la quantité.

Erreurs fréquentes

L'erreur classique du débutant est le prompt « je verse tout » : coller un PDF de 50 pages et poser une question précise. Le modèle se noie. La deuxième erreur est le chat interminable, où vous gardez une conversation ouverte pendant des jours en vous demandant pourquoi elle devient plus bête. La troisième est de croire qu'un context window plus grand vous autorise à être négligent sur la pertinence. Les trois viennent du fait de ne pas respecter le cliff. La solution est toujours la même : envoyez moins, mais le bon moins, et réinitialisez souvent.

ROI business

Ce n'est pas académique. Les tokens sont de l'argent et la discipline de contexte est de la qualité. Une équipe qui comprend cela écrit des prompts plus serrés, choisit des modèles moins chers pour les tâches simples et obtient des résultats plus fiables, ce qui veut dire moins de reprise. Dans un vrai workflow qui tourne des milliers de fois, réduire un prompt boursouflé de 30 000 à 5 000 tokens peut baisser votre facture de 80 pour cent ET améliorer les réponses. Comprendre le cliff est de loin la chose la plus impactante qu'une fondatrice non technique puisse apprendre avant de déployer l'IA à grande échelle.

Checklist

Avant d'avancer, assurez-vous de pouvoir répondre à ces questions sans revenir en arrière. Si une réponse est bancale, relisez la section correspondante - ce modèle est sous tout le reste du cours.

  • Pouvez-vous expliquer un token à un collègue en une phrase ?
  • Savez-vous grossièrement combien de mots tiennent dans une fenêtre de 200 000 tokens ?
  • Pouvez-vous décrire le performance cliff et pourquoi la pertinence bat la quantité ?
  • Savez-vous pourquoi on vous facture toute la conversation à chaque tour ?

Ressources

Gardez l'idée à portée de main pendant que vous travaillez : quand une réponse est mauvaise, vos deux premières questions sont toujours « Mon contexte est-il trop gros ? » et « La bonne information est-elle vraiment près du début ou de la fin ? » La page de fondamentaux sur les tokens creuse la tokenisation si vous voulez le détail, et la comparaison de modèles de la prochaine leçon s'appuie directement sur les chiffres introduits ici.

Votre mission

Faites l'expérience en quatre étapes ci-dessus dans un modèle de chat de votre choix et notez, dans vos propres mots, une phrase décrivant le moment où vous avez vu le modèle « oublier » ou devenir flou. Fixer ce souvenir concret fera cliquer chaque décision de prompting plus tard dans le cours.

Prochaine leçon

Maintenant que vous savez ce qu'un modèle fait sous le capot, la question suivante est évidente : quel modèle utiliser ? La prochaine leçon compare Haiku, Sonnet et Opus avec GPT et Gemini, explique les benchmarks honnêtement et montre où obtenir des modèles solides à bas prix ou gratuitement.

Commentaires

Chargement des commentaires.

Poster un commentaire
CommentairesSuivant
Étape suivante

Prêt à mettre l’IA au service d’un véritable workflow ?

Commencez par le cours de base, conservez vos progrès localement et synchronisez tout sur votre compte gratuit quand vous le souhaitez.