FR
Fondamentaux

Comment fonctionnent vraiment les LLM : tokens, contexte et le performance cliff

Fondamentaux9 lecture min.12 juin 2026

En bref

Un grand modèle de langage fait une chose remarquablement bien : il prédit le prochain token à partir de tout ce qu'il a vu. Dès que vous comprenez les tokens, le context window et le performance cliff sur les longues entrées, travailler avec n'importe quel modèle cesse de ressembler à deviner. Ce guide explique les trois en langage clair, avec les rares chiffres qui comptent vraiment en 2026, pour que vous pilotiez bien tout modèle et cessiez de reprocher à l'outil un comportement parfaitement prévisible.

Des tokens, pas des mots

Un modèle ne voit jamais les mots comme vous. Votre texte est d'abord découpé en tokens - des blocs de caractères fréquents, grosso modo quatre caractères ou trois quarts d'un mot anglais. Deux choses se mesurent en tokens : le prix que vous payez et la quantité qu'un modèle peut retenir d'un coup. C'est pourquoi un modèle bon marché peut devenir cher sur de longs documents, et pourquoi le code ou d'autres langues coûtent plus de tokens que la même idée en anglais simple. Le prix est indiqué par million de tokens et réparti entre Input et Output, l'Output coûtant en général un multiple de l'Input.

Le context window

Le context window est le nombre maximum de tokens qu'un modèle peut prendre en compte d'un coup : vos instructions, les fichiers collés, l'historique de conversation et la réponse qu'il écrit, le tout additionné. Voyez-le comme le bureau du modèle. Tout ce qui est pertinent doit tenir sur le bureau en même temps, et quand le bureau est plein, quelque chose tombe et est de fait oublié. C'est pourquoi un long chat perd le fil des instructions du début. En 2026, un modèle fort a typiquement une fenêtre d'environ 200 000 tokens, certains vantent un million ou plus.

Le performance cliff

Plus de contexte n'est pas la même chose que de meilleures réponses. À mesure que vous remplissez un context window, la qualité baisse bien avant d'atteindre la limite dure. Les modèles font le plus attention au début et à la fin d'une longue entrée et deviennent flous au milieu - un schéma souvent appelé "lost in the middle". Une fenêtre d'un million de tokens sonne formidable, mais la qualité de réponse avec une fenêtre bourrée est souvent pire qu'avec un prompt concis et bien choisi. C'est le performance cliff, et la leçon est nette : la pertinence bat le volume à chaque fois.

Pourquoi les énormes context windows déçoivent

Vous verrez des modèles vanter d'énormes context windows et supposerez qu'ils sont strictement meilleurs. En pratique, ils déçoivent souvent, pour la raison ci-dessus. Un modèle peut techniquement accepter un million de tokens et quand même répondre moins bien qu'avec un prompt ciblé, car la qualité baisse à mesure que la fenêtre se remplit. Traitez une énorme fenêtre comme une assurance occasionnelle pour un document vraiment grand, pas comme une permission d'arrêter de curer ce que vous envoyez.

Comment vous utilisez cela en pratique

Les leçons pratiques sont simples. Envoyez moins, mais le bon moins. Démarrez des conversations fraîches au lieu d'empiler sur les longues. Quand une réponse est mauvaise, vos deux premières questions sont de savoir si votre contexte est trop grand et si l'information pertinente se trouve bien près du début ou de la fin. Dans un workflow qui tourne des milliers de fois, raccourcir un prompt gonflé peut réduire drastiquement votre facture et améliorer les réponses en même temps.

Pourquoi cela compte pour votre business

Les tokens sont de l'argent et la discipline de contexte est de la qualité. Une équipe qui comprend cela écrit des prompts plus concis, choisit des modèles moins chers pour les tâches simples et obtient des résultats plus fiables, donc moins de reprises. Comprendre le cliff est de loin la chose la plus à levier qu'une fondatrice non technique puisse apprendre avant de déployer l'IA à grande échelle, car cela change chaque décision en aval sur les modèles, les prompts et les agents.

Questions fréquemment posées

Correspondance des leçons et des ressources

Étape suivante

Prêt à mettre l’IA au service d’un véritable workflow ?

Commencez par le cours de base, conservez vos progrès localement et synchronisez tout sur votre compte gratuit quand vous le souhaitez.