FR
Leçon 1.2

Choisir votre modèle : Haiku vs Sonnet vs Opus, GPT, Gemini et les benchmarks

Choisir le bon palier de modèle pour chaque tâche et savoir où trouver des modèles solides à bas prix ou gratuitement

24 minFondations - De zéro à votre première app en ligneDisponible

Ce que tu apprends

  • Les trois paliers de modèles (petit, moyen, grand) et comment Haiku, Sonnet, Opus, GPT et Gemini s'y rangent
  • Comment lire honnêtement les benchmarks et les prix, au lieu de courir après les leaderboards
  • Où trouver des modèles solides à bas prix ou gratuits : OpenRouter, crédits Gemini gratuits et pourquoi les modèles à contexte géant déçoivent

Vue d'ensemble

Chaque fournisseur de modèles livre une famille de modèles, pas un modèle. Ils viennent en paliers : petit et rapide, moyen et équilibré, grand et intelligent. Dès que vous voyez les paliers au lieu des noms de marque, le choix devient simple. Cette leçon vous donne une règle de décision applicable à chaque nouveau modèle qui sort, plus les astuces pratiques pour obtenir des modèles de pointe à bas prix ou gratuitement.

Ce que vous allez apprendre

Vous allez apprendre le modèle à trois paliers, comment Claude (Haiku, Sonnet, Opus), OpenAI GPT et Google Gemini s'y rangent, comment traiter les benchmarks avec une saine méfiance et comment obtenir des modèles solides sans payer le plein tarif - avec OpenRouter et les crédits Gemini gratuits.

Prérequis

La leçon précédente sur les tokens et le contexte. Vous devez être à l'aise avec l'idée que le prix s'exprime par million de tokens et que plus de contexte n'est pas automatiquement mieux, car ces deux idées gouvernent le choix du modèle.

Le problème

Les débutants prennent soit le seul modèle dont ils ont entendu parler, soit ils courent après ce qui a dominé un leaderboard la semaine dernière. Les deux sont des erreurs coûteuses. Utiliser un modèle vaisseau amiral pour reformater une liste, c'est comme faire coller un pansement par une chirurgienne. Utiliser un tout petit modèle pour un raisonnement architectural difficile produit des absurdités assénées avec assurance. La compétence consiste à faire correspondre la difficulté de la tâche au palier de modèle, et cette compétence survit à chaque nom de modèle.

Les trois paliers

Oubliez la fidélité de marque et pensez en paliers. Les petits modèles sont rapides et bon marché, parfaits pour la classification, l'extraction, les réécritures simples et les jobs à fort volume. Les modèles moyens sont le cheval de trait équilibré pour la plupart du vrai travail de coding et d'écriture. Les grands modèles sont plus lents et plus chers, mais raisonnent bien mieux sur les problèmes vraiment durs. Presque chaque fournisseur reflète cette structure, donc une fois qu'elle est intériorisée, vous pouvez ranger n'importe quel nouveau modèle instantanément.

  • Petit / rapide : Claude Haiku, GPT palier petit, Gemini Flash. Utilisez-les pour le volume, l'extraction, le routage, les brouillons bon marché.
  • Moyen / équilibré : Claude Sonnet, GPT palier moyen, Gemini Pro. Votre compagnon quotidien pour le coding et l'écriture sérieuse.
  • Grand / intelligent : Claude Opus, GPT grand palier de reasoning, Gemini Ultra/Pro haut palier. Utilisez-les pour le reasoning dur, le debugging délicat, l'architecture.
  • Règle de pouce : commencez un palier plus bas que vous ne le pensez et ne montez que si l'output n'est vraiment pas assez bon.

Comment lire honnêtement les benchmarks

Les benchmarks sont à la fois utiles et régulièrement trompeurs. Un modèle peut dominer un benchmark de coding et se révéler quand même moins bon sur votre vrai projet, parce que les benchmarks mesurent des tâches étroites dans des conditions idéales et que les fournisseurs optimisent durement dessus. Traitez les benchmarks comme un filtre grossier, pas comme un verdict. Le seul benchmark qui compte est le vôtre : prenez trois vraies tâches de votre travail, faites-les passer par deux ou trois modèles et jugez l'output vous-même. Surveillez la constance, pas seulement le pic de performance, car un modèle avec lequel vous passez en production doit être fiablement bon, pas brillant de temps en temps.

Les prix et le vrai tableau des coûts

Le prix s'exprime par million de tokens d'input et d'output, et l'écart entre paliers est grand - souvent 10x ou plus entre un petit et un grand modèle. Comme l'output coûte plusieurs fois l'input, les modèles bavards et les prompts verbeux coûtent plus que vous ne le pensez. Le geste pratique est de router selon la difficulté : modèle bon marché pour les 80 pour cent d'appels faciles, modèle cher seulement pour les 20 pour cent durs. Dans un workflow à grande échelle, cette seule décision compte souvent plus que le choix du fournisseur.

Des modèles solides à bas prix ou gratuits

Vous n'avez pas besoin de payer le plein tarif pour démarrer. Il y a trois voies fiables en 2026, et un débutant devrait toutes les connaître avant d'engager du budget.

  • OpenRouter : un seul compte et une clé API qui vous donnent accès à presque tous les modèles (Claude, GPT, Gemini, modèles ouverts) via un endpoint, avec une tarification transparente par token et un changement de modèle facile. Idéal pour comparer des modèles sans jongler avec cinq comptes.
  • Crédits Gemini gratuits : Google offre régulièrement, via son AI Studio, un free tier généreux et des crédits, une voie vraiment solide et bon marché vers un modèle moyen capable pour les expériences et les outils à petit volume.
  • Free tiers et essais des fournisseurs : la plupart des fournisseurs vous donnent un peu d'usage gratuit pour évaluer. Utilisez-le de façon ciblée pour faire tourner votre propre benchmark de trois tâches.

Pourquoi les modèles à contexte de 1M déçoivent

Vous verrez des modèles annonçant des context windows de 1 000 000 de tokens et vous supposerez qu'ils sont strictement meilleurs. En pratique, ils déçoivent souvent, pour la raison exacte vue à la leçon précédente : le performance cliff. Un modèle peut techniquement accepter un million de tokens et pourtant répondre moins bien qu'à un prompt ciblé, parce que la qualité baisse à mesure que la fenêtre se remplit. Traitez un context window géant comme une assurance occasionnelle pour un document vraiment gros, pas comme un permis d'arrêter de curer le contexte. La plupart des jours, un modèle moyen avec un prompt serré bat un modèle à contexte géant avec un prompt bâclé.

Pas à pas : choisir un modèle pour une vraie tâche

Rendez cela concret avec une tâche de votre propre travail. Le but est de s'entraîner à la règle de décision, pas de trouver une réponse définitive.

  • Écrivez la tâche et notez sa difficulté : facile, normale ou vraiment dure.
  • Choisissez le palier adapté : petit, moyen ou grand.
  • Faites-la passer par deux modèles de ce palier (utilisez OpenRouter pour basculer vite).
  • Jugez l'output vous-même sur la qualité et la constance et notez lequel vous utiliseriez vraiment et pourquoi.

Erreurs fréquentes

Les grosses : prendre toujours le vaisseau amiral et brûler de l'argent sur des tâches faciles ; faire plus confiance à un leaderboard qu'à votre propre test de trois tâches ; supposer qu'un context window plus grand signifie un modèle plus intelligent ; et se verrouiller sur un fournisseur, si bien que vous ne remarquez jamais qu'un concurrent sort mieux pour votre cas d'usage. OpenRouter existe justement pour que les coûts de bascule restent bas.

ROI business

Le choix du modèle est l'un des leviers les plus clairs sur votre facture d'IA et sur votre qualité d'output. Diriger le travail léger vers un petit modèle et réserver le grand modèle au reasoning dur peut baisser les coûts d'un ordre de grandeur tout en augmentant la fiabilité, parce que chaque tâche reçoit le bon outil. Pour une fondatrice, la discipline « adapter le palier à la difficulté, benchmarker sur ses propres tâches, garder la bascule bon marché » vaut plus que n'importe quel choix de modèle isolé.

Checklist

Vous êtes prêt à avancer quand vous savez faire ce qui suit avec assurance, sans douter des noms de marque.

  • Ranger chaque nouveau modèle comme petit, moyen ou grand à partir de sa fiche technique et de son prix.
  • Expliquer pourquoi vous n'utiliseriez pas un vaisseau amiral pour un simple job d'extraction.
  • Faire tourner un benchmark personnel de trois tâches au lieu de faire confiance à un leaderboard.
  • Nommer où trouver un modèle solide à bas prix ou gratuit (OpenRouter, crédits Gemini).

Ressources

Créez dès maintenant un compte OpenRouter pour que la bascule de modèles soit fluide pour le reste du cours, et attrapez des crédits Gemini gratuits dans le Google AI Studio pour des expériences bon marché. Vous utiliserez les deux sans cesse. La prochaine leçon passe du modèle à l'outil qui l'enveloppe.

Votre mission

Créez un compte OpenRouter, puis faites passer une vraie tâche de votre travail par un petit, un moyen et un grand modèle. Écrivez une note de deux lignes indiquant quel palier était réellement assez bon. Cette note est votre première donnée de benchmark réelle et personnelle, et elle guidera votre choix de modèle pendant des mois.

Prochaine leçon

Un modèle seul ne fait que parler. Pour qu'il abatte du travail - lire des fichiers, exécuter des commandes, modifier du code - vous l'enveloppez dans un harness. La prochaine leçon explique ce qu'est un harness et compare Claude Code, Codex, Pi et OpenCode, pour que vous sachiez quel outil saisir.

Commentaires

Chargement des commentaires.

Poster un commentaire
CommentairesSuivant
Étape suivante

Prêt à mettre l’IA au service d’un véritable workflow ?

Commencez par le cours de base, conservez vos progrès localement et synchronisez tout sur votre compte gratuit quand vous le souhaitez.