---
title: "Bâtir vos propres outils IA avec des API"
description: "Bâtir vos propres outils IA par-dessus des API de modèles, y compris des workflows image-vers-données-structurées, au lieu d'acheter du SaaS"
type: "lesson"
locale: "fr"
course: "Automatisation et systèmes agentiques"
number: "4.4"
canonical: "https://agenticschool.dev/fr/cours/automation-agentic-systems/building-your-own-ai-tools-with-apis"
datePublished: "2026-06-12"
dateModified: "2026-06-12"
---

# Bâtir vos propres outils IA avec des API

- Course: Automatisation et systèmes agentiques
- Lesson: 4.4
- Duration: 28 min
- Level: fortgeschritten
- Status: published
- Canonical URL: https://agenticschool.dev/fr/cours/automation-agentic-systems/building-your-own-ai-tools-with-apis
- Locale: fr

> Bâtir vos propres outils IA par-dessus des API de modèles, y compris des workflows image-vers-données-structurées, au lieu d'acheter du SaaS

## Summary

Vous n'avez pas à attendre que quelqu'un bâtisse l'outil dont vous avez besoin. Avec les API de modèles, vous bâtissez le vôtre, souvent en un après-midi. Cette leçon montre comment appeler Gemini et Claude directement, récupérer du JSON structuré et utiliser la vision pour transformer une photo en enregistrement de base de données - illustré par deux vrais outils de fondateur : l'attribution de factures et un catalogueur de cartes à collectionner suisses.

## What you learn

- Appeler les API Gemini et Claude directement, y compris le quota Gemini gratuit
- Imposer un output JSON structuré, pour qu'une réponse de modèle devienne un enregistrement de base de données
- Deux études de cas de fondateur : attribution de factures et cartes suisses, photo en entrée, enregistrement en sortie

## Vue d'ensemble

Le plus grand changement dans la construction de logiciel est celui-ci : quand l'outil dont vous avez besoin n'existe pas, vous le bâtissez le jour même. Les API de modèles vous laissent appeler un LLM depuis votre propre code, avec votre propre prompt, et - crucialement - récupérer des données structurées au lieu d'un mur de prose. Dès qu'un modèle peut transformer de façon fiable une image ou un document en un propre enregistrement JSON, toute une classe de travail de saisie manuelle disparaît. Cette leçon enseigne l'appel d'API direct, l'astuce d'output structuré qui rend la réponse utilisable, et deux vrais outils que le fondateur de cette School a bâtis à partir de ces mêmes pièces.

## Ce que vous allez apprendre

Vous allez apprendre à appeler Gemini et Claude directement avec une requête fetch minimale, à forcer le modèle à renvoyer du JSON conforme à un schema pour que l'output tombe directement en base de données, à utiliser la vision pour qu'une photo devienne des données structurées, et à reconnaître quand bâtir un petit outil interne bat payer du SaaS. Les deux études de cas de fondateur rendent cela concret : photo d'une facture en entrée, enregistrement attribué en sortie ; photo d'une carte à collectionner en entrée, enregistrement catalogué en sortie.

## Prérequis

Les Cours 1 à 3. Vous avez besoin de la leçon de choix de modèle du Cours 1 (le coût de l'outil dépend entièrement du modèle que vous appelez), de la discipline des secrets du Cours 3 (la clé API ne touche jamais le code client) et d'une base de données où écrire - Convex du Cours 3 est parfait. La page de fondamentaux sur ce qu'est une API couvre les bases de la requête, au besoin.

## Le problème

Les entreprises paient chaque mois pour des outils SaaS qui font une chose étroite - lire des reçus, taguer des images, extraire des champs de PDF - et qui ne collent quand même pas tout à fait à leur workflow. Pourtant le même job est à un seul appel d'API. Le blocage n'a jamais été la capacité ; c'est que les gens ne réalisent pas à quel point il y a peu de code entre « j'ai une photo d'une facture » et « la facture est dans mon système comptable, attribuée au bon projet ». Cette leçon retire ce blocage en montrant tout le chemin de bout en bout.

## Les API comme blocs de construction

Appeler une API de modèle directement vous donne un contrôle total : votre prompt, votre modèle, votre format d'output, aucune UI dans le chemin. C'est aussi moins de code que les gens ne l'attendent. Une requête est un POST avec votre clé API dans un header et un body JSON qui décrit ce que vous voulez. Voici un appel minimal vers Gemini et la même idée contre Claude, pour que vous voyiez les deux. Google offre un quota Gemini gratuit vraiment généreux via AI Studio, ce qui en fait l'endroit naturel pour prototyper des outils vision sans rien dépenser.

```typescript
// Appel Gemini minimal. La clé vit dans une env var, jamais dans le code client.
const res = await fetch(
  'https://generativelanguage.googleapis.com/v1beta/models/gemini-2.5-flash:generateContent',
  {
    method: 'POST',
    headers: {
      'Content-Type': 'application/json',
      'x-goog-api-key': process.env.GEMINI_API_KEY!,
    },
    body: JSON.stringify({
      contents: [{ parts: [{ text: 'Summarise this in one sentence: ...' }] }],
    }),
  },
)
const data = await res.json()
console.log(data.candidates[0].content.parts[0].text)
```
Un appel d'API Gemini minimal. Les noms de modèles et chemins exacts changent - confirmez contre les docs Google AI à jour.

Claude fonctionne pareil : un POST vers l'endpoint Messages d'Anthropic avec votre clé dans un header x-api-key et un tableau messages dans le body. Le fournisseur diffère, la forme est la même. Choisissez le modèle avec la règle de choix de modèle du Cours 1 - un modèle rapide et bon marché pour l'extraction à fort volume, un plus puissant seulement quand le raisonnement est vraiment dur.

## Output structuré : l'astuce qui le rend utile

Un modèle qui répond en prose n'est pas un outil - vous ne pouvez pas mettre un paragraphe dans une colonne de base de données. L'astuce est de demander un output structuré : donnez au modèle un schema JSON et exigez qu'il renvoie des données conformes exactement à ce schema. Les API modernes le supportent directement (un response schema ou un mode structured output), et le résultat est un objet à forme garantie que vous pouvez valider et insérer. C'est ce qui transforme « le modèle a dit quelque chose sur la facture » en « la ligne de facture a un fournisseur, un montant, une devise, une date et un project_id ». Validez toujours le JSON renvoyé contre votre schema (Zod de votre stack est idéal) avant de lui faire confiance, car un modèle peut encore dériver occasionnellement.

```typescript
import { z } from 'zod'

// La forme exacte que vous voulez en retour - c'EST votre enregistrement de base de données.
const InvoiceSchema = z.object({
  supplier: z.string(),
  invoiceNumber: z.string(),
  amount: z.number(),
  currency: z.string(),
  issueDate: z.string(), // date ISO
  projectId: z.string().nullable(),
})

// Dites au modèle de renvoyer UNIQUEMENT du JSON conforme à ce schema, puis validez.
const parsed = InvoiceSchema.parse(JSON.parse(modelJsonString))
// parsed est maintenant un enregistrement typé et validé, prêt à insérer. Pas de prose.
```
Définissez la forme de l'enregistrement avec Zod, instruisez le modèle de renvoyer du JSON conforme, et validez avant d'insérer. La validation attrape la rare dérive.

## Vision : une photo en entrée, un enregistrement en sortie

La même API accepte des images, pas seulement du texte. Les modèles vision comme Gemini lisent une image et, combinés à l'astuce d'output structuré, renvoient un propre enregistrement qui décrit ce qu'ils voient. Vous envoyez les bytes de l'image aux côtés de votre instruction et de votre schema et récupérez des données structurées. C'est le coup qui automatise la saisie de données depuis le monde physique : pointez un téléphone sur un document ou un objet, et une ligne de base de données apparaît. Le modèle fait la lecture ; votre schema fait la structuration ; votre code fait l'insertion. Trois étapes, et une tâche qui était autrefois une personne tapant pendant des heures devient une photo et un webhook.

## Étude de cas de fondateur : attribution de factures

En voici une vraie que nous avons bâtie. Une entreprise se noyait sous les factures fournisseurs qui devaient chacune être lue, ses champs extraits et - la partie fastidieuse - attribuée au bon projet interne avant d'entrer dans le système comptable. Nous avons bâti un petit outil : jetez une photo ou un PDF de facture, un modèle vision extrait fournisseur, numéro, montant, devise et date dans le schema exact ci-dessus, et une deuxième étape l'attribue au bon projet, à partir des lignes et de l'historique fournisseur. Un humain approuve toujours les cas limites (plus là-dessus dans la leçon human-in-the-loop), mais la lecture et l'attribution qui dévoraient autrefois des heures par semaine arrivent maintenant en secondes. Aucun abonnement SaaS, aucun frais par document, un contrôle total de la logique, et cela colle exactement à l'entreprise, parce que l'entreprise a défini le schema.

## Étude de cas de fondateur : cartes à collectionner suisses

Le deuxième outil est plus amusant et fait le même point. Nous avions une grande collection de cartes à collectionner suisses à cataloguer - chacune a besoin de son joueur ou motif, du set, de l'année et de l'état saisis, ce qui est éreintant à la main. L'outil est presque gênant de simplicité : photographiez une carte, un modèle vision renvoie un enregistrement structuré (nom, set, année, état estimé) conforme à un schema, et cela atterrit dans une base de données avec l'image attachée. Ce qui aurait été des jours de saisie manuelle est devenu un après-midi à prendre des photos. La leçon ne porte pas sur les cartes à collectionner ; c'est que « image vers enregistrement de base de données structuré » est un pattern universel. Factures, cartes, inventaire, cartes de visite, reçus, plaques signalétiques d'appareils - les mêmes trois étapes s'appliquent à toutes.

## Bâtir, pas acheter

Les deux études de cas ont remplacé un achat SaaS par un outil interne, et c'est le point stratégique. Quand un job est étroit et spécifique à votre entreprise, un petit outil que vous possédez, alimenté par une API, bat généralement un produit générique que vous louez. Vous obtenez un ajustement exact, aucun frais par siège ou par document, un contrôle total des données et la capacité de changer la logique dès que votre processus change. Ce n'est pas « bâtissez tout » - prenez d'excellents SaaS pour les besoins standard. C'est « pour les jobs de données étroits, répétitifs et spécifiques à l'entreprise, un outil de cinquante lignes par-dessus une API de modèle gagne souvent ».

- Bâtissez quand le job est étroit, spécifique à votre entreprise et à volume assez élevé pour que les frais SaaS par unité s'additionnent.
- Achetez quand le besoin est générique, l'ajustement SaaS bon et que vous réinventeriez un produit mûr.
- Possédez vos données et votre schema. Un outil que vous avez bâti se plie à votre processus ; un outil que vous louez fait plier votre processus à lui.

## Erreurs fréquentes

Les courantes : mettre la clé API dans du code côté client, où n'importe qui peut la voler (elle appartient à une env var serveur, toujours) ; demander de la prose puis la parser avec du string-matching fragile au lieu d'exiger du JSON validé par schema ; sauter la validation et insérer un enregistrement défectueux dans votre base de données ; utiliser un modèle vaisseau amiral cher pour de l'extraction simple à fort volume alors qu'un modèle rapide bon marché est amplement suffisant ; et acheter du SaaS pour un job qu'un outil interne de cinquante lignes ferait mieux et moins cher.

## ROI business

C'est la leçon où l'IA cesse d'être un jouet de chat et commence à remplacer des lignes sur votre facture et des heures dans votre calendrier. Un outil image-vers-enregistrement peut éliminer un poste de saisie de données à temps partiel, et parce que vous le possédez, le coût marginal par document est des fractions de centime d'usage de modèle, pas un abonnement SaaS. Les outils de fondateur ci-dessus ont pris chacun un après-midi à bâtir et ont épargné des heures récurrentes chaque semaine. Pour une petite entreprise, la capacité de bâtir l'outil exact dont vous avez besoin à la demande est un avantage structurel que des concurrents qui n'achètent que du SaaS ne peuvent pas atteindre.

## Checklist

Vous êtes prêt à avancer quand chacun de ces points est vrai, car les prochaines leçons bâtissent des funnels et des boucles de feedback par-dessus des outils comme ceux-ci.

- Faire un appel d'API minimal vers Gemini ou Claude, la clé en sécurité dans une env var.
- Imposer un output JSON structuré et le valider avec un schema avant de l'utiliser.
- Transformer une photo en un enregistrement de base de données structuré avec un modèle vision.
- Décider pour un vrai job si vous bâtissez un outil interne ou achetez du SaaS.

## Ressources

Récupérez du crédit Gemini gratuit dans Google AI Studio pour prototyper des outils vision gratuitement, et gardez à portée les docs Anthropic et Google AI, car les noms de modèles et la surface d'API d'output structuré changent. Zod de votre stack existant est votre couche de validation. Les études de cas /builds sur l'automatisation de factures et l'outil de cartes à collectionner suisses vont plus loin sur chacune, si vous voulez toute l'histoire.

## Votre mission

Choisissez une tâche de saisie de données répétitive de votre travail qui commence par une image ou un document. Bâtissez un tout petit outil : prenez l'image, envoyez-la à Gemini avec un schema Zod, validez le JSON et loggez l'enregistrement. Vous n'avez pas besoin d'UI - un script qui affiche l'enregistrement structuré est la preuve. Notez combien de temps cela a pris versus ce que la tâche manuelle vous coûte chaque semaine.

## Prochaine leçon

Les outils et automatisations ont besoin de gens pour les trouver. La prochaine leçon couvre la plomberie marketing : lead magnets, formulaires de capture, funnels et les règles de double opt-in par e-mail que vous devez suivre dans l'UE et en Suisse.

## Transcript

Vous n'avez pas à attendre que quelqu'un bâtisse l'outil dont vous avez besoin. Avec les API de modèles, vous bâtissez le vôtre, souvent en un après-midi. Cette leçon montre comment appeler Gemini et Claude directement, récupérer du JSON structuré et utiliser la vision pour transformer une photo en enregistrement de base de données - illustré par deux vrais outils de fondateur : l'attribution de factures et un catalogueur de cartes à collectionner suisses.
