Pila
Da una scatola da scarpe piena di carte al catalogo
L'idea era prendere foto di carte da collezione e generare automaticamente i dati prodotto strutturati che servono per vendere: il nome, il set, lo stato, gli attributi che contano per un compratore. Farlo a mano per una grande collezione e abbrutente e soggetto a errori, il che ne faceva il candidato perfetto per una pipeline immagine-verso-dati.
Una pipeline, non un solo prompt
L'errore sarebbe stato buttare tutta l'immagine su un modello e chiedere tutto in una volta. Invece, l'ho tagliata in passi, ciascuno con un compito chiaro, per poter testare e correggere ogni passo indipendentemente. Una pipeline pulita e molto piu facile da debuggare di un enorme prompt che e o giusto o sbagliato, senza niente in mezzo.
- Il passo uno identifica la carta; il passo due estrae gli attributi; il passo tre li normalizza nello schema prodotto.
- Ogni passo esce dati strutturati che il successivo consuma, perche gli errori siano localizzati e visibili.
- Le carte ambigue sono segnalate per revisione piuttosto che indovinate, perche una scheda sbagliata e peggio di una scheda mancante.
Il valore e nella normalizzazione
Leggere una carta era la parte scintillante. La parte davvero preziosa era la normalizzazione: assicurarsi che lo stesso set sia sempre scritto allo stesso modo, che gli stessi livelli di stato mappino sugli stessi valori, e che l'output rientri sempre esattamente nello schema prodotto. I compratori e i sistemi a valle se ne infischiano dell'impressione che dava il passo di vision; cio che gli importa e che i dati siano coerenti. Ho imparato che una pipeline immagine-verso-prodotto vive o muore sul suo strato noioso di normalizzazione, e che tagliare il lavoro in piccoli passi testabili ha reso il tutto abbastanza degno di fiducia per listare veri prodotti reali a partire da li.
Lezioni apprese
- Taglia il lavoro immagine-verso-dati in piccoli passi testabili piuttosto che in un enorme prompt tutto-in-uno.
- Il vero valore e nella normalizzazione. Un output coerente conta piu di un'estrazione impressionante.
- Segnala i casi ambigui per revisione. Una scheda prodotto sbagliata e peggio di una scheda mancante.
- Una pipeline a passi localizza gli errori, perche tu corregga un passo piuttosto che debuggare una scatola nera.
