Cosa impari
- Cos'e un token e perche ti si fattura e ti si limita in token, non in parole
- Come funziona un context window e cosa succede davvero quando si riempie
- Perche la qualita del modello cala su input lunghi - il performance cliff - e come evitarlo
Panoramica
Un grande modello linguistico fa una cosa in modo notevolmente buono: predice il prossimo token a partire da tutto cio che ha visto finora. Appena capisci i token, il context window e il performance cliff sugli input lunghi, ogni decisione successiva - quale modello scegliere, come usarlo con i prompt e come far girare gli agenti - smette di sembrare una scommessa. Questa lezione ti da questo modello mentale in linguaggio chiaro, con i pochi numeri che contano davvero nel 2026.
Cosa imparerai
Imparerai cos'e un token, perche paghi e sei limitato al token e non alla parola, come il context window contiene l'intera conversazione, e perche versare piu testo in un modello rende spesso le risposte peggiori invece che migliori. Alla fine saprai leggere la scheda tecnica di un modello e prevederne il comportamento prima di spendere un solo centesimo.
Prerequisiti
Nessuno. Non hai bisogno di saper programmare ne di aver gia usato uno strumento di IA. Se hai gia scritto un messaggio in ChatGPT, Claude o Gemini, hai tutto il bagaglio necessario. Le basi piu profonde su terminale e Git le colleghiamo piu avanti, quando ne avrai davvero bisogno.
Il problema
La maggior parte delle persone tratta un LLM come un motore di ricerca o come un essere umano. Incollano un documento enorme, pongono una domanda vaga e restano sorprese quando la risposta e piatta, sbagliata o ignora meta del contenuto incollato. Il modello non e diventato pigro. Ha colpito dei limiti iscritti nel suo funzionamento. Senza un modello mentale di token e contesto, continuerai a rimproverare allo strumento un comportamento perfettamente prevedibile.
Token, non parole
Un modello non vede mai lettere ne parole come le vedi tu. Prima che accada qualsiasi cosa, il tuo testo viene diviso in token - blocchi di caratteri frequenti. Un token e all'incirca quattro caratteri o circa tre quarti di una parola inglese. Le parole comuni stanno in un solo token; le parole rare, i simboli di codice e le altre lingue costano di piu. Due cose si misurano in token: il prezzo che paghi e la quantita che un modello puo tenere in una volta. Ecco perche un modello "economico" puo diventare caro su documenti lunghi, e perche un prompt in italiano o in codice costa piu token della stessa idea in inglese semplice.
- 1 token vale circa 4 caratteri o 0,75 parole inglesi.
- 1.000 token fanno all'incirca 750 parole, cioe circa una pagina e mezza di testo.
- Il prezzo si esprime per milione di token, ripartito tra input (cio che invii) e output (cio che il modello riscrive). L'output costa quasi sempre diverse volte l'input.
- Ti viene fatturata TUTTA la conversazione ad ogni turno, perche il modello rilegge tutto ogni volta prima di rispondere.
Il context window
Il context window e il numero massimo di token che un modello puo considerare in una volta: le tue istruzioni, i file incollati, la cronologia della conversazione e la risposta che sta scrivendo, tutto sommato insieme. Nel 2026, un modello solido tipico ha un context window di circa 200.000 token, alcuni dichiarano 1.000.000 o piu. Vedilo come la scrivania del modello. Tutto cio che e pertinente deve stare sulla scrivania nello stesso momento. Se la scrivania e piena, qualcosa deve caderne, e il modello di fatto lo dimentica. Ecco perche una chat lunga perde il filo delle istruzioni date all'inizio: quei token sono caduti dalla scrivania.
Il performance cliff
Ora la parte che quasi nessuno spiega ai principianti: piu contesto non equivale a risposte migliori. Man mano che riempi un context window, la qualita del modello cala ben prima di raggiungere il limite rigido. I modelli prestano piu attenzione all'inizio e alla fine di un input lungo e diventano confusi nel mezzo - uno schema spesso chiamato "lost in the middle". Una finestra da 1.000.000 di token suona benissimo, ma in pratica la qualita di risposta su una finestra satura puo essere nettamente inferiore a quella di un prompt corto e ben scelto da 20.000 token. Questo e il performance cliff. La lezione e chiara: la pertinenza batte la quantita. Un prompt corto con esattamente il contesto giusto batte un prompt gigante ogni volta.
- La qualita e piu alta quando la finestra e quasi vuota e ogni token merita il suo posto.
- La qualita crolla man mano che la finestra si riempie, soprattutto per le informazioni sepolte nel mezzo.
- Le finestre giganti dichiarate (1M+) raramente offrono la loro piena qualita al loro limite - trattale come un margine di sicurezza, non come una superficie di lavoro.
- Nel dubbio, avvia una conversazione nuova invece di accumulare su una lunga.
Passo passo: vedilo tu stesso
Puoi sviluppare un'intuizione in dieci minuti, senza scrivere codice. Apri un modello di chat qualsiasi e fai questo piccolo esperimento. L'obiettivo e sentire come token, finestra e cliff si manifestano in risposte reali.
- Chiedi al modello: "Di quanti token e composta la parola internationalization, e perche?" Nota che si scompone in piu token, perche e lunga e rara.
- Incolla un articolo lungo (qualche migliaio di parole) e poni una domanda su una frase situata esattamente nel mezzo. Poi poni la stessa domanda sulla prima frase. La risposta sul mezzo e generalmente piu debole.
- In una chat molto lunga, chiedi al modello di ripetere un'istruzione data proprio in cima. Guardalo faticare o inventare - quei primi token sono caduti dalla scrivania.
- Avvia una chat completamente nuova, incolla solo il paragrafo pertinente e richiedi. La risposta e piu netta. E la pertinenza che batte la quantita.
Errori frequenti
L'errore classico del principiante e il prompt "verso tutto": incollare un PDF di 50 pagine e porre una domanda precisa. Il modello annega. Il secondo errore e la chat infinita, in cui tieni una conversazione aperta per giorni chiedendoti perche diventa piu stupida. Il terzo e credere che un context window piu grande ti autorizzi a essere sciatto sulla pertinenza. Tutti e tre nascono dal non rispettare il cliff. La soluzione e sempre la stessa: invia meno, ma il meno giusto, e reimposta spesso.
ROI business
Non e accademico. I token sono denaro e la disciplina di contesto e qualita. Un team che capisce questo scrive prompt piu serrati, sceglie modelli piu economici per i compiti semplici e ottiene risultati piu affidabili, il che significa meno rilavorazione. In un vero workflow che gira migliaia di volte, ridurre un prompt gonfio da 30.000 a 5.000 token puo abbassare la tua fattura dell'80 percento E migliorare le risposte. Capire il cliff e di gran lunga la cosa piu impattante che un fondatore non tecnico possa imparare prima di dispiegare l'IA su larga scala.
Checklist
Prima di andare avanti, assicurati di poter rispondere a queste domande senza tornare indietro. Se una risposta e traballante, rileggi la sezione corrispondente - questo modello sta sotto tutto il resto del corso.
- Sai spiegare un token a un collega in una frase?
- Sai all'incirca quante parole stanno in una finestra da 200.000 token?
- Sai descrivere il performance cliff e perche la pertinenza batte la quantita?
- Sai perche ti si fattura tutta la conversazione ad ogni turno?
Risorse
Tieni l'idea a portata di mano mentre lavori: quando una risposta e cattiva, le tue prime due domande sono sempre "Il mio contesto e troppo grosso?" e "L'informazione giusta e davvero vicino all'inizio o alla fine?". La pagina dei fondamenti sui token approfondisce la tokenizzazione se vuoi il dettaglio, e il confronto tra modelli della prossima lezione si appoggia direttamente sui numeri introdotti qui.
La tua missione
Fai l'esperimento in quattro passi qui sopra in un modello di chat a tua scelta e annota, con parole tue, una frase che descriva il momento in cui hai visto il modello "dimenticare" o diventare confuso. Fissare questo ricordo concreto fara scattare ogni decisione di prompting piu avanti nel corso.
Prossima lezione
Ora che sai cosa fa un modello sotto il cofano, la domanda successiva e ovvia: quale modello usare? La prossima lezione confronta Haiku, Sonnet e Opus con GPT e Gemini, spiega i benchmark onestamente e mostra dove ottenere modelli solidi a basso costo o gratis.

Commenti
Caricamento dei commenti.
Pubblica un commento