Le basi
Questa è la versione di riferimento: 55 termini, prima la definizione poi il dettaglio. Se preferisci il percorso più leggero con solo le parole che contano nella prima settimana, leggi invece Termini dell'IA spiegati e torna qui quando un termine ti rimanda a questa pagina.
Intelligenza artificiale
L'intelligenza artificiale è un software che svolge compiti che normalmente richiedono il giudizio umano, come scrivere, ragionare o riconoscere cosa c'è in un'immagine.
Nell'uso quotidiano del 2026, "IA" indica quasi sempre gli assistenti di chat costruiti sui modelli linguistici di grandi dimensioni, più che il campo accademico più ampio.
Apprendimento automatico
L'apprendimento automatico (machine learning) è la tecnica che insegna al software mostrandogli esempi invece di programmarlo con regole.
Ogni assistente IA moderno è costruito così: il comportamento nasce dagli schemi presenti nei dati di addestramento, ed è per questo che lo stesso modello può essere brillante nei compiti comuni e incerto in quelli rari.
Modello
Un modello è uno specifico sistema di IA addestrato, l'oggetto a cui in pratica invii un prompt.
GPT, Claude e Gemini sono famiglie di modelli; una famiglia contiene modelli singoli con dimensioni, velocità e prezzi diversi. Scegliere tra loro compito per compito è l'abilità principale per usare bene l'IA.
LLM (large language model)
Un LLM, o modello linguistico di grandi dimensioni, è un modello addestrato su enormi quantità di testo per prevedere quale testo debba venire dopo.
Quel singolo trucco, applicato su scala enorme, è ciò che produce risposte, bozze, codice e riassunti. "Large" si riferisce sia ai dati di addestramento sia al numero di parametri.
Chatbot
Un chatbot è l'interfaccia di conversazione che avvolge un modello, la cosa con la casella dei messaggi.
La distinzione conta quando confronti prodotti diversi: due chatbot possono avvolgere lo stesso modello e sembrare diversi, e un chatbot può offrire più modelli, che è proprio come funziona Whizi.
Prompt
Un prompt è tutto ciò che invii al modello: la domanda, le istruzioni e qualsiasi testo o file che includi.
La qualità della risposta segue da vicino la qualità del prompt. Contesto, vincoli e il formato di output che vuoi sono le tre cose che i principianti tralasciano più spesso.
Token
Un token è il piccolo frammento di testo che un modello legge e scrive davvero, all'incirca tre quarti di una parola inglese media.
Prezzi, velocità e finestre di contesto si misurano tutti in token, ed è per questo che la parola compare in ogni pagina dei prezzi dell'IA. Un documento da 1.000 parole equivale a circa 1.300 token.
Finestra di contesto
Una finestra di contesto è la quantità massima di testo, misurata in token, che un modello riesce a considerare in una volta sola.
Il tuo prompt, la conversazione fatta fin lì, i documenti allegati e la risposta la condividono tutti. La tabella del confronto delle finestre di contesto elenca il valore attuale per ogni modello principale, e la spiegazione copre perché questo spiega la maggior parte dei reclami del tipo "l'IA ha dimenticato".
Parametri
I parametri sono i numeri interni che un modello ha appreso durante l'addestramento, e la misura consueta della sua dimensione.
Contati in miliardi, più parametri significano genericamente più capacità e più costo. Da soli sono un pessimo criterio di scelta; i benchmark e i tuoi test personali battono il conteggio dei parametri.
Risposta
Una risposta è l'output del modello per un singolo prompt, chiamata anche completion.
Le risposte vengono generate da zero ogni volta, ed è per questo che rigenerare lo stesso prompt dà una formulazione diversa e a volte una risposta diversa.
Parlare con un modello
System prompt
Un system prompt è l'istruzione permanente che un modello riceve prima del tuo messaggio, che ne stabilisce ruolo, tono e regole.
Ogni prodotto ne ha uno anche quando non lo vedi. Quando un chatbot "ha una personalità", di solito è nel system prompt che vive.
Prompt engineering
Il prompt engineering è la pratica di scrivere prompt in modo deliberato per ottenere risultati migliori in modo affidabile.
Nonostante il nome altisonante, per lo più è chiarezza ordinaria: dichiara l'obiettivo, dai il contesto, mostra un esempio, indica il formato. La guida per principianti copre le tecniche che davvero spostano i risultati.
Zero-shot
Zero-shot vuol dire chiedere a un modello di svolgere un compito senza fornirgli alcun esempio.
I modelli moderni gestiscono la maggior parte dei compiti quotidiani in modalità zero-shot. Il termine sopravvive soprattutto come contrasto con il prompting few-shot.
Few-shot
Few-shot vuol dire includere nel prompt una manciata di esempi già svolti così che il modello ne copi lo schema.
È il modo più economico in assoluto per migliorare l'affidabilità nei lavori sensibili alla formattazione: due o tre esempi di input e output desiderato battono un paragrafo di descrizione.
Catena di ragionamento (chain of thought)
La catena di ragionamento è un modello che elabora passaggi intermedi prima di dare la risposta finale.
Chiedere a un modello di ragionare passo per passo migliora in modo misurabile i problemi difficili, e i modelli di ragionamento ora ne fanno una versione interna per impostazione predefinita.
Temperatura
La temperatura è l'impostazione che controlla quanta casualità un modello aggiunge nella scelta di ogni token successivo.
Una temperatura bassa dà un output coerente e prudente; una alta dà varietà e occasionali sciocchezze. I prodotti di chat di solito scelgono per te un valore intermedio.
Streaming
Lo streaming è il modello che invia la risposta token per token man mano che la genera, invece di tutta insieme a lavoro finito.
È per questo che le risposte sembrano scriversi da sole, ed è per questo che una risposta sbagliata può essere interrotta subito invece di doverla aspettare fino alla fine.
Rigenera
Rigenerare vuol dire chiedere una risposta nuova allo stesso prompt.
Poiché la generazione è probabilistica, una rigenerazione è un'estrazione davvero nuova, non un nuovo tentativo dello stesso calcolo. Confrontare due estrazioni, o lo stesso prompt su due modelli, è un controllo di qualità veloce.
Come nascono i modelli
Addestramento
L'addestramento è il processo di regolare i parametri di un modello sui dati finché le sue previsioni non diventano buone.
Avviene prima che tu incontri mai il modello e costa al fornitore una potenza di calcolo enorme. Niente di ciò che scrivi in una chat riaddestra il modello sul momento, anche se i fornitori possono usare le conversazioni per addestrare versioni future a seconda della loro policy.
Dati di addestramento
I dati di addestramento sono il testo e gli altri materiali da cui un modello ha imparato.
La loro ampiezza spiega cosa sa un modello, le loro lacune spiegano i punti ciechi sistematici, e il loro intervallo di date fissa la data di taglio.
Pre-addestramento
Il pre-addestramento è la prima e più ampia fase dell'addestramento, in cui un modello impara il linguaggio e la conoscenza del mondo da grandi quantità di testo.
Il risultato è capace ma grezzo. Tutto ciò che fa comportare un modello come un assistente utile arriva dopo.
Fine-tuning
Il fine-tuning è addestramento aggiuntivo su un set di dati più ristretto per specializzare o plasmare un modello già pre-addestrato.
I fornitori fanno fine-tuning per l'utilità e la sicurezza; le aziende lo fanno per compiti di settore. Per la maggior parte degli utenti, un buon prompting più un modello generico capace batte pagare per un fine-tuning.
RLHF
L'RLHF, apprendimento per rinforzo da feedback umano, è addestrare un modello sulla base delle valutazioni umane delle sue risposte.
È gran parte del motivo per cui gli assistenti moderni sono educati, strutturati e prudenti. Se esagerato, produce anche quella cautela eccessiva che fa rifiutare o tergiversare alcuni modelli.
Allineamento
L'allineamento è il lavoro di far corrispondere il comportamento di un modello alle intenzioni e ai valori umani.
In pratica copre tutto, dal rifiutare richieste dannose al semplice seguire le istruzioni con precisione. Quando un modello fa qualcosa di tecnicamente impressionante ma indesiderato, è un vuoto di allineamento.
Inferenza
L'inferenza è far girare un modello già addestrato per produrre una risposta, in contrapposizione ad addestrarlo.
Ogni messaggio che invii innesca un'inferenza, ed è il costo dell'inferenza ciò che il prezzo per token misura. I modelli economici da far girare possono essere sorprendentemente capaci; l'Indice dei costi dei modelli IA mostra una differenza di prezzo di 2.000 volte.
Transformer
Il transformer è l'architettura di rete neurale dietro praticamente ogni modello linguistico moderno.
Il suo meccanismo chiave, l'attenzione, permette al modello di soppesare ogni parte dell'input rispetto a ogni altra parte. Non ti serviranno mai i dettagli, ma la parola è ovunque negli scritti sull'IA.
Quando le cose vanno storte
Allucinazione
Un'allucinazione è un modello che afferma qualcosa di falso con piena sicurezza.
Non è un difetto che verrà sistemato con la prossima versione: deriva da come funziona la generazione stessa. La frequenza varia molto per modello e per compito. Tratta ogni fatto, numero o citazione specifici come non verificati finché non li controlli. Perché l'IA sbaglia ne copre il meccanismo.
Grounding (ancoraggio ai fatti)
Il grounding significa dare a un modello materiale autorevole da cui rispondere, invece di lasciare che si affidi alla memoria.
Incollare il contratto, allegare il rapporto o attivare la ricerca sul web sono tutte forme di grounding. È la difesa quotidiana più efficace contro l'allucinazione.
Bias
Il bias è un modello che distorce sistematicamente i propri output in modi ereditati dai dati di addestramento.
Si manifesta come presupposti su persone, luoghi e valori predefiniti. Per le decisioni importanti, rivedi l'output dell'IA come rivederesti il lavoro di uno stagista sveglio ma non verificato.
Guardrail (barriere di sicurezza)
I guardrail sono le restrizioni che un fornitore costruisce attorno a un modello per bloccare output dannosi o fuori policy.
Fornitori diversi tracciano il confine in modo diverso, ed è una vera differenza tra prodotti: la stessa richiesta può essere accolta da un modello e rifiutata da un altro.
Jailbreak
Un jailbreak è un prompt costruito per indurre con l'inganno un modello a ignorare i propri guardrail.
I fornitori li correggono di continuo. Per l'utente comune il termine conta soprattutto come concetto di sicurezza: qualunque cosa un modello possa essere convinto a fare, qualcuno proverà a convincerlo a farla.
Red teaming
Il red teaming consiste nell'attaccare deliberatamente un modello prima del rilascio per trovare modalità di fallimento dannose.
I fornitori mettono in campo red team interni ed esterni, e le model card pubblicate spesso riassumono ciò che hanno trovato. È l'equivalente per l'IA del penetration testing.
Data di taglio
La data di taglio è la data dopo la quale finiscono i dati di addestramento di un modello.
Chiedi qualcosa di più recente e il modello o ammette di non saperlo, o naviga sul web se può farlo, oppure allucina. Conoscere la data di taglio del modello che stai usando previene un'intera categoria di errori.
Il recupero delle informazioni e i tuoi dati
RAG (retrieval augmented generation)
Il RAG, generazione aumentata dal recupero, consiste nel recuperare prima i documenti rilevanti e far rispondere il modello a partire da quelli.
È così che funzionano sotto il cofano i prodotti "chatta con la tua knowledge base", ed è per questo che possono citare le fonti. Il RAG riduce l'allucinazione ma eredita la qualità di ciò che recupera.
Embedding
Un embedding è un elenco di numeri che rappresenta il significato di un pezzo di testo.
Testi con significato simile ottengono numeri vicini tra loro, il che permette al software di trovare matematicamente i passaggi correlati. Gli embedding sono il meccanismo dietro la ricerca semantica e il RAG.
Database vettoriale
Un database vettoriale è un database costruito per memorizzare embedding e trovare velocemente quelli più vicini.
Se un prodotto dice di aver "indicizzato" i tuoi documenti per la ricerca IA, da qualche parte in uno di questi c'è un embedding per ogni frammento.
Ricerca semantica
La ricerca semantica trova il testo in base al significato invece che alla corrispondenza di parole chiave.
Cercare "problemi di soldi" può far emergere un passaggio sulla tensione di liquidità anche se nessuna parola corrisponde. Sono gli embedding messi al lavoro.
Chunking (suddivisione in blocchi)
Il chunking è dividere documenti lunghi in pezzi abbastanza piccoli da poter essere trasformati in embedding e recuperati bene.
Suona come idraulica ed è idraulica, ma un chunking fatto male è un motivo comune per cui gli strumenti di chat con i documenti rispondono attingendo dalla parte sbagliata di un file.
Ricerca sul web (nell'IA)
La ricerca sul web nell'IA significa che il modello recupera pagine attuali prima di rispondere, invece di affidarsi alla memoria di addestramento.
Scambia velocità con freschezza e permette alle risposte di portare citazioni che puoi aprire. Per tutto ciò che viene dopo la data di taglio del modello, è la differenza tra una risposta e un'ipotesi.
Knowledge base (base di conoscenza)
Una knowledge base è l'insieme curato di documenti che un'azienda dà alla propria IA come base per rispondere.
Qualità in entrata, qualità in uscita: un assistente ancorato a un wiki obsoleto fornisce con sicurezza risposte obsolete, complete di citazioni.
Tre termini di questo glossario indicano risposte in competizione alla stessa domanda, come rendere un modello migliore nel tuo compito, e confonderli è l'errore di gergo più comune nelle riunioni di prodotto. A confronto:
| Approccio | Cosa cambia | Costo e velocità | Quando vince |
|---|---|---|---|
| Prompting migliore (zero-shot, few-shot) | Solo il testo che invii | Gratis, richiede minuti | Quasi sempre la prima mossa; due o tre esempi svolti risolvono la maggior parte dei problemi di formattazione |
| RAG | Cosa legge il modello prima di rispondere | Da moderato a costruire, nessun riaddestramento | Risposte che devono restare aggiornate o citare i tuoi documenti |
| Fine-tuning | I parametri stessi del modello | Lento e costoso, poi fisso | Requisiti di stile e formato stabili su larga scala, quasi mai per un singolo utente |
Oltre il testo
Multimodale
Multimodale significa un modello che lavora su più di un mezzo, come testo più immagini, audio o video.
È per questo che puoi fare uno screenshot di un errore e chiedere cosa non va. La guida all'IA multimodale copre cosa funziona davvero oggi.
Modello di visione
Un modello di visione è un modello capace di interpretare immagini: foto, screenshot, grafici e documenti.
Leggere non è la stessa cosa di generare: un modello può descrivere perfettamente il tuo diagramma e restare comunque incapace di disegnarne uno.
Generazione di immagini
La generazione di immagini è produrre immagini nuove a partire da una descrizione testuale.
Qualità, gamma di stili e resa del testo dentro le immagini variano molto da un generatore all'altro, per questo chi lo usa seriamente ne confronta diversi. La rassegna dei generatori di immagini resta aggiornata sul settore.
Modello di diffusione
Un modello di diffusione genera immagini partendo dal rumore e affinandolo passo dopo passo verso la descrizione.
È la tecnica dominante dietro i generatori di immagini moderni. La parola conta soprattutto perché "diffusion" nel nome di un prodotto ti dice cosa fa quel prodotto.
Da voce a testo (speech to text)
Da voce a testo significa trascrivere audio parlato in parole scritte.
La trascrizione moderna è abbastanza accurata da rendere ricercabili riunioni, note vocali e interviste, ed è così che funziona l'input vocale nelle app di chat.
Da testo a voce (text to speech)
Da testo a voce significa generare audio parlato a partire da parole scritte.
I sistemi attuali producono voci naturali ed espressive, il che alimenta le funzioni di lettura ad alta voce e le conversazioni vocali con l'IA.
L'ecosistema
API
Un'API è la porta programmatica che gli sviluppatori usano per inviare prompt a un modello dal proprio software.
Il prezzo delle API è per token, ed è da lì che alla fine derivano i costi per risposta di ogni prodotto IA.
Pesi aperti (open weights)
Pesi aperti significa che i parametri addestrati di un modello sono pubblicati e chiunque può scaricarli e farli girare.
Permette l'auto-hosting e lascia che altri fornitori offrano il modello sulla propria infrastruttura. DeepSeek e Llama sono gli esempi più noti.
Modello open source
Un modello open source è, in senso lato, un modello rilasciato per uso e modifica pubblici, anche se le licenze variano molto.
Le domande pratiche sono sempre le stesse due: puoi usarlo commercialmente, e chi te lo ospita. L'ecosistema dei pesi aperti conta di più quando privacy o costo escludono i top di gamma ospitati dai grandi fornitori.
Benchmark
Un benchmark è un test standard usato per valutare e confrontare i modelli.
Utile per una prima scrematura, ma sistematicamente sovrasfruttato nel marketing. Un modello che guida un benchmark può comunque perdere sul tuo lavoro reale, ed è per questo che fare il tuo confronto su tre compiti batte leggere i grafici.
Agente
Un agente è un sistema di IA che compie azioni per passi verso un obiettivo, invece di limitarsi a rispondere una volta sola.
Prenotare, fare ricerche, programmare e aprire ticket sono territorio degli agenti. La capacità è reale e migliora in fretta; lo stesso vale per la necessità di rivedere cosa ha fatto un agente prima che conti davvero.
Uso di strumenti (tool use)
L'uso di strumenti, o function calling, è un modello che richiama capacità esterne come la ricerca, la calcolatrice, il codice o il tuo calendario.
È così che gli assistenti di chat agiscono sul mondo invece di limitarsi a descriverlo, ed è il meccanismo che sta sotto gli agenti.
Modello di ragionamento
Un modello di ragionamento è un modello che spende potenza di calcolo extra per riflettere internamente su un problema prima di rispondere.
Lo scambio è tempo e costo in cambio di accuratezza sui problemi difficili. Per le domande semplici quel pensiero extra non porta nulla, un altro argomento a favore del cambiare modello a seconda del compito.
Latenza
La latenza è quanto aspetti tra l'invio di un prompt e l'arrivo della risposta o l'inizio dello streaming.
Varia in base alla dimensione del modello, al carico e al fatto che sia o meno un modello di ragionamento. Per il lavoro interattivo, un modello veloce e abbastanza buono spesso batte uno lento e brillante.
Limite di frequenza (rate limit)
Un limite di frequenza è il tetto che un fornitore impone a quante richieste o token puoi usare in una finestra di tempo.
Raggiungerlo è il motivo abituale per cui un prodotto di chat ti dice di aspettare o di fare l'upgrade. I limiti di messaggi sui piani in abbonamento sono limiti di frequenza con un nome più gentile.
Mantenere utile il glossario
In questo campo i termini invecchiano in fretta. Questa pagina viene mantenuta come riferimento: le voci vengono riscritte quando l'uso cambia, e le guide di approfondimento collegate portano il dettaglio che non entra in una definizione.
Se un termine che incontri in giro manca da questa pagina, la via più veloce è incollare la frase in cui l'hai trovato in un modello capace e chiedere la definizione nel contesto. Su Whizi puoi chiedere a due modelli insieme e notare quando non sono d'accordo, il che per il gergo nuovo succede sorprendentemente spesso.
- Cita la definizione di una frase; leggi il dettaglio prima di farci affidamento.
- Quando due fonti definiscono un termine in modo diverso, nell'IA di solito vince l'uso più recente.
- Impara prima token, finestra di contesto e allucinazione; la maggior parte degli altri termini dipende da questi tre.
- Verifica le affermazioni che non conosci su un modello con un tuo confronto su tre compiti.
- Usa prima il glossario per principianti se questa pagina ti sembra un manuale di riferimento, perché lo è.
Domande frequenti
Che differenza c'è tra IA, apprendimento automatico e un LLM?
L'IA è l'obiettivo generale di un software che svolge compiti che richiedono giudizio umano. L'apprendimento automatico è la tecnica per insegnare al software partendo da esempi, ed è così che viene costruita praticamente tutta l'IA moderna. Un LLM è un tipo di modello addestrato con l'apprendimento automatico, allenato sul testo, ed è il tipo che sta dietro ChatGPT, Claude e Gemini.
Cosa vuol dire RAG nell'IA?
RAG sta per retrieval augmented generation, generazione aumentata dal recupero: il sistema recupera prima i documenti rilevanti, poi fa rispondere il modello a partire da quelli invece che dalla memoria. È la tecnica standard dietro i prodotti che chattano con i tuoi file o con la tua knowledge base, ed è per questo che quei prodotti possono citare le fonti.
Che differenza c'è tra fine-tuning e RAG?
Il fine-tuning cambia il modello stesso con addestramento aggiuntivo, il che è lento e fisso. Il RAG lascia stare il modello e gli fornisce i documenti giusti al momento della domanda, il che è flessibile e aggiornato. Per tenere un assistente al passo con informazioni che cambiano, il RAG è quasi sempre lo strumento giusto; il fine-tuning si adatta a requisiti di stile e formato stabili.
Cos'è un token nell'IA?
Un token è l'unità di testo che un modello legge e scrive, circa tre quarti di una parola inglese. Tutto si misura in token: prezzi, velocità e finestra di contesto. Un documento da 1.000 parole equivale a circa 1.300 token.
Di quanti di questi termini ho davvero bisogno?
Per l'uso quotidiano, circa cinque: modello, prompt, token, finestra di contesto e allucinazione. La versione per principianti di questo glossario li copre con più calma. Il resto di questa pagina esiste per il momento in cui una pagina di prodotto o un articolo ti sbatte in faccia un termine.