Cos'è Llama 3
Llama è una famiglia di modelli di IA costruita da Meta, l'azienda dietro Facebook e Instagram. Come ChatGPT e Claude, scrivi una domanda e ottieni una risposta. La parte interessante non è cosa fa, ma come viene distribuito.
La maggior parte dei modelli di IA resta chiusa dentro il prodotto di chi li ha creati. Usi ChatGPT tramite OpenAI, e il modello vero e proprio non lascia mai i loro server. Meta invece pubblica i pesi di Llama, cioè i numeri che costituiscono il modello addestrato, perché chiunque possa scaricarli e usarli.
Un paragone utile: quasi tutta l'IA è un ristorante, dove ordini e cucinano loro. Llama assomiglia di più alla pubblicazione della ricetta. Puoi ancora mangiare al ristorante, ma puoi anche cucinare da solo, adattare il piatto o aprire una tua cucina.
Una precisazione su cui vedrai discutere online. Llama viene di solito descritto come open source e, a rigore, è a "pesi aperti", con una licenza che porta con sé alcune condizioni, tra cui limiti all'uso commerciale su larghissima scala. Per un singolo utente non cambia nulla nella pratica. Per un'azienda che ci costruisce sopra un prodotto, la licenza vale la pena leggerla.
Perché conta anche se non scarichi mai niente
Tre conseguenze arrivano fino agli utenti comuni.
Costa poco, quindi è ovunque. Dato che chiunque può ospitarlo, la concorrenza fa scendere il prezzo. I modelli Llama alimentano una buona parte dell'IA che incontri dentro altri prodotti senza che venga dichiarato, e di solito sono ciò che un servizio intende quando parla di piano veloce o economico.
Può funzionare senza internet. Un modello sul tuo computer funziona in aereo, in un ambiente protetto o in qualsiasi posto da cui i dati non devono uscire. Nessun servizio online può offrirtelo.
Tiene onesto il mercato. Un'opzione gratuita e capace mette un tetto a quanto possono farsi pagare i modelli chiusi, e questo ti fa comodo a prescindere da cosa usi.
In cosa è davvero bravo
Essere onesti su questo è più utile dell'entusiasmo. Llama esiste in diverse dimensioni, e il compromesso è sempre lo stesso: i modelli piccoli sono estremamente veloci ed economici, quelli grandi sono più capaci ma non più economici da far girare.
| Compito | Llama | Meglio altrove |
|---|---|---|
| Domande veloci su fatti | Rapido e sufficiente | No |
| Elenchi brevi, idee, riscritture semplici | Ottimo e istantaneo | No |
| Lavoro ripetitivo su molti elementi | Ideale: conta il costo per elemento | No |
| Uso offline o riservato | L'unica vera opzione | No |
| Testi che si leggono per intero | Utilizzabile | Claude, nettamente |
| Ragionamenti complessi a più passaggi | Più debole | GPT o Claude |
| Documenti molto lunghi | Limitato | Gemini |
| Fatti delle ultime settimane | Non li conosce | Un modello con accesso al web |
Lo schema è chiaro: eccellente per volume e velocità, competitivo sulle domande di tutti i giorni, indietro rispetto ai modelli di punta sul ragionamento difficile e sulla scrittura rifinita. È uno scambio equo per qualcosa di gratuito, ed è il motivo per cui "qual è il migliore" è la domanda sbagliata. Usalo dove contano velocità e costo, e cambia quando il compito si fa difficile.
Tre modi per usarlo
1. Dentro uno spazio di lavoro, senza installare nulla. L'opzione più semplice. Llama è incluso in Whizi insieme a GPT, Claude e Gemini, così mandi a lui le domande veloci e passi a un modello più forte nella stessa conversazione quando il compito si complica. Niente da installare.
2. Sul tuo computer. Strumenti come Ollama e LM Studio scaricano un modello e lo fanno girare in locale. Aspettative realistiche: ti serve una macchina ragionevolmente moderna con parecchia memoria, i modelli che girano comodamente sono quelli piccoli e le risposte saranno più lente di un servizio online, a meno che tu non abbia una buona GPU. In cambio, niente di ciò che scrivi esce dal tuo computer e funziona anche senza internet. Ne vale davvero la pena se il requisito è la riservatezza o l'uso offline, altrimenti è superfluo.
3. Tramite API. Se stai sviluppando software, diversi fornitori ospitano Llama a un costo per token bassissimo, ed è spesso questo il motivo per sceglierlo al posto di un modello di punta nei compiti ad alto volume.
Come ottenere buone risposte
I modelli piccoli premiano uno stile di prompt diverso da quello dei modelli di punta. Tre abitudini fanno una grande differenza.
Sii diretto e preciso. Elenca 10 idee di nome per una caffetteria, una per riga, senza spiegazioni funziona meglio di una richiesta discorsiva. I modelli piccoli seguono bene istruzioni semplici ed esplicite, e si perdono su quelle elaborate.
Una cosa alla volta. I modelli di punta gestiscono sei vincoli in un solo prompt. I modelli piccoli rendono di più con una sequenza di richieste singole.
Indica il formato. Rispondi in una frase oppure restituisci solo un elenco numerato evita il riempitivo che i modelli piccoli producono quando sono incerti.
E riconosci quando cambiare. Se una risposta è vaga, si contraddice o salta qualcosa di ovvio, è il segnale per spostare la stessa domanda su un modello più forte invece di continuare a riformularla. In uno spazio di lavoro che ne contiene diversi, basta un clic e la conversazione prosegue.
A cosa fare attenzione
Non sa cosa è successo di recente. La sua conoscenza si ferma alla data di addestramento e, se non è collegato a un motore di ricerca, risponderà a una domanda sul mese scorso con conoscenze generiche, e con grande sicurezza.
Si inventa le cose, come ogni modello. I modelli piccoli lo fanno un po' di più. Controlla ogni fatto, data o cifra specifica.
Gratuito non significa riservato, se è ospitato da qualcuno. Far girare Llama sul tuo computer è riservato. Usarlo tramite il servizio di qualcun altro significa che vale la loro politica sui dati, esattamente come per ogni altro modello.
Confusione tra versioni. Llama 3 è stata una generazione e da allora ne sono uscite di più recenti. Chiedi quale versione stai usando se la cosa conta, perché le differenze di capacità tra generazioni sono grandi.
- Usalo per domande veloci, elenchi brevi e compiti ripetitivi dove conta la velocità
- Passa a un modello più forte quando serve ragionare con cura o scrivere in modo rifinito
- Tieni i prompt diretti, una richiesta alla volta, e indica il formato dell'output
- Fallo girare in locale solo se ti serve davvero l'uso offline o riservato
- Controlla ogni fatto, data o cifra specifica, come con qualsiasi modello
- Chiedi quale versione stai usando, perché le generazioni sono molto diverse
Domande frequenti
Devo scaricare qualcosa per usare Llama 3?
No. Scaricarlo e farlo girare in locale è una delle opzioni, ed è quella giusta se ti serve un uso offline o del tutto riservato, ma richiede una macchina abbastanza potente e dà risposte più lente di un servizio online. La maggior parte delle persone lo usa da browser su una piattaforma, dove sta accanto agli altri modelli e non richiede alcuna configurazione.
Llama 3 è più veloce di ChatGPT?
I modelli Llama più piccoli sono nettamente più veloci, il che li rende ottimi per domande brevi, elenchi rapidi e qualsiasi cosa ripetitiva. Il compromesso riguarda la capacità: sul ragionamento complesso e sulla scrittura rifinita i modelli di punta sono chiaramente migliori. L'approccio sensato è usare Llama per la velocità e cambiare quando una domanda si rivela più difficile del previsto.
Llama è davvero gratis?
I pesi del modello si scaricano gratis e la licenza consente quasi tutti gli usi, con alcune condizioni che riguardano soprattutto le installazioni commerciali su larghissima scala. Farlo funzionare però non è gratis: costa il tuo hardware e la tua elettricita, oppure la tariffa per token di un fornitore, che è semplicemente molto più bassa di quella dei modelli di punta.
È riservato se lo faccio girare sul mio computer?
Sì, ed è la ragione più forte per usarlo in locale. Niente di ciò che scrivi esce dalla tua macchina, funziona anche con internet scollegato e non si applica la politica di nessun fornitore, perché non c'è nessun fornitore. I costi sono la fatica della configurazione, una macchina con memoria sufficiente, risposte più lente senza una buona GPU e il limite ai modelli piccoli che girano comodamente.
Conviene usare Llama al posto di ChatGPT o Claude?
Al posto, raramente. Insieme, spesso. È la scelta giusta per domande semplici e veloci, per lavoro ripetitivo ad alto volume e per tutto ciò che deve restare riservato o funzionare offline. Per i testi che qualcuno leggerà con attenzione, per i ragionamenti difficili a più passaggi e per i documenti molto lunghi, i modelli di punta sono nettamente migliori. Averli tutti a disposizione significa scegliere compito per compito invece di legarsi a uno solo.