La risposta breve
Sì, Whizi include la famiglia Llama di Meta nel suo catalogo di oltre 280 modelli, e tutte e tre le righe Llama del set Pro si trovano sul gradino più economico che Whizi misura: 1 credito a messaggio. Llama sta sul piano Pro, che costa $29.99/mese, oppure $19.99/mo con fatturazione annuale a $239.88. Starter non include alcun modello Llama.
Le righe Llama tariffate da Whizi, con il costo in crediti addebitato per messaggio:
| Modello | Finestra di contesto | Costo per risposta standard | Crediti per messaggio | Piano minimo |
|---|---|---|---|---|
| Llama 4 Maverick | 1M | $0.0006 | 1 | Pro |
| Llama 3.3 70B Instruct | 131K | $0.00026 | 1 | Pro |
| Llama 4 Scout | Non presente nel Cost Index | Non presente nel Cost Index | 1 | Pro |
Una risposta standard è composta da 1.000 token in input più 500 in output, con prezzi rilevati il 2026-08-20, così le cifre si confrontano alla pari tra i vari fornitori.
Questi tre identificativi sono le righe Llama nominate nel set di modelli Pro. Qualsiasi altro identificativo Llama presente nel catalogo ricade sul fallback Powerhouse descritto più avanti, quindi va letta come la lista Pro e non come un elenco completo del catalogo.
Quanto costa in crediti un messaggio Llama
Tutte e tre le righe Llama del set Pro si trovano sul gradino più basso della scala crediti, quindi un turno Llama costa 1 credito qualunque cosa tu invii. Il terzo identificativo, Llama 4 Scout, non è presente nel Cost Index, quindi la tabella non pubblica una finestra o un prezzo per risposta, ma la tabella crediti gli addebita comunque 1 credito come agli altri due.
A 1 credito per messaggio, l'allowance in crediti coincide con il numero di messaggi Llama: sul web, Pro dà diritto a 2.000 turni Llama al mese e Powerhouse a 8.000. Starter non raggiunge alcuna riga Llama.
| Piano | Crediti al mese (web) | Messaggi al mese fuori dalla allowlist crediti |
|---|---|---|
| Starter | 400 | 400 |
| Pro | 2.000 | 800 |
| Powerhouse | 8.000 | 5.000 |
La fatturazione settimanale è offerta solo su mobile, e non su ogni livello. Dove è venduta, le allowance settimanali in crediti sono 100 su Starter e 500 su Pro, e le allowance settimanali di messaggi sono 100 e 400.
Un turno viene addebitato al gradino del modello che ha risposto, quindi una conversazione che si sposta tra famiglie diverse viene fatturata per turno alla tariffa di ciascun modello che risponde. I crediti non si accumulano da un periodo all'altro: il saldo somma l'utilizzo all'interno della chiave del periodo corrente, quindi l'arrivo di un nuovo periodo è esso stesso il reset. Non esiste un modo per ricaricare oltre l'allowance.
I moltiplicatori dei crediti vengono applicati solo sulle piattaforme presenti nella allowlist crediti, che oggi è la web app. Una piattaforma fuori dalla allowlist vede un moltiplicatore fisso di 1x, viene addebitata di uno a turno, e mantiene la vecchia allowance di messaggi. Su Starter le due allowance coincidono, 400. Su Pro e Powerhouse non coincidono, il che corrisponde alla seconda e terza colonna della tabella sopra.
La scala completa, tutti e quattordici i gradini occupati, è nel riferimento crediti.
Il blocco per piano, nel dettaglio
L'accesso viene risolto lato server per identificativo (vedi il riferimento modelli).
Starter raggiunge esattamente quattro voci nel selettore: Auto, Whizi AI, un modello OpenAI e un modello Google. Nessuna riga Llama è tra queste.
Pro aggiunge il set Llama sopra a Starter. Letta come la regola di curatela applicata a un'unica famiglia, quel set è composto dalle attuali righe Llama 4 più il veterano Llama 3, tre identificativi in totale.
Powerhouse include tutto ciò che Pro raggiunge, perché i ranghi dei piani si confrontano con un test maggiore o uguale, quindi un livello superiore soddisfa sempre un requisito inferiore. Powerhouse è anche dove finisce qualsiasi identificativo di catalogo non nominato nei set Starter o Pro, motivo per cui un identificativo Llama non elencato è Powerhouse finché non viene deliberatamente promosso.
Selezionare un modello sopra il proprio livello restituisce HTTP 403 con il codice tier_upgrade_required e il messaggio "Upgrade your plan to use this model." Quel sintomo è trattato in quando un modello non è disponibile.
Gli account gratuiti non raggiungono alcuna riga Llama: dal 2026-09-02 il livello gratuito apre solo Whizi AI e Auto e nient'altro. L'allowance gratuita in crediti è 0, e l'allowance di messaggi è 7 messaggi il primo giorno, poi 3 al giorno, spesi su quelle due righe.
Finestra di contesto contro ciò che un turno riceve davvero
La finestra di contesto nella tabella sopra è la finestra pubblicata dal modello. Non è il budget con cui gira un singolo turno di Whizi.
Ogni modello del catalogo riceve un budget fisso di 40.000 token in input e 20.000 in output per turno. Un modello la cui finestra è sotto i 93.000 token riceve invece un budget proporzionalmente più piccolo, con l'output limitato al 40 percento della finestra e un margine di sicurezza di 1.000 token trattenuto.
Poiché entrambe le righe Llama tariffate si trovano sopra la soglia dei 93.000 token, entrambe girano con lo stesso budget fisso di 40.000 in input e 20.000 in output. La finestra pubblicata più ampia non alza quanto un singolo turno di Whizi invia, e il fornitore conta il massimo di output richiesto contro la finestra tanto quanto l'input, quindi la riga da 1M e quella da 131K sono dimensionate qui in modo identico. Se una conversazione supera il budget, vedi quando una conversazione è troppo lunga.
Dove si collocano queste righe nel Cost Index
Il Cost Index tariffa 100 righe su 29 fornitori a una risposta standard ciascuna. Quel numero è la dimensione dell'indice prezzi, non la dimensione del catalogo Whizi.
| Punto di riferimento | Costo per risposta standard |
|---|---|
| Riga più economica tariffata nell'indice | $0.000053 |
| Riga mediana tariffata | $0.00185 |
| Llama 3.3 70B Instruct | $0.00026 |
| Llama 4 Maverick | $0.0006 |
| Riga più costosa tariffata nell'indice | $0.105 |
Entrambe le righe Llama tariffate si collocano sotto la mediana dell'indice, e lo scarto tra la riga più economica e quella più costosa tariffata è di circa 2000x. 89 delle 100 righe tariffate portano un addebito in crediti Whizi; le restanti sono tariffate per confronto ma non sono offerte come riga misurata a sé.
Per cosa Llama non viene usato in Whizi
Nessuna riga Llama sta sulla scala Auto. Auto ha sei gradini, e i modelli su di essi sono il modello di casa per domande brevi, una riga Gemini Flash per le riscritture e di nuovo per gli allegati, una riga GPT per i contenuti lunghi, una riga Claude Sonnet per il codice e una seconda riga GPT per il ragionamento a più passaggi. Nessun identificativo Llama compare su nessuno dei sei, quindi Auto non può mai raggiungere Llama a nessun livello e una risposta Llama è sempre una scelta manuale nel selettore modelli.
Gli allegati su Auto vanno altrove. Auto instrada qualsiasi turno con un allegato verso Gemini Flash, con il ragionamento che un'immagine richiede la vista piuttosto che una grande finestra. Selezionando tu stesso una riga Llama, l'allegato viene gestito per richiesta anziché per modello. Sull'app, viene inoltrato al modello su cui si trova il turno, e viene inoltrato solo il messaggio più recente dell'utente che porta allegati. Sul web, un file PDF, Word o foglio di calcolo ha il testo estratto nel browser, ed è quel testo a raggiungere il modello.
La generazione voce e media non sono scelte per modello. I generatori di media saltano del tutto il blocco per modello e sono invece organizzati per livello a seconda della sezione del selettore, e la modalità voce gira su un proprio percorso in tempo reale, quindi scegliere una riga Llama non cambia nulla di questo.
Whizi non pubblica il supporto vision per modello. Non esiste alcun indicatore di capacità vision o multimodale da nessuna parte nel catalogo o nel cost index, quindi Whizi non può dirti quale riga Llama legge un'immagine. Le parti immagine vengono inoltrate al modello su cui si trova il turno, e il risultato resta tra te e il modello.
- Llama è nel catalogo e tutte e tre le righe del set Pro costano 1 credito per messaggio
- Pro è il piano che sblocca il set Llama, e Powerhouse lo include
- Starter non include alcun modello Llama
- Un account gratuito non raggiunge alcuna riga Llama: Pro è il piano più basso che lo fa
- Un turno Llama gira sul budget fisso di 40.000 token in input e 20.000 in output, perché entrambe le righe tariffate stanno sopra la soglia dei 93.000 token
- Nessuna riga Llama sta su nessuno dei sei gradini Auto, quindi Llama è sempre una scelta manuale
- Whizi non pubblica alcun indicatore vision per modello, quindi quale riga Llama legge un'immagine non è qualcosa che può dirti
Domande frequenti
Quali modelli Llama include Whizi?
Il set di modelli Pro nomina tre identificativi Llama: le due varianti Llama 4 più il veterano Llama 3, e tutte e tre costano 1 credito per messaggio. Due di essi sono tariffati nel Cost Index di Whizi, con finestre di contesto pubblicate di 1M e 131K. Il catalogo può includere ulteriori identificativi Llama, e qualsiasi cosa non nominata nei set Starter o Pro richiede Powerhouse.
Quanti crediti costa un messaggio Llama?
Un credito, che è il gradino più basso della scala e lo stesso costo di un messaggio sul modello di casa di Whizi. Né Starter né il livello gratuito aprono alcuna riga Llama, quindi Pro è il primo piano in cui quel 1 credito compra qualcosa qui.
Serve il piano più alto per usare Llama?
No. Pro è il piano più economico che apre una riga Llama, a $29.99/mese. Starter non ne raggiunge una, Powerhouse serve solo per un identificativo Llama che il set Pro non nomina, e un account gratuito non ne raggiunge nessuna: gira su Whizi AI e Auto.
Posso spostare una conversazione da Llama a un altro modello?
Sì. Ogni turno viene addebitato al gradino del modello che ha risposto, quindi una conversazione che si sposta tra famiglie diverse viene fatturata per turno alla tariffa di ciascuna, non a livello dell'intera conversazione. Un modello non lascia mai il catalogo una volta offerto, perché una conversazione porta con sé il modello con cui è stata creata, quindi una vecchia conversazione Llama si apre ancora in seguito. I dettagli sono in cambiare modello a metà conversazione.
Cosa posso allegare a un turno Llama?
Gli allegati vengono gestiti per richiesta anziché per modello, e non costano crediti propri. I limiti sono 10 MB per file, 4 allegati per prompt e 20 MB in totale per prompt. I tipi accettati sono JPEG, PNG, WebP, GIF, PDF, testo semplice, Markdown, CSV e JSON.
La ricerca web funziona con Llama?
Whizi non pubblica un elenco di ricerca web per modello. La ricerca è un interruttore per richiesta con tre modalità, off, probe e native, non un indicatore di capacità per modello, e la matrice per modello non è mai stata enumerata, quindi non c'è una risposta specifica per Llama da dare. L'interruttore stesso è trattato in ricerca web.