A resposta rápida
Sim, o Whizi traz a família Llama da Meta dentro do seu catálogo de 280+ modelos, e as três linhas Llama do conjunto Pro ficam no degrau mais barato que o Whizi mede: 1 crédito por mensagem. O Llama está no plano Pro, que custa $29.99/mês, ou $19.99/mês na cobrança anual de $239.88. O Starter não inclui nenhum modelo Llama.
As linhas Llama que o Whizi precifica, com o custo em créditos cobrado por mensagem:
| Modelo | Janela de contexto | Custo por resposta padrão | Créditos por mensagem | Plano mínimo |
|---|---|---|---|---|
| Llama 4 Maverick | 1M | $0.0006 | 1 | Pro |
| Llama 3.3 70B Instruct | 131K | $0.00026 | 1 | Pro |
| Llama 4 Scout | Não incluído no Cost Index | Não incluído no Cost Index | 1 | Pro |
Uma resposta padrão equivale a 1,000 tokens de entrada mais 500 tokens de saída, precificada com taxas lidas em 2026-08-20, então os valores comparam de forma equivalente entre provedores.
Esses três identificadores são as linhas Llama nomeadas no conjunto de modelos Pro. Qualquer outro identificador Llama que o catálogo carregue cai no fallback do Powerhouse descrito abaixo, então trate a tabela como a lista do Pro, não como uma enumeração completa do catálogo.
Quanto uma mensagem do Llama custa em créditos
As três linhas Llama do conjunto Pro ficam no degrau mais baixo da escala de créditos, então um turno do Llama custa 1 crédito seja o que for que você envie. O terceiro identificador, o Llama 4 Scout, não está incluído no Cost Index, então a tabela não publica janela ou preço por resposta para ele, mas a tabela de créditos cobra 1 crédito dele, como dos outros dois.
A 1 crédito por mensagem, a cota de créditos é a própria contagem de mensagens Llama: na web, o Pro compra 2,000 turnos do Llama por mês e o Powerhouse compra 8,000. O Starter não alcança nenhuma linha Llama.
| Plano | Créditos por mês (web) | Mensagens por mês fora da allowlist de créditos |
|---|---|---|
| Starter | 400 | 400 |
| Pro | 2,000 | 800 |
| Powerhouse | 8,000 | 5,000 |
A cobrança semanal só é oferecida no app mobile, e não em todos os planos. Onde é vendida, as cotas semanais de créditos são 100 no Starter e 500 no Pro, e as cotas semanais de mensagens são 100 e 400.
Um turno é cobrado no degrau do modelo que respondeu, então uma conversa que transita entre famílias é cobrada por turno, na taxa de cada modelo que respondeu. Créditos não acumulam de um período para outro: o saldo soma o uso dentro da chave do período atual, então a chegada de um novo período já é o próprio reset. Não existe caminho para recarga avulsa.
Multiplicadores de crédito são cobrados apenas nas plataformas da allowlist de créditos, que hoje é o app web. Uma plataforma fora da allowlist vê um multiplicador fixo de 1x, é cobrada uma unidade por turno e mantém a cota de mensagens mais antiga. No Starter as duas cotas são o mesmo número, 400. No Pro e no Powerhouse não são, o que corresponde à segunda e à terceira coluna da tabela acima.
A escala completa, com os quatorze degraus ocupados, está na referência de créditos.
O bloqueio por plano, com exatidão
O acesso é resolvido no servidor por identificador (veja a referência de modelos).
Starter alcança exatamente quatro opções no seletor: Auto, Whizi AI, um modelo da OpenAI e um modelo do Google. Nenhuma linha Llama está entre elas.
Pro adiciona o conjunto Llama sobre o Starter. Lido como a regra de curadoria aplicada a uma família, esse conjunto é composto pelas linhas atuais do Llama 4 mais o veterano Llama 3, três identificadores no total.
Powerhouse inclui tudo o que o Pro alcança, porque a hierarquia de planos compara com um teste de maior ou igual, então um plano mais alto sempre satisfaz um requisito mais baixo. O Powerhouse é também onde cai qualquer identificador do catálogo que não esteja nomeado nos conjuntos Starter ou Pro, e é por isso que um identificador Llama não listado é Powerhouse até ser promovido deliberadamente.
Selecionar um modelo acima do seu plano retorna HTTP 403 com o código tier_upgrade_required e a mensagem "Atualize seu plano para usar este modelo." Esse sintoma é tratado em quando um modelo está indisponível.
Contas gratuitas não alcançam nenhuma linha Llama: desde 2026-09-02 o plano gratuito abre apenas Whizi AI e Auto. A cota de créditos gratuita é 0, e a cota de mensagens é 7 mensagens no primeiro dia, depois 3 por dia, gastas nessas duas linhas.
Janela de contexto versus o que um turno realmente recebe
A janela de contexto na tabela acima é a janela publicada pelo modelo. Não é o orçamento com o qual um único turno do Whizi roda.
Todo modelo do catálogo recebe um orçamento fixo de 40,000 tokens de entrada e 20,000 tokens de saída por turno. Um modelo cuja janela fique abaixo de 93,000 tokens recebe, em vez disso, um orçamento proporcional menor, com a saída limitada a 40 por cento da janela e uma margem de segurança de 1,000 tokens reservada.
Como as duas linhas Llama precificadas ficam acima do limite de 93,000 tokens, ambas rodam no mesmo orçamento fixo de 40,000 de entrada e 20,000 de saída. A janela publicada maior não aumenta o que um único turno do Whizi envia, e o provedor conta a saída máxima solicitada contra a janela, assim como a entrada, então a linha de 1M e a de 131K têm o mesmo tamanho aqui. Se uma thread ultrapassar o orçamento, veja quando uma conversa é longa demais.
Onde essas linhas ficam no Cost Index
O Cost Index precifica 100 linhas em 29 provedores, cada uma em uma resposta padrão. Esse número é o tamanho do índice de preços, não o tamanho do catálogo do Whizi.
| Ponto de referência | Custo por resposta padrão |
|---|---|
| Linha mais barata precificada no índice | $0.000053 |
| Linha de custo mediano | $0.00185 |
| Llama 3.3 70B Instruct | $0.00026 |
| Llama 4 Maverick | $0.0006 |
| Linha mais cara precificada no índice | $0.105 |
As duas linhas Llama precificadas ficam abaixo da mediana do índice, e a diferença entre a linha mais barata e a mais cara precificada é de aproximadamente 2000x. 89 das 100 linhas precificadas carregam uma cobrança de créditos do Whizi; o restante é precificado para comparação, mas não é oferecido como sua própria linha medida.
Para que o Llama não é usado no Whizi
Nenhuma linha Llama está na escada do Auto. O Auto tem seis degraus, e os modelos neles são o modelo da casa para perguntas curtas, uma linha Gemini Flash para reescritas e também para anexos, uma linha GPT para textos longos, uma linha Claude Sonnet para código e uma segunda linha GPT para raciocínio em múltiplas etapas. Nenhum identificador Llama aparece em nenhum dos seis, então o Auto não consegue alcançar o Llama em nenhum plano, e uma resposta do Llama é sempre uma escolha manual no seletor de modelos.
Anexos no Auto vão para outro lugar. O Auto roteia qualquer turno com anexo para o Gemini Flash, com o raciocínio de que uma imagem precisa de visão, não de uma janela grande. Se você escolher uma linha Llama, o anexo é tratado por requisição, não por modelo. No app, ele é encaminhado para o modelo em que o turno está, e apenas a mensagem mais recente do usuário com anexos é encaminhada. Na web, um arquivo PDF, Word ou de planilha tem seu texto extraído no navegador, e é esse texto que chega ao modelo.
Voz e geração de mídia não são escolhas por modelo. Os geradores de mídia ignoram totalmente o bloqueio por modelo e são escalonados por seção do seletor, e o modo de voz roda em sua própria rota em tempo real, então escolher uma linha Llama não muda nenhum dos dois.
O Whizi não publica suporte a visão por modelo. Não existe nenhuma flag de capacidade de visão ou multimodal no catálogo ou no cost index, então o Whizi não consegue dizer qual linha Llama lê uma imagem. As partes de imagem são encaminhadas para o modelo em que o turno está, e o resultado fica entre você e o modelo.
- O Llama está no catálogo, e as três linhas do conjunto Pro custam 1 crédito por mensagem
- O Pro é o plano que libera o conjunto Llama, e o Powerhouse o inclui
- O Starter não inclui nenhum modelo Llama
- Uma conta gratuita não alcança nenhuma linha Llama: o Pro é o plano mais barato que alcança
- Um turno do Llama roda no orçamento fixo de 40,000 tokens de entrada e 20,000 de saída, porque as duas linhas precificadas ficam acima do limite de 93,000 tokens
- Nenhuma linha Llama está em nenhum dos seis degraus do Auto, então o Llama é sempre uma escolha manual
- O Whizi não publica flag de visão por modelo, então qual linha Llama lê uma imagem não é algo que ele consiga dizer
Perguntas frequentes
Quais modelos Llama o Whizi inclui?
O conjunto de modelos Pro nomeia três identificadores Llama: as duas variantes do Llama 4 mais o veterano Llama 3, e todos os três custam 1 crédito por mensagem. Dois deles são precificados no Cost Index do Whizi, com janelas de contexto publicadas de 1M e 131K. O catálogo pode carregar outros identificadores Llama, e qualquer um não nomeado nos conjuntos Starter ou Pro exige o Powerhouse.
Quantos créditos custa uma mensagem do Llama?
Um crédito, que é o degrau mais baixo da escala e o mesmo custo de uma mensagem no modelo da casa do Whizi. Nem o Starter nem o plano gratuito abrem nenhuma linha Llama, então o Pro é o primeiro plano em que esse 1 crédito compra alguma coisa aqui.
Preciso do plano mais caro para usar o Llama?
Não. O Pro é o plano mais barato que abre uma linha Llama, a $29.99/mês. O Starter não alcança nenhuma, o Powerhouse só é necessário para um identificador Llama que o conjunto Pro não nomeia, e uma conta gratuita não alcança nenhum deles: ela roda Whizi AI e Auto.
Posso trocar uma conversa do Llama para outro modelo?
Sim. Cada turno é cobrado no degrau do modelo que respondeu, então uma thread que transita entre famílias é cobrada por turno, em cada taxa, e não no nível da thread inteira. Um modelo nunca sai do catálogo depois de oferecido, porque uma conversa carrega o modelo com que foi criada, então uma thread antiga do Llama ainda abre depois. Os detalhes estão em trocar de modelo no meio da conversa.
O que posso anexar em um turno do Llama?
Anexos são tratados por requisição, não por modelo, e não custam créditos próprios. Os limites são 10 MB por arquivo, 4 anexos por prompt e 20 MB no total por prompt. Os tipos aceitos são JPEG, PNG, WebP, GIF, PDF, texto simples, Markdown, CSV e JSON.
A busca na web funciona com o Llama?
O Whizi não publica uma lista de busca na web por modelo. A busca é um toggle por requisição com três modos, desligado, probe e nativo, em vez de uma flag de capacidade por modelo, e a matriz por modelo nunca foi enumerada, então não há uma resposta específica para o Llama. O toggle em si é tratado em busca na web.