O que é Llama 3 da Meta: explicação simples para iniciantes

Descubra o que é o Llama 3 da Meta, como ele funciona por baixo do capô e como qualquer iniciante pode usar essa IA rapidíssima para respostas do dia a dia.

O que é o Llama 3

Llama é uma família de modelos de IA criada pela Meta, a empresa dona do Facebook e do Instagram. Assim como o ChatGPT e o Claude, você digita uma pergunta e ele responde. O interessante não é o que ele faz, e sim como ele é distribuído.

A maioria dos modelos de IA fica trancada dentro do produto de quem os criou. Você usa o ChatGPT através da OpenAI, e o modelo em si nunca sai dos servidores deles. A Meta publica os pesos do Llama, que são os números que constituem o modelo já treinado, para qualquer pessoa baixar e rodar.

Uma analogia útil: quase toda IA funciona como um restaurante, onde você pede e eles cozinham. O Llama é mais parecido com publicar a receita. Você ainda pode comer no restaurante, e também pode cozinhar por conta própria, adaptar o prato ou abrir a sua própria cozinha.

Um esclarecimento que você vai ver sendo discutido na internet. O Llama costuma ser chamado de código aberto e, a rigor, ele é de "pesos abertos": a licença traz algumas condições, entre elas restrições para uso comercial em escala muito grande. Para uma pessoa física não faz nenhuma diferença prática. Para uma empresa que vai construir um produto em cima dele, vale a pena ler a licença.

Por que isso importa mesmo que você nunca baixe nada

Três consequências chegam até o usuário comum.

É barato, então está em todo lugar. Como qualquer um pode hospedar, a concorrência empurra o custo para baixo. Os modelos Llama movem boa parte da IA que você encontra em outros produtos sem nenhum rótulo, e costumam ser o que um serviço quer dizer quando fala em um nível rápido ou econômico.

Ele consegue rodar sem internet. Um modelo no seu próprio computador funciona no avião, em um ambiente seguro ou em qualquer lugar onde os dados não podem sair do prédio. Nenhum serviço hospedado consegue oferecer isso.

Ele mantém o mercado honesto. Uma opção gratuita e competente coloca um teto no que os modelos fechados podem cobrar, e isso é bom para você independentemente do que você usa.

Em que ele é bom de verdade

Ser honesto sobre isso ajuda mais do que entusiasmo. O Llama vem em vários tamanhos, e a troca é sempre a mesma: os modelos menores são rapidíssimos e baratos, os maiores são mais capazes, mas já não saem baratos de rodar.

TarefaLlamaMelhor em outro lugar
Perguntas rápidas de fato concretoRápido e bom o bastanteNão
Listas curtas, brainstorming, reescritas simplesMuito bom, e instantâneoNão
Trabalho repetitivo em muitos itensIdeal, porque aí o custo por item pesaNão
Qualquer coisa que precise rodar offline ou em privadoA única opção realNão
Um texto que uma pessoa vai ler do início ao fimAceitávelClaude, e dá para notar
Raciocínio complexo de vários passosMais fraco que os modelos de fronteiraGPT ou Claude
Documentos muito longosLimitadoGemini
Qualquer coisa das últimas semanasEle não sabeUm modelo com acesso à web

O padrão: excelente para volume e velocidade, competitivo nas perguntas do dia a dia, e atrás dos modelos de fronteira em raciocínio difícil e escrita polida. É um acordo justo para algo gratuito, e é por isso que "qual é melhor" é a pergunta errada. Use onde velocidade e custo importam, e troque de modelo quando a tarefa ficar difícil.

Três formas de usar

1. Por um espaço de trabalho, sem configurar nada. A opção mais simples. O Llama já vem incluído no Whizi ao lado de GPT, Claude e Gemini, então você manda as perguntas rápidas para ele e troca por um modelo mais forte na mesma conversa quando a tarefa aperta. Não há nada para instalar.

2. No seu próprio computador. Ferramentas como Ollama e LM Studio baixam um modelo e rodam ele localmente. Expectativas realistas: você precisa de uma máquina razoavelmente moderna e com bastante memória, os modelos que rodam confortavelmente são os menores, e as respostas vão sair mais lentas que em um serviço hospedado, a não ser que você tenha uma boa GPU. Em troca, nada do que você digita sai do seu computador, e funciona com a internet desligada. Vale muito a pena se o requisito for privacidade ou uso offline, e é desnecessário em qualquer outro caso.

3. Por uma API. Se você está construindo software, há provedores que hospedam o Llama a um custo por token muito baixo, e essa costuma ser a razão para escolher ele no lugar de um modelo de fronteira em tarefas de alto volume.

Como arrancar boas respostas dele

Modelos menores recompensam um estilo de prompt diferente do que os de fronteira pedem. Três hábitos fazem uma diferença enorme.

Seja direto e específico. Liste 10 ideias de nome para uma cafeteria, uma por linha, sem explicações funciona melhor do que um pedido em tom de conversa. Modelos menores seguem bem instruções simples e explícitas, e se perdem nas elaboradas.

Uma coisa de cada vez. Modelos de fronteira dão conta de seis restrições em um único prompt. Modelos menores rendem mais com uma sequência de pedidos separados.

Diga o formato. Responda em uma frase ou retorne apenas uma lista numerada evita a enrolação que os modelos menores produzem quando estão em dúvida.

E saiba a hora de trocar. Se uma resposta vem vaga, se contradiz ou deixa passar algo óbvio, esse é o sinal para levar a mesma pergunta a um modelo mais forte em vez de continuar reformulando. Em um espaço de trabalho que reúne vários, isso é um clique e a conversa vai junto.

Coisas para tomar cuidado

Ele não sabe o que aconteceu recentemente. O conhecimento dele para na data do treinamento e, a não ser que esteja conectado a uma busca, ele vai responder uma pergunta sobre o mês passado usando conhecimento geral, e com toda a segurança.

Ele inventa coisas, como todo modelo. Os menores fazem isso um pouco mais. Confira qualquer fato específico, data ou número.

Gratuito não significa privado, se estiver hospedado. Rodar o Llama no seu próprio computador é privado. Usar ele pelo serviço de outra pessoa significa que a política de dados dela se aplica, exatamente como com qualquer outro modelo.

Confusão de versões. O Llama 3 foi uma geração, e desde então saíram versões mais novas. Pergunte qual versão você está usando se isso importar, porque as diferenças de capacidade entre gerações são grandes.

Lista de verificação
  • Use para perguntas rápidas, listas curtas e tarefas repetitivas em que a velocidade importa
  • Troque por um modelo mais forte quando a tarefa pedir raciocínio cuidadoso ou escrita polida
  • Faça prompts diretos, um pedido de cada vez, e diga em que formato quer a resposta
  • Rode no seu computador só se você realmente precisar de uso offline ou privado
  • Confira qualquer fato específico, data ou número, como faria com qualquer modelo
  • Pergunte qual versão você está usando, porque entre gerações a diferença é grande

Perguntas frequentes

Preciso baixar algum programa para usar o Llama 3?

Não. Baixar e rodar no seu computador é uma das opções, e é a certa se você precisa de uso offline ou totalmente privado, mas exige uma máquina razoavelmente potente e entrega respostas mais lentas que um serviço hospedado. A maioria das pessoas usa por uma plataforma no navegador, onde ele fica ao lado de outros modelos e não há absolutamente nada para configurar.

O Llama 3 é mais rápido que o ChatGPT?

Os modelos Llama menores são bem mais rápidos, o que os torna excelentes para perguntas curtas, listas rápidas e qualquer coisa repetitiva. A contrapartida está na capacidade: em raciocínio complexo e escrita polida, os modelos de fronteira são claramente melhores. O sensato é usar o Llama pela velocidade e trocar quando uma pergunta se revela mais difícil do que parecia.

O Llama é realmente gratuito?

Os pesos do modelo são gratuitos para baixar e a licença permite quase todos os usos, com algumas condições que pesam sobretudo em implantações comerciais de escala muito grande. Rodar não sai de graça na prática, porque custa ou o seu próprio hardware e a energia elétrica, ou a taxa por token de um provedor hospedado, que é simplesmente muito mais baixa do que a que os modelos de fronteira cobram.

É privado se eu rodar no meu próprio computador?

Sim, e essa é a razão mais forte para rodar localmente. Nada do que você digita sai da sua máquina, funciona com a internet desconectada e nenhuma política de provedor se aplica, porque não existe provedor no meio. Os custos são o esforço de configuração, um computador com memória suficiente, respostas mais lentas sem uma boa GPU e ficar limitado aos modelos menores, que são os que rodam confortavelmente.

Devo usar o Llama no lugar do ChatGPT ou do Claude?

No lugar, raramente. Junto, com frequência. Ele é a escolha certa para perguntas simples e rápidas, para trabalho repetitivo de alto volume e para qualquer coisa que precise rodar em privado ou offline. Para um texto que alguém vai ler com atenção, para raciocínio difícil de vários passos e para documentos muito longos, os modelos de fronteira são bem melhores. Ter os dois à disposição transforma a escolha em algo que você decide por tarefa, e não em um compromisso.