O básico
Esta é a versão de referência: 55 termos, definição primeiro, detalhe depois. Se você quiser um passeio mais suave só pelas palavras que importam na sua primeira semana, leia Termos de IA explicados e volte aqui quando um termo te mandar para cá.
Inteligência artificial
Inteligência artificial é o software que realiza tarefas que normalmente exigem julgamento humano, como escrever, raciocinar ou reconhecer o que há em uma imagem.
No uso cotidiano em 2026, "IA" quase sempre significa os assistentes de chat construídos sobre grandes modelos de linguagem, e não o campo acadêmico mais amplo.
Machine learning
Machine learning é a técnica de ensinar software mostrando exemplos a ele, em vez de programá-lo com regras.
Todo assistente de IA moderno é construído assim: o comportamento vem de padrões nos dados de treinamento, e é por isso que o mesmo modelo pode ser brilhante em tarefas comuns e instável em tarefas raras.
Modelo
Um modelo é um sistema de IA treinado específico, o artefato para o qual você realmente envia um prompt.
GPT, Claude e Gemini são famílias de modelos; uma família contém modelos individuais com tamanhos, velocidades e preços diferentes. Escolher entre eles por tarefa é a habilidade central de usar IA bem.
LLM (modelo de linguagem de grande porte)
Um LLM, ou modelo de linguagem de grande porte, é um modelo treinado com quantidades enormes de texto para prever qual texto deve vir a seguir.
Esse único truque, feito em escala, é o que produz respostas, rascunhos, código e resumos. O "grande" se refere tanto aos dados de treinamento quanto à contagem de parâmetros.
Chatbot
Um chatbot é a interface de conversa construída em torno de um modelo, a coisa com a caixa de mensagens.
A distinção importa ao comparar produtos: dois chatbots podem envolver o mesmo modelo e parecer diferentes, e um chatbot pode oferecer vários modelos, que é como o Whizi funciona.
Prompt
Um prompt é tudo o que você envia ao modelo: a pergunta, as instruções e qualquer texto ou arquivo que você inclua.
A qualidade da resposta acompanha de perto a qualidade do prompt. Contexto, restrições e o formato de saída que você quer são as três coisas que iniciantes mais deixam de fora.
Token
Um token é o pequeno pedaço de texto que um modelo realmente lê e escreve, em média cerca de três quartos de uma palavra em inglês.
Preço, velocidade e janelas de contexto são todos medidos em tokens, e é por isso que a palavra aparece em toda página de preços de IA. Um documento de 1.000 palavras tem cerca de 1.300 tokens.
Janela de contexto
Uma janela de contexto é a quantidade máxima de texto, medida em tokens, que um modelo consegue considerar de uma vez.
Seu prompt, a conversa até ali, os documentos anexados e a resposta dividem esse espaço. A tabela de comparação de janelas de contexto traz o número atual para cada modelo importante, e o texto explicativo mostra por que ela explica a maioria das reclamações de "a IA esqueceu".
Parâmetros
Parâmetros são os números internos que um modelo aprendeu durante o treinamento, e a medida usual do seu tamanho.
Contados em bilhões, mais parâmetros costuma significar mais capacidade e mais custo. Sozinho, é uma métrica de compra ruim; benchmarks e os seus próprios testes valem mais do que a contagem de parâmetros.
Resposta
Uma resposta é a saída do modelo para um prompt, também chamada de completion.
As respostas são geradas do zero a cada vez, e é por isso que regenerar o mesmo prompt traz uma redação diferente e às vezes uma resposta diferente.
Conversando com um modelo
System prompt
Um system prompt é a instrução permanente que um modelo recebe antes da sua mensagem, definindo seu papel, tom e regras.
Todo produto tem um, mesmo quando você não consegue vê-lo. Quando um chatbot "tem personalidade", o system prompt costuma ser onde ela mora.
Prompt engineering
Prompt engineering é a prática de escrever prompts de forma deliberada para obter resultados melhores de forma confiável.
Apesar do nome grandioso, a maior parte é clareza comum: declare o objetivo, dê contexto, mostre um exemplo, nomeie o formato. O guia para iniciantes cobre as técnicas que realmente mudam os resultados.
Zero-shot
Zero-shot significa pedir a um modelo que faça uma tarefa sem dar nenhum exemplo a ele.
Modelos modernos lidam com a maioria das tarefas do dia a dia em zero-shot. O termo sobrevive principalmente como contraste com o prompting few-shot.
Few-shot
Few-shot significa incluir alguns exemplos prontos no prompt para que o modelo copie o padrão.
É a forma mais barata de melhorar a confiabilidade em trabalhos sensíveis a formatação: dois ou três exemplos de entrada e saída desejada valem mais do que um parágrafo de descrição.
Chain of thought
Chain of thought é um modelo passando por etapas intermediárias antes de dar a resposta final.
Pedir a um modelo que raciocine passo a passo melhora de forma mensurável problemas difíceis, e os modelos de raciocínio hoje fazem uma versão disso internamente por padrão.
Temperature
Temperature é a configuração que controla quanta aleatoriedade um modelo adiciona ao escolher cada próximo token.
Temperature baixa dá uma saída consistente e conservadora; temperature alta dá variedade e, às vezes, alguma bobagem. Produtos de chat costumam escolher um valor intermediário por você.
Streaming
Streaming é o modelo enviando a resposta token por token conforme gera, em vez de tudo de uma vez quando termina.
É por isso que as respostas parecem se digitar sozinhas, e por isso uma resposta ruim pode ser interrompida cedo em vez de você esperar até o fim.
Regenerate
Regenerate significa pedir uma resposta nova para o mesmo prompt.
Como a geração é probabilística, um regenerate é uma tentativa genuinamente nova, não uma repetição do mesmo cálculo. Comparar duas tentativas, ou o mesmo prompt em dois modelos, é uma checagem rápida de qualidade.
Como os modelos são feitos
Training
Training (treinamento) é o processo de ajustar os parâmetros de um modelo em relação aos dados até que as previsões dele fiquem boas.
Isso acontece antes de você sequer conhecer o modelo e custa ao fornecedor uma quantidade enorme de poder computacional. Nada que você digita em um chat retreina o modelo na hora, embora fornecedores possam usar conversas para treinar versões futuras, dependendo da política deles.
Training data
Training data (dados de treinamento) é o texto e outros materiais dos quais um modelo aprendeu.
Sua amplitude explica o que um modelo sabe, suas lacunas explicam pontos cegos sistemáticos, e o intervalo de datas define o corte de conhecimento.
Pretraining
Pretraining (pré-treinamento) é a primeira e maior fase do treinamento, na qual um modelo aprende linguagem e conhecimento de mundo a partir de grandes volumes de texto.
O resultado é capaz, mas bruto. Tudo o que faz um modelo se comportar como um assistente útil vem depois disso.
Fine-tuning
Fine-tuning é treinamento adicional sobre um conjunto de dados mais estreito, para especializar ou moldar um modelo já pré-treinado.
Fornecedores fazem fine-tuning para utilidade e segurança; empresas fazem fine-tuning para tarefas de domínio específico. Para a maioria dos usuários, um bom prompt mais um modelo geral capaz vale mais do que pagar por um fine-tune.
RLHF
RLHF, aprendizado por reforço com feedback humano, é treinar um modelo com base em avaliações humanas das suas respostas.
É boa parte do motivo pelo qual assistentes modernos são educados, estruturados e cautelosos. Em excesso, também produz aquela cautela exagerada que faz alguns modelos recusarem ou enrolarem.
Alignment
Alignment (alinhamento) é o trabalho de fazer o comportamento de um modelo corresponder à intenção e aos valores humanos.
Na prática, isso cobre de tudo, desde recusar pedidos prejudiciais até simplesmente seguir instruções com precisão. Quando um modelo faz algo tecnicamente impressionante mas indesejado, isso é uma lacuna de alinhamento.
Inference
Inference (inferência) é rodar um modelo já treinado para produzir uma resposta, em vez de treiná-lo.
Cada mensagem que você envia dispara uma inferência, e o custo de inferência é o que o preço por token mede. Modelos baratos de rodar podem ser notavelmente capazes; o Índice de Custo de Modelos de IA mostra uma diferença de preço de 2.000x.
Transformer
O transformer é a arquitetura de rede neural por trás de praticamente todo modelo de linguagem moderno.
Seu mecanismo chave, a atenção (attention), permite que o modelo pese cada parte da entrada em relação a todas as outras partes. Você nunca precisa dos detalhes, mas a palavra está em todo lugar nos textos sobre IA.
Quando as coisas dão errado
Hallucination
Uma hallucination (alucinação) é um modelo afirmando algo falso com total confiança.
Não é um bug que vai ser corrigido na próxima versão; decorre de como a geração funciona. A frequência varia bastante por modelo e tarefa. Trate qualquer fato, número ou citação específica como não verificada até conferir. Por que a IA erra cobre a mecânica por trás disso.
Grounding
Grounding é dar a um modelo material confiável para basear a resposta, em vez de deixá-lo depender da memória.
Colar o contrato, anexar o relatório ou ativar a busca na web são formas de grounding. É a defesa cotidiana mais eficaz contra a alucinação.
Bias
Bias (viés) é um modelo distorcendo sistematicamente suas saídas de formas herdadas dos dados de treinamento.
Aparece como suposições sobre pessoas, lugares e padrões. Para decisões que têm consequências, revise a saída da IA como você revisaria o trabalho de um estagiário esperto mas sem experiência.
Guardrails
Guardrails são as restrições que um fornecedor constrói em torno de um modelo para bloquear saídas prejudiciais ou fora de política.
Fornecedores diferentes traçam os limites de forma diferente, o que é uma diferença real entre produtos: o mesmo pedido pode ser respondido por um modelo e recusado por outro.
Jailbreak
Um jailbreak é um prompt criado para enganar um modelo e fazê-lo ignorar seus guardrails.
Os fornecedores corrigem isso continuamente. Para usuários comuns, o termo importa principalmente como conceito de segurança: qualquer coisa que um modelo possa ser convencido a fazer, alguém vai tentar convencê-lo a fazer.
Red teaming
Red teaming é atacar deliberadamente um modelo antes do lançamento para encontrar modos de falha prejudiciais.
Fornecedores rodam equipes de red teaming internas e externas, e os model cards publicados costumam resumir o que encontraram. É o equivalente em IA de um teste de invasão.
Knowledge cutoff
Um knowledge cutoff (corte de conhecimento) é a data depois da qual os dados de treinamento de um modelo terminam.
Pergunte sobre qualquer coisa mais recente e o modelo ou admite que não sabe, ou navega na web se puder, ou aluciona. Saber o corte do modelo que você está usando evita uma categoria inteira de erros.
Recuperação de dados e os seus dados
RAG (geração aumentada por recuperação)
RAG, geração aumentada por recuperação, é buscar documentos relevantes primeiro e fazer o modelo responder a partir deles.
É assim que produtos de "converse com sua base de conhecimento" funcionam por baixo do capô, e por isso conseguem citar fontes. RAG reduz a alucinação, mas herda a qualidade de tudo o que recupera.
Embedding
Um embedding é uma lista de números que representa o significado de um trecho de texto.
Textos com significado parecido recebem números próximos, o que permite que o software encontre trechos relacionados matematicamente. Embeddings são o mecanismo por trás da busca semântica e do RAG.
Vector database
Um vector database (banco de dados vetorial) é um banco de dados feito para armazenar embeddings e encontrar os mais próximos rapidamente.
Se um produto diz que "indexou" seus documentos para busca com IA, existe um embedding para cada pedaço guardado em um banco desses.
Semantic search
Semantic search (busca semântica) é encontrar texto pelo significado, em vez de por correspondência de palavras-chave.
Buscar "problemas de dinheiro" pode trazer um trecho sobre aperto de fluxo de caixa mesmo sem nenhuma palavra bater. É o embedding colocado para trabalhar.
Chunking
Chunking é dividir documentos longos em pedaços pequenos o bastante para gerar embeddings e recuperar bem.
Parece encanamento, e é mesmo, mas um chunking malfeito é um motivo comum para ferramentas de chat com documentos responderem com base na parte errada de um arquivo.
Web search (em IA)
Web search em IA significa o modelo buscar páginas atuais antes de responder, em vez de depender da memória de treinamento.
Troca velocidade por atualidade e permite que as respostas tragam citações que você pode abrir. Para qualquer coisa depois do corte de conhecimento do modelo, é a diferença entre uma resposta e um chute.
Knowledge base
Uma knowledge base (base de conhecimento) é o conjunto selecionado de documentos que uma empresa dá à sua IA para basear as respostas.
Qualidade que entra, qualidade que sai: um assistente baseado em uma wiki desatualizada entrega respostas desatualizadas com toda confiança, com citações e tudo.
Três termos deste glossário nomeiam respostas concorrentes para a mesma pergunta, como deixar um modelo melhor na sua tarefa, e confundi-los é o erro de jargão mais comum em reuniões de produto. Lado a lado:
| Abordagem | O que muda | Custo e velocidade | Quando vence |
|---|---|---|---|
| Prompt melhor (zero-shot, few-shot) | Só o texto que você envia | Gratuito, leva minutos | Quase sempre o primeiro passo; dois ou três exemplos prontos resolvem a maioria dos problemas de formatação |
| RAG | O que o modelo lê antes de responder | Moderado para construir, sem retreinar | Respostas que precisam ficar atuais ou citar os seus próprios documentos |
| Fine-tuning | Os próprios parâmetros do modelo | Lento e caro, depois fixo | Exigências estáveis de estilo e formato em escala, quase nunca para uma pessoa sozinha |
Além do texto
Multimodal
Multimodal significa um modelo que funciona em mais de um meio, como texto mais imagens, áudio ou vídeo.
É por isso que você pode tirar um print de um erro e perguntar o que está errado. O guia de IA multimodal cobre o que realmente funciona hoje.
Vision model
Um vision model (modelo de visão) é um modelo que consegue interpretar imagens: fotos, prints, gráficos e documentos.
Ler não é a mesma coisa que gerar; um modelo pode descrever o seu diagrama perfeitamente e ainda assim ser incapaz de desenhar um.
Image generation
Image generation (geração de imagem) é produzir novas imagens a partir de uma descrição em texto.
Qualidade, variedade de estilo e a renderização de texto dentro das imagens variam muito entre geradores, e é por isso que usuários sérios comparam vários. O panorama de geradores de imagem se mantém atualizado sobre o assunto.
Diffusion model
Um diffusion model (modelo de difusão) gera imagens começando de um ruído e refinando esse ruído passo a passo em direção à descrição.
É a técnica dominante por trás dos geradores de imagem modernos. A palavra importa principalmente para que "diffusion" no nome de um produto te diga o que o produto faz.
Speech to text
Speech to text é transcrever áudio falado em palavras escritas.
A transcrição moderna é precisa o suficiente para tornar reuniões, notas de voz e entrevistas pesquisáveis, e é assim que a entrada por voz funciona em apps de chat.
Text to speech
Text to speech é gerar áudio falado a partir de palavras escritas.
Os sistemas atuais produzem vozes naturais e expressivas, o que alimenta recursos de leitura em voz alta e conversas por voz com IA.
O ecossistema
API
Uma API é a porta programática que desenvolvedores usam para enviar prompts a um modelo a partir do próprio software deles.
O preço de API é por token, e é dali que vem, no fim das contas, a economia por resposta de todo produto de IA.
Open weights
Open weights significa que os parâmetros treinados de um modelo são publicados para qualquer pessoa baixar e rodar.
Isso permite autohospedagem e deixa outros fornecedores servirem o modelo na própria infraestrutura deles. DeepSeek e Llama são os exemplos famosos.
Open-source model
Um open-source model (modelo de código aberto) é, de forma ampla, um modelo lançado para uso e modificação pública, embora as licenças variem muito.
As perguntas práticas são sempre as mesmas duas: você pode usar comercialmente, e quem está hospedando isso para você. O ecossistema de open weights importa mais quando privacidade ou custo descartam os modelos principais hospedados.
Benchmark
Um benchmark é um teste padronizado usado para pontuar e comparar modelos.
Útil para uma primeira triagem, rotineiramente superexplorado no marketing. Um modelo que lidera um benchmark ainda pode perder no seu trabalho real, e é por isso que rodar a sua própria comparação com três tarefas vale mais do que ler gráficos.
Agent
Um agent (agente) é um sistema de IA que toma ações em etapas em direção a um objetivo, em vez de apenas responder uma vez.
Reservar, pesquisar, programar e abrir chamados são território de agente. A capacidade é real e está melhorando rápido; também está crescendo a necessidade de revisar o que um agente fez antes que isso importe.
Tool use
Tool use, ou function calling, é um modelo acionando capacidades externas como busca, calculadoras, código ou o seu calendário.
É assim que assistentes de chat agem sobre o mundo em vez de só descrevê-lo, e é o mecanismo por trás dos agentes.
Reasoning model
Um reasoning model (modelo de raciocínio) é aquele que gasta poder computacional extra pensando um problema internamente antes de responder.
A troca é tempo e custo por precisão em problemas difíceis. Para perguntas simples, esse pensamento extra não compra nada, o que é mais um argumento para trocar de modelo por tarefa.
Latency
Latency (latência) é quanto tempo você espera entre enviar um prompt e a resposta chegar ou começar a aparecer.
Varia pelo tamanho do modelo, pela carga do sistema e se o modelo é um modelo de raciocínio. Para trabalho interativo, um modelo rápido e bom o suficiente costuma vencer um modelo lento e brilhante.
Rate limit
Um rate limit é o teto que um fornecedor coloca em quantas requisições ou tokens você pode usar em uma janela de tempo.
Bater nesse teto costuma ser o motivo de um produto de chat te dizer para esperar ou fazer upgrade. Os limites de mensagens em planos de assinatura são rate limits com um nome mais simpático.
Mantendo o glossário útil
Os termos envelhecem rápido nessa área. Esta página é mantida como referência: as entradas são reescritas quando o uso muda, e os guias detalhados linkados carregam o detalhe que não cabe em uma definição.
Se um termo que você encontrou por aí não está aqui, o caminho mais rápido é colar a frase onde você o encontrou em um modelo capaz e pedir a definição no contexto. No Whizi você pode perguntar a dois modelos ao mesmo tempo e notar quando eles discordam, o que para jargão novo acontece surpreendentemente muitas vezes.
- Cite a definição de uma frase; leia o detalhe antes de confiar nela
- Quando duas fontes definem um termo de forma diferente, o uso mais recente costuma vencer em IA
- Aprenda token, janela de contexto e alucinação primeiro; a maioria dos outros termos depende desses três
- Teste afirmações desconhecidas sobre um modelo com a sua própria comparação de três tarefas
- Use primeiro o glossário para iniciantes se esta página parecer um manual de referência, porque é isso que ela é
Perguntas frequentes
Qual é a diferença entre IA, machine learning e um LLM?
IA é o objetivo amplo de o software fazer tarefas que precisam de julgamento humano. Machine learning é a técnica de ensinar software a partir de exemplos, e é assim que praticamente toda IA moderna é construída. Um LLM é um tipo de modelo treinado por machine learning, treinado com texto, e é o tipo por trás do ChatGPT, do Claude e do Gemini.
O que significa RAG em IA?
RAG significa geração aumentada por recuperação (retrieval augmented generation): o sistema primeiro busca documentos relevantes, depois faz o modelo responder a partir deles em vez de a partir da memória. É a técnica padrão por trás de produtos que conversam com os seus arquivos ou base de conhecimento, e é por isso que esses produtos conseguem citar fontes.
Qual é a diferença entre fine-tuning e RAG?
Fine-tuning muda o próprio modelo com treinamento extra, o que é lento e fixo. RAG deixa o modelo em paz e entrega a ele os documentos certos no momento da pergunta, o que é flexível e atual. Para manter um assistente atualizado com informações que mudam, RAG é quase sempre a ferramenta certa; fine-tuning serve para exigências estáveis de estilo e formato.
O que é um token em IA?
Um token é a unidade de texto que um modelo lê e escreve, cerca de três quartos de uma palavra em inglês. Tudo é medido em tokens: preço, velocidade e a janela de contexto. Um documento de 1.000 palavras tem cerca de 1.300 tokens.
De quantos desses termos eu realmente preciso?
Para o uso do dia a dia, cerca de cinco: modelo, prompt, token, janela de contexto e alucinação. A versão para iniciantes deste glossário cobre esses com mais calma. O resto desta página existe para o momento em que uma página de produto ou um artigo jogar um termo na sua frente.