O glossário de IA: 55 termos em linguagem simples

Resposta rápida

Este glossário de IA define 55 termos em linguagem simples, cada entrada começando com uma definição de uma frase que você pode citar, seguida do detalhe. Ele é organizado pelo que você está fazendo, não em ordem alfabética, cobrindo o básico, os prompts, como os modelos são feitos, os modos de falha, a recuperação de dados, o trabalho além de texto e o ecossistema mais amplo.

O básico

Esta é a versão de referência: 55 termos, definição primeiro, detalhe depois. Se você quiser um passeio mais suave só pelas palavras que importam na sua primeira semana, leia Termos de IA explicados e volte aqui quando um termo te mandar para cá.

Inteligência artificial

Inteligência artificial é o software que realiza tarefas que normalmente exigem julgamento humano, como escrever, raciocinar ou reconhecer o que há em uma imagem.

No uso cotidiano em 2026, "IA" quase sempre significa os assistentes de chat construídos sobre grandes modelos de linguagem, e não o campo acadêmico mais amplo.

Machine learning

Machine learning é a técnica de ensinar software mostrando exemplos a ele, em vez de programá-lo com regras.

Todo assistente de IA moderno é construído assim: o comportamento vem de padrões nos dados de treinamento, e é por isso que o mesmo modelo pode ser brilhante em tarefas comuns e instável em tarefas raras.

Modelo

Um modelo é um sistema de IA treinado específico, o artefato para o qual você realmente envia um prompt.

GPT, Claude e Gemini são famílias de modelos; uma família contém modelos individuais com tamanhos, velocidades e preços diferentes. Escolher entre eles por tarefa é a habilidade central de usar IA bem.

LLM (modelo de linguagem de grande porte)

Um LLM, ou modelo de linguagem de grande porte, é um modelo treinado com quantidades enormes de texto para prever qual texto deve vir a seguir.

Esse único truque, feito em escala, é o que produz respostas, rascunhos, código e resumos. O "grande" se refere tanto aos dados de treinamento quanto à contagem de parâmetros.

Chatbot

Um chatbot é a interface de conversa construída em torno de um modelo, a coisa com a caixa de mensagens.

A distinção importa ao comparar produtos: dois chatbots podem envolver o mesmo modelo e parecer diferentes, e um chatbot pode oferecer vários modelos, que é como o Whizi funciona.

Prompt

Um prompt é tudo o que você envia ao modelo: a pergunta, as instruções e qualquer texto ou arquivo que você inclua.

A qualidade da resposta acompanha de perto a qualidade do prompt. Contexto, restrições e o formato de saída que você quer são as três coisas que iniciantes mais deixam de fora.

Token

Um token é o pequeno pedaço de texto que um modelo realmente lê e escreve, em média cerca de três quartos de uma palavra em inglês.

Preço, velocidade e janelas de contexto são todos medidos em tokens, e é por isso que a palavra aparece em toda página de preços de IA. Um documento de 1.000 palavras tem cerca de 1.300 tokens.

Janela de contexto

Uma janela de contexto é a quantidade máxima de texto, medida em tokens, que um modelo consegue considerar de uma vez.

Seu prompt, a conversa até ali, os documentos anexados e a resposta dividem esse espaço. A tabela de comparação de janelas de contexto traz o número atual para cada modelo importante, e o texto explicativo mostra por que ela explica a maioria das reclamações de "a IA esqueceu".

Parâmetros

Parâmetros são os números internos que um modelo aprendeu durante o treinamento, e a medida usual do seu tamanho.

Contados em bilhões, mais parâmetros costuma significar mais capacidade e mais custo. Sozinho, é uma métrica de compra ruim; benchmarks e os seus próprios testes valem mais do que a contagem de parâmetros.

Resposta

Uma resposta é a saída do modelo para um prompt, também chamada de completion.

As respostas são geradas do zero a cada vez, e é por isso que regenerar o mesmo prompt traz uma redação diferente e às vezes uma resposta diferente.

Conversando com um modelo

System prompt

Um system prompt é a instrução permanente que um modelo recebe antes da sua mensagem, definindo seu papel, tom e regras.

Todo produto tem um, mesmo quando você não consegue vê-lo. Quando um chatbot "tem personalidade", o system prompt costuma ser onde ela mora.

Prompt engineering

Prompt engineering é a prática de escrever prompts de forma deliberada para obter resultados melhores de forma confiável.

Apesar do nome grandioso, a maior parte é clareza comum: declare o objetivo, dê contexto, mostre um exemplo, nomeie o formato. O guia para iniciantes cobre as técnicas que realmente mudam os resultados.

Zero-shot

Zero-shot significa pedir a um modelo que faça uma tarefa sem dar nenhum exemplo a ele.

Modelos modernos lidam com a maioria das tarefas do dia a dia em zero-shot. O termo sobrevive principalmente como contraste com o prompting few-shot.

Few-shot

Few-shot significa incluir alguns exemplos prontos no prompt para que o modelo copie o padrão.

É a forma mais barata de melhorar a confiabilidade em trabalhos sensíveis a formatação: dois ou três exemplos de entrada e saída desejada valem mais do que um parágrafo de descrição.

Chain of thought

Chain of thought é um modelo passando por etapas intermediárias antes de dar a resposta final.

Pedir a um modelo que raciocine passo a passo melhora de forma mensurável problemas difíceis, e os modelos de raciocínio hoje fazem uma versão disso internamente por padrão.

Temperature

Temperature é a configuração que controla quanta aleatoriedade um modelo adiciona ao escolher cada próximo token.

Temperature baixa dá uma saída consistente e conservadora; temperature alta dá variedade e, às vezes, alguma bobagem. Produtos de chat costumam escolher um valor intermediário por você.

Streaming

Streaming é o modelo enviando a resposta token por token conforme gera, em vez de tudo de uma vez quando termina.

É por isso que as respostas parecem se digitar sozinhas, e por isso uma resposta ruim pode ser interrompida cedo em vez de você esperar até o fim.

Regenerate

Regenerate significa pedir uma resposta nova para o mesmo prompt.

Como a geração é probabilística, um regenerate é uma tentativa genuinamente nova, não uma repetição do mesmo cálculo. Comparar duas tentativas, ou o mesmo prompt em dois modelos, é uma checagem rápida de qualidade.

Como os modelos são feitos

Training

Training (treinamento) é o processo de ajustar os parâmetros de um modelo em relação aos dados até que as previsões dele fiquem boas.

Isso acontece antes de você sequer conhecer o modelo e custa ao fornecedor uma quantidade enorme de poder computacional. Nada que você digita em um chat retreina o modelo na hora, embora fornecedores possam usar conversas para treinar versões futuras, dependendo da política deles.

Training data

Training data (dados de treinamento) é o texto e outros materiais dos quais um modelo aprendeu.

Sua amplitude explica o que um modelo sabe, suas lacunas explicam pontos cegos sistemáticos, e o intervalo de datas define o corte de conhecimento.

Pretraining

Pretraining (pré-treinamento) é a primeira e maior fase do treinamento, na qual um modelo aprende linguagem e conhecimento de mundo a partir de grandes volumes de texto.

O resultado é capaz, mas bruto. Tudo o que faz um modelo se comportar como um assistente útil vem depois disso.

Fine-tuning

Fine-tuning é treinamento adicional sobre um conjunto de dados mais estreito, para especializar ou moldar um modelo já pré-treinado.

Fornecedores fazem fine-tuning para utilidade e segurança; empresas fazem fine-tuning para tarefas de domínio específico. Para a maioria dos usuários, um bom prompt mais um modelo geral capaz vale mais do que pagar por um fine-tune.

RLHF

RLHF, aprendizado por reforço com feedback humano, é treinar um modelo com base em avaliações humanas das suas respostas.

É boa parte do motivo pelo qual assistentes modernos são educados, estruturados e cautelosos. Em excesso, também produz aquela cautela exagerada que faz alguns modelos recusarem ou enrolarem.

Alignment

Alignment (alinhamento) é o trabalho de fazer o comportamento de um modelo corresponder à intenção e aos valores humanos.

Na prática, isso cobre de tudo, desde recusar pedidos prejudiciais até simplesmente seguir instruções com precisão. Quando um modelo faz algo tecnicamente impressionante mas indesejado, isso é uma lacuna de alinhamento.

Inference

Inference (inferência) é rodar um modelo já treinado para produzir uma resposta, em vez de treiná-lo.

Cada mensagem que você envia dispara uma inferência, e o custo de inferência é o que o preço por token mede. Modelos baratos de rodar podem ser notavelmente capazes; o Índice de Custo de Modelos de IA mostra uma diferença de preço de 2.000x.

Transformer

O transformer é a arquitetura de rede neural por trás de praticamente todo modelo de linguagem moderno.

Seu mecanismo chave, a atenção (attention), permite que o modelo pese cada parte da entrada em relação a todas as outras partes. Você nunca precisa dos detalhes, mas a palavra está em todo lugar nos textos sobre IA.

Quando as coisas dão errado

Hallucination

Uma hallucination (alucinação) é um modelo afirmando algo falso com total confiança.

Não é um bug que vai ser corrigido na próxima versão; decorre de como a geração funciona. A frequência varia bastante por modelo e tarefa. Trate qualquer fato, número ou citação específica como não verificada até conferir. Por que a IA erra cobre a mecânica por trás disso.

Grounding

Grounding é dar a um modelo material confiável para basear a resposta, em vez de deixá-lo depender da memória.

Colar o contrato, anexar o relatório ou ativar a busca na web são formas de grounding. É a defesa cotidiana mais eficaz contra a alucinação.

Bias

Bias (viés) é um modelo distorcendo sistematicamente suas saídas de formas herdadas dos dados de treinamento.

Aparece como suposições sobre pessoas, lugares e padrões. Para decisões que têm consequências, revise a saída da IA como você revisaria o trabalho de um estagiário esperto mas sem experiência.

Guardrails

Guardrails são as restrições que um fornecedor constrói em torno de um modelo para bloquear saídas prejudiciais ou fora de política.

Fornecedores diferentes traçam os limites de forma diferente, o que é uma diferença real entre produtos: o mesmo pedido pode ser respondido por um modelo e recusado por outro.

Jailbreak

Um jailbreak é um prompt criado para enganar um modelo e fazê-lo ignorar seus guardrails.

Os fornecedores corrigem isso continuamente. Para usuários comuns, o termo importa principalmente como conceito de segurança: qualquer coisa que um modelo possa ser convencido a fazer, alguém vai tentar convencê-lo a fazer.

Red teaming

Red teaming é atacar deliberadamente um modelo antes do lançamento para encontrar modos de falha prejudiciais.

Fornecedores rodam equipes de red teaming internas e externas, e os model cards publicados costumam resumir o que encontraram. É o equivalente em IA de um teste de invasão.

Knowledge cutoff

Um knowledge cutoff (corte de conhecimento) é a data depois da qual os dados de treinamento de um modelo terminam.

Pergunte sobre qualquer coisa mais recente e o modelo ou admite que não sabe, ou navega na web se puder, ou aluciona. Saber o corte do modelo que você está usando evita uma categoria inteira de erros.

Recuperação de dados e os seus dados

RAG (geração aumentada por recuperação)

RAG, geração aumentada por recuperação, é buscar documentos relevantes primeiro e fazer o modelo responder a partir deles.

É assim que produtos de "converse com sua base de conhecimento" funcionam por baixo do capô, e por isso conseguem citar fontes. RAG reduz a alucinação, mas herda a qualidade de tudo o que recupera.

Embedding

Um embedding é uma lista de números que representa o significado de um trecho de texto.

Textos com significado parecido recebem números próximos, o que permite que o software encontre trechos relacionados matematicamente. Embeddings são o mecanismo por trás da busca semântica e do RAG.

Vector database

Um vector database (banco de dados vetorial) é um banco de dados feito para armazenar embeddings e encontrar os mais próximos rapidamente.

Se um produto diz que "indexou" seus documentos para busca com IA, existe um embedding para cada pedaço guardado em um banco desses.

Semantic search (busca semântica) é encontrar texto pelo significado, em vez de por correspondência de palavras-chave.

Buscar "problemas de dinheiro" pode trazer um trecho sobre aperto de fluxo de caixa mesmo sem nenhuma palavra bater. É o embedding colocado para trabalhar.

Chunking

Chunking é dividir documentos longos em pedaços pequenos o bastante para gerar embeddings e recuperar bem.

Parece encanamento, e é mesmo, mas um chunking malfeito é um motivo comum para ferramentas de chat com documentos responderem com base na parte errada de um arquivo.

Web search (em IA)

Web search em IA significa o modelo buscar páginas atuais antes de responder, em vez de depender da memória de treinamento.

Troca velocidade por atualidade e permite que as respostas tragam citações que você pode abrir. Para qualquer coisa depois do corte de conhecimento do modelo, é a diferença entre uma resposta e um chute.

Knowledge base

Uma knowledge base (base de conhecimento) é o conjunto selecionado de documentos que uma empresa dá à sua IA para basear as respostas.

Qualidade que entra, qualidade que sai: um assistente baseado em uma wiki desatualizada entrega respostas desatualizadas com toda confiança, com citações e tudo.

Três termos deste glossário nomeiam respostas concorrentes para a mesma pergunta, como deixar um modelo melhor na sua tarefa, e confundi-los é o erro de jargão mais comum em reuniões de produto. Lado a lado:

AbordagemO que mudaCusto e velocidadeQuando vence
Prompt melhor (zero-shot, few-shot)Só o texto que você enviaGratuito, leva minutosQuase sempre o primeiro passo; dois ou três exemplos prontos resolvem a maioria dos problemas de formatação
RAGO que o modelo lê antes de responderModerado para construir, sem retreinarRespostas que precisam ficar atuais ou citar os seus próprios documentos
Fine-tuningOs próprios parâmetros do modeloLento e caro, depois fixoExigências estáveis de estilo e formato em escala, quase nunca para uma pessoa sozinha

Além do texto

Multimodal

Multimodal significa um modelo que funciona em mais de um meio, como texto mais imagens, áudio ou vídeo.

É por isso que você pode tirar um print de um erro e perguntar o que está errado. O guia de IA multimodal cobre o que realmente funciona hoje.

Vision model

Um vision model (modelo de visão) é um modelo que consegue interpretar imagens: fotos, prints, gráficos e documentos.

Ler não é a mesma coisa que gerar; um modelo pode descrever o seu diagrama perfeitamente e ainda assim ser incapaz de desenhar um.

Image generation

Image generation (geração de imagem) é produzir novas imagens a partir de uma descrição em texto.

Qualidade, variedade de estilo e a renderização de texto dentro das imagens variam muito entre geradores, e é por isso que usuários sérios comparam vários. O panorama de geradores de imagem se mantém atualizado sobre o assunto.

Diffusion model

Um diffusion model (modelo de difusão) gera imagens começando de um ruído e refinando esse ruído passo a passo em direção à descrição.

É a técnica dominante por trás dos geradores de imagem modernos. A palavra importa principalmente para que "diffusion" no nome de um produto te diga o que o produto faz.

Speech to text

Speech to text é transcrever áudio falado em palavras escritas.

A transcrição moderna é precisa o suficiente para tornar reuniões, notas de voz e entrevistas pesquisáveis, e é assim que a entrada por voz funciona em apps de chat.

Text to speech

Text to speech é gerar áudio falado a partir de palavras escritas.

Os sistemas atuais produzem vozes naturais e expressivas, o que alimenta recursos de leitura em voz alta e conversas por voz com IA.

O ecossistema

API

Uma API é a porta programática que desenvolvedores usam para enviar prompts a um modelo a partir do próprio software deles.

O preço de API é por token, e é dali que vem, no fim das contas, a economia por resposta de todo produto de IA.

Open weights

Open weights significa que os parâmetros treinados de um modelo são publicados para qualquer pessoa baixar e rodar.

Isso permite autohospedagem e deixa outros fornecedores servirem o modelo na própria infraestrutura deles. DeepSeek e Llama são os exemplos famosos.

Open-source model

Um open-source model (modelo de código aberto) é, de forma ampla, um modelo lançado para uso e modificação pública, embora as licenças variem muito.

As perguntas práticas são sempre as mesmas duas: você pode usar comercialmente, e quem está hospedando isso para você. O ecossistema de open weights importa mais quando privacidade ou custo descartam os modelos principais hospedados.

Benchmark

Um benchmark é um teste padronizado usado para pontuar e comparar modelos.

Útil para uma primeira triagem, rotineiramente superexplorado no marketing. Um modelo que lidera um benchmark ainda pode perder no seu trabalho real, e é por isso que rodar a sua própria comparação com três tarefas vale mais do que ler gráficos.

Agent

Um agent (agente) é um sistema de IA que toma ações em etapas em direção a um objetivo, em vez de apenas responder uma vez.

Reservar, pesquisar, programar e abrir chamados são território de agente. A capacidade é real e está melhorando rápido; também está crescendo a necessidade de revisar o que um agente fez antes que isso importe.

Tool use

Tool use, ou function calling, é um modelo acionando capacidades externas como busca, calculadoras, código ou o seu calendário.

É assim que assistentes de chat agem sobre o mundo em vez de só descrevê-lo, e é o mecanismo por trás dos agentes.

Reasoning model

Um reasoning model (modelo de raciocínio) é aquele que gasta poder computacional extra pensando um problema internamente antes de responder.

A troca é tempo e custo por precisão em problemas difíceis. Para perguntas simples, esse pensamento extra não compra nada, o que é mais um argumento para trocar de modelo por tarefa.

Latency

Latency (latência) é quanto tempo você espera entre enviar um prompt e a resposta chegar ou começar a aparecer.

Varia pelo tamanho do modelo, pela carga do sistema e se o modelo é um modelo de raciocínio. Para trabalho interativo, um modelo rápido e bom o suficiente costuma vencer um modelo lento e brilhante.

Rate limit

Um rate limit é o teto que um fornecedor coloca em quantas requisições ou tokens você pode usar em uma janela de tempo.

Bater nesse teto costuma ser o motivo de um produto de chat te dizer para esperar ou fazer upgrade. Os limites de mensagens em planos de assinatura são rate limits com um nome mais simpático.

Mantendo o glossário útil

Os termos envelhecem rápido nessa área. Esta página é mantida como referência: as entradas são reescritas quando o uso muda, e os guias detalhados linkados carregam o detalhe que não cabe em uma definição.

Se um termo que você encontrou por aí não está aqui, o caminho mais rápido é colar a frase onde você o encontrou em um modelo capaz e pedir a definição no contexto. No Whizi você pode perguntar a dois modelos ao mesmo tempo e notar quando eles discordam, o que para jargão novo acontece surpreendentemente muitas vezes.

Lista de verificação
  • Cite a definição de uma frase; leia o detalhe antes de confiar nela
  • Quando duas fontes definem um termo de forma diferente, o uso mais recente costuma vencer em IA
  • Aprenda token, janela de contexto e alucinação primeiro; a maioria dos outros termos depende desses três
  • Teste afirmações desconhecidas sobre um modelo com a sua própria comparação de três tarefas
  • Use primeiro o glossário para iniciantes se esta página parecer um manual de referência, porque é isso que ela é

Perguntas frequentes

Qual é a diferença entre IA, machine learning e um LLM?

IA é o objetivo amplo de o software fazer tarefas que precisam de julgamento humano. Machine learning é a técnica de ensinar software a partir de exemplos, e é assim que praticamente toda IA moderna é construída. Um LLM é um tipo de modelo treinado por machine learning, treinado com texto, e é o tipo por trás do ChatGPT, do Claude e do Gemini.

O que significa RAG em IA?

RAG significa geração aumentada por recuperação (retrieval augmented generation): o sistema primeiro busca documentos relevantes, depois faz o modelo responder a partir deles em vez de a partir da memória. É a técnica padrão por trás de produtos que conversam com os seus arquivos ou base de conhecimento, e é por isso que esses produtos conseguem citar fontes.

Qual é a diferença entre fine-tuning e RAG?

Fine-tuning muda o próprio modelo com treinamento extra, o que é lento e fixo. RAG deixa o modelo em paz e entrega a ele os documentos certos no momento da pergunta, o que é flexível e atual. Para manter um assistente atualizado com informações que mudam, RAG é quase sempre a ferramenta certa; fine-tuning serve para exigências estáveis de estilo e formato.

O que é um token em IA?

Um token é a unidade de texto que um modelo lê e escreve, cerca de três quartos de uma palavra em inglês. Tudo é medido em tokens: preço, velocidade e a janela de contexto. Um documento de 1.000 palavras tem cerca de 1.300 tokens.

De quantos desses termos eu realmente preciso?

Para o uso do dia a dia, cerca de cinco: modelo, prompt, token, janela de contexto e alucinação. A versão para iniciantes deste glossário cobre esses com mais calma. O resto desta página existe para o momento em que uma página de produto ou um artigo jogar um termo na sua frente.