Lo básico
Esta es la versión de referencia: 55 términos, primero la definición y después el detalle. Si prefieres el recorrido más suave con solo las palabras que importan en tu primera semana, lee Glosario de IA para principiantes y vuelve aquí cuando un término te mande a buscarlo.
Inteligencia artificial
La inteligencia artificial es software que realiza tareas que normalmente requieren criterio humano, como escribir, razonar o reconocer qué hay en una imagen.
En el uso cotidiano de 2026, "IA" casi siempre se refiere a los asistentes de chat construidos sobre grandes modelos de lenguaje, y no al campo académico más amplio.
Aprendizaje automático (machine learning)
El aprendizaje automático es la técnica de enseñar al software mostrándole ejemplos en lugar de programarlo con reglas.
Todo asistente de IA moderno se construye así: el comportamiento viene de patrones en los datos de entrenamiento, por eso el mismo modelo puede ser brillante en tareas comunes e inestable en las raras.
Modelo
Un modelo es un sistema de IA entrenado en concreto, el objeto al que en realidad le envías un prompt.
GPT, Claude y Gemini son familias de modelos; una familia contiene modelos individuales con distintos tamaños, velocidades y precios. Elegir entre ellos según la tarea es la habilidad central de usar bien la IA.
LLM (modelo de lenguaje de gran tamaño)
Un LLM, o modelo de lenguaje de gran tamaño, es un modelo entrenado con cantidades enormes de texto para predecir qué texto debería venir después.
Ese único truco, hecho a gran escala, es lo que produce respuestas, borradores, código y resúmenes. Lo de "gran tamaño" se refiere tanto a los datos de entrenamiento como a la cantidad de parámetros.
Chatbot
Un chatbot es la interfaz conversacional que envuelve a un modelo, lo que tiene la caja de mensajes.
La distinción importa al comparar productos: dos chatbots pueden envolver el mismo modelo y sentirse distintos, y un solo chatbot puede ofrecer muchos modelos, que es como funciona Whizi.
Prompt
Un prompt es todo lo que le envías al modelo: la pregunta, las instrucciones y cualquier texto o archivo que incluyas.
La calidad de la respuesta sigue de cerca la calidad del prompt. El contexto, las restricciones y el formato de salida que quieres son las tres cosas que más se les olvidan a los principiantes.
Token
Un token es el pequeño trozo de texto que un modelo realmente lee y escribe, más o menos tres cuartas partes de una palabra media en inglés.
Los precios, la velocidad y las ventanas de contexto se miden todos en tokens, por eso la palabra aparece en cada página de precios de IA. Un documento de 1000 palabras equivale a unos 1300 tokens.
Ventana de contexto
Una ventana de contexto es la cantidad máxima de texto, medida en tokens, que un modelo puede tener en cuenta a la vez.
Tu prompt, la conversación hasta ese punto, los documentos adjuntos y la respuesta la comparten entre todos. La tabla de comparación de ventanas de contexto lista la cifra actual de cada modelo importante, y el explicador cuenta por qué explica la mayoría de las quejas de "la IA se olvidó".
Parámetros
Los parámetros son los números internos que un modelo aprendió durante el entrenamiento, y la medida habitual de su tamaño.
Contados en miles de millones, más parámetros suele significar más capacidad y más costo, aunque de forma aproximada. Por sí solo es un mal criterio de compra; los benchmarks y tus propias pruebas le ganan al conteo de parámetros.
Respuesta
Una respuesta es lo que produce el modelo para un prompt, también llamada completion.
Las respuestas se generan de cero cada vez, por eso regenerar el mismo prompt da una redacción distinta y a veces una respuesta diferente.
Hablar con un modelo
Prompt de sistema
Un prompt de sistema es la instrucción permanente que recibe un modelo antes de tu mensaje, y que fija su rol, su tono y sus reglas.
Todo producto tiene uno, aunque no puedas verlo. Cuando un chatbot "tiene personalidad", normalmente vive ahí.
Ingeniería de prompts
La ingeniería de prompts es la práctica de escribir prompts de forma deliberada para conseguir mejores resultados de manera confiable.
A pesar del nombre grandilocuente, casi todo se reduce a claridad normal: di el objetivo, da contexto, muestra un ejemplo, nombra el formato. La guía para principiantes cubre las técnicas que de verdad mueven los resultados.
Zero-shot
Zero-shot significa pedirle a un modelo que haga una tarea sin darle ningún ejemplo.
Los modelos modernos manejan la mayoría de las tareas cotidianas en modo zero-shot. El término sobrevive sobre todo como contraste con el prompting few-shot.
Few-shot
Few-shot significa incluir un puñado de ejemplos resueltos en el prompt para que el modelo copie el patrón.
Es la mejora de fiabilidad más barata que existe para trabajos sensibles al formato: dos o tres ejemplos de entrada y salida deseada le ganan a un párrafo de descripción.
Cadena de razonamiento
La cadena de razonamiento (chain of thought) es un modelo trabajando pasos intermedios antes de dar su respuesta final.
Pedirle a un modelo que razone paso a paso mejora de forma medible los problemas difíciles, y los modelos de razonamiento ahora hacen una versión de esto internamente por defecto.
Temperatura
La temperatura es el ajuste que controla cuánta aleatoriedad añade un modelo al elegir cada token siguiente.
Una temperatura baja da un resultado constante y conservador; una alta da variedad y algún disparate ocasional. Los productos de chat suelen elegir un valor intermedio por ti.
Streaming
El streaming es el modelo enviando su respuesta token por token a medida que la genera, en lugar de todo de golpe al terminar.
Por eso las respuestas parecen escribirse solas, y por eso una mala respuesta se puede detener a tiempo en lugar de esperarla entera.
Regenerar
Regenerar significa pedir una respuesta nueva para el mismo prompt.
Como la generación es probabilística, un regenerar es una tirada genuinamente nueva, no un reintento del mismo cálculo. Comparar dos tiradas, o el mismo prompt en dos modelos, es una forma rápida de comprobar la calidad.
Cómo se hacen los modelos
Entrenamiento
El entrenamiento es el proceso de ajustar los parámetros de un modelo contra datos hasta que sus predicciones son buenas.
Ocurre antes de que llegues a conocer el modelo y le cuesta al proveedor una cantidad enorme de cómputo. Nada de lo que escribes en un chat reentrena el modelo en el momento, aunque los proveedores pueden usar las conversaciones para entrenar versiones futuras según su política.
Datos de entrenamiento
Los datos de entrenamiento son el texto y demás material del que aprendió un modelo.
Su amplitud explica lo que sabe un modelo, sus huecos explican puntos ciegos sistemáticos, y su rango de fechas fija la fecha de corte.
Preentrenamiento
El preentrenamiento es la primera y más grande fase del entrenamiento, donde un modelo aprende idioma y conocimiento del mundo a partir de texto masivo.
El resultado es capaz pero en bruto. Todo lo que hace que un modelo se comporte como un asistente útil llega después.
Ajuste fino
El ajuste fino es entrenamiento adicional sobre un conjunto de datos más estrecho para especializar o moldear un modelo preentrenado.
Los proveedores lo usan para mejorar la utilidad y la seguridad; las empresas lo usan para tareas de su sector. Para la mayoría de los usuarios, un buen prompt sobre un buen modelo general le gana a pagar por un ajuste fino.
RLHF
RLHF, aprendizaje por refuerzo con retroalimentación humana, es entrenar un modelo contra las calificaciones que dan personas a sus respuestas.
Es buena parte de la razón por la que los asistentes modernos son educados, estructurados y cautelosos. Si se abusa de él, también produce la cautela excesiva que hace que algunos modelos se nieguen a responder o den rodeos.
Alineación
La alineación es el trabajo de hacer que el comportamiento de un modelo coincida con la intención y los valores humanos.
En la práctica cubre desde negarse a peticiones dañinas hasta simplemente seguir instrucciones con precisión. Cuando un modelo hace algo técnicamente impresionante pero no deseado, eso es un fallo de alineación.
Inferencia
La inferencia es ejecutar un modelo ya entrenado para producir una respuesta, a diferencia de entrenarlo.
Cada mensaje que envías activa una inferencia, y el costo de inferencia es lo que mide el precio por token. Los modelos baratos de ejecutar pueden ser sorprendentemente capaces; el Índice de Costo de Modelos de IA muestra una diferencia de precio de 2000 veces.
Transformer
El transformer es la arquitectura de red neuronal detrás de prácticamente todos los modelos de lenguaje modernos.
Su mecanismo clave, la atención, deja que el modelo compare cada parte de la entrada contra todas las demás. Nunca necesitas los detalles, pero la palabra aparece por todas partes en los textos sobre IA.
Cuando algo sale mal
Alucinación
Una alucinación es un modelo afirmando algo falso con total seguridad.
No es un fallo que se vaya a corregir en la próxima versión; se desprende de cómo funciona la generación de texto. La frecuencia varía mucho según el modelo y la tarea. Trata cualquier dato, cifra o cita concreta como no verificada hasta comprobarla. Por qué la IA se equivoca cubre el mecanismo.
Anclaje
El anclaje (grounding) es darle a un modelo material de referencia del que responder, en lugar de dejar que dependa de su memoria.
Pegar el contrato, adjuntar el informe o activar la búsqueda web son formas de anclaje. Es la defensa cotidiana más eficaz contra la alucinación.
Sesgo
El sesgo es un modelo desviando sistemáticamente sus resultados de maneras heredadas de los datos de entrenamiento.
Se nota en suposiciones sobre personas, lugares y valores por defecto. Para decisiones importantes, revisa el resultado de la IA como revisarías el trabajo de un becario listo pero sin experiencia.
Barreras de seguridad
Las barreras de seguridad (guardrails) son las restricciones que un proveedor construye alrededor de un modelo para bloquear resultados dañinos o fuera de política.
Cada proveedor traza la línea de forma distinta, lo cual es una diferencia real entre productos: la misma petición puede ser respondida por un modelo y rechazada por otro.
Jailbreak
Un jailbreak es un prompt diseñado para engañar a un modelo y hacer que ignore sus barreras de seguridad.
Los proveedores los parchean de forma continua. Para un usuario normal, el término importa sobre todo como concepto de seguridad: todo lo que se pueda convencer a un modelo de hacer, alguien intentará convencerlo de hacer.
Red teaming
El red teaming es atacar deliberadamente un modelo antes de su lanzamiento para encontrar formas dañinas en las que puede fallar.
Los proveedores tienen equipos internos y externos dedicados a esto, y las fichas de modelo publicadas suelen resumir lo que encontraron. Es el equivalente en IA a las pruebas de penetración.
Fecha de corte
La fecha de corte es la fecha después de la cual terminan los datos de entrenamiento de un modelo.
Pregunta por algo más reciente y el modelo admite que no lo sabe, busca en la web si puede, o alucina. Conocer la fecha de corte del modelo que usas evita toda una categoría de errores.
Recuperación de información y tus datos
RAG (generación aumentada por recuperación)
RAG, generación aumentada por recuperación, es buscar documentos relevantes primero y hacer que el modelo responda a partir de ellos.
Así funcionan por dentro los productos de "chatea con tu base de conocimiento", y por eso pueden citar fuentes. RAG reduce la alucinación, pero hereda la calidad de lo que sea que recupera.
Embedding
Un embedding es una lista de números que representa el significado de un fragmento de texto.
Los textos con significado parecido reciben números cercanos, lo que le permite al software encontrar pasajes relacionados de forma matemática. Los embeddings son la maquinaria detrás de la búsqueda semántica y de RAG.
Base de datos vectorial
Una base de datos vectorial es una base de datos construida para almacenar embeddings y encontrar los más cercanos rápidamente.
Si un producto dice que "indexó" tus documentos para búsqueda con IA, hay un embedding de cada fragmento guardado en una de estas.
Búsqueda semántica
La búsqueda semántica es encontrar texto por significado en lugar de por coincidencia de palabras clave.
Buscar "problemas de dinero" puede sacar a la luz un pasaje sobre tensión de flujo de caja aunque ninguna palabra coincida. Son los embeddings puestos a trabajar.
Chunking
El chunking es dividir documentos largos en fragmentos lo bastante pequeños como para convertirlos en embeddings y recuperarlos bien.
Suena a fontanería y lo es, pero un mal chunking es una razón habitual por la que las herramientas de chat con documentos responden desde la parte equivocada de un archivo.
Búsqueda web (en IA)
La búsqueda web en IA significa que el modelo va a buscar páginas actuales antes de responder, en lugar de depender de su memoria de entrenamiento.
Cambia velocidad por actualidad y permite que las respuestas lleven citas que puedes abrir. Para cualquier cosa posterior a la fecha de corte del modelo, es la diferencia entre una respuesta y una suposición.
Base de conocimiento
Una base de conocimiento es el conjunto seleccionado de documentos que una empresa le da a su IA para responder.
Calidad que entra, calidad que sale: un asistente anclado en una wiki desactualizada sirve respuestas desactualizadas con total confianza, y con citas.
Tres términos de este glosario nombran respuestas rivales a la misma pregunta, cómo hacer que un modelo sea mejor en tu tarea, y confundirlos es el error de jerga más común en las reuniones de producto. Lado a lado:
| Enfoque | Qué cambia | Costo y velocidad | Cuándo gana |
|---|---|---|---|
| Mejor prompting (zero-shot, few-shot) | Solo el texto que envías | Gratis, toma minutos | Casi siempre el primer paso; dos o tres ejemplos resueltos arreglan la mayoría de los problemas de formato |
| RAG | Lo que el modelo lee antes de responder | Moderado de construir, sin reentrenar | Respuestas que deben mantenerse actuales o citar tus propios documentos |
| Ajuste fino | Los parámetros del propio modelo | Lento y caro, y luego queda fijo | Requisitos de estilo y formato estables a gran escala, casi nunca para una persona individual |
Más allá del texto
Multimodal
Multimodal significa un modelo que funciona en más de un formato, como texto más imágenes, audio o video.
Por eso puedes hacer una captura de un error y preguntar qué pasa. La guía de IA multimodal cubre lo que realmente funciona hoy.
Modelo de visión
Un modelo de visión es un modelo que puede interpretar imágenes: fotos, capturas de pantalla, gráficos y documentos.
Leer no es lo mismo que generar; un modelo puede describir tu diagrama a la perfección y aun así ser incapaz de dibujar uno.
Generación de imágenes
La generación de imágenes es producir imágenes nuevas a partir de una descripción de texto.
La calidad, el rango de estilos y cómo se renderiza el texto dentro de las imágenes varían mucho entre generadores, por eso los usuarios serios comparan varios. El repaso de generadores de imágenes se mantiene al día del campo.
Modelo de difusión
Un modelo de difusión genera imágenes empezando desde ruido y refinándolo paso a paso hacia la descripción.
Es la técnica dominante detrás de los generadores de imágenes modernos. La palabra importa sobre todo para que "difusión" en el nombre de un producto te diga qué hace ese producto.
Voz a texto
Voz a texto es transcribir audio hablado en palabras escritas.
La transcripción moderna es lo bastante precisa para hacer buscables reuniones, notas de voz y entrevistas, y así funciona la entrada de voz en las apps de chat.
Texto a voz
Texto a voz es generar audio hablado a partir de palabras escritas.
Los sistemas actuales producen voces naturales y expresivas, lo que impulsa las funciones de lectura en voz alta y las conversaciones de voz con IA.
El ecosistema
API
Una API es la puerta programática que usan los desarrolladores para enviarle prompts a un modelo desde su propio software.
El precio de la API es por token, y de ahí sale en última instancia la economía por respuesta de cada producto de IA.
Pesos abiertos
Pesos abiertos significa que los parámetros entrenados de un modelo se publican para que cualquiera los descargue y ejecute.
Permite el autoalojamiento y deja que otros proveedores sirvan el modelo en su propia infraestructura. DeepSeek y Llama son los ejemplos famosos.
Modelo de código abierto
Un modelo de código abierto es, en términos generales, un modelo publicado para uso y modificación pública, aunque las licencias varían mucho.
Las preguntas prácticas son siempre las mismas dos: si lo puedes usar comercialmente, y quién lo aloja por ti. El ecosistema de pesos abiertos importa más cuando la privacidad o el costo descartan los modelos insignia alojados.
Benchmark
Un benchmark es una prueba estándar usada para puntuar y comparar modelos.
Útil como primer corte, y sobreexplotado de forma habitual en el marketing. Un modelo que encabeza un benchmark puede seguir perdiendo en tu trabajo real, por eso hacer tu propia comparación de tres tareas le gana a leer gráficos.
Agente
Un agente es un sistema de IA que da pasos hacia un objetivo, en lugar de solo responder una vez.
Reservar, investigar, programar y abrir tickets son territorio de agentes. La capacidad es real y mejora rápido; también crece la necesidad de revisar lo que hizo un agente antes de que importe.
Uso de herramientas
El uso de herramientas, o function calling, es un modelo invocando capacidades externas como búsqueda, calculadoras, código o tu calendario.
Así es como los asistentes de chat actúan sobre el mundo en lugar de solo describirlo, y es el mecanismo que hay debajo de los agentes.
Modelo de razonamiento
Un modelo de razonamiento es uno que gasta cómputo extra pensando el problema internamente antes de responder.
El intercambio es tiempo y costo por precisión en problemas difíciles. En preguntas simples, ese pensamiento extra no aporta nada, otro argumento más para cambiar de modelo según la tarea.
Latencia
La latencia es cuánto esperas entre enviar un prompt y que la respuesta llegue o empiece a transmitirse.
Varía según el tamaño del modelo, la carga y si el modelo es de razonamiento. Para trabajo interactivo, un modelo rápido y suficientemente bueno suele ganarle a uno brillante pero lento.
Límite de tasa
Un límite de tasa es el tope que pone un proveedor a cuántas peticiones o tokens puedes usar en una ventana de tiempo.
Alcanzar uno es la razón habitual por la que un producto de chat te dice que esperes o mejores de plan. Los topes de mensajes de los planes de suscripción son límites de tasa con una marca más amable.
Mantener útil el glosario
Los términos envejecen rápido en este campo. Esta página se mantiene como referencia: las entradas se reescriben cuando cambia el uso, y las guías detalladas enlazadas llevan el detalle que no cabe en una definición.
Si un término que te encuentras por ahí no está aquí, la ruta más rápida es pegar la frase donde lo viste en un modelo capaz y pedirle la definición en contexto. En Whizi puedes preguntarle a dos modelos a la vez y notar cuándo no están de acuerdo, algo que con jerga nueva pasa sorprendentemente seguido.
- Cita la definición de una frase; lee el detalle antes de confiar en ella
- Cuando dos fuentes definen un término de forma distinta, en IA suele ganar el uso más reciente
- Aprende primero token, ventana de contexto y alucinación; casi todos los demás términos cuelgan de esos tres
- Pon a prueba afirmaciones desconocidas sobre un modelo con tu propia comparación de tres tareas
- Usa primero el glosario para principiantes si esta página se siente como un manual de referencia, porque lo es
Preguntas frecuentes
¿Cuál es la diferencia entre IA, machine learning y un LLM?
La IA es el objetivo amplio de que el software haga tareas que necesitan criterio humano. El machine learning es la técnica de enseñar al software a partir de ejemplos, y así se construye esencialmente toda la IA moderna. Un LLM es un tipo de modelo entrenado por machine learning sobre texto, y es el tipo que hay detrás de ChatGPT, Claude y Gemini.
¿Qué significa RAG en IA?
RAG son las siglas de generación aumentada por recuperación: el sistema primero busca documentos relevantes, y luego hace que el modelo responda a partir de ellos en lugar de su memoria. Es la técnica estándar detrás de los productos que chatean con tus archivos o tu base de conocimiento, y por eso esos productos pueden citar fuentes.
¿Cuál es la diferencia entre el ajuste fino y RAG?
El ajuste fino cambia el modelo mismo con entrenamiento adicional, que es lento y queda fijo. RAG deja el modelo intacto y le entrega los documentos correctos en el momento de la pregunta, algo flexible y actual. Para mantener a un asistente al día con información que cambia, RAG es casi siempre la herramienta correcta; el ajuste fino conviene para requisitos de estilo y formato estables.
¿Qué es un token en IA?
Un token es la unidad de texto que un modelo lee y escribe, más o menos tres cuartas partes de una palabra en inglés. Todo se mide en tokens: el precio, la velocidad y la ventana de contexto. Un documento de 1000 palabras equivale a unos 1300 tokens.
¿Cuántos de estos términos necesito realmente?
Para el uso cotidiano, unos cinco: modelo, prompt, token, ventana de contexto y alucinación. La versión para principiantes de este glosario cubre esos con más calma. El resto de esta página existe para el momento en que una página de producto o un artículo te lance un término encima.