La respuesta corta
Pulsa Comparar en la cabecera del chat, elige un modelo para cada columna y envía un mismo prompt a ambas. Cada columna mantiene su propia conversación oculta, así que ningún modelo ve la salida del otro y ninguna respuesta queda condicionada por la otra, que es la razón de ser de toda la comparación. Las columnas se transmiten una tras otra, primero izquierda y luego derecha, porque solo se ejecuta una generación por cuenta a la vez.
La comparación en paralelo es una función Powerhouse y ejecuta dos modelos a la vez. Cada respuesta se factura a la tarifa de créditos de su propio modelo, así que comparar un modelo de 10 créditos con uno de 20 cuesta 30 créditos.
Úsala para decidir qué modelo debería ser tu opción por defecto para un tipo de tarea concreto. Si lo que quieres es mejorar una respuesta en lugar de comparar dos, haz la otra cosa en su lugar: cambia de modelo dentro del mismo hilo y pide al segundo que critique al primero.
Por qué los benchmarks no responden a tu pregunta
Los benchmarks publicados miden el rendimiento en tareas estandarizadas. Tu pregunta es más concreta y más útil: qué modelo es mejor en lo que tú haces personalmente veinte veces por semana. Son preguntas distintas, y la segunda no tiene respuesta publicada porque nadie tiene tu carga de trabajo.
Ejecutar un prompt en dos modelos lleva unos treinta segundos y la responde directamente. Lo importante no es que obtengas dos respuestas, sino descubrir cuán grande es la brecha. A veces las salidas son casi idénticas, lo que te dice que dejes de pensar en la elección de modelo para esa tarea. Otras veces una es inservible, algo que conviene saber antes de construir un flujo de trabajo sobre ella.
Lo otro que detecta la comparación es el error con seguridad. Cuando dos modelos dan respuestas sustancialmente distintas a una pregunta factual, al menos uno se equivoca, y no lo habrías sabido leyendo solo uno de los dos. Esa señal no está disponible en un flujo de trabajo de un solo modelo, sea cual sea el precio.
Decide qué significa mejor antes de leer
La trampa de la comparación en paralelo es preferir la salida que sea más larga, más segura de sí misma o más pulida. Eso no es calidad. Elige primero tu criterio y luego lee.
| Tarea | Qué significa mejor | Qué ignorar |
|---|---|---|
| Redacción | Necesita menos edición para poder enviarse | Extensión, vocabulario, entusiasmo |
| Investigación factual | Fuentes que se resuelven y respaldan la afirmación | Fluidez y seguridad |
| Extracción | Esquema correcto, sin campos inventados, etiquetas coherentes | La calidad de la prosa alrededor de la tabla |
| Razonamiento | Los pasos se sostienen y se aborda el caso límite | Si la conclusión coincide con lo que ya pensabas |
| Código | Gestiona la ruta de fallo, es revisable | Ingenio, brevedad |
| Resumen | Conserva lo importante y descarta lo que no lo es | Exhaustividad |
Un truco práctico: antes de leer ninguna de las dos salidas, escribe una frase describiendo qué contendría una buena respuesta. Luego lee. Lleva diez segundos y evita el sesgo por el pulido, que es fuerte y en gran medida inconsciente.
En preguntas factuales, fíjate en el desacuerdo más que en el ganador. Cuando dos modelos coinciden en una cifra concreta y una fuente, la confianza es razonable. Cuando divergen, eso es lo que hay que verificar, y es el resultado más valioso de todo el ejercicio.
Prompts que exponen diferencias reales
Algunas tareas separan claramente a los modelos y otras no. Si quieres aprender algo de una comparación, usa prompts que presionen una capacidad concreta.
- Tono en una situación difícil.
Escribe una nota a un cliente explicando que no llegamos al plazo, asumiendo responsabilidad sin disculparte en exceso y sin excusas. Menos de 120 palabras.Aquí las diferencias de registro se notan de inmediato. - Extracción estricta.
Extrae cada fecha, importe y parte de este texto en un array JSON con exactamente estas claves. Si falta un campo, usa null. No infieras.Pone a prueba la disciplina de formato y la tendencia a inventar. - Razonamiento con trampa. Plantea un problema con una respuesta incorrecta plausible, como una pregunta de tasa o proporción donde el atajo intuitivo es erróneo. Los modelos difieren en si toman el atajo.
- Recuerdo de contexto largo. Sube un documento largo y pregunta sobre algo que esté en medio. Revela el contexto realmente utilizable, no el contexto anunciado.
- Admitir ignorancia.
¿Qué se anunció sobre [algo genuinamente oscuro o muy reciente]?La mejor respuesta es un claro "no lo sé" o una recuperación con fuente. Inventar algo aquí descalifica. - Seguir una restricción negativa.
Explica X sin usar ninguna analogía ni metáfora.El cumplimiento de instrucciones negativas varía más de lo que cabría esperar.
Haz las comparaciones sobre tu propio trabajo real, no sobre acertijos. Un modelo mejor en tu informe trimestral es más útil que uno mejor en un acertijo de lógica.
Convertir una semana de comparaciones en un mapa de enrutado
Una sola comparación es interesante. Una semana de ellas es procesable. La rutina:
- Durante cinco días, cada vez que una tarea importe, ejecútala en dos modelos en lugar de uno.
- Anota el tipo de tarea, el ganador y cuán grande fue la brecha. Con tres palabras basta.
- Al final de la semana, mira dónde un modelo ganó repetidamente y dónde las salidas eran intercambiables.
- Fija tus opciones por defecto a partir de eso, y deja de comparar en las tareas donde la brecha fue sistemáticamente nula.
Lo que la gente suele encontrar es que la comparación importa en una minoría de su trabajo y es una pérdida de tiempo en el resto. Las búsquedas factuales rápidas, las reescrituras sencillas y el formateo rutinario rara vez separan a los modelos. La redacción que va a leer un cliente, la investigación que va a informar una decisión y el razonamiento sobre algo poco familiar sí los separan, y mucho.
Ese resultado es la recompensa: dejas de comparar donde no cambia nada y lo reservas para las tareas donde sí cambia el resultado.
En paralelo frente a secuencial
Dos técnicas distintas, que merece la pena distinguir.
En paralelo ejecuta el mismo prompt en dos modelos que no pueden ver la salida del otro. Cada columna mantiene su propia conversación oculta, con el prefijo [Compare] y fuera de la barra lateral, así las preguntas de seguimiento siguen siendo una prueba justa: ambos modelos mantienen contexto multiturno independiente. Es la herramienta adecuada para elegir un modelo por defecto y para detectar desacuerdos factuales.
Secuencial significa obtener una respuesta y luego cambiar de modelo en el mismo hilo pidiendo al nuevo que la critique. Úsalo cuando quieras encontrar el fallo en lugar de hacer una comparación, porque el segundo modelo puede entrar directamente en el argumento concreto. Consulta cómo cambiar de modelo a mitad de conversación.
Regla general: en paralelo para decidir qué modelo, secuencial para mejorar una respuesta.
- Escribe y afina el prompt en un chat normal antes de comparar
- Decide qué significa mejor para esta tarea antes de leer ninguna de las dos salidas
- Escribe una frase describiendo una buena respuesta y luego lee, para evitar el sesgo por el pulido
- En preguntas factuales, trata el desacuerdo como el hallazgo y ve a verificarlo
- Compara sobre tu propio trabajo real, no sobre acertijos
- Registra el ganador y el tamaño de la brecha durante una semana y fija las opciones por defecto según el patrón
- Deja de comparar en las tareas donde la brecha es sistemáticamente nula
Preguntas frecuentes
¿Cuántos modelos puedo comparar a la vez?
La comparación en paralelo es una función Powerhouse y ejecuta dos modelos a la vez, algo deliberado: dos columnas es el diseño que realmente puedes leer con atención. Tres columnas tiende a convertirse en una lectura por encima, y eso arruina el propósito, ya que el valor del ejercicio está en notar dónde las respuestas realmente difieren.
¿La comparación en paralelo gasta más de mis mensajes mensuales?
Sí, cuesta el doble: dos modelos producen cada uno una respuesta, y cada respuesta se factura a su propia tarifa de créditos, así que comparar un modelo de 10 créditos con uno de 20 gasta 30 créditos en lugar de 10 o 20. Detectar una respuesta equivocada o un borrador inservible antes de enviarlo suele merecer ese gasto. El enfoque eficiente es comparar en decisiones y entregables, y usar un solo modelo para búsquedas rutinarias y reescrituras rápidas.
¿Y si las dos respuestas son igual de buenas?
Ese es un resultado real y útil: te dice que esta tarea no depende de la elección de modelo, así que deja de gastar atención en ello y usa el que tengas por defecto. La mayoría de las cargas de trabajo se reparten así, con una mayoría de tareas donde los modelos son intercambiables y una minoría donde la brecha es grande. Averiguar cuál es cuál es el propósito de comparar durante una semana.
¿Cómo evito quedarme solo con la respuesta que suena mejor?
Decide tu criterio antes de leer. Las salidas más largas, más seguras de sí mismas y más pulidas se prefieren sistemáticamente incluso cuando son peores, y ese sesgo es en gran medida inconsciente. Escribir una frase sobre qué contendría una buena respuesta, antes de mirar, basta para contrarrestar la mayor parte. En trabajo factual, juzga según si las fuentes se resuelven y respaldan la afirmación, no según cómo suena la respuesta.
¿Qué dos modelos debería comparar?
Compara los dos entre los que realmente estés decidiendo para esa tarea concreta, que para la mayoría de la gente es Claude frente a GPT para redacción y razonamiento, o un modelo de contexto amplio frente a tu opción por defecto cuando hay documentos de por medio. Comparar un modelo que nunca usarías con tu favorito no te dice nada sobre lo que vas a hacer.