A resposta curta
Pressione Compare no cabeçalho do chat, escolha um modelo para cada coluna e envie um prompt para os dois. Cada coluna mantém sua própria conversa oculta, então nenhum modelo vê a resposta do outro e nenhuma resposta fica ancorada pela outra, que é todo o motivo pelo qual a comparação vale alguma coisa. As colunas são geradas uma após a outra, primeiro a esquerda depois a direita, porque uma geração roda por conta de cada vez.
A comparação lado a lado é um recurso Powerhouse e roda dois modelos por vez. Cada resposta é cobrada na taxa de crédito do seu próprio modelo, então comparar um modelo de 10 créditos com um de 20 créditos custa 30 créditos.
Use isso para decidir qual modelo deve ser o seu padrão para um tipo de tarefa. Se você quer uma resposta melhorada em vez de duas respostas comparadas, faça a outra coisa: troque de modelo dentro da mesma conversa e peça ao segundo para criticar o primeiro.
Por que benchmarks não respondem à sua pergunta
Benchmarks publicados medem desempenho em tarefas padronizadas. A sua pergunta é mais estreita e mais útil: qual modelo é melhor naquilo que você pessoalmente faz vinte vezes por semana. São perguntas diferentes, e a segunda não tem resposta publicada porque ninguém tem a sua carga de trabalho.
Rodar um prompt em dois modelos leva cerca de trinta segundos e responde diretamente. A parte importante não é que você recebe duas respostas, é que você descobre o tamanho da diferença. Às vezes as saídas são quase idênticas, o que indica que você pode parar de pensar em escolha de modelo para aquela tarefa. Às vezes uma delas é inutilizável, o que vale a pena saber antes de construir um fluxo de trabalho em cima dela.
A outra coisa que a comparação detecta é o erro confiante. Quando dois modelos dão respostas substancialmente diferentes para uma pergunta factual, pelo menos um está errado, e você não saberia disso lendo apenas um deles. Esse sinal não está disponível num fluxo de trabalho de modelo único a preço nenhum.
Decida o que significa melhor antes de ler
A armadilha na comparação lado a lado é preferir qualquer saída que seja mais longa, mais confiante ou mais polida. Isso não é qualidade. Escolha o seu critério primeiro, depois leia.
| Tarefa | O que melhor significa | O que ignorar |
|---|---|---|
| Escrita | Precisa de menos edição para ser enviável | Extensão, vocabulário, entusiasmo |
| Pesquisa factual | Fontes que se confirmam e sustentam a afirmação | Fluência e confiança |
| Extração | Esquema correto, sem campos inventados, rótulos consistentes | Qualidade da prosa em torno da tabela |
| Raciocínio | Os passos se sustentam e o caso extremo é tratado | Se a conclusão bate com a sua opinião prévia |
| Código | Trata o caminho de falha, é revisável | Esperteza, brevidade |
| Resumo | Mantém o que importa e descarta o que não importa | Abrangência |
Um truque prático: antes de ler qualquer uma das saídas, escreva uma frase descrevendo o que uma boa resposta deveria conter. Depois leia. Leva dez segundos e evita o viés de polimento, que é forte e em grande parte inconsciente.
Para perguntas factuais, verifique a discordância em vez do vencedor. Onde dois modelos concordam sobre um número específico e uma fonte, a confiança é razoável. Onde divergem, é isso que vale a pena verificar, e é o resultado mais valioso de todo o exercício.
Prompts que expõem diferenças reais
Algumas tarefas separam claramente os modelos e outras não. Se você quer aprender algo com uma comparação, use prompts que pressionem uma capacidade específica.
- Tom sob dificuldade.
Escreva um recado para um cliente explicando que perdemos o prazo, assumindo responsabilidade sem exagerar nas desculpas e sem dar justificativas. Menos de 120 palavras.As diferenças de registro aparecem imediatamente aqui. - Extração rigorosa.
Extraia toda data, valor e parte deste texto para um array JSON com exatamente estas chaves. Se um campo estiver ausente, use null. Não infira.Testa a disciplina de formato e a tendência a inventar. - Raciocínio com armadilha. Dê um problema com uma resposta errada plausível, como uma questão de taxa ou proporção onde o caminho intuitivo é incorreto. Os modelos diferem em pegar ou não o atalho.
- Recuperação de contexto longo. Envie um documento longo e pergunte sobre algo no meio dele. Revela contexto realmente utilizável, não o contexto anunciado.
- Admitir ignorância.
O que foi anunciado sobre [algo genuinamente obscuro ou muito recente]?A melhor resposta é um claro "eu não sei" ou uma recuperação com fonte. Fabricação aqui é desqualificante. - Seguir uma restrição negativa.
Explique X sem usar nenhuma analogia ou metáfora.A obediência a instruções negativas varia mais do que se esperaria.
Rode comparações no seu próprio trabalho real em vez de em quebra-cabeças. Um modelo que é melhor no seu relatório trimestral é mais útil do que um que é melhor num enigma de lógica.
Transformando uma semana de comparações em um mapa de roteamento
Uma única comparação é interessante. Uma semana delas é acionável. A rotina:
- Por cinco dias, sempre que uma tarefa importar, rode ela em dois modelos em vez de um.
- Anote o tipo de tarefa, o vencedor e o quão grande foi a diferença. Três palavras bastam.
- No fim da semana, veja onde um modelo venceu repetidamente e onde as saídas eram intercambiáveis.
- Defina os seus padrões a partir disso e pare de comparar nas tarefas em que a diferença era consistentemente nula.
O que as pessoas normalmente descobrem é que a comparação importa numa minoria do seu trabalho e é perda de tempo no resto. Buscas factuais rápidas, reescritas simples e formatação de rotina raramente separam os modelos. Escrita que será lida por um cliente, pesquisa que vai orientar uma decisão e raciocínio sobre algo pouco familiar os separam bastante.
Esse resultado é a recompensa: você para de comparar onde isso não faz diferença nenhuma e mantém a comparação para as tarefas em que ela muda o resultado.
Lado a lado versus sequencial
Duas técnicas diferentes, que vale a pena distinguir.
Lado a lado roda o mesmo prompt em dois modelos que não conseguem ver a resposta um do outro. Cada coluna mantém sua própria conversa oculta, nomeada com um prefixo [Compare] e mantida fora da barra lateral, então perguntas de acompanhamento continuam sendo um teste justo: ambos os modelos mantêm contexto independente de múltiplas interações. Esta é a ferramenta certa para escolher um modelo padrão e para detectar discordância factual.
Sequencial significa obter uma resposta e depois trocar de modelo na mesma conversa, pedindo ao novo para criticá-la. Use isso quando você quer que a falha seja encontrada em vez de uma comparação feita, porque o segundo modelo pode se engajar diretamente com o argumento específico. Veja trocar de modelo no meio da conversa.
Regra geral: lado a lado para decidir qual modelo, sequencial para melhorar uma resposta.
- Escreva e refine o prompt num chat normal antes de comparar
- Decida o que melhor significa para esta tarefa antes de ler qualquer uma das respostas
- Escreva uma frase descrevendo uma boa resposta, depois leia, para evitar o viés de polimento
- Em perguntas factuais, trate a discordância como o achado e vá verificá-la
- Compare no seu próprio trabalho real, não em quebra-cabeças
- Registre o vencedor e o tamanho da diferença por uma semana, depois defina padrões a partir do padrão observado
- Pare de comparar nas tarefas em que a diferença é consistentemente nula
Perguntas frequentes
Quantos modelos posso comparar de uma vez?
A comparação lado a lado é um recurso Powerhouse e roda dois modelos por vez, o que é deliberado: duas colunas é o layout que você consegue realmente ler com atenção. Três colunas tende a virar leitura superficial, e leitura superficial derrota o propósito, já que o valor do exercício está em notar onde as respostas realmente diferem.
A comparação lado a lado usa mais das minhas mensagens mensais?
Sim, custa o dobro: dois modelos produzem uma resposta cada, e cada resposta é cobrada na sua própria taxa de crédito, então comparar um modelo de 10 créditos com um de 20 créditos gasta 30 créditos em vez de 10 ou 20. Detectar uma resposta errada ou um rascunho inutilizável antes de ele ser enviado geralmente vale essa despesa. A abordagem eficiente é comparar em decisões e entregas, e usar um único modelo para buscas de rotina e reescritas rápidas.
E se as duas respostas forem igualmente boas?
Esse é um resultado real e útil: indica que esta tarefa não depende de escolha de modelo, então pare de gastar atenção nela e use o que for o seu padrão. A maioria das cargas de trabalho se divide assim, com uma maioria de tarefas em que os modelos são intercambiáveis e uma minoria em que a diferença é grande. Descobrir qual é qual é o propósito de rodar comparações por uma semana.
Como evito simplesmente escolher a resposta que soa melhor?
Decida o seu critério antes de ler. Respostas mais longas, mais confiantes e mais polidas são sistematicamente preferidas mesmo quando são piores, e esse viés é em grande parte inconsciente. Escrever uma frase sobre o que uma boa resposta deveria conter, antes de olhar, já basta para neutralizar a maior parte disso. Para trabalho factual, julgue se as fontes se confirmam e sustentam a afirmação, e não como a resposta soa.
Quais dois modelos eu devo comparar?
Compare os dois entre os quais você realmente está decidindo para aquela tarefa específica, que para a maioria das pessoas é Claude contra GPT para escrita e raciocínio, ou um modelo de contexto grande contra o seu padrão quando documentos estão envolvidos. Comparar um modelo que você nunca usaria contra o seu favorito não conta nada em que você vá agir.