La réponse courte
Appuyez sur Comparer dans l'en-tête du chat, choisissez un modèle pour chaque colonne, puis envoyez un seul prompt aux deux. Chaque colonne garde sa propre conversation cachée, si bien qu'aucun modèle ne voit la réponse de l'autre et qu'aucune réponse n'est influencée par l'autre, ce qui est précisément ce qui rend la comparaison utile. Les colonnes s'affichent l'une après l'autre, d'abord à gauche puis à droite, car une seule génération tourne à la fois par compte.
La comparaison côte à côte est une fonctionnalité Powerhouse et fait tourner deux modèles à la fois. Chaque réponse est facturée au tarif en crédits de son propre modèle, donc comparer un modèle à 10 crédits avec un modèle à 20 crédits coûte 30 crédits.
Utilisez-la pour décider quel modèle devrait être votre choix par défaut pour un type de travail donné. Si vous voulez qu'une réponse soit améliorée plutôt que d'en comparer deux, faites autre chose à la place : changez de modèle dans le même fil de discussion et demandez au second de critiquer le premier.
Pourquoi les benchmarks ne répondent pas à votre question
Les benchmarks publiés mesurent la performance sur des tâches standardisées. Votre question est plus étroite et plus utile : quel modèle est meilleur pour la tâche que vous faites personnellement vingt fois par semaine. Ce sont deux questions différentes, et la seconde n'a pas de réponse publiée car personne n'a votre charge de travail exacte.
Envoyer un prompt à deux modèles prend environ trente secondes et y répond directement. L'important n'est pas d'obtenir deux réponses, mais de découvrir l'ampleur de l'écart entre elles. Parfois les réponses sont quasi identiques, ce qui vous indique d'arrêter de vous soucier du choix du modèle pour cette tâche. Parfois l'une est inutilisable, ce qui vaut la peine d'être su avant de construire un flux de travail dessus.
L'autre chose que la comparaison révèle, c'est l'erreur exprimée avec assurance. Quand deux modèles donnent des réponses substantiellement différentes à une question factuelle, l'un des deux au moins se trompe, et vous ne l'auriez pas su en lisant l'un ou l'autre seul. Ce signal n'est disponible dans aucun flux de travail à modèle unique, quel qu'en soit le prix.
Définissez ce que « meilleur » signifie avant de lire
Le piège de la comparaison côte à côte, c'est de préférer la réponse la plus longue, la plus assurée ou la plus soignée. Ce ne sont pas des critères de qualité. Choisissez d'abord votre critère, puis lisez.
| Tâche | Ce que « meilleur » signifie | Ce qu'il faut ignorer |
|---|---|---|
| Rédaction | Nécessite moins de retouches pour être envoyable | Longueur, vocabulaire, enthousiasme |
| Recherche factuelle | Sources qui se vérifient et soutiennent l'affirmation | Fluidité et assurance |
| Extraction | Schéma correct, aucun champ inventé, étiquettes cohérentes | Qualité de la prose autour du tableau |
| Raisonnement | Les étapes tiennent et le cas particulier est traité | Si la conclusion correspond à votre a priori |
| Code | Gère le chemin d'échec, est relisable | Ingéniosité, concision |
| Résumé | Garde l'essentiel et laisse de côté le reste | Exhaustivité |
Une astuce pratique : avant de lire l'une ou l'autre réponse, écrivez une phrase décrivant ce que contiendrait une bonne réponse. Puis lisez. Cela prend dix secondes et évite le biais de la forme soignée, qui est fort et largement inconscient.
Pour les questions factuelles, examinez le désaccord plutôt que le vainqueur. Là où deux modèles s'accordent sur un chiffre précis et une source, la confiance est raisonnable. Là où ils divergent, c'est ce qu'il faut aller vérifier, et c'est le résultat le plus précieux de tout l'exercice.
Des prompts qui révèlent de vraies différences
Certaines tâches distinguent nettement les modèles, d'autres non. Si vous voulez tirer un enseignement d'une comparaison, utilisez des prompts qui mettent une capacité spécifique sous pression.
- Le ton dans une situation difficile.
Rédige un mot à un client expliquant que nous avons manqué la date limite, en assumant la responsabilité sans excès d'excuses ni justifications. Moins de 120 mots.Les différences de registre apparaissent immédiatement ici. - L'extraction stricte.
Extrais chaque date, montant et partie de ce texte dans un tableau JSON avec exactement ces clés. Si un champ est absent, utilise null. N'invente rien.Teste la discipline de format et la tendance à inventer. - Le raisonnement avec un piège. Donnez un problème avec une réponse fausse plausible, comme une question de taux ou de proportion où la voie intuitive est incorrecte. Les modèles diffèrent selon qu'ils prennent ou non le raccourci.
- Le rappel sur long contexte. Téléversez un document long et posez une question sur quelque chose situé au milieu. Révèle le contexte réellement exploitable, pas le contexte annoncé.
- Admettre son ignorance.
Qu'a-t-on annoncé au sujet de [un événement vraiment obscur ou très récent] ?La meilleure réponse est un « je ne sais pas » clair ou une récupération sourcée. Une invention ici est disqualifiante. - Suivre une contrainte négative.
Explique X sans utiliser d'analogie ni de métaphore.Le respect des consignes négatives varie plus qu'on ne l'attendrait.
Faites vos comparaisons sur votre propre travail réel plutôt que sur des énigmes. Un modèle meilleur pour votre rapport trimestriel est plus utile qu'un modèle meilleur pour une devinette logique.
Transformer une semaine de comparaisons en carte de routage
Une seule comparaison est intéressante. Une semaine de comparaisons est exploitable. La routine :
- Pendant cinq jours, chaque fois qu'une tâche compte vraiment, exécutez-la sur deux modèles au lieu d'un.
- Notez le type de tâche, le vainqueur, et l'ampleur de l'écart. Trois mots suffisent.
- À la fin de la semaine, regardez où un modèle a gagné de façon répétée et où les réponses étaient interchangeables.
- Fixez vos réglages par défaut à partir de cela, et cessez de comparer sur les tâches où l'écart était systématiquement nul.
Ce que les gens constatent généralement, c'est que la comparaison compte pour une minorité de leur travail et est une perte de temps pour le reste. Les recherches factuelles rapides, les réécritures simples et la mise en forme routinière séparent rarement les modèles. La rédaction destinée à être lue par un client, la recherche qui éclairera une décision et le raisonnement sur quelque chose d'inconnu les séparent beaucoup.
Ce résultat, c'est le gain : vous arrêtez de comparer là où cela ne change rien et le gardez pour les tâches où cela change le résultat.
Côte à côte contre séquentiel
Deux techniques différentes, qu'il vaut la peine de distinguer.
Côte à côte envoie le même prompt à deux modèles qui ne peuvent pas voir la réponse l'un de l'autre. Chaque colonne garde sa propre conversation cachée, nommée avec un préfixe [Compare] et tenue hors de la barre latérale, si bien que les questions de suivi restent un test équitable : les deux modèles conservent un contexte multi-tours indépendant. C'est le bon outil pour choisir un modèle par défaut et pour repérer un désaccord factuel.
Séquentiel signifie obtenir une réponse, puis changer de modèle dans le même fil et demander au nouveau de la critiquer. Utilisez-le quand vous voulez trouver le défaut plutôt que faire une comparaison, car le second modèle peut s'engager directement avec l'argument précis. Voir changer de modèle en cours de conversation.
Règle approximative : côte à côte pour décider quel modèle, séquentiel pour améliorer une réponse.
- Rédigez et affinez le prompt dans un chat normal avant de comparer
- Décidez ce que « meilleur » signifie pour cette tâche avant de lire l'une ou l'autre réponse
- Écrivez une phrase décrivant une bonne réponse, puis lisez, pour éviter le biais de la forme soignée
- Sur les questions factuelles, traitez le désaccord comme le résultat et allez le vérifier
- Comparez sur votre propre travail réel, pas sur des énigmes
- Notez le vainqueur et l'ampleur de l'écart pendant une semaine, puis fixez vos réglages à partir de ce schéma
- Cessez de comparer sur les tâches où l'écart est systématiquement nul
Questions fréquentes
Combien de modèles puis-je comparer à la fois ?
La comparaison côte à côte est une fonctionnalité Powerhouse, et elle fait tourner deux modèles à la fois, ce qui est délibéré : deux colonnes, c'est la mise en page que l'on peut réellement lire avec attention. Trois colonnes tendent à devenir un survol, et le survol va à l'encontre du but, puisque la valeur de l'exercice réside dans le fait de remarquer où les réponses diffèrent réellement.
La comparaison côte à côte consomme-t-elle davantage de mes messages mensuels ?
Oui, cela coûte le double : deux modèles produisent chacun une réponse, et chaque réponse est facturée à son propre tarif en crédits, donc comparer un modèle à 10 crédits avec un modèle à 20 crédits dépense 30 crédits plutôt que 10 ou 20. Repérer une réponse fausse ou un brouillon inutilisable avant qu'il ne soit livré en vaut généralement la peine. L'approche efficace consiste à comparer sur les décisions et les livrables, et à utiliser un seul modèle pour les recherches routinières et les réécritures rapides.
Que faire si les deux réponses sont tout aussi bonnes l'une que l'autre ?
C'est un résultat réel et utile : cela vous indique que cette tâche ne dépend pas du choix du modèle, alors arrêtez d'y consacrer de l'attention et utilisez celui qui est votre choix par défaut. La plupart des charges de travail se répartissent ainsi, avec une majorité de tâches où les modèles sont interchangeables et une minorité où l'écart est important. Découvrir laquelle est laquelle est tout l'intérêt de faire des comparaisons pendant une semaine.
Comment éviter de simplement choisir la réponse qui sonne le mieux ?
Décidez votre critère avant de lire. Les réponses plus longues, plus assurées et plus soignées sont systématiquement préférées même quand elles sont moins bonnes, et ce biais est largement inconscient. Écrire une phrase sur ce que contiendrait une bonne réponse, avant de regarder, suffit à contrer la majeure partie de ce biais. Pour le travail factuel, jugez selon que les sources se vérifient et soutiennent l'affirmation, plutôt que selon la façon dont la réponse se lit.
Quels deux modèles dois-je comparer ?
Comparez les deux entre lesquels vous hésitez réellement pour cette tâche précise, ce qui pour la plupart des gens signifie Claude contre GPT pour la rédaction et le raisonnement, ou un modèle à grand contexte contre votre modèle par défaut quand des documents sont impliqués. Comparer un modèle que vous n'utiliseriez jamais avec votre préféré ne vous apprend rien sur quoi agir.