Коротка відповідь
Натисніть «Порівняти» (Compare) в шапці чату, оберіть модель для кожної колонки і надішліть один запит обом. Кожна колонка веде власну приховану розмову, тож жодна модель не бачить відповідь іншої і жодна відповідь не залежить від іншої, і саме тому це порівняння взагалі має сенс. Колонки виводять відповідь по черзі, спочатку ліва, потім права, оскільки одночасно на акаунт виконується лише одна генерація.
Порівняння пліч-о-пліч це функція плану Powerhouse, і воно одночасно запускає дві моделі. Кожна відповідь тарифікується за ставкою кредитів своєї моделі, тож порівняння моделі на 10 кредитів з моделлю на 20 кредитів коштує 30 кредитів.
Використовуйте його, щоб визначити, яка модель має бути вашою типовою для певного виду роботи. Якщо ви хочете покращити одну відповідь, а не порівняти дві, зробіть інше: перемкніть модель у тому самому треді і попросіть другу модель розкритикувати першу.
Чому бенчмарки не дають відповіді на ваше запитання
Опубліковані бенчмарки вимірюють продуктивність на стандартизованих завданнях. Ваше запитання вужче і корисніше: яка модель краще справляється саме з тим, що ви особисто робите двадцять разів на тиждень. Це різні запитання, і на друге немає опублікованої відповіді, бо ніхто не має саме вашого навантаження.
Запуск одного запиту для двох моделей займає близько тридцяти секунд і дає пряму відповідь. Важливо не те, що ви отримуєте дві відповіді, а те, що ви дізнаєтеся, наскільки великий розрив між ними. Іноді відповіді майже ідентичні, і це означає, що для цього завдання можна більше не думати про вибір моделі. Іноді одна з відповідей непридатна, і краще дізнатися про це до того, як ви побудуєте на ній робочий процес.
Ще одне, що виявляє порівняння, це впевнена помилка. Коли дві моделі дають суттєво різні відповіді на фактичне запитання, принаймні одна з них помиляється, і ви не дізналися б про це, читаючи лише одну відповідь. Цей сигнал недоступний у робочому процесі з однією моделлю за жодних грошей.
Визначте, що означає «краще», перш ніж читати
Пастка порівняння пліч-о-пліч у тому, що ви віддаєте перевагу тій відповіді, яка довша, впевненіша або більш відшліфована. Це не якість. Спочатку визначте свій критерій, потім читайте.
| Завдання | Що означає «краще» | Що ігнорувати |
|---|---|---|
| Написання тексту | Потребує менше редагування, щоб бути готовим до відправлення | Довжину, лексику, ентузіазм |
| Фактологічне дослідження | Джерела, які підтверджують і обґрунтовують твердження | Плавність і впевненість тону |
| Витягування даних | Правильна схема, без вигаданих полів, послідовні мітки | Якість прози навколо таблиці |
| Міркування | Кроки логічні, і враховано крайній випадок | Чи збігається висновок із вашим упередженням |
| Код | Обробляє шлях відмови, придатний до рев'ю | Витонченість, лаконічність |
| Підсумовування | Зберігає важливе і відкидає зайве | Повноту |
Практичний прийом: перш ніж читати будь-яку з відповідей, запишіть одне речення про те, що мала б містити гарна відповідь. Потім читайте. Це займає десять секунд і запобігає упередженню на користь відшліфованості, яке дуже сильне і здебільшого несвідоме.
Для фактичних питань перевіряйте розбіжність, а не переможця. Якщо дві моделі погоджуються щодо конкретного числа і джерела, впевненість цілком виправдана. Якщо вони розходяться, саме це варто перевірити, і це найцінніший результат усієї вправи.
Запити, які виявляють реальні відмінності
Деякі завдання чітко розділяють моделі, а деякі ні. Якщо хочете дізнатися щось із порівняння, використовуйте запити, які тиснуть на конкретну здатність моделі.
- Тон у складній ситуації.
Напиши лист клієнту з поясненням, що ми пропустили дедлайн, візьми на себе відповідальність без надмірних вибачень і без виправдань. Не більше 120 слів.Тут відмінності в регістрі стилю проявляються одразу. - Сувора екстракція.
Витягни кожну дату, суму й сторону з цього тексту у JSON-масив із саме цими ключами. Якщо поле відсутнє, використай null. Не додумуй.Перевіряє дисципліну формату і схильність вигадувати. - Міркування з пасткою. Дайте задачу з правдоподібною неправильною відповіддю, наприклад питання про ставку чи пропорцію, де інтуїтивний шлях невірний. Моделі відрізняються тим, чи вони йдуть коротким шляхом.
- Пригадування довгого контексту. Завантажте довгий документ і запитайте про щось із середини. Показує реальний придатний до використання контекст, а не заявлений.
- Визнання незнання.
Що було оголошено про [щось справді маловідоме або дуже нещодавнє]?Найкраща відповідь це чітке «я не знаю» або пошук із джерелом. Вигадування тут дискваліфікує. - Дотримання негативного обмеження.
Поясни X, не використовуючи жодної аналогії чи метафори.Дотримання негативних інструкцій варіюється більше, ніж можна очікувати.
Робіть порівняння на своїй реальній роботі, а не на головоломках. Модель, яка краща у вашому квартальному звіті, корисніша за ту, яка краща в логічній загадці.
Як перетворити тиждень порівнянь на карту маршрутизації
Одне порівняння цікаве. Тиждень порівнянь дає план дій. Ось процедура:
- Протягом п'яти днів, коли завдання важливе, запускайте його на двох моделях замість однієї.
- Занотуйте тип завдання, переможця і наскільки великим був розрив. Досить трьох слів.
- Наприкінці тижня подивіться, де одна модель перемагала стабільно, а де відповіді були взаємозамінні.
- Встановіть свої типові моделі на основі цього і припиніть порівнювати завдання, де розрив стабільно був нульовим.
Зазвичай люди виявляють, що порівняння важливе лише для меншості їхньої роботи, а на решту це марна трата часу. Швидкі фактологічні пошуки, прості переписування і рутинне форматування рідко розділяють моделі. Текст, який читатиме клієнт, дослідження, яке вплине на рішення, і міркування про щось незнайоме розділяють їх сильно.
Саме в цьому й полягає вигода: ви перестаєте порівнювати там, де це не має значення, і залишаєте порівняння для завдань, де воно змінює результат.
Пліч-о-пліч проти послідовного підходу
Дві різні техніки, які варто розрізняти.
Пліч-о-пліч запускає той самий запит для двох моделей, які не бачать відповідь одна одної. Кожна колонка веде власну приховану розмову з префіксом [Compare], прихованою від бічної панелі, тож наступні запитання лишаються чесним тестом: обидві моделі мають незалежний багатокроковий контекст. Це правильний інструмент для вибору типової моделі і для виявлення фактичних розбіжностей.
Послідовний підхід означає отримати відповідь, а потім перемкнути модель у тому самому треді й попросити нову модель розкритикувати її. Використовуйте його, коли хочете знайти помилку, а не зробити порівняння, бо друга модель може безпосередньо розібрати конкретний аргумент. Див. перемикання моделей посеред розмови.
Приблизне правило: пліч-о-пліч, щоб вирішити, яку модель обрати, послідовний підхід, щоб покращити відповідь.
- Напишіть і відшліфуйте запит у звичайному чаті перед порівнянням
- Визначте, що означає «краще» для цього завдання, перш ніж читати будь-яку з відповідей
- Запишіть одне речення про те, якою має бути гарна відповідь, а потім читайте, щоб уникнути упередження на користь відшліфованості
- У фактичних питаннях сприймайте розбіжність як результат і перевіряйте її
- Порівнюйте на своїй реальній роботі, а не на головоломках
- Записуйте переможця і розмір розриву протягом тижня, а потім встановлюйте типові моделі на основі закономірності
- Припиніть порівнювати завдання, де розрив стабільно нульовий
Поширені запитання
Скільки моделей можна порівнювати одночасно?
Порівняння пліч-о-пліч це функція плану Powerhouse, і воно запускає дві моделі одночасно, і це навмисно: дві колонки це макет, який можна справді уважно прочитати. Три колонки зазвичай призводять до побіжного перегляду, а побіжний перегляд руйнує саму мету, адже цінність цієї вправи в тому, щоб помітити, де відповіді справді відрізняються.
Чи витрачає порівняння пліч-о-пліч більше моїх місячних повідомлень?
Так, це коштує вдвічі більше: кожна з двох моделей видає власну відповідь, і кожна відповідь тарифікується за ставкою кредитів своєї моделі, тож порівняння моделі на 10 кредитів з моделлю на 20 кредитів витрачає 30 кредитів, а не 10 чи 20. Виявити неправильну відповідь або непридатний чернетковий варіант до його використання зазвичай того варте. Ефективний підхід це порівнювати на рішеннях і результатах роботи, а для рутинних пошуків і швидких переписувань використовувати одну модель.
Що, якщо обидві відповіді однаково гарні?
Це реальний і корисний результат: він показує, що це завдання не залежить від вибору моделі, тож перестаньте витрачати на нього увагу і використовуйте свою типову модель. Більшість робочих навантажень діляться саме так: більшість завдань, де моделі взаємозамінні, і меншість, де розрив великий. З'ясувати, де саме що, це і є сенс проведення порівнянь протягом тижня.
Як уникнути того, щоб просто обирати відповідь, яка звучить краще?
Визначте свій критерій перед тим, як читати. Довшим, впевненішим і більш відшліфованим відповідям систематично надають перевагу, навіть коли вони гірші, і це упередження здебільшого несвідоме. Написання одного речення про те, що мала б містити гарна відповідь, перш ніж дивитися, достатньо, щоб протидіяти більшій частині цього ефекту. Для фактологічної роботи оцінюйте, чи джерела підтверджують і обґрунтовують твердження, а не те, як звучить відповідь.
Які дві моделі варто порівнювати?
Порівнюйте ті дві моделі, між якими ви справді вагаєтеся для конкретного завдання, а для більшості людей це Claude проти GPT для написання текстів і міркування, або модель з великим контекстом проти вашої типової, коли йдеться про документи. Порівняння моделі, яку ви ніколи не використали б, з вашою улюбленою не дає жодної інформації, на основі якої можна діяти.