Как сравнивать AI модели бок о бок в Whizi

Краткий ответ

Чтобы сравнить AI модели бок о бок в Whizi, нажмите Compare в шапке чата, выберите модель для каждой колонки и отправьте один промпт обеим сразу. Каждая колонка хранит свой собственный контекст, поэтому ни один ответ не влияет на другой. Сравнение бок о бок это функция Powerhouse, и каждый ответ тарифицируется по кредитной ставке своей модели.

Короткий ответ

Нажмите Compare в шапке чата, выберите модель для каждой колонки и отправьте один промпт обеим сразу. Каждая колонка ведёт свой скрытый диалог, поэтому ни одна модель не видит ответ другой и ни один ответ не привязан к другому, в этом и есть весь смысл сравнения. Колонки выводят ответ по очереди, сначала левая, затем правая, потому что на аккаунт одновременно выполняется только одна генерация.

Сравнение бок о бок это функция Powerhouse, и оно запускает две модели одновременно. Каждый ответ оплачивается по кредитной ставке своей модели, поэтому сравнение модели за 10 кредитов с моделью за 20 кредитов обойдётся в 30 кредитов.

Используйте его, чтобы решить, какая модель должна быть у вас по умолчанию для определённого типа задач. Если вам нужно улучшить один ответ, а не сравнить два, поступите иначе: переключите модель внутри того же треда и попросите вторую раскритиковать первую.

Почему бенчмарки не отвечают на ваш вопрос

Опубликованные бенчмарки измеряют производительность на стандартизированных задачах. Ваш вопрос уже и полезнее: какая модель лучше справляется с тем, что вы лично делаете двадцать раз в неделю. Это разные вопросы, и на второй нет опубликованного ответа, потому что вашей рабочей нагрузки ни у кого больше нет.

Запустить один промпт на двух моделях занимает секунд тридцать и отвечает на вопрос напрямую. Важно не то, что вы получаете два ответа, а то, что вы узнаёте, насколько велик разрыв. Иногда ответы почти идентичны, и это говорит вам перестать думать о выборе модели для этой задачи. Иногда один ответ непригоден, и это стоит знать до того, как вы построите на нём рабочий процесс.

Ещё одна вещь, которую ловит сравнение, это уверенная ошибка. Когда две модели дают существенно разные ответы на фактический вопрос, хотя бы одна из них ошибается, и вы бы не узнали об этом, читая только одну из них. Этот сигнал недоступен в однмодельном рабочем процессе ни при каких затратах.

Решите, что значит «лучше», до того как читать

Ловушка сравнения бок о бок в том, чтобы предпочитать тот ответ, который длиннее, увереннее или отполированнее. Это не качество. Сначала определите свой критерий, потом читайте.

ЗадачаЧто значит «лучше»Что игнорировать
Написание текстаТребует меньше правок, чтобы быть готовым к отправкеДлину, лексику, воодушевление
Фактический поискИсточники, которые проверяются и подтверждают утверждениеБеглость и уверенность
Извлечение данныхПравильная схема, без придуманных полей, единообразные меткиКачество прозы вокруг таблицы
РассуждениеШаги логичны, и пограничный случай учтёнСовпадает ли вывод с вашим ожиданием
КодОбрабатывает путь ошибки, поддаётся ревьюИзощрённость, лаконичность
СуммаризацияСохраняет важное и отбрасывает лишнееПолноту охвата

Практический приём: до того как прочитать любой из ответов, запишите одно предложение о том, что должен содержать хороший ответ. Затем читайте. Это занимает десять секунд и предотвращает предвзятость к «отполированности», которая сильна и в основном неосознанна.

Для фактических вопросов проверяйте расхождение, а не победителя. Там, где две модели согласны в конкретном числе и источнике, уверенность оправдана. Там, где они расходятся, это и есть то, что стоит проверить, и это самый ценный результат всего упражнения.

Промпты, выявляющие реальные различия

Некоторые задачи резко разделяют модели, а некоторые нет. Если вы хотите чему-то научиться из сравнения, используйте промпты, которые нагружают конкретную способность.

  • Тон в сложной ситуации. Write a note to a client explaining that we missed the deadline, taking responsibility without over-apologising and without excuses. Under 120 words. Различия в регистре проявляются здесь сразу.
  • Строгое извлечение. Extract every date, amount, and party from this text into a JSON array with exactly these keys. If a field is absent, use null. Do not infer. Проверяет дисциплину формата и склонность придумывать.
  • Рассуждение с ловушкой. Дайте задачу с правдоподобным неверным ответом, например вопрос на ставку или пропорцию, где интуитивный путь неверен. Модели различаются в том, идут ли они коротким путём.
  • Запоминание длинного контекста. Загрузите длинный документ и спросите о чём-то из середины. Показывает реальный доступный контекст, а не заявленный.
  • Признание незнания. What was announced about [something genuinely obscure or very recent]? Лучший ответ это чёткое «я не знаю» или ответ с источником. Выдумка здесь дисквалифицирует модель.
  • Соблюдение негативного ограничения. Explain X without using any analogy or metaphor. Соблюдение негативных инструкций варьируется сильнее, чем можно ожидать.

Проводите сравнения на своей реальной работе, а не на головоломках. Модель, которая лучше справляется с вашим квартальным отчётом, полезнее той, что лучше решает логическую загадку.

Как превратить неделю сравнений в карту маршрутизации

Одно сравнение интересно. Неделя сравнений даёт возможность действовать. Рутина такая:

  1. В течение пяти дней, когда задача важна, запускайте её на двух моделях вместо одной.
  2. Отмечайте тип задачи, победителя и насколько велик был разрыв. Достаточно трёх слов.
  3. В конце недели посмотрите, где одна модель побеждала стабильно, а где ответы были взаимозаменяемы.
  4. Установите модели по умолчанию исходя из этого и перестаньте сравнивать на задачах, где разрыв стабильно отсутствовал.

Обычно люди обнаруживают, что сравнение имеет значение для меньшинства их задач и является тратой времени на остальные. Быстрый фактический поиск, простые переписывания и рутинное форматирование редко разделяют модели. Тексты, которые прочитает клиент, исследования, влияющие на решение, и рассуждения о чём-то незнакомом разделяют их сильно.

Этот результат и есть выигрыш: вы перестаёте сравнивать там, где это не даёт разницы, и продолжаете там, где это меняет результат.

Бок о бок против последовательного подхода

Две разные техники, которые стоит различать.

Бок о бок запускает один и тот же промпт на двух моделях, которые не видят ответ друг друга. Каждая колонка ведёт свой скрытый диалог, названный с префиксом [Compare] и скрытый из боковой панели, так что дополнительные вопросы остаются честным тестом: обе модели держат независимый многоходовой контекст. Это правильный инструмент для выбора модели по умолчанию и для выявления фактических расхождений.

Последовательный подход означает получить ответ, затем переключить модель в том же треде и попросить новую раскритиковать его. Используйте его, когда вам нужно найти изъян, а не сделать сравнение, потому что вторая модель может напрямую разобрать конкретный аргумент. См. переключение моделей в середине разговора.

Приблизительное правило: бок о бок, чтобы решить, какую модель выбрать, последовательно, чтобы улучшить ответ.

Чек-лист
  • Напишите и доработайте промпт в обычном чате перед сравнением
  • Решите, что значит «лучше» для этой задачи, до того как прочитать любой из ответов
  • Запишите одно предложение о том, каким должен быть хороший ответ, затем читайте, чтобы избежать предвзятости к отполированности
  • В фактических вопросах воспринимайте расхождение как результат и проверяйте его
  • Сравнивайте на своей реальной работе, а не на головоломках
  • Ведите записи о победителе и размере разрыва неделю, затем установите настройки по умолчанию по этой закономерности
  • Перестаньте сравнивать на задачах, где разрыв стабильно отсутствует

Частые вопросы

Сколько моделей я могу сравнить одновременно?

Сравнение бок о бок это функция Powerhouse, и оно запускает две модели одновременно, это сделано намеренно: две колонки это макет, который реально можно внимательно прочитать. Три колонки обычно превращаются в беглый просмотр, а беглый просмотр сводит на нет смысл упражнения, ведь ценность в том, чтобы заметить, где ответы действительно различаются.

Тратит ли сравнение бок о бок больше моих месячных сообщений?

Да, оно стоит вдвое дороже: две модели дают по ответу каждая, и каждый ответ тарифицируется по своей кредитной ставке, поэтому сравнение модели за 10 кредитов с моделью за 20 кредитов тратит 30 кредитов, а не 10 или 20. Поймать неверный ответ или непригодный черновик до того, как он уйдёт в дело, обычно того стоит. Эффективный подход: сравнивать на решениях и итоговых результатах, а для рутинного поиска и быстрых переписываний использовать одну модель.

Что если оба ответа одинаково хороши?

Это реальный и полезный результат: он говорит вам, что эта задача не зависит от выбора модели, так что перестаньте тратить на неё внимание и используйте ту, что у вас по умолчанию. Большинство рабочих нагрузок делятся именно так: большинство задач, где модели взаимозаменяемы, и меньшинство, где разрыв велик. Выяснить, где какое, и есть смысл проведения сравнений в течение недели.

Как избежать выбора ответа только потому, что он звучит лучше?

Определите свой критерий до чтения. Более длинные, уверенные и отполированные ответы систематически предпочитают, даже когда они хуже, и эта предвзятость в основном неосознанна. Записать одно предложение о том, что должен содержать хороший ответ, до того как вы посмотрите, достаточно, чтобы противостоять большей части этого эффекта. Для фактической работы оценивайте, проверяются ли источники и подтверждают ли они утверждение, а не то, как звучит ответ.

Какие две модели мне сравнивать?

Сравнивайте те две, между которыми вы реально выбираете для конкретной задачи, для большинства людей это Claude против GPT для написания текстов и рассуждений, или модель с большим контекстом против вашей модели по умолчанию, когда задействованы документы. Сравнение модели, которую вы никогда не станете использовать, с вашей любимой не даёт ничего, на что можно опереться.