Как использовать несколько нейросетей вместе (4 работающие схемы)

Четыре практичных рабочих процесса, чтобы задействовать больше одной модели ИИ в одной задаче, включая проход с критикой и проверку расхождений, которая ловит уверенные ошибки.

Почему одной модели мало

Обычный аргумент в пользу нескольких моделей ИИ звучит так: каждая в чём-то сильнее остальных, значит под каждую задачу надо брать лучшую. Это правда, но это самая скучная из причин.

Причина поинтереснее: модель не видит собственных слепых зон. Попросите модель проверить свою же работу, и она в основном её подтвердит, потому что те же веса, что породили ошибку, породили и уверенность в ней. Спросите другую модель, обученную иначе, на других данных и с другими типами сбоев, и она заметит то, чего не могла заметить первая. Это не фокус. По той же причине вы просите коллегу прочитать письмо, прежде чем отправить его клиенту.

Вторая причина практическая: лидерство среди моделей постоянно меняется. Тот, кто лучше всех пишет код в этом квартале, может уступить в следующем. Рабочий процесс, построенный на одном поставщике, приходится перестраивать при каждом сдвиге в рейтинге. Рабочий процесс, построенный на самой идее смены моделей, такой проблемы не знает.

Дальше идут четыре схемы, в порядке пользы относительно затраченных усилий. Все четыре вам не нужны. Большинство получает почти всё от первых двух.

Схема 1: черновик, затем критика другой моделью

Самая ценная схема и та, которой почти никто не пользуется. Пишете одной моделью, разбираете другой.

Работает потому, что создавать и оценивать, это разные задачи. Модель, порождающая текст, оптимизирует связное продолжение. Модель, оценивающая чужой текст, ничего не вложила в этот аргумент, поэтому она скажет, что третий абзац не следует из предыдущего, вместо того чтобы сгладить нестыковку.

Промпт здесь решает всё. Вопрос «что думаешь об этом тексте?» принесёт вам комплименты. Просите иначе:

Текст ниже написан не тобой, и у тебя нет в нём никакого интереса. Разбери его как скептичный редактор. Перечисли по порядку: 1) любое фактическое утверждение, которое неверно, ничем не подкреплено или слишком категорично, 2) любое место, где вывод на самом деле не следует из сказанного, 3) единственный самый слабый абзац и в чём именно его слабость. Ничего не переписывай. Не рассказывай мне, что здесь хорошо.

Настоящую работу делают три указания в конце. «Ничего не переписывай» не даёт модели выдать свою версию текста собственным голосом, а вы просили не об этом. «Не рассказывай, что хорошо» убирает рефлекторную похвалу, которой набита большая часть отзывов от ИИ. «Это написал не ты», на удивление действенная рамка, потому что она мешает модели защищать решения, которые она считает своими.

Затем отнесите критику обратно первой модели, вместе с той её частью, с которой вы согласны. Редактор здесь вы, и вы решаете, какие замечания принять. Это ровно то разделение труда, которое нужно.

Где эти лишние две минуты окупаются: всё, что идёт клиенту, всё публичное, всё, где ошибка стоит дорого. Где нет: сообщение в мессенджере, черновой план, список покупок.

Схема 2: проверка расхождений

Это самое близкое к надёжному детектору галлюцинаций, что не требует ручной проверки всего подряд.

Задайте двум разным моделям один и тот же фактический вопрос, независимо и одним и тем же промптом. Потом сравните. Там, где они сходятся, скорее всего всё в порядке. Там, где расходятся, вы нашли ровно то место, которое надо проверить.

В этом вся техника, и она работает потому, что галлюцинации обычно не совпадают. Когда модель выдумывает статистику, название дела, сигнатуру функции или дату, другая модель, обученная иначе, редко выдумывает то же самое. Совпадение, это слабое свидетельство правоты. Расхождение, это сильное свидетельство того, что где-то ошибка, и оно указывает прямо на неё.

Если утверждений много, пусть сравнение сделает работу за вас:

Ниже два ответа на один и тот же вопрос, помеченные A и B. Игнорируй стиль и длину. Перечисли все содержательные расхождения между ними, включая различия в числах, датах, именах и в том, насколько категорично что-то утверждается. По каждому расхождению скажи, что вероятнее верно и какой один источник закрыл бы вопрос.

На выходе у вас короткий список того, что надо проверить, вместо длинного документа для фактчекинга, и этот список обычно точно указывает, где проблемы.

Два предупреждения. Первое: модели могут разделять одну и ту же ошибку, если она широко распространена в интернете, так что метод ловит выдумку, а не массовое заблуждение. Второе: не пропускайте проверку только потому, что две модели сошлись. Приём сужает область проверки, но не отменяет её.

Применяйте к статистике, юридическим и медицинским утверждениям, историческим фактам, деталям API и всему, что вам потом процитируют. Пропускайте на мнениях, творческих задачах и всём, где достаточно быть примерно правым.

Схема 3: маршрутизация по задачам

Очевидная схема, которую стоит применять всерьёз. Отправляйте каждый тип работы модели, которая справляется с ним лучше всех, а не той, что просто открыта в соседней вкладке.

ЗадачаК кому идтиПочему
Первый черновик любого текстаСамая сильная модель для письмаВы покупаете сокращение времени на правку
Разбор этого черновикаДругая модельСвежий взгляд, другие типы сбоев
Всё про эту неделюМодель с живым поискомОбучающие данные всегда отстают
Очень длинный документ или кодовая базаМодель с большим контекстомСначала текст должен поместиться, только потом его поймут
Сложная логика, математика или хитрый багМодель для рассуждений с расширенным размышлениемМедленнее и заметно точнее на многошаговых задачах
Однотипная работа в больших объёмахДешёвая быстрая модельТоповое качество пропадает зря на классификации и разметке
Всё чувствительноеТа, что проходит по вашим правилам работы с даннымиВозможности не отменяют ваших обязательств

Одна привычка, которую стоит выработать: перестаньте ходить по умолчанию. Большинство людей используют ту модель, что досталась им с подпиской, вообще для всего, включая задачи, в которых она слаба, и делают вывод, что ИИ с такими задачами не справляется. Десять секунд размышления о том, какая модель подходит, меняют результат сильнее, чем час доработки промпта.

Развёрнутая версия этого решения, это как выбрать модель ИИ, а что такое контекстное окно объясняет, откуда взялась строка про длинные документы.

Схема 4: эстафета с письменной передачей

Когда работа идёт в несколько этапов, ломается всё на стыках. Вы объясняете проект одной модели, доходите до чего-то полезного, потом переходите к другой и либо вставляете простыню из всей переписки, либо заново и коряво объясняете всё с нуля.

Лечится тем, что вы просите передачу явно, до переключения:

Напиши бриф для передачи другому ассистенту, который не видел этот разговор. Включи: что мы пытаемся получить, какие решения уже приняты и почему, ограничения и то, чего надо избегать, что уже пробовали и отвергли, и что именно мне нужно дальше. Напиши достаточно конкретно, чтобы он мог продолжить, не задавая мне ни одного вопроса.

Это полезно, даже если вы не меняете модель. Это самый чистый способ выбраться из длинного разговора, который стал медленным и расплывчатым: вы сохраняете суть и выбрасываете накопившийся шум. Вставьте бриф в новый чат, и качество обычно подскакивает сразу.

Реалистичная эстафета выглядит так. Отдайте отчёт на 200 страниц модели с большим контекстом и попросите структурированное краткое изложение с десятью значимыми фрагментами, приведёнными дословно. Возьмите их в сильную модель для письма и сделайте записку для клиента. Прогоните проход с критикой из первой схемы через третью модель. Всего минут пятнадцать, и на каждом этапе работал подходящий инструмент.

Когда не стоит заморачиваться

У мультимодельных рабочих процессов есть накладные расходы, и если делать вид, что их нет, дело кончается изощрённым процессом ради письма в две строки.

Одной модели достаточно, когда: задача маленькая, цена ошибки низкая, вы скорее исследуете, чем производите, вы быстро итерируете и лишнее трение сбило бы вам темп, или работа по-настоящему творческая и второе мнение только замылит ваш голос.

Две и больше нужны, когда: результат уходит другому человеку, важна фактическая точность, у задачи есть отдельные этапы, требующие разных сильных сторон, вы застряли и вам нужен по-настоящему другой угол зрения, или вы собираетесь принять решение на основе того, что сказала модель.

Разумное правило: если вы попросили бы посмотреть коллегу, спросите вторую модель. Если не попросили бы, не спрашивайте.

Как это делать без мучений

В теории всё это просто, а на практике раздражает, если каждая модель живёт за отдельной подпиской. Трение вполне реальное: отдельные вкладки, отдельные истории, перенос контекста между ними, слетевшее форматирование и то самое небольшое сопротивление, из-за которого вы пропускаете проход с критикой ровно в тот день, когда он нужнее всего.

Именно из-за этого трения схемы выше используют так редко. Они не сложные, они просто достаточно муторные, чтобы их пропустить, когда вы заняты.

Ради этого и существует мультимодельное рабочее пространство. В Whizi модели живут в одном разговоре, поэтому проход с критикой, это смена модели и ещё один вопрос, а не открытие другого продукта и вставка туда своего черновика. Одна история, один поиск по всему, что вы когда-либо спрашивали, один счёт. Как именно работают эти два шага, смотрите в материалах переключение моделей посреди разговора и сравнение моделей бок о бок.

Если вы предпочитаете собрать всё сами из отдельных подписок, эти схемы всё равно работают, и пользоваться ими всё равно стоит. Меняется только то, насколько часто вам хватит на это сил. Если вы уже платите за два-три тарифа, чтобы всё это было возможно, сначала прогоните калькулятор экономии, потому что обычно это более дорогой способ получить тот же результат.

Начните со схемы один. Возьмите следующий текст, который вы напишете и который прочитает кто-то ещё, прогоните промпт с критикой через другую модель и посмотрите, что она найдёт. Одна эта привычка стоит больше, чем вся остальная статья.

Чек-лист
  • Пишите черновик одной моделью и отдавайте его на критику другой, прежде чем что-то уйдёт наружу
  • Используйте промпт для критики, который запрещает переписывать и запрещает хвалить
  • Задавайте двум моделям один и тот же фактический вопрос и проверяйте каждое расхождение
  • Направляйте длинные документы, сложную логику и вопросы о свежих событиях подходящим моделям
  • Просите письменный бриф для передачи перед сменой модели или началом нового чата
  • Пропускайте всё это на мелких, малорисковых или исследовательских задачах

Частые вопросы

Зачем использовать больше одной модели ИИ?

Потому что модель не видит собственных слепых зон. Вторая модель, обученная иначе, ловит ошибки, в которых первая была уверена. Плюс ваш рабочий процесс перестаёт ломаться каждый раз, когда в какой-то задаче вперёд выходит другая лаборатория.

Как поймать галлюцинации нейросети?

Задайте двум разным моделям один и тот же вопрос независимо друг от друга и сравните ответы. Выдуманные факты редко выдумываются одинаково дважды, поэтому проверять надо там, где ответы расходятся. Совпадение сужает область проверки, но не отменяет её.

Какая модель должна писать, а какая проверять?

Черновик делайте той моделью, которая требует наименьшей правки для вашего типа работы, обычно это сильная модель для письма, а на разбор отдавайте другую. Кто именно проверяет, важно меньше, чем сам факт, что это другая модель с другими типами сбоев.

Стоит ли работа с несколькими моделями потраченного времени?

Для всего, что уходит другому человеку или с чего вас потом спросят, да, и проход с критикой занимает около двух минут. Для быстрых, малорисковых или исследовательских задач это лишние накладные расходы. Если вы попросили бы проверить коллегу, спросите вторую модель.

Нужно ли для этого несколько подписок?

Нет. Мультимодельное рабочее пространство даёт вам основные модели на одном тарифе и с одной историей, что убирает трение, из-за которого эти шаги пропускают. Отдельные подписки тоже работают, просто с ними полезные привычки удерживать труднее.