Jak sprawdzić, czy nowy model AI faktycznie jest lepszy do Twojej pracy

Krótka odpowiedź

Aby ocenić model AI, przetestuj go na własnej pracy, zamiast czytać benchmarki premierowe. Zbierz pięć prawdziwych zadań z ostatnich dwóch tygodni, zapisz, co powinna zawierać dobra odpowiedź, zanim cokolwiek uruchomisz, uruchom oba modele równolegle i oceniaj na podstawie nakładu pracy przy edycji, a nie tego, jak brzmi wynik. Prowadź dziennik.

Dlaczego benchmarki premierowe nie odpowiedzą na Twoje pytanie

Każda flagowa premiera przychodzi z wykresem pokazującym przewagę w zestawie standaryzowanych testów. Te liczby są prawdziwe, ale są też prawie bezużyteczne, gdy trzeba zdecydować, czego używać w poniedziałek, i to z trzech powodów.

Różnice są niewielkie, a zadania nie są Twoje. Różnica dwóch punktów w benchmarku rozumowania nic nie mówi o tym, czy jeden model napisze lepszy e-mail do klienta albo utrzyma schemat wiarygodniej w dwustu wierszach.

Benchmarki mierzą zadania, które łatwo ocenić. Rzeczy z jedną poprawną odpowiedzią. Większość pracy zawodowej takiej odpowiedzi nie ma: ton, struktura, ocena tego, co pominąć. To właśnie tam modele różnią się najbardziej i to właśnie tam nic się nie mierzy.

Porównania premierowe przygotowuje dostawca. Niekoniecznie nieuczciwie, ale nikt nie publikuje testu, w którym jego model wypadł gorzej.

Pytanie warte odpowiedzi jest węższe: który z tych dwóch modeli jest lepszy w konkretnych zadaniach, które wykonujesz dwadzieścia razy w tygodniu? Nie ma na to opublikowanej odpowiedzi, a znalezienie jej zajmuje około godziny.

Co naprawdę zwykle zmienia się między premierami

W ostatnich flagowych premierach usprawnienia, które liczą się w codziennym użyciu, konsekwentnie dotyczą tych samych obszarów i rzadko są tymi, które są eksponowane w zapowiedzi.

Co się poprawiłoJak to zauważyszCzy pokazuje to benchmark
Przestrzeganie instrukcjiModel przestaje ignorować trzeci warunekRzadko
Instrukcje negatywne"Nie używaj analogii" jest faktycznie respektowaneNie
Pamięć długiego kontekstuZnajduje informację na stronie 140, nie tylko na stronie 3Częściowo
Dyscyplina formatowaniaTabela ma dokładnie te kolumny, o które prosiłeś, za każdym razemNie
Skalibrowana niepewnośćMówi, że nie wie, zamiast zmyślaćNie
Kontrola tonuMniej poprawek, zanim coś nadaje się do wysłaniaNie
Głębia rozumowaniaWyłapuje przypadek brzegowy, który przeoczyłeśTak, to jedyne, co się mierzy

Pięć z tych siedmiu jest niewidoczne na wykresie benchmarku i to właśnie one sprawiają, że praca z nowym modelem wydaje się lepsza lub gorsza. Przestrzeganie instrukcji w szczególności jest różnicą między szkicem, który edytujesz, a szkicem, który wyrzucasz.

Godzinna ocena

Zrób to zamiast czytać relacje z premiery. Uruchom oba modele obok siebie na własnym materiale.

  1. Zbierz pięć prawdziwych zadań z ostatnich dwóch tygodni. Prawdziwych, z wklejonym rzeczywistym kontekstem, a nie zabawkowych promptów. Uwzględnij co najmniej jedno zadanie pisemne, jedno ze strukturalnym wynikiem i jedno wymagające rozumowania o czymś nieznanym.
  2. Zapisz, co powinna zawierać dobra odpowiedź dla każdego z nich, w jednym zdaniu, zanim cokolwiek uruchomisz. Ten krok chroni Cię przed preferowaniem wyniku, który jest po prostu dłuższy i bardziej pewny siebie, co jest silnym i w dużej mierze nieświadomym błędem poznawczym.
  3. Uruchom każde zadanie na obu modelach równolegle, żeby żadna odpowiedź nie zakotwiczała drugiej.
  4. Oceniaj na podstawie nakładu pracy przy edycji, czyli ile pracy dzieli wynik od czegoś, co byś wysłał. Nie tego, jak brzmi.
  5. Zanotuj wielkość różnicy, nie tylko zwycięzcę. Wymienne wyniki mówią Ci, żeby przestać zastanawiać się nad wyborem modelu do tego zadania, co jest naprawdę przydatne.
  6. Prowadź dziennik. Za trzy miesiące, gdy pojawi się kolejna premiera, ponownie uruchomisz te same pięć zadań i dostaniesz prawdziwą odpowiedź w dwadzieścia minut.

Ten ostatni punkt procentuje z czasem. Zapisany zestaw testowy to jedyna rzecz, która sprawia, że ocena każdej kolejnej premiery jest tania.

Sześć promptów, które odróżniają flagowe modele

Ogólne pytania dają podobne odpowiedzi od każdego kompetentnego modelu. Jeśli chcesz zobaczyć różnicę, wywrzyj presję na konkretną umiejętność.

  • Ton w trudnej sytuacji. Napisz wiadomość do klienta informującą, że nie dotrzymaliśmy terminu. Weź odpowiedzialność bez nadmiernych przeprosin i bez wymówek. Poniżej 120 słów. Różnice w rejestrze widać natychmiast.
  • Ograniczenie negatywne. Wyjaśnij [pojęcie] bez użycia żadnej analogii ani metafory. Przestrzeganie instrukcji negatywnych różni się znacznie bardziej, niż można by oczekiwać.
  • Ścisła ekstrakcja. Wyodrębnij każdą datę, kwotę i stronę do tablicy JSON z dokładnie tymi kluczami. Jeśli pole jest puste, użyj null. Nie zgaduj. Testuje dyscyplinę formatu i skłonność do wypełniania luk.
  • Pamięć długiego kontekstu. Prześlij długi dokument i zapytaj o coś w jego środku. Ujawnia realnie wykorzystywalny kontekst, co nie jest tym samym co deklarowany kontekst.
  • Przyznanie się do niewiedzy. Zapytaj o coś naprawdę mało znanego albo bardzo świeżego. Najlepsza odpowiedź to jasne "nie wiem" albo wyszukiwanie ze źródłem. Zmyślanie w tym miejscu dyskwalifikuje model niezależnie od jakiegokolwiek benchmarku.
  • Przestrzeganie wielu ograniczeń naraz. Podaj sześć warunków naraz i policz, ile z nich przetrwało. Ten jeden test przewiduje codzienną satysfakcję lepiej niż cokolwiek innego na tej liście.

Odpowiedź zwykle brzmi: "oba, do różnych rzeczy"

Ludzie podchodzą do premiery, chcąc usłyszeć werdykt, a uczciwy wniosek po przeprowadzeniu oceny niemal zawsze jest podzielony. Jeden model wygrywa w pisaniu i tonie. Drugi wygrywa w ścisłej strukturze i szybkości. W ogólnym rozumowaniu są na tyle blisko siebie, że to niczego nie przesądza.

To nie jest wymijająca odpowiedź, to rzeczywisty wynik, i ma praktyczne konsekwencje. Jeśli możesz używać tylko jednego modelu, wybierasz, w jakiej kategorii zadań będziesz gorszy. Jeśli możesz używać obu, pytanie przy premierze przestaje brzmieć "czy się przesiąść", a staje się "które zadania przenieść", co jest o wiele mniejszą i mniej ryzykowną decyzją.

Zmienia to też, co premiera właściwie dla Ciebie oznacza. Gdy nowe modele trafiają do przestrzeni roboczej, w której jest już kilka innych, ponownie uruchamiasz swoje pięć zadań, dostosowujesz routing i działasz dalej. Nie ma migracji, nie ma anulowanej subskrypcji i nie ma miesiąca korzystania z czegoś gorszego, bo zdecydowałeś się przed przetestowaniem.

Co zrobić w dniu premiery

Nie zmieniaj od razu domyślnych ustawień. Wrażenia z tygodnia premiery zdominowane są przez nowość i przez to, które przykłady rozeszły się najszybciej.

Ponownie uruchom swój zestaw testowy. Dwadzieścia minut, jeśli zachowałeś go z poprzedniego razu.

Sprawdź nudne rzeczy. Okno kontekstu, czy Twoje istniejące prompty nadal zachowują się tak samo i czy cokolwiek, na czym polegałeś, się zmieniło. Model, który jest ogólnie lepszy, może być gorszy w Twoim konkretnym szablonie, a warto to wiedzieć, zanim przeniesiesz na niego pracę produkcyjną.

Aktualizuj routing zadanie po zadaniu, a nie hurtowo. Przenieś kategorie, w których nowy model wyraźnie wygrał, a resztę zostaw bez zmian.

Poczekaj dwa tygodnie na ograniczenia. Słabe punkty nowego modelu wychodzą na jaw w ciągu około dwóch tygodni szerokiego użycia i rzadko są wymienione w zapowiedzi.

Ogólne ramy postępowania znajdziesz w artykule jak wybrać model AI, a mechanikę uruchamiania dwóch modeli na jednym poleceniu opisuje porównywanie modeli obok siebie.

Lista kontrolna
  • Zbuduj zestaw pięciu prawdziwych zadań z własnej pracy i zachowaj go
  • Zapisz, co powinna zawierać dobra odpowiedź, zanim przeczytasz którykolwiek wynik
  • Uruchom oba modele równolegle, żeby żaden nie zakotwiczał drugiego
  • Oceniaj na podstawie nakładu pracy przy edycji, a nie tego, jak brzmi wynik
  • Zapisuj wielkość różnicy, bo wymienne wyniki to przydatna informacja
  • Testuj szczególnie ograniczenia negatywne i przestrzeganie wielu warunków naraz
  • Poczekaj dwa tygodnie, zanim przeniesiesz pracę produkcyjną na nowy model
  • Aktualizuj routing zadanie po zadaniu, zamiast przełączać się hurtowo

Najczęstsze pytania

Czy powinienem przejść na najnowszy model?

Nie w dniu premiery i nie hurtowo. Ponownie uruchom niewielki zestaw własnych, prawdziwych zadań na obu modelach, oceń, ile edycji wymaga każdy wynik, i przenieś tylko te kategorie, w których nowy model wyraźnie wygrywa. Nowszy model jest niezawodnie lepszy w niektórych rzeczach, a czasem gorszy w innych, zwłaszcza w przypadku istniejących promptów dostrojonych pod poprzednią wersję.

Dlaczego benchmarki nie pokrywają się z moim doświadczeniem?

Ponieważ mierzą to, co da się ocenić automatycznie, czyli zadania z jedną poprawną odpowiedzią. Większość pracy zawodowej nie ma jednej poprawnej odpowiedzi, a cechy decydujące o codziennej satysfakcji, czyli przestrzeganie instrukcji, kontrola tonu, dyscyplina formatowania i umiejętność powiedzenia "nie wiem", w dużej mierze nie są mierzone. Model może prowadzić na każdym opublikowanym wykresie i wciąż być bardziej irytujący w codziennej pracy.

Jak często powinienem ponownie oceniać modele?

Zawsze, gdy model, którego używasz, otrzymuje znaczącą aktualizację, co obecnie oznacza co kilka miesięcy, a poza tym raz na kwartał niezależnie od tego. Stały zestaw pięciu prawdziwych zadań sprawia, że jest to zadanie na dwadzieścia minut, a nie na całe popołudnie, i to jedyny sposób, by zauważyć, że routing ustawiony sześć miesięcy temu jest już nieaktualny.

Czy mogę po prostu używać modelu, który wygrywa ogólnie?

Możesz, i zaakceptujesz gorsze wyniki na przewidywalnej części swojej pracy. Powtarzający się wniosek, gdy ludzie oceniają modele na własnych zadaniach, jest taki, że jeden model wygrywa w pisaniu i tonie, a drugi w ścisłej strukturze i szybkości, przy ogólnym rozumowaniu na tyle bliskim, że niczego nie przesądza. Jeśli masz dostęp do obu, wybór staje się kwestią zadania, a nie subskrypcji.

Czy ma znaczenie, przez jaki produkt korzystam z modelu?

Model to model, więc jakość wyników jest zasadniczo taka sama, niezależnie od tego, skąd z niego korzystasz. Różni się to, czy możesz porównywać, czy kontekst przenosi się przy przełączaniu i czy nowa premiera kosztuje Cię migrację, czy jest po prostu kolejną opcją na liście wyboru. Przestrzeń robocza z kilkoma modelami zamienia każdą premierę z decyzji w drobną korektę.