Ten sam prompt, obsłużony przez ChatGPT i Claude obok siebie.

Wybierz jeden z 3 promptów, zobacz, jak oba modele odpowiadają naraz, i zatrzymaj tę odpowiedź, którą faktycznie byś wysłał. Nic tu nie odpytuje modelu: odpowiedzi to stałe zapisy, więc strona jest darmowa i za każdym razem taka sama.

Jak to działa

Każdy prompt dostaje ocenę w skali do 100 za tę jedną rzecz, którą naprawdę sprawdza, a zwycięzcą nie zawsze jest ten sam model. I o to właśnie chodzi: ChatGPT lepiej porządkuje pracę, Claude lepiej rozstrzyga, co się liczy, a to, którego chcesz, zależy od zadania przed tobą.

To stałe przykładowe odpowiedzi, napisane po to, by pokazać, że oba modele różnią się rodzajem, a nie jakością. Nie są to odpowiedzi generowane na żywo ani benchmark.

Streść tę umowę na 40 stron

Oceniane za dokładność i selekcję

ChatGPT (OpenAI), 92/100

Oto zestawienie najważniejszych postanowień:

  • Strony: Meridian Corp (zleceniodawca) i Halcyon Ltd (wykonawca)
  • Okres: 24 miesiące, automatyczne przedłużenie bez wypowiedzenia na 60 dni przed
  • Wynagrodzenie: 12 400 USD miesięcznie z 4% podwyżką rocznie
  • Odpowiedzialność: ograniczona do 12 miesięcy wynagrodzenia
  • Rozwiązanie: przez każdą ze stron, 90 dni pisemnego wypowiedzenia

Daj znać, jeśli chcesz tabelę klauzula po klauzuli.

Claude Sonnet (Anthropic), 96/100

To umowa o świadczenie usług na 24 miesiące między Meridian Corp a Halcyon Ltd, 12 400 USD miesięcznie, rosnące o 4% rocznie.

Trzy rzeczy zasługują na uwagę przed podpisem: umowa przedłuża się sama, jeśli nie wypowiesz jej 60 dni przed końcem, odpowiedzialność jest ograniczona do rocznego wynagrodzenia, a 90-dniowy okres wypowiedzenia jest dłuższy niż zwykle.

Cała reszta to standardowe zapisy.

Werdykt: Claude wygrywa, 96 do 92. Oba podały fakty poprawnie, ale Claude powiedział, czym się martwić, zamiast wyliczać wszystko po równo.

Odmów spotkania, nie paląc mostów

Oceniane za ton i gotowość do wysłania

ChatGPT (OpenAI), 88/100

Temat: Re: Rozmowa o współpracy

Cześć [Imię],

Bardzo dziękuję za wiadomość! Niestety nie uda mi się tego zmieścić w obecnym kalendarzu. Naprawdę doceniam, że o mnie pomyślałeś, i chętnie zostawię otwarte drzwi na przyszłe okazje.

Życzę powodzenia przy projekcie!

Z pozdrowieniami,
[Twoje imię]

Claude Sonnet (Anthropic), 95/100

Cześć Dana,

Dzięki za zaproszenie. Odpuszczę czwartek, mam już przeładowany tydzień i wolę nie przyjść niż pojawić się w połowie przygotowana.

Jeśli to pomoże, mogę przejrzeć prezentację u siebie i przesłać uwagi do piątku. Jak nie, to złap mnie w następnej turze.

Noura

Werdykt: Claude wygrywa, 95 do 88. Żadnych pól do uzupełnienia, prawdziwy powód i propozycja alternatywy. Można to wysłać dokładnie tak, jak jest.

Zamień te notatki w listę zadań przed premierą

Oceniane za strukturę i przypisanie zadań

ChatGPT (OpenAI), 94/100

Lista przed premierą, według terminów:

  1. Zamrożenie zakresu (pon), odpowiedzialny: product manager
  2. Ostatnie testy płatności (wt), odpowiedzialny: zespół techniczny
  3. Materiały prasowe i zrzuty ekranu (śr), odpowiedzialny: design
  4. Zaplanowanie materiałów na Product Hunt (czw), odpowiedzialny: marketing
  5. Sztab w dniu premiery (pt), wszyscy

Chcesz to jako tabelę z kolumnami statusu?

Claude Sonnet (Anthropic), 90/100

Pięć rzeczy dzieli te notatki od piątku: zamrozić zakres w poniedziałek, żeby testerzy mieli stabilną wersję, przepuścić regresję płatności we wtorek, odebrać materiały prasowe od designu do środy, zaplanować materiały na Product Hunt w czwartek wieczorem i zostawić piątek wolny na samą premierę.

W notatkach są też ceny lokalne. Wyciąłbym je z tej premiery, nic na nich nie stoi.

Werdykt: ChatGPT wygrywa, 94 do 90. Odpowiedzialni, terminy i numerowana lista, którą wklejasz prosto do systemu zadań.

Pytania

Czy to odpytuje prawdziwe modele?

Nie. Odpowiedzi to stałe zapisy i dlatego strona ładuje się natychmiast i nic nie kosztuje. Żeby wysłać własny prompt do obu modeli naraz, otwórz Whizi.

Który model jest lepszy, ChatGPT czy Claude?

Żaden na całej linii. Na tych trzech promptach Claude wygrywa streszczenie umowy i e-mail, bo rozstrzyga, co się liczy, a ChatGPT wygrywa listę zadań, bo porządkuje pracę. Wybieranie jednego do wszystkiego to dokładnie ten błąd, o którym mówi ta strona.

Czy mogę udostępnić konkretne porównanie?

Tak. Skopiuj link do udostępnienia, a strona otworzy się na tym samym prompcie u odbiorcy.

Następny krok

Przeczytaj pełne porównanie ChatGPT i Claude albo policz koszt tego samego zadania na wszystkich modelach w Kalkulator kosztu tokenów.