Yeni bir yapay zeka modelinin işiniz için gerçekten daha iyi olup olmadığını nasıl anlarsınız

Hızlı yanıt

Bir yapay zeka modelini değerlendirmek için lansman kıyaslamalarını okumak yerine onu kendi işinizde test edin. Son iki haftadan beş gerçek görev toplayın, herhangi bir şey çalıştırmadan önce iyi bir yanıtın neler içermesi gerektiğini yazın, iki modeli paralel olarak çalıştırın ve çıktının nasıl okunduğuna değil düzenleme eforuna göre puanlayın. Kaydı saklayın.

Lansman kıyaslamaları sorunuzu neden yanıtlamayacak

Her öncü sürüm, standartlaştırılmış bir dizi değerlendirmede önde olduğunu gösteren bir grafikle gelir. Bu sayılar gerçektir, ama Pazartesi günü ne kullanmanız gerektiğine karar vermek için de üç nedenden ötürü neredeyse işe yaramazdır.

Farklar küçüktür ve görevler size ait değildir. Bir akıl yürütme kıyaslamasındaki iki puanlık fark, bir modelin daha iyi bir müşteri e-postası yazıp yazmadığı ya da iki yüz satır boyunca bir şemayı daha güvenilir şekilde koruyup korumadığı hakkında size hiçbir şey söylemez.

Kıyaslamalar, puanlanması kolay görevleri ölçer. Doğru cevabı olan şeyleri. Profesyonel işlerin çoğunun tek bir doğru cevabı yoktur: ton, yapı, neyin dışarıda bırakılacağına dair muhakeme. Modellerin en çok farklılaştığı ve hiçbir şeyin ölçülmediği yer tam olarak burasıdır.

Lansman karşılaştırmalarını satıcı yapar. Bu mutlaka dürüst olmadığı anlamına gelmez, ama kimse kendi modelinin ikinci geldiği değerlendirmeyi yayınlamaz.

Yanıtlanmaya değer soru daha dardır: haftada yirmi kez yaptığınız belirli görevlerde, bu ikisinden hangisi daha iyi? Bunun yayınlanmış bir cevabı yoktur ve öğrenmek yaklaşık bir saat sürer.

Sürümler arasında gerçekte neyin değiştiği

Son öncü sürümlerde, günlük kullanımda önem taşıyan iyileştirmeler istikrarlı biçimde aynı alanlarda olur ve bunlar duyuruda öne çıkarılanlar nadiren olur.

Ne iyileştiNasıl fark edersinizKıyaslama bunu gösteriyor mu
Talimatlara uyumÜçüncü kısıtınızı görmezden gelmeyi bırakırNadiren
Olumsuz talimatlar"Analoji kullanma" talimatına gerçekten uyulurHayır
Uzun bağlam hatırlama140. sayfadaki şeyi bulur, sadece 3. sayfadakini değilKısmen
Biçimlendirme disipliniTablo, her seferinde istediğiniz sütunlara sahiptirHayır
Kalibre edilmiş belirsizlikUydurmak yerine bilmediğini söylerHayır
Ton kontrolüGönderilebilir hale gelmeden önce daha az yeniden yazımHayır
Akıl yürütme derinliğiKaçırdığınız uç durumu yakalarEvet, ölçtükleri şey tam olarak bu

Bu yedi maddeden beşi bir kıyaslama grafiğinde görünmezdir ve yeni bir modelin çalışması daha iyi ya da daha kötü hissettirmesinin nedeni tam da budur. Özellikle talimatlara uyum, düzenlediğiniz bir taslakla çöpe attığınız bir taslak arasındaki farktır.

Bir saatlik değerlendirme

Lansman haberlerini okumak yerine bunu yapın. İki modeli kendi materyaliniz üzerinde yan yana çalıştırın.

  1. Beş gerçek görev toplayın, son iki haftadan. Gerçek görevler olsun, oyuncak istemler değil, gerçek bağlamınız yapıştırılmış olsun. En az bir yazma görevi, bir yapılandırılmış çıktı görevi ve aşina olmadığınız bir konuda akıl yürütme gerektiren bir görev ekleyin.
  2. İyi bir yanıtın neler içerdiğini yazın, her biri için tek cümleyle, herhangi bir şey çalıştırmadan önce. Bu adım, hangi çıktının daha uzun ve daha kendinden emin olduğunu tercih etmenizi önler; bu güçlü ve büyük ölçüde bilinçsiz bir önyargıdır.
  3. Her görevi iki modele karşı paralel olarak çalıştırın, böylece hiçbir yanıt diğerinden etkilenmez.
  4. Düzenleme eforuna göre puanlayın, yani çıktı ile göndereceğiniz bir şey arasındaki iş miktarına göre. Nasıl okunduğuna göre değil.
  5. Sadece kazananı değil, fark büyüklüğünü de not edin. Birbirinin yerine geçebilir sonuçlar, o görev için model seçimini düşünmeyi bırakmanız gerektiğini söyler; bu gerçekten faydalıdır.
  6. Kaydı saklayın. Üç ay sonra bir sonraki sürüm çıktığında, aynı beş görevi yeniden çalıştırır ve yirmi dakikada gerçek bir cevap alırsınız.

Son madde, katlanarak fayda sağlayan maddedir. Kayıtlı bir değerlendirme seti, sonraki her sürümü değerlendirmeyi ucuz hale getiren tek şeydir.

Öncü modelleri birbirinden ayıran altı istem

Genel sorular, yetenekli her modelden benzer yanıtlar üretir. Bir fark görmek istiyorsanız, belirli bir yeteneğe baskı uygulayın.

  • Zorluk altında ton. Bir müşteriye teslim tarihini kaçırdığımızı bildiren bir not yaz. Aşırı özür dilemeden ve mazeret göstermeden sorumluluğu üstlen. 120 kelimenin altında. Ton farkları hemen ortaya çıkar.
  • Olumsuz kısıt. [Kavramı] hiçbir analoji veya metafor kullanmadan açıkla. Olumsuz talimatlara uyum, beklediğinizden çok daha fazla değişir.
  • Sıkı çıkarım (extraction). Her tarihi, tutarı ve tarafı tam olarak bu anahtarlarla bir JSON dizisine çıkar. Bir alan yoksa null kullan. Çıkarım yapma. Biçim disiplinini ve boşlukları doldurma eğilimini test eder.
  • Uzun bağlam hatırlama. Uzun bir belge yükleyin ve ortasındaki bir şey hakkında soru sorun. Kullanılabilir bağlamı ortaya çıkarır, bu da reklamı yapılan bağlamla aynı şey değildir.
  • Bilmediğini kabul etme. Gerçekten belirsiz veya çok yeni bir şey hakkında soru sorun. En iyi yanıt net bir "bilmiyorum" ya da kaynaklı bir alım (retrieval) sonucudur. Buradaki uydurma, herhangi bir kıyaslamadan bağımsız olarak diskalifiye edicidir.
  • Çoklu kısıt uyumu. Aynı anda altı kısıt verin ve kaçının hayatta kaldığını sayın. Bu tek test, listedeki diğer her şeyden daha iyi günlük memnuniyeti tahmin eder.

Yanıt genellikle "ikisi de, farklı şeyler için"dir

İnsanlar bir sürüme bir hüküm bekleyerek yaklaşır, ancak değerlendirmeyi çalıştırdıktan sonraki dürüst bulgu neredeyse her zaman bölünmüştür. Bir model yazım ve tonda kazanır. Diğeri sıkı yapı ve hızda kazanır. Genel akıl yürütmede o kadar yakındırlar ki bu hiçbir şeye karar vermez.

Bu bir kaçamak değil, gerçek sonuçtur ve pratik bir sonucu vardır. Yalnızca bir model kullanabiliyorsanız, hangi görev kategorisinde daha kötü olacağınızı seçiyorsunuz demektir. İkisini de kullanabiliyorsanız, sürüm sorusu "değiştirmeli miyim" olmaktan çıkıp "hangi görevler değişiyor" haline gelir; bu çok daha küçük ve daha düşük riskli bir karardır.

Bu aynı zamanda bir sürümün sizin için ne anlama geldiğini de değiştirir. Zaten birden fazla modelin bulunduğu bir çalışma alanına yeni modeller geldiğinde, beş görevinizi yeniden çalıştırır, yönlendirmenizi ayarlar ve devam edersiniz. Ortada bir geçiş, iptal edilen bir abonelik ya da test etmeden önce taahhüt ettiğiniz için bir ay boyunca daha kötü bir şey kullanmak yoktur.

Sürüm gününde ne yapmalı

Varsayılanlarınızı hemen değiştirmeyin. Lansman haftasındaki izlenimlere yenilik ve ilk dolaşıma giren örnekler hakimdir.

Değerlendirme setinizi yeniden çalıştırın. Bir öncekinden saklamışsanız yirmi dakika sürer.

Sıkıcı şeyleri kontrol edin. Bağlam penceresini, mevcut istemlerinizin hâlâ aynı şekilde davranıp davranmadığını ve güvendiğiniz herhangi bir şeyin değişip değişmediğini. Genel olarak daha iyi bir model, sizin özel şablonunuzda daha kötü olabilir ve üretim işini ona taşımadan önce bunu bilmekte fayda vardır.

Yönlendirmeyi topluca değil, görev bazında güncelleyin. Yeni modelin açıkça kazandığı kategorileri taşıyın, geri kalanını bırakın.

Sınırlamalar için iki hafta bekleyin. Yeni bir modelin başarısızlık biçimleri, yaygın kullanımın yaklaşık iki haftası içinde ortaya çıkar ve bunlar duyuruda nadiren yer alır.

Genel çerçeve için bir yapay zeka modeli nasıl seçilir sayfasına, tek bir istemde iki modeli çalıştırmanın mekaniği için ise modelleri yan yana karşılaştırma sayfasına bakın.

Kontrol listesi
  • Kendi işinizden beş gerçek görevden oluşan bir set oluşturun ve saklayın
  • Her iki çıktıyı da okumadan önce iyi bir yanıtın neler içerdiğini yazın
  • Hiçbiri diğerini etkilemesin diye iki modeli paralel çalıştırın
  • Çıktının nasıl okunduğuna değil, düzenleme eforuna göre puanlayın
  • Fark büyüklüğünü kaydedin, çünkü birbirinin yerine geçebilir sonuçlar faydalı bilgidir
  • Özellikle olumsuz kısıtları ve çoklu kısıt uyumunu test edin
  • Üretim işini yeni bir modele taşımadan önce iki hafta bekleyin
  • Topluca değiştirmek yerine yönlendirmeyi görev bazında güncelleyin

Sık sorulan sorular

En yeni modele geçmeli miyim?

Lansman gününde değil, topluca da değil. Kendi gerçek görevlerinizden küçük bir seti her ikisine karşı yeniden çalıştırın, her çıktının ne kadar düzenleme gerektirdiğine göre puanlayın ve yalnızca yeni modelin açıkça kazandığı kategorileri taşıyın. Daha yeni model bazı şeylerde güvenilir şekilde daha iyidir, ancak özellikle önceki sürüme göre ayarlanmış mevcut istemler için bazı şeylerde arada bir daha kötü olabilir.

Kıyaslamalar neden deneyimimle uyuşmuyor?

Çünkü otomatik olarak puanlanabilen şeyleri ölçerler, bu da doğru cevabı olan görevler demektir. Profesyonel işlerin çoğunun tek bir doğru cevabı yoktur ve günlük memnuniyete karar veren nitelikler, yani talimatlara uyum, ton kontrolü, biçimlendirme disiplini ve ne zaman "bilmiyorum" diyeceğini bilmek, büyük ölçüde ölçülmez. Bir model yayınlanan her grafikte önde olabilir ve yine de çalışması daha sinir bozucu olabilir.

Ne sıklıkla yeniden değerlendirmeliyim?

Kullandığınız bir model önemli bir sürüm aldığında, bu şu anda birkaç ayda bir anlamına gelir, buna ek olarak durum ne olursa olsun üç ayda bir. Sabit beş gerçek görevden oluşan bir set tutmak, bunu bir öğleden sonra işi yerine yirmi dakikalık bir işe dönüştürür ve altı ay önce belirlediğiniz yönlendirmenin artık yanlış olduğunu fark etmenin tek yoludur.

Genel olarak hangisi kazanıyorsa onu mu kullanabilirim?

Kullanabilirsiniz, ancak işinizin öngörülebilir bir kısmında daha kötü sonuçları kabul etmiş olursunuz. İnsanlar kendi görevlerinde değerlendirme yaptığında ortaya çıkan tutarlı bulgu, bir modelin yazım ve tonda kazanırken diğerinin sıkı yapı ve hızda kazandığı, genel akıl yürütmenin ise hiçbir şeye karar vermeyecek kadar yakın olduğudur. İkisi de elinizdeyse, seçim abonelik başına değil görev başına hale gelir.

Modele hangi ürün üzerinden eriştiğim önemli mi?

Model modeldir, dolayısıyla nereden eriştiğinizde çıktı kalitesi genel olarak aynıdır. Değişen şey, karşılaştırma yapıp yapamayacağınız, geçiş yaptığınızda bağlamın taşınıp taşınmadığı ve yeni bir sürümün size bir geçiş maliyeti mi getirdiği yoksa seçicide sadece başka bir seçenek mi olduğudur. Birden fazla modeli olan bir çalışma alanı, her sürümü bir karardan bir ayarlamaya dönüştürür.