Daha güçlü bir yapay zekâ modeli, daha küçük ve ucuz bir modeli yeniden eğitmeden belirgin biçimde iyileştirebilir mi? “AI4AI at Test-Time” başlıklı yeni ön baskı çalışma bu soruya kontrollü bir deneyle yanıt arıyor. Araştırmacılar güçlü “builder” modelin, zayıf hedef model için çalışma zamanında kullanılan bir harness hazırlamasını sağladı. Dört Theory of Mind testinde hedef modellerin ortalama puanı 0,49’dan 0,91’e yükseldi.
Harness Nedir?
Harness, kullanıcı sorusu ile hedef model arasına giren bir çalışma düzeni. Soruyu uygun şablona dönüştürebilir, hangi alt yöntemin kullanılacağını seçebilir, deterministik kod çalıştırabilir ve cevabı testin istediği kesin biçime sokabilir. Modelin milyarlarca ağırlığı değişmez; iyileşme tamamen istek işlenirken uygulanan dış süreçten gelir.
Bu yaklaşım klasik ince ayardan farklı. Fine-tuning için eğitim verisi, hesaplama ve yeni model sürümü gerekir. Harness ise mevcut modele yönelik istem, yönlendirme, doğrulama ve küçük araçlardan oluşur. Uygulamada bir müşteri hizmetleri akışı, veri çıkarma sistemi veya kurum içi asistan için benzer katmanlar zaten kullanılıyor. Araştırmanın yeniliği, bu katmanı daha güçlü bir modelin sistematik olarak tasarlaması ve ölçmesi.
Deney Nasıl Yapıldı?
Builder model, her testin verisinin yalnızca yüzde 5’ini geliştirme ve doğrulama amacıyla gördü. İlk harness’i hazırladı, sonuçları inceledi ve yinelemeli biçimde düzenledi. Son sürüm daha önce görmediği tam test kümesinde zayıf hedef modelle çalıştırıldı. Böylece builder’ın doğrudan bütün cevapları ezberleyip hedefe aktarması sınırlandırılmaya çalışıldı.
Deneyler insanların inanç, niyet ve bilgi durumunu anlamayı ölçen dört Theory of Mind veri kümesine odaklandı. Bu görevlerde bir karakterin neyi gördüğü, neyi bilmediği veya yanlış bildiği takip ediliyor. Basit dil görünümünün altında durum takibi ve dikkatli cevap formatı gerektirdiği için küçük modeller sık hata yapabiliyor.
0,49’dan 0,91’e Artış Nereden Geldi?
Ortalama puanın 0,49’dan 0,91’e çıkması yaklaşık iki kata yakın güçlü bir iyileşme. Makaleye göre kazanç yalnızca modele daha uzun düşünme süresi vermekten gelmedi. Builder; test türünü tanıyan yönlendirme, belirli problemleri çözen deterministik kod ve sıkı cevap biçimlendirme oluşturdu. Başka bir ifadeyle zayıf modelin her şeyi kendi başına çözmesini istemek yerine hataya açık adımların bir bölümü güvenilir araçlara devredildi.
Daha güçlü akıl yürütme kapasitesine sahip builder modeller daha iyi harness üretti ve en zayıf hedef modeller en büyük kazancı gördü. Bu sonuç, pahalı modeli her kullanıcı isteğinde çalıştırmak yerine bir kez süreç tasarlamak için kullanıp daha ucuz modele ölçekleme fikrini destekliyor. Ancak hesaplama maliyeti yalnızca hedef model çağrısından ibaret değil; yönlendirme, kod ve ek kontrol adımlarının süresi de toplam maliyete eklenmeli.
Neden Daha Fazla Örnek İstemek Yetmedi?
Test zamanı ölçekleme çoğu zaman aynı modele birkaç çözüm ürettirip çoğunluk oyu almakla anlatılıyor. Bu çalışmada asıl fark daha fazla örnekten değil, problemin yapısını değiştirip modele daha temiz görev vermekten geldi. Model yanlış bir prosedürü on kez tekrarlarsa maliyet artar ama doğruluk artmayabilir. Harness doğru prosedürü dışarıdan dayattığında tek çağrı bile daha tutarlı olabilir.
Bu fikir üretim sistemleri için önemli. Tarih hesabı, biçim doğrulama, izin kontrolü ve veri tabanı sorgusu gibi kesin işlemler modele bırakılmak yerine kodla yapılabilir. Dil modeli belirsiz metni yorumlar, araç doğrulanabilir adımı tamamlar. Böylece küçük model yalnızca güçlü olduğu bölümde çalışır.
Şirketler İçin Olası Kullanım
- Maliyet: Güçlü model süreç tasarımında, küçük model yüksek hacimli günlük çalışmada kullanılabilir.
- Güvenilirlik: Tarih, hesap ve format gibi adımlar deterministik kodla denetlenebilir.
- Taşınabilirlik: Model ağırlığı değişmediği için hedef model sürümü daha kolay değiştirilebilir.
- Denetim: Harness kuralları kayda alınabilir ve hangi adımın sonucu etkilediği izlenebilir.
- Risk: Builder’ın oluşturduğu kod güvenlik, veri sızıntısı ve beklenmeyen araç çağrısı için insan incelemesi gerektirir.
Araştırmanın Sınırları
Çalışma 23 sayfalık bir ön baskı; hakem değerlendirmesi tamamlanmış değil. Dört kontrollü Theory of Mind testi, gerçek müşteri konuşması, uzun kod tabanı veya tıbbi karar gibi açık uçlu ortamları temsil etmiyor. Benchmark yönlendirmesi ve kesin cevap formatı gerçek dünyaya göre daha kolay otomatikleştirilebilir.
0,91 puanı genel zekâ, güvenlik veya halüsinasyon sorununun çözüldüğünü göstermiyor. Harness yeni dağılımdaki soruyu yanlış sınıflandırırsa hedef model doğru aracı hiç göremeyebilir. Ayrıca güçlü builder’ın hazırlık maliyeti, veri gizliliği ve bakım yükü hesaplanmadan yalnızca hedef çağrı fiyatına bakmak yanıltıcı olur.
Almadanincele Yorumu
AI4AI’nin en değerli mesajı, küçük modeli daha çok konuşturarak değil, işini daha iyi tanımlayarak güçlendirmesi. Kesin hesapları kodun, dil yorumunu modelin yaptığı düzen; gerçek ürünlerde hem maliyet hem güvenilirlik açısından yalnızca dev modele güvenmekten daha mantıklı olabilir.
Yine de 0,49’dan 0,91’e sıçramayı bütün yapay zekâ görevlerine taşımamak gerekiyor. Başarı kontrollü testlerde ve özel hazırlanmış harness ile elde edildi. Kurumlar bu fikri deneyecekse önce dar bir görev seçmeli, bağımsız test kümesi kurmalı ve güçlü modelin ürettiği kodu güvenlik incelemesinden geçirmelidir.
Kapak görseli: Almadanincele için özgün olarak üretildi. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.















