Google DeepMind, yapay zekâ modellerini hem model sağlayıcısının hem de değerlendirme ekibinin gizli bilgisini koruyarak test eden çift kör bir altyapıyı pilotladığını açıkladı. Confidential Space ve GPU güvenli bölgesi kullanan sistemde model ağırlıkları değerlendiriciye, saklı test istemleri de model sağlayıcısına açılmıyor. Taraflar çalıştırılan kodu kriptografik olarak doğrulayabiliyor. Amaç benchmark sorularının eğitim verisine sızmasını, sonuç seçimini ve fikrî mülkiyet kaygısını azaltmak. Yöntem tarafsızlığı güçlendirebilir; yine de test tasarımı ve donanım güveni gibi yeni bağımlılıklar oluşturuyor.
Klasik Değerlendirme Neden Sorunlu?
Model sağlayıcısı test sorularını önceden görürse ürünü özellikle bu sınava göre ayarlayabilir. Değerlendirici model ağırlığını isterse şirket ticari sırrını paylaşmak istemeyebilir. Kapalı API üzerinden testte ise sağlayıcı gelen isteğin değerlendirme olduğunu anlayabilir, farklı sürüm yönlendirebilir veya tam yürütme ortamı bağımsız doğrulanamayabilir.
İnternette yayılan benchmarklar zamanla eğitim verisine karışır. Model soruyu gerçekten çözmek yerine daha önce gördüğü örüntüyü tekrar edebilir. Gizli test bunu azaltır; ancak tek seferlik veri de kapsam ve yeniden üretilebilirlik sorunu yaratır. Çift kör sistem, gizlilik ile doğrulamayı aynı anda sağlamaya çalışıyor.
Confidential Space ve GPU Enclave
Değerlendirme kodu doğrulanmış güvenli ortamda çalışıyor. Model şifreli biçimde yükleniyor ve yalnız onaylı kod bellekte çözebiliyor. Test verisi de aynı ortamda işleniyor; dışarıya yalnız izin verilen sonuç çıkıyor. Uzaktan doğrulama, tarafların beklenen yazılım ve donanım yapılandırmasının gerçekten kullanıldığını kriptografik kanıtla kontrol etmesini sağlıyor.
Güvenli bölge mutlak koruma değildir. Donanım açığı, yan kanal, yanlış yapılandırma veya sonuç çıktısından bilgi sızıntısı olabilir. Anahtar yönetimi ve güncelleme zinciri kritik. Değerlendirme ekibi hangi ölçümün dışarı çıkacağını çok dar tanımlamalı; ayrıntılı günlük model veya test hakkında istemeden ipucu verebilir.
Model Sağlayıcısı Ne Kazanıyor?
Şirket model ağırlığını üçüncü tarafa teslim etmeden bağımsız teste katılabilir. Bu, açıkça paylaşılmayan frontier modeller için daha kapsamlı güvenlik araştırmasını mümkün kılabilir. Aynı zamanda değerlendiricinin modeli kopyalama veya yetkisiz başka testte kullanma endişesini azaltır. Katılım arttıkça pazar karşılaştırması daha güvenilir olabilir.
Sağlayıcı yine hangi sürümün gönderildiğini belirler. Üretimde farklı filtre, araç, sistem istemi veya güncelleme varsa test gerçek kullanıcı deneyimini tam temsil etmeyebilir. Gönderilen dosyanın üretim sürümüyle eşleşmesi ayrı kanıt gerektirir. Çift körlük versiyon ve dağıtım şeffaflığının yerine geçmez.
Değerlendirici Ne Kazanıyor?
Gizli istem ve puanlama mantığı sağlayıcıya açılmadığı için özel optimizasyon zorlaşır. Değerlendirici daha sonra farklı modelleri aynı saklı testle karşılaştırabilir. Hassas siber güvenlik, biyolojik risk veya aldatma testinin ayrıntısı kötüye kullanım yaratıyorsa gizli yürütme ayrıca güvenlik sağlar.
Buna karşılık testin kamuya kapalı olması dış araştırmacının yöntemi incelemesini zorlaştırabilir. Çözüm, soruların kendisini açıklamadan kategori, örnekleme, puanlama, belirsizlik ve hata analizini yayımlamaktır. Sonuç tek liderlik tablosuna indirgenmemeli; modelin hangi koşulda başarısız olduğu raporlanmalıdır.
Benchmark Kirlenmesini Bitirir mi?
Yeni ve gizli sorular eğitim verisine karışma ihtimalini düşürür. Fakat model sağlayıcısı test alanını, örnek üretim yöntemini veya benzer önceki veriyi biliyorsa dolaylı uyarlama yapabilir. Test de zamanla kullanım veya hata yoluyla sızabilir. Soru havuzu yenilenmeli ve sızıntı belirtisi istatistiksel olarak izlenmelidir.
Gerçek dünya yeteneği tek veri setiyle ölçülemez. Model araç kullanırken, uzun konuşmada veya farklı dilde başka davranabilir. Çift kör altyapı bir taşıma mekanizmasıdır; iyi test tasarımının yerine geçmez. Uzman insan değerlendirmesi, kırmızı ekip ve saha olaylarıyla birlikte kullanıldığında anlamlıdır.
Düzenleyiciler İçin Anlamı
Bağımsız denetim zorunlu hâle gelirse şirketin fikrî mülkiyetini koruyan teknik altyapı uzlaşmayı kolaylaştırabilir. Düzenleyici, modeli doğrudan teslim almadan onaylı testin yürütüldüğünü görebilir. Farklı bulut ve donanım sağlayıcısında birlikte çalışabilir standartlar geliştirilirse tek platform bağımlılığı azalır.
Denetçinin bağımsızlığı yalnız kodla sağlanmaz. Finansman, test seçimi, çıkar çatışması ve sonuç yayımlama hakkı yönetişim meselesidir. Kriptografik olarak doğru çalışan kötü bir test yine kötü sonuç üretir. Teknik güvence ile kurumsal şeffaflık birlikte tasarlanmalıdır.
Almadanincele Yorumu
Çift kör değerlendirme, yapay zekâ güvenliğinde yıllardır süren “modeli gösteremem, testi gösteremem” çıkmazına uygulanabilir bir teknik yanıt veriyor. Saklı soruyu ve model ağırlığını aynı anda korumak bağımsız teste katılımı artırabilir.
Bizce bu sistem liderlik tablosuna yeni bir gizem katmamalı. Sorular saklı kalsa bile yöntem, kategori, belirsizlik ve başarısızlık analizi açıklanmalı. Güvenli donanım tarafların sırrını korur; testin gerçekten doğru şeyi ölçtüğünü tek başına kanıtlamaz.
Bir sonraki adım farklı bulut, donanım ve bağımsız laboratuvarların aynı protokolü tekrar edebilmesi olmalı. Sonuç yalnız toplam puan değil güven aralığı, alt grup başarısı ve başarısız örnek türleriyle yayımlanırsa düzenleyici ile araştırmacı gerçek risk hakkında daha sağlıklı karar verebilir.
Pilotun gerçek değeri farklı model sağlayıcıları ve bağımsız laboratuvarlar aynı yöntemi kullandığında anlaşılacak. Donanım doğrulaması, sürüm kimliği ve sonuç şeması ortak standarda bağlanırsa şirketler sırlarını açmadan karşılaştırılabilir güvenlik kanıtı üretebilir. Aksi hâlde her kurumun kapalı sistemi yeni bir uyumsuzluk yaratır.
Kapak görseli: Google DeepMind resmi araştırma görseli. Kullanım bilgisi: Araştırmayı yayımlayan kurumun resmi araştırma görseli; kaynak belirtilerek editoryal kullanım.
















