Yapay zekâ ajanları takvim, ödeme, seyahat ve veri tabanı hizmetlerine bağlandığında başarı yalnızca doğru metni yazmakla ölçülemez. Ajanın doğru API’yi seçmesi, gerekli parametreleri doldurması, bir çağrının sonucunu sonraki adıma taşıması ve erişim politikasına uyması gerekir. IBM araştırmacılarının yayımladığı VAKRA benchmarkı, bu zinciri 62 farklı alanda 8 binden fazla çalıştırılabilir API ile test ediyor.
VAKRA Neyi Farklı Yapıyor?
Birçok araç kullanım testi, modelin önceden hazırlanmış küçük bir işlev listesinden doğru adı seçip JSON üretmesini ölçüyor. VAKRA daha geniş bir katalog, birbirine bağlı veri kaynakları ve gerçek çalıştırma ortamı sunuyor. Tahmin edilen araç çağrıları canlı API karşısında yeniden yürütülüyor; yalnızca metinsel olarak beklenen cevaba benzemesi yeterli sayılmıyor.
Aynı sonuca giden birden fazla geçerli yol bulunabildiği için değerlendirme tek bir ezberlenmiş çağrı dizisine bağlı değil. Örneğin bilgi doğrudan bir uç noktadan veya iki kaynağı birleştirerek alınabiliyorsa sistem yürütme sonucunu kontrol ediyor. Bu yaklaşım gerçek uygulamadaki esnekliğe daha yakın, fakat canlı servislerin sürüm ve erişim koşulları benchmarkın tekrarlanabilirliğini zorlaştırabilir.
Hangi Görevler Ölçülüyor?
- Tek adımlı API etkileşimi: Doğru uç noktayı ve parametreleri seçme.
- Çok adımlı yapı: İlk çağrının sonucunu ikinci veya üçüncü çağrıda kullanma.
- Çok kaynaklı cevap: Farklı servislerden gelen bilgiyi birleştirme.
- Politika kısıtı: İzin verilmeyen veriye erişmeden sorunun cevaplanıp cevaplanamayacağını belirleme.
- Cevaplanamaz görev: Gerekli bilgi yoksa güvenli biçimde durma ve uydurmama.
Sonuçlar Neden Dikkat Çekici?
Sabit ReAct çalışma düzeninde en iyi model tek adımlı uç nokta görevlerinde yüzde 70,4 başarıya ulaştı. Görevler bileşik hâle geldiğinde en iyi sonuçlar yüzde 50-51 bandına düştü. Akıl yürütme derinliği arttıkça performansın yüzde 50’den fazla gerilemesi, tek tek doğru araç kullanabilen modelin uzun zinciri güvenilir biçimde koruyamadığını gösteriyor.
En sert tablo politika kısıtlı, cevaplanamaz sorularda ortaya çıktı. Bazı koşullarda başarı yüzde 2,4’e kadar indi. Model gerekli bilgiye yasal veya tanımlı araçlarla erişemediğinde “yapamıyorum” demek yerine yanlış kaynağa yönelebiliyor, eksik veriden sonuç çıkarabiliyor veya politika sınırını gözden kaçırabiliyor. Üretim sisteminde bu davranış yalnızca hatalı cevap değil, gizlilik ve yetki ihlali riski yaratır.
Sorun API Çağrısı mı, Dilsel Akıl Yürütme mi?
Araştırmacılar temel sorunun yalnızca işlev çağrısı sözdizimi olmadığını belirtiyor. Modeller çoğu zaman araç adını ve parametre biçimini üretebiliyor. Hatalar; benzer isimli varlıkları ayırma, kullanıcının niyetini doğru kaynağa bağlama, birden fazla sonuç arasında kimlik eşleme ve politika metnini süreç boyunca hatırlama noktalarında yoğunlaşıyor.
Bu ayrım önemli. JSON biçimini düzeltmek için daha iyi şema yeterli olabilir, fakat “hangi Ahmet, hangi hesap ve hangi izin?” sorusu kurumsal bağlam ister. Ajanın her adımda kimlik, veri kaynağı ve yetki durumunu açık bir çalışma belleğinde tutması gerekebilir. Serbest metin düşünce zinciri tek başına güvenilir kayıt değildir.
Üretim Sistemi Kuranlar Ne Öğrenmeli?
İlk ders, tek adımlı demo başarısını uçtan uca güvenilirlik sanmamak. Beş adımlı bir işte her adım yüzde 90 doğru olsa bile bütün zincirin teorik başarısı yaklaşık yüzde 59’a iner. İkinci ders, yetki kontrolünü modelin doğal dil yorumuna bırakmamak. API geçidi, kullanıcı kimliği ve kaynak kapsamını deterministik olarak doğrulamalı.
- Ajanın kullanabileceği araçları görev ve kullanıcı rolüne göre en başta daraltın.
- Yazma, ödeme veya silme işlemlerinde insan onayı ve işlem özeti isteyin.
- Her çağrıyı parametre, sonuç ve yetki kararıyla denetlenebilir günlükte tutun.
- Eksik veri için açık “cevaplanamaz” sınıfı ve güvenli durma kuralı oluşturun.
- Testleri yalnızca doğru yanıtla değil, yanlış araca hiç dokunmama ölçütüyle değerlendirin.
Sınırlamalar
VAKRA bir ön baskı çalışma ve kullanılan API’ler zamanla değişebilir. Sabit ReAct harness’i her model için en iyi ajan mimarisi olmayabilir. Daha güçlü planlayıcı, bellek ve doğrulama katmanları sonucu yükseltebilir. Buna karşılık benchmarkın genişliği, kontrollü laboratuvar testlerinden gerçek servis karmaşıklığına doğru önemli bir adım sunuyor.
Yüzdeler belirli model, istem ve yürütme ayarlarına ait; bütün ajan ürünlerini aynı sıraya koymuyor. Asıl bulgu, performansın görev derinliği ve politika kısıtıyla dramatik biçimde değişmesi. Bir şirket kendi verisi ve yetki modeliyle ayrıca kırmızı takım ve uçtan uca test yapmadan bu sonuçları doğrudan güvenlik garantisi sayamaz.
Almadanincele Yorumu
VAKRA’nın gösterdiği en önemli nokta, “API çağırabiliyor” ile “işi güvenli biçimde tamamlayabiliyor” arasındaki büyük fark. Tek adımda yüzde 70’i aşan modelin çok adımlı ve politika kısıtlı görevlerde hızla düşmesi, etkileyici ajan demolarına neden temkinli yaklaşmamız gerektiğini açıklıyor.
Gerçek üründe izin kontrolü, kimlik eşleme ve geri döndürülemez işlem modeli çevreleyen yazılım tarafından güvenceye alınmalı. Yapay zekâ plan önerebilir; yetkiyi kendisi genişletememeli. Ajan satın alan veya geliştiren kurumlar ortalama doğruluk yerine en kötü senaryoda güvenli durma oranını sormalıdır.
Kapak görseli: Almadanincele için özgün olarak üretildi. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.

















