AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Merkezde yapay zeka ajanı ve çevresinde birbirine bağlı çok sayıda API servisi

VAKRA, yapay zekâ ajanlarını tek araç çağrısından çok adımlı ve politika kısıtlı API görevlerine kadar sınamak için tasarlandı.

8 Binden Fazla API ile Yeni Yapay Zekâ Testi: VAKRA Zayıf Noktayı Gösterdi

Ağustos 13, 2026
in Yapay Zeka
0
586
SHARES
3.3k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

Yapay zekâ ajanları takvim, ödeme, seyahat ve veri tabanı hizmetlerine bağlandığında başarı yalnızca doğru metni yazmakla ölçülemez. Ajanın doğru API’yi seçmesi, gerekli parametreleri doldurması, bir çağrının sonucunu sonraki adıma taşıması ve erişim politikasına uyması gerekir. IBM araştırmacılarının yayımladığı VAKRA benchmarkı, bu zinciri 62 farklı alanda 8 binden fazla çalıştırılabilir API ile test ediyor.

VAKRA Neyi Farklı Yapıyor?

Birçok araç kullanım testi, modelin önceden hazırlanmış küçük bir işlev listesinden doğru adı seçip JSON üretmesini ölçüyor. VAKRA daha geniş bir katalog, birbirine bağlı veri kaynakları ve gerçek çalıştırma ortamı sunuyor. Tahmin edilen araç çağrıları canlı API karşısında yeniden yürütülüyor; yalnızca metinsel olarak beklenen cevaba benzemesi yeterli sayılmıyor.

Aynı sonuca giden birden fazla geçerli yol bulunabildiği için değerlendirme tek bir ezberlenmiş çağrı dizisine bağlı değil. Örneğin bilgi doğrudan bir uç noktadan veya iki kaynağı birleştirerek alınabiliyorsa sistem yürütme sonucunu kontrol ediyor. Bu yaklaşım gerçek uygulamadaki esnekliğe daha yakın, fakat canlı servislerin sürüm ve erişim koşulları benchmarkın tekrarlanabilirliğini zorlaştırabilir.

Hangi Görevler Ölçülüyor?

  • Tek adımlı API etkileşimi: Doğru uç noktayı ve parametreleri seçme.
  • Çok adımlı yapı: İlk çağrının sonucunu ikinci veya üçüncü çağrıda kullanma.
  • Çok kaynaklı cevap: Farklı servislerden gelen bilgiyi birleştirme.
  • Politika kısıtı: İzin verilmeyen veriye erişmeden sorunun cevaplanıp cevaplanamayacağını belirleme.
  • Cevaplanamaz görev: Gerekli bilgi yoksa güvenli biçimde durma ve uydurmama.

Sonuçlar Neden Dikkat Çekici?

Sabit ReAct çalışma düzeninde en iyi model tek adımlı uç nokta görevlerinde yüzde 70,4 başarıya ulaştı. Görevler bileşik hâle geldiğinde en iyi sonuçlar yüzde 50-51 bandına düştü. Akıl yürütme derinliği arttıkça performansın yüzde 50’den fazla gerilemesi, tek tek doğru araç kullanabilen modelin uzun zinciri güvenilir biçimde koruyamadığını gösteriyor.

En sert tablo politika kısıtlı, cevaplanamaz sorularda ortaya çıktı. Bazı koşullarda başarı yüzde 2,4’e kadar indi. Model gerekli bilgiye yasal veya tanımlı araçlarla erişemediğinde “yapamıyorum” demek yerine yanlış kaynağa yönelebiliyor, eksik veriden sonuç çıkarabiliyor veya politika sınırını gözden kaçırabiliyor. Üretim sisteminde bu davranış yalnızca hatalı cevap değil, gizlilik ve yetki ihlali riski yaratır.

Sorun API Çağrısı mı, Dilsel Akıl Yürütme mi?

Araştırmacılar temel sorunun yalnızca işlev çağrısı sözdizimi olmadığını belirtiyor. Modeller çoğu zaman araç adını ve parametre biçimini üretebiliyor. Hatalar; benzer isimli varlıkları ayırma, kullanıcının niyetini doğru kaynağa bağlama, birden fazla sonuç arasında kimlik eşleme ve politika metnini süreç boyunca hatırlama noktalarında yoğunlaşıyor.

Bu ayrım önemli. JSON biçimini düzeltmek için daha iyi şema yeterli olabilir, fakat “hangi Ahmet, hangi hesap ve hangi izin?” sorusu kurumsal bağlam ister. Ajanın her adımda kimlik, veri kaynağı ve yetki durumunu açık bir çalışma belleğinde tutması gerekebilir. Serbest metin düşünce zinciri tek başına güvenilir kayıt değildir.

Üretim Sistemi Kuranlar Ne Öğrenmeli?

İlk ders, tek adımlı demo başarısını uçtan uca güvenilirlik sanmamak. Beş adımlı bir işte her adım yüzde 90 doğru olsa bile bütün zincirin teorik başarısı yaklaşık yüzde 59’a iner. İkinci ders, yetki kontrolünü modelin doğal dil yorumuna bırakmamak. API geçidi, kullanıcı kimliği ve kaynak kapsamını deterministik olarak doğrulamalı.

  • Ajanın kullanabileceği araçları görev ve kullanıcı rolüne göre en başta daraltın.
  • Yazma, ödeme veya silme işlemlerinde insan onayı ve işlem özeti isteyin.
  • Her çağrıyı parametre, sonuç ve yetki kararıyla denetlenebilir günlükte tutun.
  • Eksik veri için açık “cevaplanamaz” sınıfı ve güvenli durma kuralı oluşturun.
  • Testleri yalnızca doğru yanıtla değil, yanlış araca hiç dokunmama ölçütüyle değerlendirin.

Sınırlamalar

VAKRA bir ön baskı çalışma ve kullanılan API’ler zamanla değişebilir. Sabit ReAct harness’i her model için en iyi ajan mimarisi olmayabilir. Daha güçlü planlayıcı, bellek ve doğrulama katmanları sonucu yükseltebilir. Buna karşılık benchmarkın genişliği, kontrollü laboratuvar testlerinden gerçek servis karmaşıklığına doğru önemli bir adım sunuyor.

Yüzdeler belirli model, istem ve yürütme ayarlarına ait; bütün ajan ürünlerini aynı sıraya koymuyor. Asıl bulgu, performansın görev derinliği ve politika kısıtıyla dramatik biçimde değişmesi. Bir şirket kendi verisi ve yetki modeliyle ayrıca kırmızı takım ve uçtan uca test yapmadan bu sonuçları doğrudan güvenlik garantisi sayamaz.

Almadanincele Yorumu

VAKRA’nın gösterdiği en önemli nokta, “API çağırabiliyor” ile “işi güvenli biçimde tamamlayabiliyor” arasındaki büyük fark. Tek adımda yüzde 70’i aşan modelin çok adımlı ve politika kısıtlı görevlerde hızla düşmesi, etkileyici ajan demolarına neden temkinli yaklaşmamız gerektiğini açıklıyor.

Gerçek üründe izin kontrolü, kimlik eşleme ve geri döndürülemez işlem modeli çevreleyen yazılım tarafından güvenceye alınmalı. Yapay zekâ plan önerebilir; yetkiyi kendisi genişletememeli. Ajan satın alan veya geliştiren kurumlar ortalama doğruluk yerine en kötü senaryoda güvenli durma oranını sormalıdır.

Kapak görseli: Almadanincele için özgün olarak üretildi. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.

Kaynaklar

  • VAKRA araştırması – arXiv
  • IBM VAKRA açık kaynak deposu
  • IBM Research VAKRA veri kümesi
Tags: APIBenchmarkIBM ResearchVAKRAYapay Zeka Ajanları
SummarizeShare234
Previous Post

Güçlü Yapay Zekâ Zayıf Modeli İki Kat İyileştirdi: AI4AI Ne Anlama Geliyor?

Next Post

Kimera K-39 Monterey’e Çıkıyor: 1000 Beygirlik Stradale ve Yarış Versiyonu

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

Konuşma dalga biçimi ve gerçek zamanlı yazıya döküm fikrini anlatan özgün editoryal görsel

Microsoft’tan Anlık Konuşma Çözümleme: Yeni MAI Modelleri 60 Dili Destekliyor

by Almadanincele Editör Ekibi
Ekim 2, 2026
0

Microsoft’un 1 Ekim’de duyurduğu MAI-Transcribe-2-Streaming, 60 dilde konuşma sürerken metin üretiyor; MAI-Voice 2.1 ailesi 23 dil ve 26 yerel seçeneğe odaklanıyor.

Kurum içi sunucu altyapısı üzerinde çalışan yazılım geliştirme yapay zekâsını anlatan özgün editoryal illüstrasyon

IBM Bob Kurum İçi Kuruluma Açılıyor: Hassas Kodlar Bulutta Kalmak Zorunda Değil

by Almadanincele Editör Ekibi
Ekim 2, 2026
0

IBM, Bob yazılım geliştirme platformunun kurumların kendi sunucularında, özel veya egemen bulutta ve internetten yalıtılmış ortamlarda çalışabilecek dağıtım seçeneğini duyurdu.

Google DeepMind’in SynthID Bio duyurusundaki protein yapılarının biyolojik filigranla işaretlenmesini anlatan görsel

SynthID Bio: Google, Yapay Zekâyla Tasarlanan Proteinlere Biyolojik Filigran Ekliyor

by Almadanincele Editör Ekibi
Ekim 1, 2026
0

Google DeepMind, yapay zekâyla tasarlanan protein dizilerine ve üç boyutlu yapılara algılanamaz işaret ekleyen bir kavram kanıtı yayımladı. Laboratuvar sonuçları, açık kaynak planı ve çözülmemiş riskler.

Gemini 4 Argon’un siber güvenlik odağını anlatan özgün editoryal görsel: kod ve tehdit grafiğiyle donatılmış güvenlik operasyon merkezi

Google Gemini 4 Argon’u Tanıttı: Kodlama ve Siber Güvenlikte Yeni Model, Erişim Şimdilik Sınırlı

by Almadanincele Editör Ekibi
Ekim 1, 2026
0

Google’ın 30 Eylül’de duyurduğu Gemini 4 Argon, karmaşık kodlama, bilgi işi ve siber güvenlik akışlarına odaklanıyor. İlk erişim güvenlik uzmanlarıyla sınırlı; şirket iddiaları ve belirsiz noktaları ayırıyoruz.

Next Post
Kimera K-39 yarış otomobili ve yol versiyonunun yan yana görünümü

Kimera K-39 Monterey’e Çıkıyor: 1000 Beygirlik Stradale ve Yarış Versiyonu

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

Meta VR Glasses sanal gerçeklik gözlüğünün resmi ürün görseli

Meta VR Glasses Ön İncelemesi: 100 Gramlık Gözlük Quest’in Yerini Alır mı?

Eylül 24, 2026
Dell XPS Googlebook dizüstü bilgisayarın resmi ürün fotoğrafı

Dell XPS Googlebook Ön İncelemesi: Android ile Çalışan 13 İnç Dizüstü Kime Uygun?

Eylül 21, 2026
Lenovo ThinkBook 14x ailesinin farklı renklerdeki resmi ürün görünümü

Lenovo ThinkBook 14x Gen 2 Ön İncelemesi: 990 Gramlık İş Bilgisayarı Kime Uygun?

Eylül 6, 2026
TCL P80 Ultra telefonların mavi, bordo ve altın renkli arka tasarımları

TCL P80 Ultra Ön İncelemesi: NXTPAPER AMOLED ve Periskop Kamera Birlikte Ne Sunuyor?

Eylül 7, 2026
Aurora Green renkli POCO F9 Pro telefonun arka tasarımı

POCO F9 Pro Ön İncelemesi: 200 MP Kamera, 185 Hz Ekran ve 100W Şarj Kime Uygun?

Eylül 9, 2026
Google Pixel telefon ve akıllı saat için Eylül yazılım güncellemesini anlatan çizim

Eylül Pixel Drop: Google Telefon ve Saatlere Eklenen Yeni Özellikler

Eylül 29, 2026
Samsung Galaxy telefonunda One UI 9 Now Nudge özelliğinin arayüzünü gösteren resmî ekran görüntüsü

One UI 9 Galaxy S26 Serisine Geliyor: Yeni Özellikler ve Güncellemeyi Kontrol Etme Rehberi

Ekim 1, 2026
viaim Rise kulaklıklar ve yapay zekâ tuşlu şarj kutusu

viaim Rise Ön İncelemesi: AI Agent Kulaklık Toplantıları Gerçekten İşe Dönüştürebilir mi?

Eylül 8, 2026
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

HP ProBook 4 G2iS iş dizüstüsünün resmi basın görseli

HP ProBook 4 G2iS 14 Ön İnceleme: İş Dünyasına 120 Hz OLED Ekran

Ekim 2, 2026
HP OmniBook 5 14 dizüstü bilgisayarın açık ekranlı resmi basın fotoğrafı

HP OmniBook 5 14 Ön İnceleme: OLED Ekran ve 42 Saatlik Pil İddiası

Ekim 2, 2026

Takip

Windows bilgisayarında disk şifreleme ve kurtarma anahtarı yedeklemeyi anlatan özgün editoryal görsel

Windows 11’de BitLocker Kurtarma Anahtarı Nasıl Yedeklenir?

Ekim 2, 2026
Ev ağında yeni nesil kablosuz bağlantı ve router yerleşimini gösteren özgün editoryal illüstrasyon

Wi-Fi 7 Evde Gerçekten Fark Yaratır mı? Router Almadan Önce 7 Kontrol

Ekim 2, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.