AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Merkezde yapay zeka ajanı ve çevresinde birbirine bağlı çok sayıda API servisi

VAKRA, yapay zekâ ajanlarını tek araç çağrısından çok adımlı ve politika kısıtlı API görevlerine kadar sınamak için tasarlandı.

8 Binden Fazla API ile Yeni Yapay Zekâ Testi: VAKRA Zayıf Noktayı Gösterdi

Ağustos 13, 2026
in Yapay Zeka
0
585
SHARES
3.2k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

Yapay zekâ ajanları takvim, ödeme, seyahat ve veri tabanı hizmetlerine bağlandığında başarı yalnızca doğru metni yazmakla ölçülemez. Ajanın doğru API’yi seçmesi, gerekli parametreleri doldurması, bir çağrının sonucunu sonraki adıma taşıması ve erişim politikasına uyması gerekir. IBM araştırmacılarının yayımladığı VAKRA benchmarkı, bu zinciri 62 farklı alanda 8 binden fazla çalıştırılabilir API ile test ediyor.

VAKRA Neyi Farklı Yapıyor?

Birçok araç kullanım testi, modelin önceden hazırlanmış küçük bir işlev listesinden doğru adı seçip JSON üretmesini ölçüyor. VAKRA daha geniş bir katalog, birbirine bağlı veri kaynakları ve gerçek çalıştırma ortamı sunuyor. Tahmin edilen araç çağrıları canlı API karşısında yeniden yürütülüyor; yalnızca metinsel olarak beklenen cevaba benzemesi yeterli sayılmıyor.

Aynı sonuca giden birden fazla geçerli yol bulunabildiği için değerlendirme tek bir ezberlenmiş çağrı dizisine bağlı değil. Örneğin bilgi doğrudan bir uç noktadan veya iki kaynağı birleştirerek alınabiliyorsa sistem yürütme sonucunu kontrol ediyor. Bu yaklaşım gerçek uygulamadaki esnekliğe daha yakın, fakat canlı servislerin sürüm ve erişim koşulları benchmarkın tekrarlanabilirliğini zorlaştırabilir.

Hangi Görevler Ölçülüyor?

  • Tek adımlı API etkileşimi: Doğru uç noktayı ve parametreleri seçme.
  • Çok adımlı yapı: İlk çağrının sonucunu ikinci veya üçüncü çağrıda kullanma.
  • Çok kaynaklı cevap: Farklı servislerden gelen bilgiyi birleştirme.
  • Politika kısıtı: İzin verilmeyen veriye erişmeden sorunun cevaplanıp cevaplanamayacağını belirleme.
  • Cevaplanamaz görev: Gerekli bilgi yoksa güvenli biçimde durma ve uydurmama.

Sonuçlar Neden Dikkat Çekici?

Sabit ReAct çalışma düzeninde en iyi model tek adımlı uç nokta görevlerinde yüzde 70,4 başarıya ulaştı. Görevler bileşik hâle geldiğinde en iyi sonuçlar yüzde 50-51 bandına düştü. Akıl yürütme derinliği arttıkça performansın yüzde 50’den fazla gerilemesi, tek tek doğru araç kullanabilen modelin uzun zinciri güvenilir biçimde koruyamadığını gösteriyor.

En sert tablo politika kısıtlı, cevaplanamaz sorularda ortaya çıktı. Bazı koşullarda başarı yüzde 2,4’e kadar indi. Model gerekli bilgiye yasal veya tanımlı araçlarla erişemediğinde “yapamıyorum” demek yerine yanlış kaynağa yönelebiliyor, eksik veriden sonuç çıkarabiliyor veya politika sınırını gözden kaçırabiliyor. Üretim sisteminde bu davranış yalnızca hatalı cevap değil, gizlilik ve yetki ihlali riski yaratır.

Sorun API Çağrısı mı, Dilsel Akıl Yürütme mi?

Araştırmacılar temel sorunun yalnızca işlev çağrısı sözdizimi olmadığını belirtiyor. Modeller çoğu zaman araç adını ve parametre biçimini üretebiliyor. Hatalar; benzer isimli varlıkları ayırma, kullanıcının niyetini doğru kaynağa bağlama, birden fazla sonuç arasında kimlik eşleme ve politika metnini süreç boyunca hatırlama noktalarında yoğunlaşıyor.

Bu ayrım önemli. JSON biçimini düzeltmek için daha iyi şema yeterli olabilir, fakat “hangi Ahmet, hangi hesap ve hangi izin?” sorusu kurumsal bağlam ister. Ajanın her adımda kimlik, veri kaynağı ve yetki durumunu açık bir çalışma belleğinde tutması gerekebilir. Serbest metin düşünce zinciri tek başına güvenilir kayıt değildir.

Üretim Sistemi Kuranlar Ne Öğrenmeli?

İlk ders, tek adımlı demo başarısını uçtan uca güvenilirlik sanmamak. Beş adımlı bir işte her adım yüzde 90 doğru olsa bile bütün zincirin teorik başarısı yaklaşık yüzde 59’a iner. İkinci ders, yetki kontrolünü modelin doğal dil yorumuna bırakmamak. API geçidi, kullanıcı kimliği ve kaynak kapsamını deterministik olarak doğrulamalı.

  • Ajanın kullanabileceği araçları görev ve kullanıcı rolüne göre en başta daraltın.
  • Yazma, ödeme veya silme işlemlerinde insan onayı ve işlem özeti isteyin.
  • Her çağrıyı parametre, sonuç ve yetki kararıyla denetlenebilir günlükte tutun.
  • Eksik veri için açık “cevaplanamaz” sınıfı ve güvenli durma kuralı oluşturun.
  • Testleri yalnızca doğru yanıtla değil, yanlış araca hiç dokunmama ölçütüyle değerlendirin.

Sınırlamalar

VAKRA bir ön baskı çalışma ve kullanılan API’ler zamanla değişebilir. Sabit ReAct harness’i her model için en iyi ajan mimarisi olmayabilir. Daha güçlü planlayıcı, bellek ve doğrulama katmanları sonucu yükseltebilir. Buna karşılık benchmarkın genişliği, kontrollü laboratuvar testlerinden gerçek servis karmaşıklığına doğru önemli bir adım sunuyor.

Yüzdeler belirli model, istem ve yürütme ayarlarına ait; bütün ajan ürünlerini aynı sıraya koymuyor. Asıl bulgu, performansın görev derinliği ve politika kısıtıyla dramatik biçimde değişmesi. Bir şirket kendi verisi ve yetki modeliyle ayrıca kırmızı takım ve uçtan uca test yapmadan bu sonuçları doğrudan güvenlik garantisi sayamaz.

Almadanincele Yorumu

VAKRA’nın gösterdiği en önemli nokta, “API çağırabiliyor” ile “işi güvenli biçimde tamamlayabiliyor” arasındaki büyük fark. Tek adımda yüzde 70’i aşan modelin çok adımlı ve politika kısıtlı görevlerde hızla düşmesi, etkileyici ajan demolarına neden temkinli yaklaşmamız gerektiğini açıklıyor.

Gerçek üründe izin kontrolü, kimlik eşleme ve geri döndürülemez işlem modeli çevreleyen yazılım tarafından güvenceye alınmalı. Yapay zekâ plan önerebilir; yetkiyi kendisi genişletememeli. Ajan satın alan veya geliştiren kurumlar ortalama doğruluk yerine en kötü senaryoda güvenli durma oranını sormalıdır.

Kapak görseli: Almadanincele için özgün olarak üretildi. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.

Kaynaklar

  • VAKRA araştırması – arXiv
  • IBM VAKRA açık kaynak deposu
  • IBM Research VAKRA veri kümesi
Tags: APIBenchmarkIBM ResearchVAKRAYapay Zeka Ajanları
SummarizeShare234
Previous Post

Güçlü Yapay Zekâ Zayıf Modeli İki Kat İyileştirdi: AI4AI Ne Anlama Geliyor?

Next Post

Kimera K-39 Monterey’e Çıkıyor: 1000 Beygirlik Stradale ve Yarış Versiyonu

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

Güçlü yapay zeka modelinden harness katmanı üzerinden zayıf modele yetenek aktarımını gösteren görsel

Güçlü Yapay Zekâ Zayıf Modeli İki Kat İyileştirdi: AI4AI Ne Anlama Geliyor?

by Almadanincele Editör Ekibi
Ağustos 13, 2026
0

AI4AI araştırmasında güçlü bir model, zayıf modelin çalışma biçimini düzenleyen bir harness hazırladı. Dört testte ortalama başarı 0,49’dan 0,91’e çıktı; ancak sonuçların önemli sınırları var.

Python refactoring aracındaki davranış değişikliklerini yapay zekâ ile denetleyen araştırma iş akışı

Yapay Zekâ Python Refactoring Hatalarını Buldu: 13 Hatanın 12’si Kabul Edildi

by Almadanincele Editör Ekibi
Ağustos 13, 2026
0

Yeni bir çalışma, yapay zekâ tabanlı denetçiyle Python refactoring araçlarının davranış değiştiren hatalarını aradı. 1.152 denemede bulunan 13 farklı hatanın 12’si geliştiricilerce kabul edildi.

ChatGPT görevlerinin meslek sınırları arasında kullanım oranlarını gösteren araştırma grafiği

ChatGPT İş Rollerini Genişletiyor: Mesleğe Özgü İsteklerin Yüzde 43,5’i Sınır Aşıyor

by Almadanincele Editör Ekibi
Ağustos 13, 2026
0

OpenAI, ABD’deki iş bağlantılı mesleklerden 800 binden fazla anonimleştirilmiş ChatGPT mesajını inceledi. Mesleğe özgü isteklerin yüzde 43,5’i kullanıcının kendi rolünün dışına taşıyor.

Hanoi Kulesi durumlarını Sierpinski üçgeni biçiminde gösteren araştırma grafiği

Akıl Yürüten Modeller Dünya Modelini Kuruyor ama Planlarken Kaybediyor: Yeni Çalışma Ne Diyor?

by Almadanincele Editör Ekibi
Ağustos 10, 2026
0

Hanoi Kulesi üzerinde yapılan yeni çalışma, bazı akıl yürütme modellerinin doğru iç temsili kurabildiğini ancak çok adımlı plan sırasında bu temsili koruyamadığını gösteriyor. Sonuçları ve sınırları açıkladık.

Next Post
Kimera K-39 yarış otomobili ve yol versiyonunun yan yana görünümü

Kimera K-39 Monterey’e Çıkıyor: 1000 Beygirlik Stradale ve Yarış Versiyonu

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

Playstation 5

Playstation 5, AMD Ryzen İşlemcileri Kullanabilir

Mayıs 23, 2018
MagicMirror: Sağlığınızı Yansıtan Teknoloji Harikası

MagicMirror: Sağlığınızı Yansıtan Teknoloji Harikası

Şubat 20, 2024
Ubuntu Touch

Ubuntu Touch Android Desteği Geliyor

Aralık 27, 2017
HTC Vive Pro

CES 2018: HTC Vive Pro Sanal Gerçeklik Gözlüğü Karşınızda

Ocak 11, 2018
Canlı Kıyafet Üretildi

Canlı Kıyafet Üretildi.

Mayıs 28, 2017
IOS 11.1 Özellikleri Nelerdir

iOS 11.1 Özellikleri

Eylül 29, 2017
İphone 8 Kasası Sızdırıldı

İphone 8 Kasası Sızdırıldı

Nisan 14, 2017
Samsung Galaxy S9 ve S9+ Tanıtım Videosu

Samsung Galaxy S9 ve S9+ Tanıtım Videosu Yayınlandı

Şubat 26, 2018
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

Yeşil renkli Bose QuietComfort 2. nesil kablosuz kulaklık kullanan kişi

Bose QuietComfort 2. Nesil Ön İncelemesi: Ultra Özellikleri Daha Uygun Fiyata mı?

Ağustos 13, 2026
Sarı detaylı Philips The Roller taşınabilir Bluetooth hoparlör

Philips The Roller İncelemesi: 60 W Ses ve 24 Saat Pil Ne Kadar İyi?

Ağustos 13, 2026

Takip

Hell Let Loose Vietnam oyununda askerler ve helikopterlerin yer aldığı savaş sahnesi

Hell Let Loose: Vietnam Bugün Çıktı: 50’ye 50 Savaşta Bilmeniz Gerekenler

Ağustos 13, 2026
Galaxy Z Fold8 ve OPPO Find N6 katlanabilir ekranlarının iz karşılaştırması

Galaxy Z Fold8 ve OPPO Find N6 Karşılaştırıldı: Ekran İzi Hangisinde Daha Az?

Ağustos 13, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.