Bir yapay zekâ ajanı terminal komutunu doğru üretebilir, fakat komut çalıştırma aracına ulaşana kadar tırnak işaretleri, kaçış karakterleri veya JSON katmanı tarafından değiştirilebilir. Sonuçta model mantıken doğru cevabı verirken sistem yanlış komutu çalıştırır. 13 Ağustos 2026’da yayımlanan QuoteBench çalışması, çoğu kıyaslamanın gözden kaçırdığı bu taşıma katmanını ayrı bir güvenilirlik problemi olarak ölçüyor.
Araştırmanın önemli yanı, hatayı yalnızca “model başarısız oldu” diye etiketlememesi. Model çıktısı, aracı çağıran protokol, ayrıştırıcı ve çalıştırma ortamı ayrı ayrı ele alınıyor. Böylece bir ajanın başarısı ile modelin gerçek komut yazma becerisi arasındaki fark görülebiliyor. Bu ayrım; kodlama asistanı, sunucu otomasyonu ve güvenlik aracı geliştiren ekipler için doğrudan pratik değer taşıyor.
QuoteBench Nasıl Kuruldu?
Çalışmada gerçek olaylardan türetilen 14 hata ailesine yayılan 56 tek atımlık görev kullanıldı. Görevler; iç içe tırnak, boşluk, değişken genişletme, özel karakter ve kabuk sözdizimi gibi komutun katmanlar arasında değişmesine yol açabilecek durumları kapsıyor. Araştırmacılar sekiz farklı model-sistem yapılandırmasını hem doğrudan hem de ek bir parser üzerinden test etti.
Bir görev yalnızca komut metninin güzel görünmesiyle başarılı sayılmıyor. Nihai çalıştırılan komutun beklenen davranışı üretmesi gerekiyor. Bu yaklaşım, bir mesajın model ekranında doğru görünmesine rağmen JSON veya kabuk katmanında farklı yorumlanmasını yakalıyor. Deney ayrıca modele taşıma biçimi açıkça anlatıldığında sonucun ne kadar düzeldiğini ölçüyor.
Başarı Neden 73,2 Puana Kadar Düştü?
Ek parser katmanı, incelenen yapılandırmalarda görev başarısını 55,4 ile 73,2 yüzde puanı arasında düşürdü. Buradaki değer göreli yüzde değil, doğrudan başarı oranındaki puan kaybı. Bu kadar büyük fark, ajanın “zekâsından” bağımsız görünen bir entegrasyon ayrıntısının bütün sistemi kullanılamaz hale getirebileceğini gösteriyor.
Problemin temelinde bir metnin birden fazla kez yorumlanması var. Model kabuk için tırnak ekliyor; istemci bunu JSON içinde kaçırıyor; sunucu parser’ı yeniden çözüyor; en sonunda kabuk başka bir anlam çıkarıyor. Her katman kendi içinde doğru görünse de birleşik zincir komutu bozabiliyor. Özellikle kullanıcı girdisini komuta ekleyen sistemlerde bu durum yalnızca hata değil, güvenlik riski de oluşturabilir.
Taşıma Biçimini Modele Anlatmak İşe Yarıyor mu?
Araştırmacılar modele, çıktının hangi parser ve taşıma yolundan geçeceğini açıkladığında altı yapılandırmada 30,4 ile 60,7 puan arasında iyileşme gördü. Yani model, gerçek çalışma ortamını bildiğinde kaçış ve tırnak stratejisini uyarlayabiliyor. Ancak iki yapılandırmada iyileşme sıfıra yakın veya hafif negatif kaldı. Tek bir “sistem istemine parser’ı yaz” çözümü her model ve araç için güvenilir değil.
Daha ilginç sonuç, toplam puanın bazı ayrıntıları gizlemesi. GPT-5.6-sol yapılandırmasında eşleştirilmiş toplam fark yalnızca eksi 3,6 puan görünürken bunun altında 64,3 puanlık hasar ile 60,7 puanlık telafi aynı anda bulunuyor. Yalnızca son ortalamaya bakıldığında sistem kararlı sanılabilir; aslında iki büyük etkinin birbirini iptal ettiği görülüyor.
Model Sıralaması Bile Değişebilir
26 model çifti karşılaştırmasında açık bir sıralama tersine dönmesi ve tek görev marjında dört değişim raporlandı. Bu, aynı modeller farklı komut taşıma katmanlarıyla test edildiğinde “en iyi model” sonucunun değişebileceği anlamına geliyor. Bir kıyaslama gerçek üretim protokolünü yansıtmıyorsa model seçimi yanıltıcı olabilir.
Dolayısıyla ajan değerlendirmesinde model adı, sıcaklık ve istem kadar araç protokolü de raporlanmalı. Komutun modele nasıl gösterildiği, nasıl seri hale getirildiği, hangi parser’ın kullandığı ve nihai kabuğa hangi baytların ulaştığı deneyin parçasıdır. Aksi halde hata modeli suçlarken entegrasyondan kaynaklanabilir.
Geliştiriciler Ne Yapmalı?
- Yapılandırılmış çağrı: Mümkünse tek bir kabuk metni yerine komut ve argümanları ayrı alanlarda taşıyın.
- Tek yorumlama: Aynı metni JSON, şablon ve kabukta art arda yeniden ayrıştırmaktan kaçının.
- Uçtan uca test: Model çıktısını değil, nihai çalıştırılan argüman dizisini ve davranışı doğrulayın.
- Olay tabanlı görevler: Tırnak, boşluk, Unicode ve kullanıcı girdisi içeren gerçek hata örneklerini test paketine ekleyin.
- Gözlemlenebilirlik: Hassas bilgileri maskeleyerek ham model çıktısı ile çalıştırılan komut arasındaki dönüşümü kaydedin.
- Yetki sınırı: Komut hatasının zararını azaltmak için ajanı düşük yetkili ve izole ortamda çalıştırın.
Çalışmanın Sınırları
QuoteBench 56 görev ve belirli sekiz yapılandırmayla sınırlı bir ön baskı. Her programlama dili, kabuk veya üretim aracını temsil etmiyor. Başarı kayıpları doğrudan bütün yapay zekâ ajanlarına genellenemez. Buna rağmen çalışma, araç kullanan modellerde güvenilirliğin yalnızca doğru akıl yürütme olmadığını somut sayılarla gösteriyor.
Almadanincele Yorumu
QuoteBench’in en değerli mesajı basit: ekranda doğru görünen komut, çalışan sistemde doğru komut olmayabilir. Yapay zekâ ajanlarında kaliteyi yalnızca model cevabıyla ölçmek, kargoya sağlam verilen fakat aktarım sırasında kırılan ürünü üretici hatası saymaya benziyor. Taşıma zinciri de ürünün kendisi kadar test edilmeli.
Bizce üretim sistemlerinde temel kural, kabuğa serbest metin göndermek yerine komut ve argümanları yapılandırılmış biçimde taşımak olmalı. Modelin parser’ı bilmesi yardımcı olabilir, fakat güvenlik sınırı olarak yeterli değil. Uçtan uca test, düşük yetki ve nihai komut denetimi birlikte uygulanmadıkça daha güçlü model yalnızca daha hızlı hata üretebilir.
Kapak görseli: Almadanincele / OpenAI ImageGen özgün editoryal görsel. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.















