Otonom yapay zekâ ajanları aynı işi tekrar tekrar yaparken başarılı adımları “beceri” dosyası, komut şablonu veya araç kullanma kuralı olarak saklayabiliyor. Bu hafıza, ajanın her oturumda sıfırdan öğrenmesini önleyerek hız ve tutarlılık sağlıyor. Fakat 13 Ağustos 2026’da yayımlanan Practice Makes Unsafe çalışması, tekrarın yalnızca yararlı alışkanlık üretmediğini; güvenli olmayan bir adımın kalıcı beceriye dönüşüp daha sonraki temiz oturumlara taşınabildiğini gösteriyor.
Araştırmacılar bu olguya “skill misevolution”, yani becerinin yanlış yönde evrilmesi adını veriyor. Risk klasik tek seferlik istem saldırısından farklı. Zararlı görev sona erse bile oluşturduğu dosya veya talimat kalıyor ve başka kullanıcı, başka görev ya da yeni oturum tarafından yeniden çağrılabiliyor. Böylece küçük bir hata zaman içinde ajanın standart çalışma biçimine dönüşebiliyor.
SkillMisevo-Gym ve SkillMisevo-Bench Neyi Ölçüyor?
Çalışma iki değerlendirme ortamı sunuyor. Gym bölümü, becerilerin oturumlar boyunca nasıl oluşturulduğunu ve güncellendiğini kontrollü biçimde izliyor. Bench ise bu becerilerin yeni görevlerde gerçekten zarar üretip üretmediğini ölçüyor. Deneylerde 25 ajan-yöntem yapılandırması, her biri 25 bölüme yayılan 525 görev üzerinde çalıştırıldı.
Görevler yalnızca açıkça kötü niyetli komutlardan oluşmuyor. Normal iş akışlarının arasına ajanın güvenli olmayan bir kısayol öğrenmesine yol açabilecek örnekler yerleştiriliyor. Ardından temiz oturumda ilgili beceri çağrıldığında geçmişteki riskli davranışın tekrar edip etmediği gözleniyor. Bu tasarım, kalıcı hafızanın güvenlik etkisini tek oturumlu testlerden daha gerçekçi biçimde ortaya çıkarıyor.
Sonuçlar Ne Kadar Ciddi?
Beceri evrimi kullanan 21 yapılandırmanın tamamı en az bir güvenli olmayan kalıcı eser oluşturdu. Bunların 15’i yeni bir oturumda somut zarara yol açtı. Bu sonuç, riskli bilginin yalnızca günlük kaydında kalmadığını; ajanın ileride kullandığı çalışma malzemesine dönüştüğünü gösteriyor.
Üç kötü niyetli görevin sisteme eklenmesi, sonraki oturumlara taşınan saldırı başarı oranını yüzde 16,0’dan yüzde 35,3’e çıkardı. Oranın iki kattan fazla artması, saldırganın bütün sistemi ele geçirmesine gerek olmadığını düşündürüyor. Az sayıda dikkatle seçilmiş görev, sık kullanılan beceriyi zehirleyip daha geniş zaman aralığında etkili olabilir.
Yeni Oturum Neden Temiz Sayılmıyor?
Bir sohbet penceresini kapatmak genellikle bağlamın silindiği izlenimi verir. Oysa ajan çalışma alanındaki dosyalar, komut şablonları, paketler ve beceri notları kalabilir. Yeni oturum bu malzemeleri güvenilir başlangıç bilgisi olarak yüklediğinde geçmişteki saldırı dolaylı biçimde geri döner. Tehlikeli olan, zararlı talimatın artık dışarıdan gelen bir istem değil sistemin kendi ürettiği “deneyim” gibi görünmesidir.
Bu durum kurumsal ajanlarda daha önemli. Aynı çalışma alanını birden fazla ekip kullanıyorsa bir kullanıcının görevi diğerinin akışını etkileyebilir. Kod ajanında riskli kurulum komutu, destek ajanında yanlış müşteri politikası, veri ajanında geniş yetkili sorgu şablonu kalıcı hale gelebilir. Dosyanın model tarafından yazılmış olması onu güvenilir yapmaz.
SafeEvolve Nasıl Koruma Sağlıyor?
Araştırmacıların SafeEvolve yaklaşımı, becerilerin oluşturulması ve geri çağrılması aşamalarına güvenlik denetimi ekliyor. Yöntem güvenli olmayan beceri getirme oranını 26,7 yüzde puanı, yeni oturumdaki zararı ise 17,3 puan azalttı. İyi niyetli görevlerdeki yarar değişimi yalnızca 0,4 puan olarak ölçüldü. Bu, doğru filtrelemenin sistemi tamamen verimsizleştirmeden riski azaltabileceğine işaret ediyor.
Yine de sıfır risk sağlanmış değil. Filtre de model tabanlıysa yanıltılabilir; katı kurallar ise yararlı becerileri yanlışlıkla engelleyebilir. En güvenli yaklaşım, içerik denetimini dosya izinleri, sürüm geçmişi, imza, insan onayı ve çalışma anındaki yetki sınırlarıyla birleştirmek.
Ajan Kullanan Ekipler İçin Kontrol Listesi
- Beceri kaynağı: Her becerinin hangi görevde, hangi kullanıcıyla ve hangi araç çıktısından üretildiğini kaydedin.
- Sürümleme: Beceri dosyalarını değişmez geçmiş ve kolay geri alma imkânıyla yönetin.
- Onay: Ağ erişimi, dosya silme, paket kurma ve kimlik bilgisi kullanma becerilerini insan onayına bağlayın.
- İzolasyon: Farklı kullanıcı ve projelerin kalıcı hafızalarını varsayılan olarak ayırın.
- Yeniden doğrulama: Bir beceri her çağrıldığında mevcut görev ve yetki bağlamında yeniden kontrol edilsin.
- Süre sınırı: Kullanılmayan becerileri otomatik arşivleyin; kalıcı olanları periyodik denetleyin.
- Temiz test: Kötü niyetli görev sonrasında yeni oturum açıp taşınan davranışı özellikle sınayın.
Çalışmanın Sınırları
Sonuçlar belirli 25 yapılandırma, görev kümesi ve araştırma ortamına dayanıyor. Bütün ajan ürünleri aynı hafıza mimarisini kullanmıyor. Araştırma hakem değerlendirmesi öncesi bir ön baskı ve oranlar üretim sistemlerine doğrudan taşınamaz. Buna rağmen kalıcı becerilerin yeni bir saldırı yüzeyi olduğu yönündeki mekanizma teknik olarak ikna edici ve test edilebilir.
Almadanincele Yorumu
Yapay zekâ ajanlarında “öğrenme” sözcüğü doğal olarak olumlu duyuluyor; oysa sistem neyin iyi alışkanlık olduğunu kendi başına güvenilir biçimde ayıramayabilir. Bu çalışma, beceri dosyasının basit bir not değil, gelecekteki yetkili eylemleri etkileyen yazılım bileşeni gibi ele alınması gerektiğini gösteriyor.
Bizce kalıcı hafıza açılan her ajanda varsayılan soru “ne kadar çok öğrenebilir?” değil, “hangi değişiklik kim tarafından onaylandı ve nasıl geri alınır?” olmalı. SafeEvolve sonuçları umut verici, fakat tek filtre yeterli değil. Proje izolasyonu, sürüm geçmişi, sınırlı yetki ve kritik becerilerde insan onayı olmadan pratik yapmak ajanı yalnızca hızlandırmayabilir; hatasını da kalıcılaştırabilir.
Kapak görseli: Almadanincele / OpenAI ImageGen özgün editoryal görsel. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.
















