809 katılımcılı yeni ön baskı, halk oylamasıyla ahlaki yapay zekâ tasarlamanın otomatik olarak tarafsız olmadığını gösteriyor. Özellik seçimi, örneklem ve...
Devamını okuDetailsYedi gelişmiş model 36 uzun soluklu araştırma-geliştirme görevinde sınandı. Yeni çalışma, ajanların uygulamada iyi ama özgün keşif, geri bildirim kullanımı...
Devamını okuDetailsOmniScientist adlı araştırma sistemi görüntü, ses, video, tablo ve 3B veriyi doğrudan işleyerek 36 deneyin tamamında derlenebilir makale oluşturdu. 6,3...
Devamını okuDetailsSkillMisevo araştırması, tekrar kullanılan ajan becerilerinin zaman içinde güvenli olmayan kalıplar öğrenip yeni oturumlara zarar taşıyabildiğini gösteriyor. SafeEvolve yaklaşımını ve...
Devamını okuDetailsQuoteBench, yapay zekâ ajanlarında modelin doğru ürettiği komutun taşıma ve ayrıştırma katmanında nasıl bozulduğunu ölçtü. Başarı bazı yapılandırmalarda 73,2 puana...
Devamını okuDetailsIBM araştırmacılarının VAKRA testi, 62 alanda 8 binden fazla çalıştırılabilir API ile yapay zekâ ajanlarını ölçüyor. En iyi modeller bile...
Devamını okuDetailsAI4AI araştırmasında güçlü bir model, zayıf modelin çalışma biçimini düzenleyen bir harness hazırladı. Dört testte ortalama başarı 0,49’dan 0,91’e çıktı;...
Devamını okuDetailsYeni bir çalışma, yapay zekâ tabanlı denetçiyle Python refactoring araçlarının davranış değiştiren hatalarını aradı. 1.152 denemede bulunan 13 farklı hatanın...
Devamını okuDetailsOpenAI, ABD’deki iş bağlantılı mesleklerden 800 binden fazla anonimleştirilmiş ChatGPT mesajını inceledi. Mesleğe özgü isteklerin yüzde 43,5’i kullanıcının kendi rolünün...
Devamını okuDetailsHanoi Kulesi üzerinde yapılan yeni çalışma, bazı akıl yürütme modellerinin doğru iç temsili kurabildiğini ancak çok adımlı plan sırasında bu...
Devamını okuDetailsBali’de 4.776 işletmeyi kapsayan yeni çalışma, dört yapay zekâ sisteminin mekânların yüzde 85,6’sını hiç önermediğini buldu. Puan, web sitesi, yorum...
Devamını okuDetailsGoogle DeepMind’de görev dağılımı değişiyor: Demis Hassabis başkanlık ve Alphabet baş bilim insanlığına geçerken birimin günlük liderliğini Koray Kavukcuoglu üstleniyor....
Devamını okuDetailsOpenAI, yayımlanmamış Astra modelinde kritik siber kabiliyet ihtimalini dışlayamadığını belirterek güvenlik testlerini genişletti ve çıkış sürecini yavaşlattı. Bu açıklamanın neyi...
Devamını okuDetailsGoogle Research, SymptomAI adlı deneysel belirti değerlendirme ajanını 13.917 katılımcıyla sınadı. Sonuçların ne anlama geldiğini ve neden tıbbi tanı olmadığını...
Devamını okuDetails© 2026 almadanincele.com. Tüm hakları saklıdır.
© 2026 almadanincele.com. Tüm hakları saklıdır.