AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Hanoi Kulesi durumlarını Sierpinski üçgeni biçiminde gösteren araştırma grafiği

Dört diskli Hanoi Kulesi’nin olası durumları Sierpinski üçgeni oluşturuyor; çalışma modellerin bu geometrik yapıyı iç temsilde kurabildiğini bildiriyor.

Akıl Yürüten Modeller Dünya Modelini Kuruyor ama Planlarken Kaybediyor: Yeni Çalışma Ne Diyor?

Ağustos 10, 2026
in Yapay Zeka
0
585
SHARES
3.3k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

Büyük dil modelleri bir sorunun kurallarını gerçekten temsil ediyor mu, yoksa yalnızca daha önce gördükleri çözüm kalıplarını mı taklit ediyor? 7 Ağustos 2026’da yayımlanan “Transformers Struggle to Use Their Emergent World Models” başlıklı çalışma, bu soruyu Hanoi Kulesi üzerinden mekanik olarak inceliyor. Devin Pereira ve Willem Zuidema’nın sonucu basit bir “modeller düşünemiyor” iddiasından daha incelikli: Bazı modeller doğru dünya modelini kuruyor, fakat uzun plan boyunca onu koruyup kullanmakta zorlanıyor.

Neden Hanoi Kulesi?

Bulmacada farklı büyüklükteki diskler üç çubuk arasında taşınıyor; bir seferde tek disk hareket ediyor ve büyük disk küçüğün üzerine konamıyor. Standart sürümde bütün diskler bir çubuktan diğerine aktarılıyor. Araştırmacıların kullandığı “flat-to-flat” varyantında başlangıç ve hedef diskleri birden fazla çubuğa dağılmış durumda. Bu, ezberlenmiş klasik özyinelemeli çözüm kalıbını yetersiz bırakıyor ve modelin mevcut durumla hedef arasındaki yolu gerçekten planlamasını gerektiriyor.

Küçük Transformer Ne Öğrendi?

Ekip önce önceden hesaplanmış çözüm izleri üzerinde küçük Transformer modellerini sıfırdan eğitti. Katmanlardaki iç etkinlik doğrusal çözümleyiciler ve temsil analiziyle incelendi. Dört diskli bulmacanın 81 olası durumu, matematiksel olarak Sierpinski üçgeni biçiminde bir durum uzayı oluşturuyor. Modelin artık akışında bu geometrinin doğrusal olarak çözülebildiği ve yalnızca görsel bir benzerlik olmadığı bulundu.

Nedensellik testi için bir problemin iç temsili başka bir probleme aktarıldı. Çıktının beklenen yönde değişmesi, temsilin çözüm üretiminde gerçekten rol oynadığını gösterdi. Başka bir deyişle küçük model yalnızca hamle dizilerini ezberlememiş; disklerin hangi çubukta olduğunu ve durumlar arasındaki geçişleri sıkıştırılmış bir dünya modeli içinde kodlamış görünüyor.

Büyük Akıl Yürütme Modellerinde Şaşırtıcı Ayrım

Araştırma daha sonra Qwen3.6-27B ile DeepSeek-R1-Distill-Qwen-32B modellerine geçti. Makaleye göre iki model de istemin sonunda Sierpinski durum modelini neredeyse kusursuz biçimde kodlayabiliyordu. Buna rağmen üçten fazla disk içeren flat-to-flat görevlerin çoğunda başarısız oldular. Sorun başlangıçta kuralların veya durumun hiç anlaşılmaması değildi.

Üretim adımları boyunca yapılan ölçüm, dünya modeli temsilinin plan ilerledikçe zayıfladığını gösterdi. Model bir sonraki hamleleri yazarken başlangıçtaki net durum bilgisi bozuluyor; yanlış hamle bir sonraki bağlamı daha da kirletiyor. Bu ayrım önemli, çünkü çözümü yalnızca daha fazla başlangıç açıklaması vermekte değil, çalışma belleğini plan boyunca korumakta aramak gerektiğini düşündürüyor.

Temsile Müdahale Performansı Artırdı

Araştırmacılar istem sonundaki daha temiz temsili çıkarım sırasında belirli katmanlara yeniden enjekte etti. Yardımsız çözülemeyen örneklerin bir bölümünde performans arttı. Bu deney, “gerekli bilgi modelde hiç yok” açıklamasını zayıflatıyor. Bilgi var, ancak hesaplama boyunca erişilebilir biçimde tutulamıyor. İyileşmenin kısmi kalması ise tek sorunun temsil kaybı olmadığını; arama, hata kontrolü ve çıktı üretiminin de rol oynadığını gösteriyor.

Bu Sonuç Ürünler İçin Ne Anlama Geliyor?

  • Uzun görevlerde ara durumu dış belleğe yazmak, yalnızca daha uzun düşünme metni üretmekten daha yararlı olabilir.
  • Planın her adımında kural ve durum doğrulaması yapmak hata zincirini erken kesebilir.
  • Ajan sistemleri, hedef ve gerçekleşen durumu yapılandırılmış tabloda tutarak dil bağlamındaki bozulmayı azaltabilir.
  • Değerlendirmeler yalnızca doğru sonuca değil, iç durumun adımlar boyunca korunup korunmadığına da bakabilir.

Sınırları Unutmamak Gerekiyor

Hanoi Kulesi kapalı kurallı, küçük ve sentetik bir planlama problemi. Sonuçları yazılım geliştirme, tıp, hukuk veya gerçek dünya robot görevlerine doğrudan genellemek doğru değil. İncelenen büyük modeller de bütün yapay zekâ ekosistemini temsil etmiyor. Makale arXiv ön baskısı ve bulgular hakemli yayın sürecinden geçmeden değişebilir. Yine de iç temsille görünen davranışı birbirinden ayırması, başarısızlığı daha somut bir mühendislik problemine dönüştürüyor.

Almadanincele Yorumu

Bu çalışma, modelin bir şeyi “bilmesi” ile o bilgiyi uzun görev boyunca güvenilir kullanmasının aynı olmadığını güzel gösteriyor. Günlük kullanıcı için pratik karşılığı açık: Yapay zekâdan uzun bir plan isterken ara hedefleri, gerçekleşen adımları ve kısıtları düzenli biçimde yeniden doğrulatmak hâlâ gerekli.

Gelecek kuşak akıl yürütme sistemlerinde en büyük sıçrama yalnızca daha büyük modelden gelmeyebilir. Kalıcı çalışma belleği, yapılandırılmış durum takibi ve adım sonrası denetim, modelin başta kurduğu doğru resmi planın sonunda da korumasını sağlayabilir.

Kapak görseli: Devin Pereira ve Willem Zuidema araştırması, Şekil 2. Kullanım bilgisi: Açık erişimli araştırmanın özgün grafiği; kaynak ve lisans bilgisiyle editoryal kullanım.

Kaynaklar

  • Transformers Struggle to Use Their Emergent World Models – arXiv
  • Araştırmanın açık erişimli HTML tam metni
Tags: Akıl YürütmeBüyük Dil ModelleriDünya ModeliTower of HanoiYapay Zeka Araştırması
SummarizeShare234
Previous Post

Yapay Zekâ Restoranların Yüzde 85,6’sını Hiç Önermedi: Görünürlükte Ne Belirleyici?

Next Post

GIIAS 2026 Sona Erdi: 43 Otomobil Markası Elektrikli ve Hibrit Yarışını Nasıl Gösterdi?

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

Microsoft araştırmasındaki robot kollu görev deneyini gösteren resmi görsel

Microsoft Araştırması: Robotun Yapay Zekâ İşlemini Dışarı Taşımak Ne Kazandırıyor?

by Almadanincele Editör Ekibi
Eylül 24, 2026
0

Microsoft Research, robot AI hesaplamasını robot dışındaki GPU’ya taşımanın görev başarısı ve pil ömrüne etkisini inceledi. Ağ gecikmesi sınırını da anlattık.

Google AI Max ve AI Brief reklam kontrolünü anlatan resmi görsel

Google AI Brief Yedi Yeni Dile Açılıyor: Türkçe Neden Henüz Listede Yok?

by Almadanincele Editör Ekibi
Eylül 24, 2026
0

Google, AI Brief kapalı beta dil kapsamını genişletti ve AI Max için yeni rapor duyurdu. Türkçe desteği, reklam kontrolü ve rapor takvimini ayırdık.

EvilTokens soruşturmasına ilişkin Microsoft resmi editoryal başlık görseli

Microsoft EvilTokens Altyapısını Hedef Aldı: Yapay Zekâ Dolandırıcılıkta Nasıl Kullanıldı?

by Almadanincele Editör Ekibi
Eylül 23, 2026
0

Microsoft, AI destekli dolandırıcılık platformu EvilTokens’a ait 50 siteyi ele geçirdiğini ve 150’den fazla alan adını devre dışı bıraktığını açıkladı.

Claude Opus 5.5 sürüm duyurusunun resmi editoryal görseli

Claude Opus 5.5 Duyuruldu: Daha Düşük Maliyet İddiası Neyi Değiştiriyor?

by Almadanincele Editör Ekibi
Eylül 23, 2026
0

Anthropic, Opus 5.5 için Opus 5’e göre tipik iş yükünde yüzde 40 düşük maliyet ve yeni güvenlik değerlendirmeleri açıklıyor. Ölçümlerin sınırını anlattık.

Next Post
GIIAS 2026 otomobil fuarı tarihlerini ve gelecek temalı otomobili gösteren resmi afiş

GIIAS 2026 Sona Erdi: 43 Otomobil Markası Elektrikli ve Hibrit Yarışını Nasıl Gösterdi?

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

AsusZenfonePegasusSİnceleme

Asus Zenfone Pegasus 3S İnceleme

Ocak 10, 2017
TikTok ve Universal Music Arasındaki Anlaşmazlık Sektörde Dalgalar Yaratıyor

TikTok ve Universal Music Arasındaki Anlaşmazlık Sektörde Dalgalar Yaratıyor

Şubat 16, 2024
Apple AirBar

Apple AirBar İncelemesi

Ocak 2, 2018
Nanoleaf Aurora Sistemi

Nanoleaf Aurora Sistemi İncelemesi

Ağustos 31, 2017
Forbes Türkiye'nin En Zengin İş Adamları Listesi

Forbes Türkiye’nin En Zengin İş Adamları Listesi Açıklandı

Mart 4, 2018
Turkcell T80

Turkcell T80

Temmuz 12, 2017
Kingston DataTraveler Ultimate 2TB

Yeni Kingston 2TB Flash Bellek

Haziran 18, 2017
Claude Opus 5.5 sürüm duyurusunun resmi editoryal görseli

Claude Opus 5.5 Duyuruldu: Daha Düşük Maliyet İddiası Neyi Değiştiriyor?

Eylül 23, 2026
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

Meta VR Glasses sanal gerçeklik gözlüğünün resmi ürün görseli

Meta VR Glasses Ön İncelemesi: 100 Gramlık Gözlük Quest’in Yerini Alır mı?

Eylül 24, 2026
ASUS Googlebook 14 dizüstünün 3K OLED ekranını gösteren resmi ürün görseli

ASUS Googlebook 14 Ön İncelemesi: 990 Gramlık OLED Dizüstü Kime Uygun?

Eylül 24, 2026

Takip

Yapay yüz taklidi olasılığını video küçük resimleri üzerinde inceleyen içerik üreticisini gösteren temsili editoryal görsel

YouTube’da Yapay Zekâ ile Taklit Edilen Yüzünüzü Nasıl Kontrol Edersiniz?

Eylül 24, 2026
GitHub Copilot uygulamasının yerel sandbox özelliğini gösteren resmi görsel

GitHub Copilot Uygulamasına Yerel Sandbox Geldi: Hangi Erişimleri Sınırlıyor?

Eylül 24, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.