AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Hanoi Kulesi durumlarını Sierpinski üçgeni biçiminde gösteren araştırma grafiği

Dört diskli Hanoi Kulesi’nin olası durumları Sierpinski üçgeni oluşturuyor; çalışma modellerin bu geometrik yapıyı iç temsilde kurabildiğini bildiriyor.

Akıl Yürüten Modeller Dünya Modelini Kuruyor ama Planlarken Kaybediyor: Yeni Çalışma Ne Diyor?

Ağustos 10, 2026
in Yapay Zeka
0
585
SHARES
3.3k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

Büyük dil modelleri bir sorunun kurallarını gerçekten temsil ediyor mu, yoksa yalnızca daha önce gördükleri çözüm kalıplarını mı taklit ediyor? 7 Ağustos 2026’da yayımlanan “Transformers Struggle to Use Their Emergent World Models” başlıklı çalışma, bu soruyu Hanoi Kulesi üzerinden mekanik olarak inceliyor. Devin Pereira ve Willem Zuidema’nın sonucu basit bir “modeller düşünemiyor” iddiasından daha incelikli: Bazı modeller doğru dünya modelini kuruyor, fakat uzun plan boyunca onu koruyup kullanmakta zorlanıyor.

Neden Hanoi Kulesi?

Bulmacada farklı büyüklükteki diskler üç çubuk arasında taşınıyor; bir seferde tek disk hareket ediyor ve büyük disk küçüğün üzerine konamıyor. Standart sürümde bütün diskler bir çubuktan diğerine aktarılıyor. Araştırmacıların kullandığı “flat-to-flat” varyantında başlangıç ve hedef diskleri birden fazla çubuğa dağılmış durumda. Bu, ezberlenmiş klasik özyinelemeli çözüm kalıbını yetersiz bırakıyor ve modelin mevcut durumla hedef arasındaki yolu gerçekten planlamasını gerektiriyor.

Küçük Transformer Ne Öğrendi?

Ekip önce önceden hesaplanmış çözüm izleri üzerinde küçük Transformer modellerini sıfırdan eğitti. Katmanlardaki iç etkinlik doğrusal çözümleyiciler ve temsil analiziyle incelendi. Dört diskli bulmacanın 81 olası durumu, matematiksel olarak Sierpinski üçgeni biçiminde bir durum uzayı oluşturuyor. Modelin artık akışında bu geometrinin doğrusal olarak çözülebildiği ve yalnızca görsel bir benzerlik olmadığı bulundu.

Nedensellik testi için bir problemin iç temsili başka bir probleme aktarıldı. Çıktının beklenen yönde değişmesi, temsilin çözüm üretiminde gerçekten rol oynadığını gösterdi. Başka bir deyişle küçük model yalnızca hamle dizilerini ezberlememiş; disklerin hangi çubukta olduğunu ve durumlar arasındaki geçişleri sıkıştırılmış bir dünya modeli içinde kodlamış görünüyor.

Büyük Akıl Yürütme Modellerinde Şaşırtıcı Ayrım

Araştırma daha sonra Qwen3.6-27B ile DeepSeek-R1-Distill-Qwen-32B modellerine geçti. Makaleye göre iki model de istemin sonunda Sierpinski durum modelini neredeyse kusursuz biçimde kodlayabiliyordu. Buna rağmen üçten fazla disk içeren flat-to-flat görevlerin çoğunda başarısız oldular. Sorun başlangıçta kuralların veya durumun hiç anlaşılmaması değildi.

Üretim adımları boyunca yapılan ölçüm, dünya modeli temsilinin plan ilerledikçe zayıfladığını gösterdi. Model bir sonraki hamleleri yazarken başlangıçtaki net durum bilgisi bozuluyor; yanlış hamle bir sonraki bağlamı daha da kirletiyor. Bu ayrım önemli, çünkü çözümü yalnızca daha fazla başlangıç açıklaması vermekte değil, çalışma belleğini plan boyunca korumakta aramak gerektiğini düşündürüyor.

Temsile Müdahale Performansı Artırdı

Araştırmacılar istem sonundaki daha temiz temsili çıkarım sırasında belirli katmanlara yeniden enjekte etti. Yardımsız çözülemeyen örneklerin bir bölümünde performans arttı. Bu deney, “gerekli bilgi modelde hiç yok” açıklamasını zayıflatıyor. Bilgi var, ancak hesaplama boyunca erişilebilir biçimde tutulamıyor. İyileşmenin kısmi kalması ise tek sorunun temsil kaybı olmadığını; arama, hata kontrolü ve çıktı üretiminin de rol oynadığını gösteriyor.

Bu Sonuç Ürünler İçin Ne Anlama Geliyor?

  • Uzun görevlerde ara durumu dış belleğe yazmak, yalnızca daha uzun düşünme metni üretmekten daha yararlı olabilir.
  • Planın her adımında kural ve durum doğrulaması yapmak hata zincirini erken kesebilir.
  • Ajan sistemleri, hedef ve gerçekleşen durumu yapılandırılmış tabloda tutarak dil bağlamındaki bozulmayı azaltabilir.
  • Değerlendirmeler yalnızca doğru sonuca değil, iç durumun adımlar boyunca korunup korunmadığına da bakabilir.

Sınırları Unutmamak Gerekiyor

Hanoi Kulesi kapalı kurallı, küçük ve sentetik bir planlama problemi. Sonuçları yazılım geliştirme, tıp, hukuk veya gerçek dünya robot görevlerine doğrudan genellemek doğru değil. İncelenen büyük modeller de bütün yapay zekâ ekosistemini temsil etmiyor. Makale arXiv ön baskısı ve bulgular hakemli yayın sürecinden geçmeden değişebilir. Yine de iç temsille görünen davranışı birbirinden ayırması, başarısızlığı daha somut bir mühendislik problemine dönüştürüyor.

Almadanincele Yorumu

Bu çalışma, modelin bir şeyi “bilmesi” ile o bilgiyi uzun görev boyunca güvenilir kullanmasının aynı olmadığını güzel gösteriyor. Günlük kullanıcı için pratik karşılığı açık: Yapay zekâdan uzun bir plan isterken ara hedefleri, gerçekleşen adımları ve kısıtları düzenli biçimde yeniden doğrulatmak hâlâ gerekli.

Gelecek kuşak akıl yürütme sistemlerinde en büyük sıçrama yalnızca daha büyük modelden gelmeyebilir. Kalıcı çalışma belleği, yapılandırılmış durum takibi ve adım sonrası denetim, modelin başta kurduğu doğru resmi planın sonunda da korumasını sağlayabilir.

Kapak görseli: Devin Pereira ve Willem Zuidema araştırması, Şekil 2. Kullanım bilgisi: Açık erişimli araştırmanın özgün grafiği; kaynak ve lisans bilgisiyle editoryal kullanım.

Kaynaklar

  • Transformers Struggle to Use Their Emergent World Models – arXiv
  • Araştırmanın açık erişimli HTML tam metni
Tags: Akıl YürütmeBüyük Dil ModelleriDünya ModeliTower of HanoiYapay Zeka Araştırması
SummarizeShare234
Previous Post

Yapay Zekâ Restoranların Yüzde 85,6’sını Hiç Önermedi: Görünürlükte Ne Belirleyici?

Next Post

GIIAS 2026 Sona Erdi: 43 Otomobil Markası Elektrikli ve Hibrit Yarışını Nasıl Gösterdi?

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

YouTube’un içerik üretim araçlarını anlatan resmi Made on YouTube 2026 görseli

YouTube Studio’ya Gemini Destekli Sohbetli Kurgu Geliyor: Üreticiye Ne Sağlayacak?

by Almadanincele Editör Ekibi
Eylül 26, 2026
0

YouTube, Shorts ve Create uygulamasına sohbetli yapay zekâ kurgusu, kanal odaklı küçük resimler ve Ask Studio geri bildirimi ekliyor.

Google Gemini 3.8 Live Avatar özelliğini anlatan resmi 16:9 görsel

Gemini 3.8 Live Avatar Tanıtıldı: 97 Dilde Konuşan Kurumsal Yapay Zekâ

by Almadanincele Editör Ekibi
Eylül 26, 2026
0

Google, Gemini Enterprise için görüntülü ve sesli etkileşim kuran Live Avatar’ı tanıttı; 97 dilde konuşma ve arka planda araç çalıştırma vaat ediliyor.

Gemini üzerinden üretkenlik ve tasarım uygulamalarına bağlanan çalışma alanını gösteren resmi görsel

Gemini’ye Airtable, Adobe ve Peloton Bağlantıları Geliyor: Veriler Nasıl Paylaşılacak?

by Almadanincele Editör Ekibi
Eylül 25, 2026
0

Google, Gemini’ye üretkenlik, tasarım ve yaşam servisleri ekliyor. Airtable, Adobe, Webflow ve Peloton gibi uygulamaların kapsamını inceledik.

Meta Muse yapay zekâ ajanının gözlükle çevredeki nesneye yanıt verdiği resmi etkinlik görüntüsü

Meta Muse Gözlüklere Geliyor: Ekrana Bakmadan Görev Tamamlayan Ajan Nasıl Çalışacak?

by Almadanincele Editör Ekibi
Eylül 25, 2026
0

Meta, Muse ajanını gözlüklere ve yeni alışveriş, üretkenlik bağlantılarına taşıyacağını açıkladı. Duyurudaki vaatleri ve kontrol sorularını ayırdık.

Next Post
GIIAS 2026 otomobil fuarı tarihlerini ve gelecek temalı otomobili gösteren resmi afiş

GIIAS 2026 Sona Erdi: 43 Otomobil Markası Elektrikli ve Hibrit Yarışını Nasıl Gösterdi?

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

Apple cihazlarında çocuk güvenliği ve aile ayarlarını gösteren resmi görsel

Apple’ın Yeni Çocuk Güvenliği Özellikleri Kullanıma Açıldı: Ebeveynler Neleri Ayarlayabilir?

Eylül 16, 2026
Dizüstü bilgisayarın kurtarma sırasında kablosuz ağa bağlanmasını anlatan temsili ekran

Windows 11 Insider’da Kurtarma Yeniliği: Kayıtlı Wi-Fi Bilgileri WinRE’ye Taşınıyor

Eylül 6, 2026
Samsung Galaxy S26 FE mavi renkli telefonun resmi ürün görseli

Samsung Galaxy S26 FE Ön İncelemesi: 120 Hz Ekran, Exynos 2500 ve 7 Yıl Destek

Eylül 26, 2026
NVIDIA DSX Ready enerji ve soğutma altyapısı resmi teknik görseli

NVIDIA DSX Ready Duyuruldu: AI Veri Merkezinde Pil ve Sıvı Soğutma Nasıl Seçilecek?

Eylül 21, 2026
Aile ekran süresi ve oyun sınırlarını birlikte düzenleyen ebeveyn ile çocuk

Microsoft Family Safety Nasıl Kurulur? Windows ve Xbox İçin Adım Adım Rehber

Eylül 12, 2026
GPT-6 Astra ile bilgisayar, kod ve profesyonel iş akışlarını temsil eden görsel

GPT-6 Astra Tanıtıldı: OpenAI’ın Yeni Modeli İş Akışlarını Nasıl Değiştirecek?

Eylül 10, 2026
Dağlık arazide koşucu ile iki Garmin fēnix 9 akıllı saati

Garmin fēnix 9 Pro Ön İncelemesi: Uydu, LTE ve 57 Gün Pil Kime Uygun?

Ağustos 28, 2026
Genç kullanıcı ve ebeveynin dizüstü bilgisayarda yapay zekâ güvenlik ayarlarını incelemesi

OpenAI California’nın Gençlere Yönelik Yapay Zekâ Güvenliği Tasarısını Destekliyor

Eylül 1, 2026
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

Samsung Galaxy A08 mavi, yeşil ve gümüş renk seçenekleriyle resmi ürün görseli

Samsung Galaxy A08 Ön İncelemesi: 6.000 mAh Pil ve 6 Yıl Güncelleme Sözü

Eylül 26, 2026
Samsung Galaxy S26 FE mavi renkli telefonun resmi ürün görseli

Samsung Galaxy S26 FE Ön İncelemesi: 120 Hz Ekran, Exynos 2500 ve 7 Yıl Destek

Eylül 26, 2026

Takip

Android Motion Assist hareket baloncuklarını anlatan resmi Android güncelleme görseli

Android Motion Assist Nasıl Açılır? Yolculukta Ekran Kullanımını Daha Rahat Hale Getirme

Eylül 26, 2026
Kaynak kodu üzerinde statik güvenlik analizi akışını anlatan özgün editoryal görsel

GitHub CodeQL 2.27.1 Güncellendi: C++, Kotlin ve Go Analizinde Neler Değişti?

Eylül 26, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.