AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Kullanıcı arayüzü bileşenlerini koordinat ve erişilebilirlik ağacıyla kontrol eden iki yapay zekâ yaklaşımı

ComponentBench, koordinatla tıklama ile erişilebilirlik ağacına dayalı kontrol arasındaki büyük başarı farkını görünür hâle getiriyor.

Bilgisayar Kullanan Yapay Zekâ Neden Basit Düğmede Takılıyor? 2.910 Görevlik ComponentBench Sonucu

Ağustos 21, 2026
in Yapay Zeka
0
585
SHARES
3.2k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

Bir yapay zekâ modelinin ekrandaki düğmeye tıklaması kolay görünebilir. Ancak açılır menüyü doğru sırayla kullanmak, kaydırıcıyı belirli değere getirmek, takvimden tarih seçmek veya sürükle-bırak yapmak; görsel algı, hedef bulma ve eylem kontrolünü aynı anda gerektiriyor. ComponentBench adlı yeni çalışma bu küçük ama belirleyici becerileri 2.910 görevle ölçüyor.

18 Ağustos 2026’da arXiv’e gönderilen ve COLM 2026’ya kabul edildiği belirtilen çalışma, uzun iş akışı testleriyle tek tıklamalık oyuncak görevler arasındaki boşluğu hedefliyor. Bulgular ön çalışma niteliğinde; benchmark başarısı gerçek bilgisayarda kusursuz ajan anlamına gelmiyor.

ComponentBench Neyi Test Ediyor?

Benchmark 97 yaygın kullanıcı arayüzü bileşeni içeriyor. Düğme, onay kutusu, sekme, açılır menü, kaydırıcı, tarih seçici, dosya benzeri liste, zengin metin alanı ve sürüklenebilir öğeler gibi bileşenler programlı olarak doğrulanabilen görevlerde kullanılıyor.

Toplam 2.910 görev, yalnız “tıkla” komutundan oluşmuyor. Ajanın bileşenin durumunu anlaması, doğru hedefi seçmesi, gerektiğinde birden fazla adım atması ve sonunda arayüzün istenen hâle geldiğini doğrulaması gerekiyor. İnsan referans yolları temizlenerek gereksiz hareketlerin değerlendirmeyi bozması azaltılmış.

Neden Bileşen Düzeyi Önemli?

Uzun bir uçak bileti alma görevinde başarısızlığın nerede başladığını bulmak zordur. Model tarihi mi yanlış okudu, şehir alanını mı karıştırdı, açılır menü mü kapanmadı, yoksa son ödeme adımında mı durdu? ComponentBench her parçayı ayrı ölçerek hata kaynağını daha görünür yapıyor.

Bu yaklaşım geliştiriciye “ajan genel olarak yüzde 40 başarılı” demekten daha yararlı bilgi verir. Örneğin metin alanında güçlü ama sürükleme ve takvimde zayıf model için araç ve arayüz özelinde iyileştirme yapılabilir.

Hangi Modeller Karşılaştırıldı?

Çalışma GPT-5.4, Gemini 3 Flash, GPT-5.4 mini, GPT-5 mini, Gemini 3.1 Flash-Lite, Qwen3-VL-235B ve UI-TARS-1.5-7B dâhil yedi modeli dört farklı gözlem ve eylem alanında test ediyor. Model adları aynı olsa bile ekrana hangi temsilin verildiği ve eylemin nasıl uygulandığı sonucu ciddi biçimde değiştiriyor.

Dört Kontrol Biçimi

  • Yalnız piksel ve koordinat: Model ekran görüntüsüne bakıp x-y noktasına tıklıyor.
  • Yapılandırılmış gözlem: Arayüzdeki düğme, alan ve durumlar erişilebilirlik ağacı benzeri bir yapıyla sunuluyor.
  • Karma yaklaşım: Görsel ekran ile yapılandırılmış öğe bilgisi birlikte kullanılıyor.
  • Farklı eylem soyutlamaları: Ham fare hareketi yerine öğe seçme gibi daha yüksek seviyeli komutlar deneniyor.

En Çarpıcı Sonuç

Aynı modelin başarı oranı arayüz biçimine göre 30 yüzde puanından fazla değişebiliyor. GPT-5 mini, erişilebilirlik ağacı tabanlı gözlemde yüzde 83,1 başarıya ulaşırken yalnız piksel ve koordinat kontrolünde yüzde 48,9’da kaldı. Yani modelin “zekâsı” değişmeden, sisteme verilen araç başarıyı neredeyse iki farklı ürün düzeyine taşıyor.

Bu sonuç, bilgisayar kullanan ajanlarda yalnız daha büyük model eğitmenin yeterli olmadığını gösteriyor. Web sitesi doğru erişilebilirlik etiketlerine, tutarlı öğe durumlarına ve güvenilir odak sırasına sahipse hem engelli kullanıcı hem otomasyon sistemi daha iyi çalışıyor.

Hız Sorunu Devam Ediyor

En hızlı model ve arayüz birleşimi bile eşleştirilmiş insan referansından 3,7 kat daha yavaş kaldı. Her adımda ekranı yeniden yorumlamak, model çağrısı yapmak ve eylemi doğrulamak gecikme oluşturuyor. Başarı oranı yükselse bile müşteri temsilcisi masasındaki basit bir işlem dakikalar sürüyorsa ekonomik değer azalabilir.

Hız yalnız kullanıcı sabrı değil maliyet meselesi. Çok adımlı görevde her ekran görüntüsü ve model çağrısı ek hesaplama tüketiyor. Üretim sistemi yüksek başarı, düşük gecikme ve düşük maliyet arasında denge kurmalı.

En Zor Bileşenler

Uzamsal manipülasyon gerektiren görevler öne çıkan zayıflık. Kaydırıcıyı kesin değere getirme, öğeyi doğru bölgeye sürükleme, küçük hedefi seçme ve ekran taşması sonrası konumu koruma modelleri zorluyor. Görsel olarak benzer iki kontrolün yan yana olması da yanlış tıklamayı artırabiliyor.

Bu hatalar gerçek dünyada riskli olabilir. Yanlış tarih seçmek geri alınabilir; fakat finans uygulamasında yanlış hesap, hastane sisteminde yanlış hasta veya yönetim panelinde silme düğmesi ciddi sonuç doğurur.

Ürün Tasarımcıları İçin Dersler

  1. Erişilebilirlik adlarını yalnız yasal zorunluluk değil işlevsel arayüz verisi olarak görün.
  2. Benzer düğmelere ayırt edilebilir ad ve durum bilgisi verin.
  3. Yüksek riskli eylemde onay, geri alma ve açık sonuç mesajı kullanın.
  4. Ajanın işlem öncesi ve sonrası durumu karşılaştırmasını sağlayın.
  5. Başarıyı yalnız uçtan uca değil bileşen sınıfına göre raporlayın.

Sınırlamalar

97 bileşen geniş bir başlangıç olsa da masaüstü işletim sistemi, mobil jest, özel çizim yüzeyi ve kurumsal eski yazılımların tamamını kapsamıyor. Programlı doğrulama gerçek kullanıcının memnuniyetini veya semantik olarak doğru karar verildiğini her zaman ölçemez. Ayrıca model sürümleri hızla değiştiği için sıralama kalıcı kabul edilmemeli.

Almadanincele Yorumu

ComponentBench’in en değerli bulgusu, bilgisayar kullanan yapay zekâda model kadar arayüzün de ürünün parçası olduğunu göstermesi. Aynı model erişilebilirlik ağacıyla güçlü, yalnız piksel gördüğünde belirgin biçimde zayıf.

Bizce şirketler “ajanımız bu işi yapıyor” demeden önce görevdeki her bileşeni ayrı test etmeli. Yüksek riskli butonlarda insan onayı, işlem sonrası doğrulama ve geri alma zorunlu olmalı. Aksi hâlde yüzde 80 başarı, beş işlemden birinde yanlış eylem demektir.

Kapak görseli: Almadanincele / OpenAI ImageGen – özgün editoryal görsel. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.

Kaynaklar

  • ComponentBench: Benchmarking Component-Level GUI Agency
Tags: Bilgisayar Kullanan Yapay ZekaComponentBenchErişilebilirlik AğacıGUI AjanlarıYapay Zeka Benchmark
SummarizeShare234
Previous Post

Yapay Zekâ Ajanları Gizlice Anlaşabilir mi? VLA Testi Görünmez Koordinasyonu Yakaladı

Next Post

Microsoft Edge 27 Ağustos’ta İki Haftalık Güncelleme Düzenine Geçiyor: Kullanıcıyı Ne Bekliyor?

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

Dört yapay zekâ işlem düğümü arasındaki gizli bağlantıyı ortaya çıkaran izleme ışını

Yapay Zekâ Ajanları Gizlice Anlaşabilir mi? VLA Testi Görünmez Koordinasyonu Yakaladı

by Almadanincele Editör Ekibi
Ağustos 21, 2026
0

Yeni bir ön çalışma, ajanların görünür konuşmalar yerine gizli temsil kanallarından anlaşabildiğini gösteriyor. VLA sistemi bu davranışı nasıl izliyor, sonuçlar ne kadar güçlü?

Kırmızı bir yanlış yolun beş yapay zekâ çalışma noktasından geçerek yeşil çözüme katkı verdiği araştırma laboratuvarı

Yanlış Yapay Zekâ Mesajı Doğru Sonuca Yardım Edebilir mi? Beş Testin Şaşırtıcı Bulgusu

by Almadanincele Editör Ekibi
Ağustos 17, 2026
0

Yeni bir ön baskı, yanlış sonuç veren ajan mesajlarının yine de sonraki modele yararlı bir ara fikir taşıyabildiğini gösteriyor. Beş test ve iki model ailesindeki bulguların çok ajanlı...

Farklı görüşlerin üç karar kanalından geçtiği çağdaş bir yurttaş toplantısı ve yapay zekâ sistemi

Katılımcı Ahlaki Yapay Zekâ Tarafsız mı? 809 Kişilik Çalışmanın Sonucu

by Almadanincele Editör Ekibi
Ağustos 17, 2026
0

809 katılımcılı yeni ön baskı, halk oylamasıyla ahlaki yapay zekâ tasarlamanın otomatik olarak tarafsız olmadığını gösteriyor. Özellik seçimi, örneklem ve soru biçiminin sonucu nasıl değiştirdiğini inceledik.

Çok sayıda deney yolunu ve sonuç döngüsünü yöneten yapay zekâ araştırma sistemi

Yapay Zekâ Ajanları Araştırmacı mı, Optimizasyon Uzmanı mı? 36 Görevlik Testin Sonucu

by Almadanincele Editör Ekibi
Ağustos 16, 2026
0

Yedi gelişmiş model 36 uzun soluklu araştırma-geliştirme görevinde sınandı. Yeni çalışma, ajanların uygulamada iyi ama özgün keşif, geri bildirim kullanımı ve deney aktarımında hâlâ kararsız olduğunu gösteriyor.

Next Post
Masaüstü tarayıcı güncelleme ekranı ve iki haftalık sürüm düzenini gösteren takvim

Microsoft Edge 27 Ağustos’ta İki Haftalık Güncelleme Düzenine Geçiyor: Kullanıcıyı Ne Bekliyor?

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

Samsung İçe Doğru Katlanan Telefonu

Samsung İçe Doğru Katlanan Telefonu

Ekim 3, 2017
Nubia V18

Nubia V18 Tanıtımı Gerçekleştirildi

Mart 23, 2018
Tesla Semi

Tesla Semi Tır Modeli Rüyaları Süsleyecek

Kasım 29, 2017
Samsung Galaxy M30S Akıllı Telefon İncelemesi

Samsung Galaxy M30S Akıllı Telefon İncelemesi

Aralık 12, 2019
Nokia 8 Telefonu Özellikleri

Nokia 8 Telefonu

Ekim 9, 2017
Philips 271E1SCA Monitör İncelemesi

Philips 271E1SCA Monitör İncelemesi

Ekim 8, 2020
CXMT DDR5 SODIMM bellek modülü

AI Veri Merkezleri Bellek Krizini Büyütüyor: Ucuz Telefon ve Laptop Dönemi Zorlaşıyor

Temmuz 16, 2026
Alcatel Idol 5S

Alcatel Idol 5S Özellikleri !

Şubat 12, 2017
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

Dört yapay zekâ işlem düğümü arasındaki gizli bağlantıyı ortaya çıkaran izleme ışını

Yapay Zekâ Ajanları Gizlice Anlaşabilir mi? VLA Testi Görünmez Koordinasyonu Yakaladı

Ağustos 21, 2026
Mavi fonda pembe Fujifilm Instax Mini 13 ile fotoğraf çeken kişi

Fujifilm Instax Mini 13 İncelemesi: Selfie Zamanlayıcısı Gerçekten İşe Yarıyor mu?

Ağustos 21, 2026

Takip

S.T.A.L.K.E.R. 2 Update 2.0 resmi görselinde gaz maskeli karakter ve Zone manzarası

S.T.A.L.K.E.R. 2 Update 2.0 Çıktı: Unreal Engine 5.5.4, Yeni Yapay Zekâ ve Sis Sistemi Neyi Değiştiriyor?

Ağustos 21, 2026
Dağ yolunda ilerleyen sarı MINI John Cooper Works Convertible otomobil

MINI John Cooper Works Convertible: 231 Beygirlik Açık Otomobil Kime Hitap Ediyor?

Ağustos 21, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.