AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Kullanıcı arayüzü bileşenlerini koordinat ve erişilebilirlik ağacıyla kontrol eden iki yapay zekâ yaklaşımı

ComponentBench, koordinatla tıklama ile erişilebilirlik ağacına dayalı kontrol arasındaki büyük başarı farkını görünür hâle getiriyor.

Bilgisayar Kullanan Yapay Zekâ Neden Basit Düğmede Takılıyor? 2.910 Görevlik ComponentBench Sonucu

Ağustos 21, 2026
in Yapay Zeka
0
586
SHARES
3.3k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

Bir yapay zekâ modelinin ekrandaki düğmeye tıklaması kolay görünebilir. Ancak açılır menüyü doğru sırayla kullanmak, kaydırıcıyı belirli değere getirmek, takvimden tarih seçmek veya sürükle-bırak yapmak; görsel algı, hedef bulma ve eylem kontrolünü aynı anda gerektiriyor. ComponentBench adlı yeni çalışma bu küçük ama belirleyici becerileri 2.910 görevle ölçüyor.

18 Ağustos 2026’da arXiv’e gönderilen ve COLM 2026’ya kabul edildiği belirtilen çalışma, uzun iş akışı testleriyle tek tıklamalık oyuncak görevler arasındaki boşluğu hedefliyor. Bulgular ön çalışma niteliğinde; benchmark başarısı gerçek bilgisayarda kusursuz ajan anlamına gelmiyor.

ComponentBench Neyi Test Ediyor?

Benchmark 97 yaygın kullanıcı arayüzü bileşeni içeriyor. Düğme, onay kutusu, sekme, açılır menü, kaydırıcı, tarih seçici, dosya benzeri liste, zengin metin alanı ve sürüklenebilir öğeler gibi bileşenler programlı olarak doğrulanabilen görevlerde kullanılıyor.

Toplam 2.910 görev, yalnız “tıkla” komutundan oluşmuyor. Ajanın bileşenin durumunu anlaması, doğru hedefi seçmesi, gerektiğinde birden fazla adım atması ve sonunda arayüzün istenen hâle geldiğini doğrulaması gerekiyor. İnsan referans yolları temizlenerek gereksiz hareketlerin değerlendirmeyi bozması azaltılmış.

Neden Bileşen Düzeyi Önemli?

Uzun bir uçak bileti alma görevinde başarısızlığın nerede başladığını bulmak zordur. Model tarihi mi yanlış okudu, şehir alanını mı karıştırdı, açılır menü mü kapanmadı, yoksa son ödeme adımında mı durdu? ComponentBench her parçayı ayrı ölçerek hata kaynağını daha görünür yapıyor.

Bu yaklaşım geliştiriciye “ajan genel olarak yüzde 40 başarılı” demekten daha yararlı bilgi verir. Örneğin metin alanında güçlü ama sürükleme ve takvimde zayıf model için araç ve arayüz özelinde iyileştirme yapılabilir.

Hangi Modeller Karşılaştırıldı?

Çalışma GPT-5.4, Gemini 3 Flash, GPT-5.4 mini, GPT-5 mini, Gemini 3.1 Flash-Lite, Qwen3-VL-235B ve UI-TARS-1.5-7B dâhil yedi modeli dört farklı gözlem ve eylem alanında test ediyor. Model adları aynı olsa bile ekrana hangi temsilin verildiği ve eylemin nasıl uygulandığı sonucu ciddi biçimde değiştiriyor.

Dört Kontrol Biçimi

  • Yalnız piksel ve koordinat: Model ekran görüntüsüne bakıp x-y noktasına tıklıyor.
  • Yapılandırılmış gözlem: Arayüzdeki düğme, alan ve durumlar erişilebilirlik ağacı benzeri bir yapıyla sunuluyor.
  • Karma yaklaşım: Görsel ekran ile yapılandırılmış öğe bilgisi birlikte kullanılıyor.
  • Farklı eylem soyutlamaları: Ham fare hareketi yerine öğe seçme gibi daha yüksek seviyeli komutlar deneniyor.

En Çarpıcı Sonuç

Aynı modelin başarı oranı arayüz biçimine göre 30 yüzde puanından fazla değişebiliyor. GPT-5 mini, erişilebilirlik ağacı tabanlı gözlemde yüzde 83,1 başarıya ulaşırken yalnız piksel ve koordinat kontrolünde yüzde 48,9’da kaldı. Yani modelin “zekâsı” değişmeden, sisteme verilen araç başarıyı neredeyse iki farklı ürün düzeyine taşıyor.

Bu sonuç, bilgisayar kullanan ajanlarda yalnız daha büyük model eğitmenin yeterli olmadığını gösteriyor. Web sitesi doğru erişilebilirlik etiketlerine, tutarlı öğe durumlarına ve güvenilir odak sırasına sahipse hem engelli kullanıcı hem otomasyon sistemi daha iyi çalışıyor.

Hız Sorunu Devam Ediyor

En hızlı model ve arayüz birleşimi bile eşleştirilmiş insan referansından 3,7 kat daha yavaş kaldı. Her adımda ekranı yeniden yorumlamak, model çağrısı yapmak ve eylemi doğrulamak gecikme oluşturuyor. Başarı oranı yükselse bile müşteri temsilcisi masasındaki basit bir işlem dakikalar sürüyorsa ekonomik değer azalabilir.

Hız yalnız kullanıcı sabrı değil maliyet meselesi. Çok adımlı görevde her ekran görüntüsü ve model çağrısı ek hesaplama tüketiyor. Üretim sistemi yüksek başarı, düşük gecikme ve düşük maliyet arasında denge kurmalı.

En Zor Bileşenler

Uzamsal manipülasyon gerektiren görevler öne çıkan zayıflık. Kaydırıcıyı kesin değere getirme, öğeyi doğru bölgeye sürükleme, küçük hedefi seçme ve ekran taşması sonrası konumu koruma modelleri zorluyor. Görsel olarak benzer iki kontrolün yan yana olması da yanlış tıklamayı artırabiliyor.

Bu hatalar gerçek dünyada riskli olabilir. Yanlış tarih seçmek geri alınabilir; fakat finans uygulamasında yanlış hesap, hastane sisteminde yanlış hasta veya yönetim panelinde silme düğmesi ciddi sonuç doğurur.

Ürün Tasarımcıları İçin Dersler

  1. Erişilebilirlik adlarını yalnız yasal zorunluluk değil işlevsel arayüz verisi olarak görün.
  2. Benzer düğmelere ayırt edilebilir ad ve durum bilgisi verin.
  3. Yüksek riskli eylemde onay, geri alma ve açık sonuç mesajı kullanın.
  4. Ajanın işlem öncesi ve sonrası durumu karşılaştırmasını sağlayın.
  5. Başarıyı yalnız uçtan uca değil bileşen sınıfına göre raporlayın.

Sınırlamalar

97 bileşen geniş bir başlangıç olsa da masaüstü işletim sistemi, mobil jest, özel çizim yüzeyi ve kurumsal eski yazılımların tamamını kapsamıyor. Programlı doğrulama gerçek kullanıcının memnuniyetini veya semantik olarak doğru karar verildiğini her zaman ölçemez. Ayrıca model sürümleri hızla değiştiği için sıralama kalıcı kabul edilmemeli.

Almadanincele Yorumu

ComponentBench’in en değerli bulgusu, bilgisayar kullanan yapay zekâda model kadar arayüzün de ürünün parçası olduğunu göstermesi. Aynı model erişilebilirlik ağacıyla güçlü, yalnız piksel gördüğünde belirgin biçimde zayıf.

Bizce şirketler “ajanımız bu işi yapıyor” demeden önce görevdeki her bileşeni ayrı test etmeli. Yüksek riskli butonlarda insan onayı, işlem sonrası doğrulama ve geri alma zorunlu olmalı. Aksi hâlde yüzde 80 başarı, beş işlemden birinde yanlış eylem demektir.

Kapak görseli: Almadanincele / OpenAI ImageGen – özgün editoryal görsel. Kullanım bilgisi: Almadanincele için OpenAI ImageGen ile özgün üretilmiştir.

Kaynaklar

  • ComponentBench: Benchmarking Component-Level GUI Agency
Tags: Bilgisayar Kullanan Yapay ZekaComponentBenchErişilebilirlik AğacıGUI AjanlarıYapay Zeka Benchmark
SummarizeShare234
Previous Post

Yapay Zekâ Ajanları Gizlice Anlaşabilir mi? VLA Testi Görünmez Koordinasyonu Yakaladı

Next Post

Microsoft Edge 27 Ağustos’ta İki Haftalık Güncelleme Düzenine Geçiyor: Kullanıcıyı Ne Bekliyor?

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

Bir teknoloji ekibinin masada dizüstü bilgisayarlar üzerinde birlikte çalıştığı gerçek ofis fotoğrafı

OpenAI Model Damıtma Girişimini Durdurduğunu Açıkladı: Olay Kullanıcı Verisi İhlali miydi?

by Almadanincele Editör Ekibi
Ekim 5, 2026
0

OpenAI, korumalı akıl yürütme çıktılarının ölçekli biçimde elde edilmeye çalışıldığı bir kampanyayı durdurduğunu duyurdu. Şirketin açıklamasına göre şifreleme ya da kullanıcı veri tabanı ihlali olmadı; olay model etkileşimlerinin...

Bir araştırmacının laboratuvarda numuneyi test tüpüne aktardığı gerçek fotoğraf

GPT-Rosalind’in Ücretli Erişimi Bugün Başlıyor: Bilimsel Araştırmada Neleri Değiştirebilir?

by Almadanincele Editör Ekibi
Ekim 5, 2026
0

OpenAI’ın yaşam bilimleri araştırmaları için geliştirdiği GPT-Rosalind için yayımlanan fiyatlandırma 5 Ekim’de yürürlüğe giriyor. Erişim uygun kurumsal müşterilerle sınırlı; model ilaç onaylayan ya da doktor yerine geçen bir...

Aydınlık ofiste bir bilgisayar ekranında kod inceleyen iki yazılım geliştiricisi

Google Gemini 4 Argon’u Tanıttı: Siber Güvenlik Uzmanlarına Açılan Model Ne Yapabilecek?

by Almadanincele Editör Ekibi
Ekim 4, 2026
0

Google’ın yeni üst düzey modeli Gemini 4 Argon, ilk aşamada yalnızca Fairwind programındaki güvenilir siber savunma uzmanlarına açılıyor. Şirket 1 milyon token bağlam ve uzun görevlerde akıl yürütme...

Gerçek bir yazılım ekibinin bilgisayar başında birlikte çalıştığı doğal ofis fotoğrafı

Anthropic 10 Bin Mühendisi Yapay Zekâ İçin Eğitecek: 100 Milyon Dolarlık Program Ne Getiriyor?

by Almadanincele Editör Ekibi
Ekim 4, 2026
0

Anthropic, 2027 sonuna kadar 10 bin Frontier Deployed Engineer yetiştirmek için 100 milyon dolar ayırdığını açıkladı. Program bireysel çevrimiçi kurstan çok şirketlerin seçtiği mühendislere yönelik uygulamalı bir uzmanlık...

Next Post
Masaüstü tarayıcı güncelleme ekranı ve iki haftalık sürüm düzenini gösteren takvim

Microsoft Edge 27 Ağustos’ta İki Haftalık Güncelleme Düzenine Geçiyor: Kullanıcıyı Ne Bekliyor?

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

Windows bilgisayarında disk şifreleme ve kurtarma anahtarı yedeklemeyi anlatan özgün editoryal görsel

Windows 11’de BitLocker Kurtarma Anahtarı Nasıl Yedeklenir?

Ekim 2, 2026
Canlı sesli yapay zekâ ile kamera bağlamını birleştiren özgün çizim

Google Gemini 3.8 Live’ı Duyurdu: Görsel Bağlam ve Sesli Görevlerde Neler Değişiyor?

Eylül 29, 2026
GPT-6 Astra ile bilgisayar, kod ve profesyonel iş akışlarını temsil eden görsel

GPT-6 Astra Tanıtıldı: OpenAI’ın Yeni Modeli İş Akışlarını Nasıl Değiştirecek?

Eylül 10, 2026
Konuşma dalga biçimi ve gerçek zamanlı yazıya döküm fikrini anlatan özgün editoryal görsel

Microsoft’tan Anlık Konuşma Çözümleme: Yeni MAI Modelleri 60 Dili Destekliyor

Ekim 2, 2026
Siyah ASUS ProArt P14 H7407 dizüstü bilgisayarın açık görünümü

ASUS ProArt P14 H7407 Ön İncelemesi: 128 GB Birleşik Bellek 1,48 Kg Kasaya Sığdı

Eylül 8, 2026
Lenovo Yoga Pro 9n Gen 11 dizüstü bilgisayarın OLED ekranı ve klavyesi

Lenovo Yoga Pro 9n Gen 11 Ön İncelemesi: 128 GB Bellekli RTX Spark Dizüstü

Eylül 15, 2026
Açık mavi Samsung Galaxy A18 4G modelinin resmi önden ürün fotoğrafı

Galaxy A18 4G Ön İncelemesi: AMOLED Ekran ve Altı Yıl Güncelleme Yeterli mi?

Eylül 23, 2026
Clicks Communicator fiziksel klavyeli telefonun resmi ürün görseli

Clicks Communicator Ön İncelemesi: Fiziksel Klavye, Android 17 ve 4.350 mAh Pil

Eylül 19, 2026
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

JBL Live Flex 4 kulaklıkları ve turuncu Smart Charging Case şarj kutusu

JBL Live Flex 4 Ön İnceleme: Açık Kulak Tasarımı ve Ekranlı Şarj Kutusu

Ekim 5, 2026
Sonos Beam Ultra soundbarın televizyon altındaki oturma odası kurulumu

Sonos Beam Ultra Ön İnceleme: Kompakt Boyutta 7.1.2 Dolby Atmos Ne Vaat Ediyor?

Ekim 5, 2026

Takip

AION2 evreninden karakter ve fantastik oyun dünyasını gösteren resmî yatay görsel

AION2 Bugün Çıkıyor: Ücretsiz Binek Ödülleri, Kurucu Paketleri ve Bilinmesi Gerekenler

Ekim 5, 2026
Android uygulamaları açık bir akıllı telefonun yatay kadrajlı fotoğrafı

Android 17 QPR3 Beta 1 Yayımlandı: Pixel Kullanıcıları Kurmadan Önce Bunları Bilmeli

Ekim 5, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.