AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Bir geliştiricinin dizüstü bilgisayarda terminal ve kod ortamıyla çalıştığı doğal ofis fotoğrafı

Alicia Christin Gerald / Unsplash

TermGrade, Yapay Zekâ Kod Ajanları İçin 1.004 Gerçek Terminal Görevini Açtı

Ekim 9, 2026
in Yapay Zeka
0
585
SHARES
3.2k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

ai& araştırma ekibi 8 Ekim’de TermGrade adlı terminal görevleri koleksiyonunu ve kod ajanı eğitim deneyini yayımladı. Çalışma, bir yapay zekâ kod ajanının yalnızca doğru yanıt verip vermediğini değil, gerçek bir yazılım ortamında komut çalıştırıp dosya değiştirerek görevi tamamlayıp tamamlayamadığını ölçmeyi amaçlıyor. Araştırmacılar 1.004 görev ortamı, 36.144 model denemesi ve her deneme için ölçülmüş geçme oranlarını paylaştıklarını söylüyor. Bu, bir şirketin kendi araştırma blogunda yayımlanan teknik çalışmadır; bağımsız bir standardın ya da tüm kod ajanlarının tarafsız sıralamasının yerini tutmaz.

Öne çıkan bilgiler

  • 1.004 terminal görev ortamı, her biri talimat ve otomatik pytest doğrulayıcısıyla yayımlandı
  • Altı model için 6.024 görev-model eşleşmesinde toplam 36.144 yörünge; başarısız 14.234 deneme de veri paketinde tutuldu
  • Veri setinin üretimi 66.165 aday görevden yürütme filtreleriyle 1.004 göreve indi
  • Eğitim için seçilen ayrı tarifte Terminal-Bench 2.1 üzerinde +3,1 puan; beş koşuda ortalama +2,1 puan raporlandı
  • Bulgular ai& araştırma ekibinin çalışmasıdır; bağımsız çoğaltma ve farklı araç setleriyle kıyas henüz gereklidir

Neden önemli?

Kod yazma ajanlarını karşılaştırmak zordur: sonuç, model kadar araç kullanma biçimine, terminal kurulumuna, görev tarifine ve doğrulayıcı testlere de bağlıdır. TermGrade her görev için bir konteyner, talimat ve pytest doğrulayıcısı sunmayı hedefliyor. Makaledeki önemli yöntem ayrımı, 1.004 görevin yayımlanan değerlendirme seti olması; eğitim örneklerinin bunun tamamını doğrudan kullanmaması. Araştırmacılar görevleri yürütme ile filtrelediklerini, ardından temel model için başarı olasılığı yaklaşık yüzde 50 civarında olan görevleri ayrı bir eğitim deneyinde seçtiklerini belirtiyor. Böylece çok kolay ya da imkânsız görevler yerine gelişime alan bırakabilecek örnekler seçiliyor.

Günlük kullanım ve gerçek karşılığı

Ekip 66.165 aday görev oluşturduğunu ve filtreleme sonunda 1.004 görevi yayımladığını bildiriyor. Altı model ve 6.024 görev-model hücresi üzerinde toplam 36.144 deneme kaydedilmiş; başarısız 14.234 yörüngenin de yayımlanması, yalnızca başarılı örnekleri görme yanlılığını azaltabilir. Eğitim deneyi tarafında 151 görevlik bir alt küme kullanılmış ve ai& kendi tarifinde Terminal-Bench 2.1 skorunda 3,1 puan artış raporlamış; beş tekrarın aynı tarifle ortalaması 2,1 puan olarak verilmiş. Bunlar iki ayrı aşamanın rakamları; değerlendirme setindeki 36 bin denemenin eğitim verisi olduğu anlamına gelmiyor.

Sınırlamalar ve dikkat edilmesi gerekenler

Çalışmanın sahibi aynı zamanda altyapı ve model geliştiren ai&; bu nedenle sonuçlar yöntem açıklaması ve yayımlanan verilerle birlikte okunmalı. Başarı puanları terminal kabuğu, araç iskelesi ve model sürümünden etkilenir. Makale de görev zorluğunun kullanılan iskeleye göre kayabildiğini, 0,50 çevresinin her durumda en iyi eğitim noktası sayılmayacağını tartışıyor. Büyük sayıda örnek olması tek başına benchmarkın gerçek iş yazılımlarını temsil ettiğini kanıtlamaz. Kurumlar veri setini kullanacaksa görev güvenliğini, konteyner bağımlılıklarını, lisansı ve kendi ürünlerinin hata türlerini ayrıca gözden geçirmeli.

Çalışmanın ölçtüğü şey

  • Ortam: Her göreve ait konteyner, talimat dosyası ve otomatik pytest doğrulayıcısı.
  • Görev üretimi: 66.165 aday görevden yürütme kontrolleriyle 1.004 görevlik yayımlanan koleksiyon.
  • Değerlendirme: Altı model, 6.024 görev-model hücresi ve 36.144 ayrı deneme.
  • Hata görünürlüğü: Başarısız 14.234 deneme de pakette tutulmuş.
  • Eğitim deneyi: Ayrı bir 151 görev seçimiyle GRPO++/LoRA tarifi; Terminal-Bench 2.1'de +3,1 puan, beş koşuda +2,1 puan şirket araştırmacılarının raporu.

Neden başarısız denemeler de değerli?

Ajanın nerede takıldığını görmek, yalnızca genel başarı puanından daha çok şey anlatabilir. Yanlış dosya yolu, eksik bağımlılık, testin gereğini anlamama ya da aracı yanlış kullanma farklı hata sınıflarıdır. Hata kayıtları tekrar üretilebilir biçimde sunulursa araştırmacılar modelin hangi koşulda kırıldığını karşılaştırabilir ve eğitim verisini hedefli biçimde seçebilir. Bunun için konteynerin aynı bağımlılıklarla kurulması, model sürümünün ve sistem isteminin belirtilmesi gerekir.

Okur ve geliştirici ne çıkarmalı?

TermGrade, kod ajanlarını tek sayı üzerinden sıralamak yerine görev, model ve çalışma iskelesi ayrıntısını daha görünür kılma çabası olarak değerli. Ancak şirketin raporladığı puan artışı bir ürün kullanıcısının her kod tabanında aynı verim artışını göreceği anlamına gelmez. Özellikle gerçek depo, uzun görev, test yazımı, hata düzeltme ve güvenli terminal kullanımı için bağımsız sonuçlara bakılmalı. İşletmeler pilotta görev tamamlama oranı yanında insanın düzeltme süresini, hatalı değişiklik oranını, kaynak tüketimini ve güvenlik ihlallerini ölçmeli.

Bilgiyi nasıl değerlendirmeli?

Duyurudaki her sayı ve tarih aynı kesinlik düzeyinde değildir. Ürünün açıklanmış teknik değeri, üreticinin hedeflediği sonuç, bağımsız ölçüm ve geleceğe dönük yol haritası birbirinden ayrılmalı. Bir özelliğin hangi ülkede, hangi modelde veya hangi yazılım sürümünde kullanılacağı pratik sonucu değiştirebilir. Özellikle satış, fiyat, destek ve erişim bilgileri yayın gününde yeniden kontrol edilmelidir. Üretici açıklamasında bulunmayan ayrıntıları tahmin ederek tamamlamak yerine belirsizliği açıkça belirtmek, okuyucunun kararını daha sağlıklı kurmasına yardım eder.

Bir karşılaştırma yaparken aynı sınıftaki alternatifleri ortak ölçütlerle ele alın: kullanım amacı, toplam maliyet, uzun dönem destek, servis/uyumluluk ve gerçek performans. Böylece tek bir dikkat çekici özellik tüm ürünün değerini olduğundan büyük göstermemiş olur.

Editoryal değerlendirme

ai& TermGrade terminal ajanı değerlendirme seti hakkındaki duyuruyu değerlendirirken üretici beyanını bağımsız ölçümden ayırmak gerekiyor. Fiyat, kullanılabilirlik, performans ve uyumluluk bölgeye, yapılandırmaya ve yazılım sürümüne göre değişebilir. Karar verirken ilk maliyetin yanında öğrenme, bakım ve kullanım koşullarını da hesaba katın. Henüz bağımsız test edilmeyen sonuçları kesin hüküm gibi değil, doğrulanması gereken iddialar olarak değerlendirin.

Karar vermeden önce pratik kontrol

Resmî teknik belgeyi, yerel fiyatı ve garanti koşullarını kontrol edin. Bir duyuru tek başına gerçek kullanım performansını kanıtlamaz. Mümkünse bağımsız testleri ve kullanıcı deneyimlerini bekleyin; kurumsal kullanımda önce sınırlı bir pilot ve geri alma planı uygulayın.

Almadanincele Yorumu

TermGrade’in olumlu yanı, yalnız başarı örneklerini değil on binlerce denemeyi ve başarısızlıkları da incelemeye açması. Bu, kod ajanı değerlendirmesini daha şeffaf kılabilir. Yine de raporlanan eğitim kazanımı şirketin kendi deneyinden geliyor; farklı modellerde, araç kurulumlarında ve gerçek yazılım depolarında bağımsız tekrarlar görülmeden genelleme yapılmamalı.

Kapak görseli: Alicia Christin Gerald / Unsplash. Kullanım bilgisi: Unsplash Lisansı; fotoğraf Alicia Christin Gerald tarafından yayımlanmıştır..

Kaynaklar

  • ai& Research – TermGrade araştırması ve veri seti
  • Terminal-Bench 2.1 – resmi benchmark deposu
Tags: açık veri setikod ajanlarıTermGradeterminal benchmarkyapay zeka ölçümü
SummarizeShare234
Previous Post

Sigma 16-300mm Nikon Z Ön İnceleme: Tek Lensle 18,8x Zum Ne Sunuyor?

Next Post

İngiltere Veri Düzenleyicisi Yapay Zekâ Ajanları İçin Yeni İnceleme Başlattı

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

İki çalışma arkadaşının belgeleri ve bilgisayar ekranını birlikte incelediği doğal ofis fotoğrafı

İngiltere Veri Düzenleyicisi Yapay Zekâ Ajanları İçin Yeni İnceleme Başlattı

by Almadanincele Editör Ekibi
Ekim 9, 2026
0

ICO, on büyük temel model geliştiricisinden veri koruma iyileştirmeleri aldığını açıkladı ve otonom ajan riskleri için 20 Kasım’a kadar görüş topluyor.

Haber doğrulaması yapan gazetecinin çalışma masasından doğal ve profesyonel fotoğraf

OpenAI, Yapay Zekâ ile Desteklenen Sahte Medya Operasyonlarını Açıkladı

by Almadanincele Editör Ekibi
Ekim 8, 2026
0

OpenAI, Rusya ve İran bağlantılı olduğunu belirttiği iki gizli etki operasyonuna ilişkin bulgularını yayımladı; şirket bunların kendi araştırmasına dayandığını vurguluyor.

Yapay zekâ ajanlarının yalıtılmış sunucu çalışma alanlarını gösteren gerçek veri merkezi rafları

Intel, Yapay Zekâ Ajanları İçin Yalıtılmış Çalışma Alanlarını Ölçekleme Testini Paylaştı

by Almadanincele Editör Ekibi
Ekim 8, 2026
0

Intel’in şirket içi testinde Xeon 6990E+ işlemci, 200 ms hedefinde yaklaşık 313 eşzamanlı sandbox isteğine ulaştı. Sonuçlar üretici testi olarak okunmalı.

Microsoft Execution Containers ajan güvenliği ve uygulama sınırları diyagramı

Microsoft, Yapay Zekâ Ajanları İçin Execution Containers Katmanını Genel Kullanıma Açtı

by Almadanincele Editör Ekibi
Ekim 7, 2026
0

Microsoft’un MXC yaklaşımı, bir yapay zekâ ajanının dosya ve ağ erişimini dışarıdan belirlenen politikalarla sınırlandırmayı hedefliyor. Platformların mevcut durumu ve güvenlik sınırları burada.

Next Post
İki çalışma arkadaşının belgeleri ve bilgisayar ekranını birlikte incelediği doğal ofis fotoğrafı

İngiltere Veri Düzenleyicisi Yapay Zekâ Ajanları İçin Yeni İnceleme Başlattı

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

Canberra’daki Avustralya Parlamento Binası

OpenAI, Avustralya Parlamentosu’nda Yapay Zekâ Ajanlarının Erişimi İçin Özür Diledi

Ekim 6, 2026
Gears of War E-Day oyunundan Marcus, Dom ve Bravo ekibinin resmi ekran görüntüsü

Gears of War: E-Day Yayında: Serinin Köken Hikâyesi ve İlk Saatlerde İşe Yarayacak Taktikler

Ekim 7, 2026
Škoda Epiq elektrikli şehir SUV’sinin resmi basın fotoğrafı; Sportline donanımına ait ayrı görsel henüz yayımlanmadı

Škoda Epiq Sportline Paris Otomobil Fuarı’nda İlk Kez Sergilenecek

Ekim 8, 2026
NVIDIA DSX Ready enerji ve soğutma altyapısı resmi teknik görseli

NVIDIA DSX Ready Duyuruldu: AI Veri Merkezinde Pil ve Sıvı Soğutma Nasıl Seçilecek?

Eylül 21, 2026
Meta’nın Ray-Ban Meta Audio gözlüklerini gösteren resmî basın görseli

Ray-Ban Meta Audio Ön İnceleme: Kamerasız Akıllı Gözlük, 12 Saat Pil Sunabilir mi?

Ekim 3, 2026
Microsoft çalışanlarının yapay zekâ destekli iş akışı üzerinde birlikte çalıştığı resmi görsel

Microsoft Kendi AI Dönüşümünden Ne Öğrendi? Lisans Sayısı Değil İş Akışı Sonucu Önemli

Eylül 18, 2026
Bose Ultra Open Earbuds ikinci nesil kulaklığın siyah renkli gerçek ürün fotoğrafı

Bose Ultra Open Earbuds 2. Nesil Ön İnceleme: Açık Tasarımda Dokuz Saat Pil

Ekim 4, 2026
Ace Combat 8 Wings of Theve oyunundan savaş uçağı ve kokpit sahnesi

Ace Combat 8 Hikâyesini Kokpit Dışına Taşıyor: İlk Bakışta Öne Çıkanlar

Eylül 27, 2026
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

Sigma 16-300mm F3.5-6.7 DC OS Contemporary Nikon Z lensi

Sigma 16-300mm Nikon Z Ön İnceleme: Tek Lensle 18,8x Zum Ne Sunuyor?

Ekim 9, 2026
Sigma 50-120mm F2.8 DC OS Contemporary APS-C telefoto zum lensi

Sigma 50-120mm F2.8 DC OS Ön İnceleme: APS-C Gövdede Kompakt Telefoto

Ekim 9, 2026

Takip

Car Park Capital oyunundan çok katlı otopark ve şehir yönetimi oynanış ekranı

Car Park Capital Bugün Erken Erişime Açılıyor: Şehir Planlamasına Otomobil Hicvi

Ekim 9, 2026
Adobe Premiere mobil kurgu arayüzünde video ve ses katmanları bulunan düzenleme zaman çizelgesi

Adobe Premiere Mobile Android’e Geldi: Ücretsiz Kurgu, Çok Katmanlı Zaman Çizelgesi

Ekim 9, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.