AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka
No Result
View All Result
AI News
No Result
View All Result
Bir geliştiricinin dizüstü bilgisayarda terminal ve kod ortamıyla çalıştığı doğal ofis fotoğrafı

Alicia Christin Gerald / Unsplash

TermGrade, Yapay Zekâ Kod Ajanları İçin 1.004 Gerçek Terminal Görevini Açtı

Ekim 9, 2026
in Yapay Zeka
0
585
SHARES
3.2k
VIEWS
ChatGPT ile özetleyinFacebook'ta paylaş

ai& araştırma ekibi 8 Ekim’de TermGrade adlı terminal görevleri koleksiyonunu ve kod ajanı eğitim deneyini yayımladı. Çalışma, bir yapay zekâ kod ajanının yalnızca doğru yanıt verip vermediğini değil, gerçek bir yazılım ortamında komut çalıştırıp dosya değiştirerek görevi tamamlayıp tamamlayamadığını ölçmeyi amaçlıyor. Araştırmacılar 1.004 görev ortamı, 36.144 model denemesi ve her deneme için ölçülmüş geçme oranlarını paylaştıklarını söylüyor. Bu, bir şirketin kendi araştırma blogunda yayımlanan teknik çalışmadır; bağımsız bir standardın ya da tüm kod ajanlarının tarafsız sıralamasının yerini tutmaz.

Öne çıkan bilgiler

  • 1.004 terminal görev ortamı, her biri talimat ve otomatik pytest doğrulayıcısıyla yayımlandı
  • Altı model için 6.024 görev-model eşleşmesinde toplam 36.144 yörünge; başarısız 14.234 deneme de veri paketinde tutuldu
  • Veri setinin üretimi 66.165 aday görevden yürütme filtreleriyle 1.004 göreve indi
  • Eğitim için seçilen ayrı tarifte Terminal-Bench 2.1 üzerinde +3,1 puan; beş koşuda ortalama +2,1 puan raporlandı
  • Bulgular ai& araştırma ekibinin çalışmasıdır; bağımsız çoğaltma ve farklı araç setleriyle kıyas henüz gereklidir

Neden önemli?

Kod yazma ajanlarını karşılaştırmak zordur: sonuç, model kadar araç kullanma biçimine, terminal kurulumuna, görev tarifine ve doğrulayıcı testlere de bağlıdır. TermGrade her görev için bir konteyner, talimat ve pytest doğrulayıcısı sunmayı hedefliyor. Makaledeki önemli yöntem ayrımı, 1.004 görevin yayımlanan değerlendirme seti olması; eğitim örneklerinin bunun tamamını doğrudan kullanmaması. Araştırmacılar görevleri yürütme ile filtrelediklerini, ardından temel model için başarı olasılığı yaklaşık yüzde 50 civarında olan görevleri ayrı bir eğitim deneyinde seçtiklerini belirtiyor. Böylece çok kolay ya da imkânsız görevler yerine gelişime alan bırakabilecek örnekler seçiliyor.

Günlük kullanım ve gerçek karşılığı

Ekip 66.165 aday görev oluşturduğunu ve filtreleme sonunda 1.004 görevi yayımladığını bildiriyor. Altı model ve 6.024 görev-model hücresi üzerinde toplam 36.144 deneme kaydedilmiş; başarısız 14.234 yörüngenin de yayımlanması, yalnızca başarılı örnekleri görme yanlılığını azaltabilir. Eğitim deneyi tarafında 151 görevlik bir alt küme kullanılmış ve ai& kendi tarifinde Terminal-Bench 2.1 skorunda 3,1 puan artış raporlamış; beş tekrarın aynı tarifle ortalaması 2,1 puan olarak verilmiş. Bunlar iki ayrı aşamanın rakamları; değerlendirme setindeki 36 bin denemenin eğitim verisi olduğu anlamına gelmiyor.

Sınırlamalar ve dikkat edilmesi gerekenler

Çalışmanın sahibi aynı zamanda altyapı ve model geliştiren ai&; bu nedenle sonuçlar yöntem açıklaması ve yayımlanan verilerle birlikte okunmalı. Başarı puanları terminal kabuğu, araç iskelesi ve model sürümünden etkilenir. Makale de görev zorluğunun kullanılan iskeleye göre kayabildiğini, 0,50 çevresinin her durumda en iyi eğitim noktası sayılmayacağını tartışıyor. Büyük sayıda örnek olması tek başına benchmarkın gerçek iş yazılımlarını temsil ettiğini kanıtlamaz. Kurumlar veri setini kullanacaksa görev güvenliğini, konteyner bağımlılıklarını, lisansı ve kendi ürünlerinin hata türlerini ayrıca gözden geçirmeli.

Çalışmanın ölçtüğü şey

  • Ortam: Her göreve ait konteyner, talimat dosyası ve otomatik pytest doğrulayıcısı.
  • Görev üretimi: 66.165 aday görevden yürütme kontrolleriyle 1.004 görevlik yayımlanan koleksiyon.
  • Değerlendirme: Altı model, 6.024 görev-model hücresi ve 36.144 ayrı deneme.
  • Hata görünürlüğü: Başarısız 14.234 deneme de pakette tutulmuş.
  • Eğitim deneyi: Ayrı bir 151 görev seçimiyle GRPO++/LoRA tarifi; Terminal-Bench 2.1'de +3,1 puan, beş koşuda +2,1 puan şirket araştırmacılarının raporu.

Neden başarısız denemeler de değerli?

Ajanın nerede takıldığını görmek, yalnızca genel başarı puanından daha çok şey anlatabilir. Yanlış dosya yolu, eksik bağımlılık, testin gereğini anlamama ya da aracı yanlış kullanma farklı hata sınıflarıdır. Hata kayıtları tekrar üretilebilir biçimde sunulursa araştırmacılar modelin hangi koşulda kırıldığını karşılaştırabilir ve eğitim verisini hedefli biçimde seçebilir. Bunun için konteynerin aynı bağımlılıklarla kurulması, model sürümünün ve sistem isteminin belirtilmesi gerekir.

Okur ve geliştirici ne çıkarmalı?

TermGrade, kod ajanlarını tek sayı üzerinden sıralamak yerine görev, model ve çalışma iskelesi ayrıntısını daha görünür kılma çabası olarak değerli. Ancak şirketin raporladığı puan artışı bir ürün kullanıcısının her kod tabanında aynı verim artışını göreceği anlamına gelmez. Özellikle gerçek depo, uzun görev, test yazımı, hata düzeltme ve güvenli terminal kullanımı için bağımsız sonuçlara bakılmalı. İşletmeler pilotta görev tamamlama oranı yanında insanın düzeltme süresini, hatalı değişiklik oranını, kaynak tüketimini ve güvenlik ihlallerini ölçmeli.

Bilgiyi nasıl değerlendirmeli?

Duyurudaki her sayı ve tarih aynı kesinlik düzeyinde değildir. Ürünün açıklanmış teknik değeri, üreticinin hedeflediği sonuç, bağımsız ölçüm ve geleceğe dönük yol haritası birbirinden ayrılmalı. Bir özelliğin hangi ülkede, hangi modelde veya hangi yazılım sürümünde kullanılacağı pratik sonucu değiştirebilir. Özellikle satış, fiyat, destek ve erişim bilgileri yayın gününde yeniden kontrol edilmelidir. Üretici açıklamasında bulunmayan ayrıntıları tahmin ederek tamamlamak yerine belirsizliği açıkça belirtmek, okuyucunun kararını daha sağlıklı kurmasına yardım eder.

Bir karşılaştırma yaparken aynı sınıftaki alternatifleri ortak ölçütlerle ele alın: kullanım amacı, toplam maliyet, uzun dönem destek, servis/uyumluluk ve gerçek performans. Böylece tek bir dikkat çekici özellik tüm ürünün değerini olduğundan büyük göstermemiş olur.

Editoryal değerlendirme

ai& TermGrade terminal ajanı değerlendirme seti hakkındaki duyuruyu değerlendirirken üretici beyanını bağımsız ölçümden ayırmak gerekiyor. Fiyat, kullanılabilirlik, performans ve uyumluluk bölgeye, yapılandırmaya ve yazılım sürümüne göre değişebilir. Karar verirken ilk maliyetin yanında öğrenme, bakım ve kullanım koşullarını da hesaba katın. Henüz bağımsız test edilmeyen sonuçları kesin hüküm gibi değil, doğrulanması gereken iddialar olarak değerlendirin.

Karar vermeden önce pratik kontrol

Resmî teknik belgeyi, yerel fiyatı ve garanti koşullarını kontrol edin. Bir duyuru tek başına gerçek kullanım performansını kanıtlamaz. Mümkünse bağımsız testleri ve kullanıcı deneyimlerini bekleyin; kurumsal kullanımda önce sınırlı bir pilot ve geri alma planı uygulayın.

Almadanincele Yorumu

TermGrade’in olumlu yanı, yalnız başarı örneklerini değil on binlerce denemeyi ve başarısızlıkları da incelemeye açması. Bu, kod ajanı değerlendirmesini daha şeffaf kılabilir. Yine de raporlanan eğitim kazanımı şirketin kendi deneyinden geliyor; farklı modellerde, araç kurulumlarında ve gerçek yazılım depolarında bağımsız tekrarlar görülmeden genelleme yapılmamalı.

Kapak görseli: Alicia Christin Gerald / Unsplash. Kullanım bilgisi: Unsplash Lisansı; fotoğraf Alicia Christin Gerald tarafından yayımlanmıştır..

Kaynaklar

  • ai& Research – TermGrade araştırması ve veri seti
  • Terminal-Bench 2.1 – resmi benchmark deposu
Tags: açık veri setikod ajanlarıTermGradeterminal benchmarkyapay zeka ölçümü
SummarizeShare234
Previous Post

Sigma 16-300mm Nikon Z Ön İnceleme: Tek Lensle 18,8x Zum Ne Sunuyor?

Next Post

İngiltere Veri Düzenleyicisi Yapay Zekâ Ajanları İçin Yeni İnceleme Başlattı

Almadanincele Editör Ekibi

Almadanincele Editör Ekibi

Almadan İncele editör ekibi; teknoloji, yapay zeka, mobil, oyun, otomobil ve yazılım dünyasındaki gelişmeleri satın alma kararı odaklı, anlaşılır ve kaynaklı şekilde değerlendirir.

İlgili Haberler

İki çalışma arkadaşının belgeleri ve bilgisayar ekranını birlikte incelediği doğal ofis fotoğrafı

İngiltere Veri Düzenleyicisi Yapay Zekâ Ajanları İçin Yeni İnceleme Başlattı

by Almadanincele Editör Ekibi
Ekim 9, 2026
0

ICO, on büyük temel model geliştiricisinden veri koruma iyileştirmeleri aldığını açıkladı ve otonom ajan riskleri için 20 Kasım’a kadar görüş topluyor.

Haber doğrulaması yapan gazetecinin çalışma masasından doğal ve profesyonel fotoğraf

OpenAI, Yapay Zekâ ile Desteklenen Sahte Medya Operasyonlarını Açıkladı

by Almadanincele Editör Ekibi
Ekim 8, 2026
0

OpenAI, Rusya ve İran bağlantılı olduğunu belirttiği iki gizli etki operasyonuna ilişkin bulgularını yayımladı; şirket bunların kendi araştırmasına dayandığını vurguluyor.

Yapay zekâ ajanlarının yalıtılmış sunucu çalışma alanlarını gösteren gerçek veri merkezi rafları

Intel, Yapay Zekâ Ajanları İçin Yalıtılmış Çalışma Alanlarını Ölçekleme Testini Paylaştı

by Almadanincele Editör Ekibi
Ekim 8, 2026
0

Intel’in şirket içi testinde Xeon 6990E+ işlemci, 200 ms hedefinde yaklaşık 313 eşzamanlı sandbox isteğine ulaştı. Sonuçlar üretici testi olarak okunmalı.

Microsoft Execution Containers ajan güvenliği ve uygulama sınırları diyagramı

Microsoft, Yapay Zekâ Ajanları İçin Execution Containers Katmanını Genel Kullanıma Açtı

by Almadanincele Editör Ekibi
Ekim 7, 2026
0

Microsoft’un MXC yaklaşımı, bir yapay zekâ ajanının dosya ve ağ erişimini dışarıdan belirlenen politikalarla sınırlandırmayı hedefliyor. Platformların mevcut durumu ve güvenlik sınırları burada.

Next Post
İki çalışma arkadaşının belgeleri ve bilgisayar ekranını birlikte incelediği doğal ofis fotoğrafı

İngiltere Veri Düzenleyicisi Yapay Zekâ Ajanları İçin Yeni İnceleme Başlattı

Bir yanıt yazın Yanıtı iptal et

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Tavsiye edilen

DJI Osmo 360 II kamera ve görünmez selfie çubuğu

DJI Osmo 360 II Ön İncelemesi: 8K/60 FPS ve Değiştirilebilir Lens Ne Kazandırıyor?

Eylül 12, 2026
YouTube’un içerik üretim araçlarını anlatan resmi Made on YouTube 2026 görseli

YouTube Studio’ya Gemini Destekli Sohbetli Kurgu Geliyor: Üreticiye Ne Sağlayacak?

Eylül 26, 2026
Volkswagen Mission Efficiency elektrikli konsept otomobilin resmi basın fotoğrafı

Volkswagen Mission Efficiency 1.278 Kilometrede Ne Tüketti? Rekor İddiasının Ayrıntıları

Eylül 22, 2026
Sigma 50-120mm F2.8 DC OS Contemporary APS-C telefoto zum lensi

Sigma 50-120mm F2.8 DC OS Ön İnceleme: APS-C Gövdede Kompakt Telefoto

Ekim 9, 2026
Bordo iPhone 18 Pro ve iPhone 18 Pro Max modelleri

iPhone 18 Pro Ailesi Tanıtıldı: Pro ve Pro Max Arasındaki Farklar

Eylül 10, 2026
Yapay zekâ ajanlarının yalıtılmış sunucu çalışma alanlarını gösteren gerçek veri merkezi rafları

Intel, Yapay Zekâ Ajanları İçin Yalıtılmış Çalışma Alanlarını Ölçekleme Testini Paylaştı

Ekim 8, 2026
Alfa Romeo Luna Rossa temalı özel otomobil serisini anlatan özgün görsel

Alfa Romeo Luna Rossa Serisi Dört Modele Geliyor: Tasarımda Neler Değişiyor?

Eylül 29, 2026
Android cihazda parola yöneticileri arasında güvenli aktarım akışını gösteren resmi görsel

Android’de Parola Yöneticisi Değiştirmek Kolaylaşıyor: Passkey Nasıl Taşınacak?

Eylül 19, 2026
Almadan İncele

Almadan İncele; teknoloji, mobil, oyun, otomobil ve yazılım dünyasında satın almadan önce doğru karar vermenize yardımcı olan inceleme, haber ve rehber içerikleri yayınlar.

Follow us

Son Yazılar

Sigma 16-300mm F3.5-6.7 DC OS Contemporary Nikon Z lensi

Sigma 16-300mm Nikon Z Ön İnceleme: Tek Lensle 18,8x Zum Ne Sunuyor?

Ekim 9, 2026
Sigma 50-120mm F2.8 DC OS Contemporary APS-C telefoto zum lensi

Sigma 50-120mm F2.8 DC OS Ön İnceleme: APS-C Gövdede Kompakt Telefoto

Ekim 9, 2026

Takip

Car Park Capital oyunundan çok katlı otopark ve şehir yönetimi oynanış ekranı

Car Park Capital Bugün Erken Erişime Açılıyor: Şehir Planlamasına Otomobil Hicvi

Ekim 9, 2026
Adobe Premiere mobil kurgu arayüzünde video ve ses katmanları bulunan düzenleme zaman çizelgesi

Adobe Premiere Mobile Android’e Geldi: Ücretsiz Kurgu, Çok Katmanlı Zaman Çizelgesi

Ekim 9, 2026
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.

No Result
View All Result
  • Teknoloji Haberleri
  • İnceleme
  • Mobil
  • Nasıl Yapılır
  • Otomobil
  • Oyun
  • Yazılım
  • Yapay Zeka

© 2026 almadanincele.com. Tüm hakları saklıdır.