Android Bench 2.0, uzun ufuklu görevler ve sürekli puanlamayla güncellendi
Google, Android Bench 2.0 ile AI sistemlerini daha zor Android geliştirme işlerinde değerlendirmek için uzun ufuklu görevler ve sürekli puanlama ekledi.
Google, Android Bench’i 2.0 sürümüne yükseltti. Yeni sürüm, uzun ufuklu görevler, ajan tabanlı değerlendirme ve sürekli puanlama getirerek AI sistemlerinin daha zor Android geliştirme işlerinde nasıl performans verdiğinin ölçülmesini amaçlıyor.
Android Bench 2.0 artık bağımlılık yükseltmeleri, yeni özellik geliştirme, uygulamayı sıfırdan kurma ve çapraz platform bir uygulamayı Android’e dönüştürme gibi görevleri kapsıyor. Google, bu işlerin dakikalar yerine günler sürebilecek türden işler olduğunu söylüyor. Yeni yaklaşım, basit geçtı kaldı değerlendirmesinin yerini daha ayrıntılı bir puanlamaya bırakıyor; puanlama işlevsellik, görsel kalite, regresyonlar ve talimat izleme cezalarını dikkate alıyor.
Google’ın panelinde Claude Opus 5.5, uzun ufuklu görevler lider tablosunda yüzde 32 geçme oranıyla ilk sırada yer aldı. GPT 6 Astra yüzde 28 ile onu izledi. Google ayrıca, en iyi modelin çapraz platform bir uygulamayı Android’e taşıma görevinde yalnızca yüzde 80 tamamlanma oranına ulaştığını söyledi.
Neden önemli
Android geliştirmede AI araçlarını değerlendirme ölçütü, kısa ve net testlerden günler sürebilen işlere kayıyor. Bu, modellerin yeni kod yazma ve belirli dönüşüm işlerinde daha görünür biçimde karşılaştırılmasını sağlıyor; buna karşılık daha zor görevlerde hangi noktada kaldıkları da daha net ortaya çıkıyor.
Kalsın mı, çizilsin mi?
Bu haber önemli mi, yoksa abartı mı? Başkalarının ne dediğini görmeden önce sen işaretle.
Kaynaklar
- InfoQ