Trusence Her iddianın bir kaynağı var
Son güncelleme: 5 Ekim 2026 Ara English
← Tüm haberler
Araştırma

GitHub, AI code review için ReviewBench’i duyurdu

GitHub, Copilot code review sonuçlarını üretim deneyleriyle daha iyi ilişkilendirmeyi amaçlayan yeni bir offline benchmark yayımladı.

GitHub, AI code review için ReviewBench adını verdiği yeni bir offline benchmark tanıttı. Şirkete göre bu çalışma, farklı reviewer sistemlerini karşılaştırmayı daha sıkı ve üretim kararları için daha yararlı hale getirmeyi amaçlıyor.

ReviewBench, 103.9 million GitHub pull requests üzerinden oluşturuldu ve 19 dilde, 187 public open source repository’den alınmış 219 pull request içeriyor. GitHub, dağılımları kendi genel iş yüküne benzetmek için seçtiğini söylüyor. Benchmark için aday bulgular; human reviewers, follow-up commits, analysis tools ve multiple frontier LLMs kaynaklarından toplanıyor. Ardından GitHub, bunları ortak bir rubric ile deduplicate edip değerlendiriyor ve bu doğrulama için Claude Sonnet 5 kullanıyor.

GitHub ayrıca ReviewBench’in grounded ve augmented precision, recall ve F1 metriklerini raporladığını söylüyor. Böylece sistemler, bilinen sorunların yanı sıra başlangıçtaki gold set dışında kalan geçerli keşifler üzerinden de değerlendirilebiliyor. Şirketin ifadesine göre ReviewBench public olarak erişilebilir ve Copilot code review için offline değerlendirmelerin production experiment sonuçlarını ne kadar iyi öngördüğünü de iyileştirdi.

Neden önemli

Bu duyuru, AI code review sistemlerini yalnızca kapalı bir testte değil, gerçek kullanım sonuçlarına daha yakın bir ölçümle karşılaştırmayı kolaylaştırıyor. Bu da ekiplerin, hangi modelin ya da yaklaşımın yalnızca kağıt üzerinde değil, üretimde de daha anlamlı sonuç verdiğini daha net görmesini sağlıyor. GitHub’ın kendi araçlarında da bu ölçümün iyileştiğini söylemesi, benchmarkın pratikte kullanılan bir değerlendirme katmanı olabileceğine işaret ediyor.

Kaynaklar

  • GitHub Blog