Ne oldu?

Hugging Face, 15 Temmuz-2 Ağustos 2026 tarihleri arasında "ICML 2026 Open Reproductions" adlı bir hackathon düzenledi. 1.221 topluluk üyesi, Claude Code, Codex, Cursor, Pi ve OpenResearch'ün orx aracı gibi kodlama ajanlarını kullanarak Uluslararası Makine Öğrenmesi Konferansı'nda (International Conference on Machine Learning, ICML) 2026'da kabul edilen makaleleri iddia bazında yeniden üretmeye çalıştı.

19 gün süren etkinlikte katılımcılar 6.816 Trackio günlüğü (logbook) yayımladı ve 6.341 kabul edilmiş makalenin 2.226'sını, yani konferansın yaklaşık üçte birini, denemeye tabi tuttu. Her günlük, çalıştırılan kodu, üretilen çıktıları ve isteğe bağlı olarak ajanın tüm işlem kaydını içeren statik bir Hugging Face Space sayfası olarak yayınlandı. Katılımcılara deneyleri Hugging Face Jobs üzerinde çalıştırmaları için 20 dolarlık bulut hesaplama kredisi verildi; toplamda 2.962 bulut işi başlatıldı.

Neden önemli?

ICML 2026'ya 23.918 makale gönderildi ve bunlardan 6.352'si kabul edildi; bu sayı bir önceki yıla göre kabaca iki katına çıktı. Konferans organizatörleri bu artışı kısmen, deneylerin daha hızlı yürütülüp yazılmasını sağlayan yapay zeka ajanlarına bağlıyor. Hakemlik yapan gönüllülerin sayısı ise aynı oranda artmadığı için, bir hakemin "kanıtları dikkatlice kontrol etmediğini" itiraf ettiği ve buna rağmen spotlight ödülü alan bir makale bile hackathon sürecinde ortaya çıktı.

Her günlük, GLM-5.2 adlı açık ağırlıklı bir model tarafından çalıştırılan otomatik bir "Logbook Judge" sistemi tarafından yeniden okundu ve her iddia için doğrulandı, yalanlandı, oyuncak ölçekte (kısıtlı veriyle) kanıtlandı ya da sonuçsuz olarak işaretlendi. Sistem, her günlüğün kendi öz değerlendirmesini güvenilmez kabul edecek şekilde tasarlandı. Toplamda 35.908 iddia bu şekilde incelendi ve 274 tam ajan işlem kaydı veri kümesi olarak yayımlandı.

Sonuçlar nasıl dağıldı?

Makale bazında toplanan doğrulama sonuçları aşağıdaki gibi özetlenebilir:

KategoriMakale sayısıOran
En az bir iddia doğrulandı1.103%51
Tüm iddiaları doğrulandı (tam yeniden üretim)266-
Kısmen doğrulandı, yalanlanan yok632-
En az bir iddia yalanlandı/tartışmalı496%23
Tüm iddiaları yalanlandı49-
Farklı ekipler zıt sonuçlara ulaştı242-
Sadece oyuncak ölçekte kanıt502-
Sonuçsuz280-

Toplamda 3.978 bireysel iddia gerçek deneylerle doğrulandı. "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" başlıklı makale 20 farklı ekip tarafından yeniden üretilmeye çalışıldı ve bunların 12'si tüm iddiaları doğruladı. "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness" adlı makalede ise 17 günlükten 14'ü tüm iddiaları teyit etti.

Hangi makaleler yalanlandı?

35 katılımcı bir iddiayı resmen yalanladıklarını bildirdi; Hugging Face ekibi bu yalanlamaların tamamını makaleyi, günlüğü ve matematiksel türetmeyi yeniden inceleyerek doğruladı. Öne çıkan üç örnek şöyle:

  • "Towards Optimal Robustness in Learning-Augmented Paging": Makale, algoritmasının H_k + O(1) sağlamlık elde ettiğini iddia ediyordu. Bir katılımcının günlüğü, ek terimin gerçekte 0,38 ln k oranında büyüdüğünü ve kanıtın hangi adımda çöktüğünü tespit etti; Hugging Face'in k=1.024'e kadar genişlettiği testi bu büyümeyi yaklaşık dokuz sigma güvenle doğruladı.
  • "Attention's forward pass and Frank-Wolfe": Makale, token parçacıklarının belirli koşullar altında orijine çöktüğünü kanıtlıyordu. Üç bağımsız ekip, sırasıyla 224, yaklaşık 3.800 ve 6.416 adımda karşı örnekler buldu; bu da diğer ekiplerin neden iddiayı "doğruladığını" açıklıyor çünkü sınırlı ufuklu testler bu adımlara ulaşmadan durduruluyordu. Yazarlar aynı gün bulguyu doğruladı ve düzeltme üzerinde çalışıyor.
  • "Self-Distillation Enables Continual Learning": Makalenin teorik bölümü ters Kullback-Leibler ıraksaması (reverse KL) üzerine kurulmuşken, yayımlanan kodun varsayılan ayarı ileri KL (forward KL) hesaplıyordu. Yalanlamayı yapan günlük, yazarların kendi kodu ve verisiyle bile makalenin öne çıkan +4 puanlık sonucunu yeniden üretemedi. Yazarlar arXiv'e güncellenmiş bir sürüm yükledi.

Sırada ne var?

Hugging Face, hackathon sırasında toplanan 35.908 iddialık veri kümesini ve tüm günlükleri kamuya açık şekilde paylaştı. Ekip, otomatik doğrulama ajanlarının bilimsel gözden geçirme sürecindeki rolünün büyüyeceğini ve bu tür toplu yeniden üretim çalışmalarının gelecekteki konferanslar için de tekrarlanabileceğini belirtiyor. Şirket, sonraki adımlarda hangi konferansların benzer bir denetime tabi tutulacağına dair bir takvim açıklamadı.