Ne oldu?
Hugging Face, 15 Temmuz-2 Ağustos 2026 tarihleri arasında "ICML 2026 Open Reproductions" adlı bir hackathon düzenledi. 1.221 topluluk üyesi, Claude Code, Codex, Cursor, Pi ve OpenResearch'ün orx aracı gibi kodlama ajanlarını kullanarak Uluslararası Makine Öğrenmesi Konferansı'nda (International Conference on Machine Learning, ICML) 2026'da kabul edilen makaleleri iddia bazında yeniden üretmeye çalıştı.
19 gün süren etkinlikte katılımcılar 6.816 Trackio günlüğü (logbook) yayımladı ve 6.341 kabul edilmiş makalenin 2.226'sını, yani konferansın yaklaşık üçte birini, denemeye tabi tuttu. Her günlük, çalıştırılan kodu, üretilen çıktıları ve isteğe bağlı olarak ajanın tüm işlem kaydını içeren statik bir Hugging Face Space sayfası olarak yayınlandı. Katılımcılara deneyleri Hugging Face Jobs üzerinde çalıştırmaları için 20 dolarlık bulut hesaplama kredisi verildi; toplamda 2.962 bulut işi başlatıldı.
Neden önemli?
ICML 2026'ya 23.918 makale gönderildi ve bunlardan 6.352'si kabul edildi; bu sayı bir önceki yıla göre kabaca iki katına çıktı. Konferans organizatörleri bu artışı kısmen, deneylerin daha hızlı yürütülüp yazılmasını sağlayan yapay zeka ajanlarına bağlıyor. Hakemlik yapan gönüllülerin sayısı ise aynı oranda artmadığı için, bir hakemin "kanıtları dikkatlice kontrol etmediğini" itiraf ettiği ve buna rağmen spotlight ödülü alan bir makale bile hackathon sürecinde ortaya çıktı.
Her günlük, GLM-5.2 adlı açık ağırlıklı bir model tarafından çalıştırılan otomatik bir "Logbook Judge" sistemi tarafından yeniden okundu ve her iddia için doğrulandı, yalanlandı, oyuncak ölçekte (kısıtlı veriyle) kanıtlandı ya da sonuçsuz olarak işaretlendi. Sistem, her günlüğün kendi öz değerlendirmesini güvenilmez kabul edecek şekilde tasarlandı. Toplamda 35.908 iddia bu şekilde incelendi ve 274 tam ajan işlem kaydı veri kümesi olarak yayımlandı.
Sonuçlar nasıl dağıldı?
Makale bazında toplanan doğrulama sonuçları aşağıdaki gibi özetlenebilir:
| Kategori | Makale sayısı | Oran |
|---|---|---|
| En az bir iddia doğrulandı | 1.103 | %51 |
| Tüm iddiaları doğrulandı (tam yeniden üretim) | 266 | - |
| Kısmen doğrulandı, yalanlanan yok | 632 | - |
| En az bir iddia yalanlandı/tartışmalı | 496 | %23 |
| Tüm iddiaları yalanlandı | 49 | - |
| Farklı ekipler zıt sonuçlara ulaştı | 242 | - |
| Sadece oyuncak ölçekte kanıt | 502 | - |
| Sonuçsuz | 280 | - |
Toplamda 3.978 bireysel iddia gerçek deneylerle doğrulandı. "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" başlıklı makale 20 farklı ekip tarafından yeniden üretilmeye çalışıldı ve bunların 12'si tüm iddiaları doğruladı. "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness" adlı makalede ise 17 günlükten 14'ü tüm iddiaları teyit etti.
Hangi makaleler yalanlandı?
35 katılımcı bir iddiayı resmen yalanladıklarını bildirdi; Hugging Face ekibi bu yalanlamaların tamamını makaleyi, günlüğü ve matematiksel türetmeyi yeniden inceleyerek doğruladı. Öne çıkan üç örnek şöyle:
- "Towards Optimal Robustness in Learning-Augmented Paging": Makale, algoritmasının H_k + O(1) sağlamlık elde ettiğini iddia ediyordu. Bir katılımcının günlüğü, ek terimin gerçekte 0,38 ln k oranında büyüdüğünü ve kanıtın hangi adımda çöktüğünü tespit etti; Hugging Face'in k=1.024'e kadar genişlettiği testi bu büyümeyi yaklaşık dokuz sigma güvenle doğruladı.
- "Attention's forward pass and Frank-Wolfe": Makale, token parçacıklarının belirli koşullar altında orijine çöktüğünü kanıtlıyordu. Üç bağımsız ekip, sırasıyla 224, yaklaşık 3.800 ve 6.416 adımda karşı örnekler buldu; bu da diğer ekiplerin neden iddiayı "doğruladığını" açıklıyor çünkü sınırlı ufuklu testler bu adımlara ulaşmadan durduruluyordu. Yazarlar aynı gün bulguyu doğruladı ve düzeltme üzerinde çalışıyor.
- "Self-Distillation Enables Continual Learning": Makalenin teorik bölümü ters Kullback-Leibler ıraksaması (reverse KL) üzerine kurulmuşken, yayımlanan kodun varsayılan ayarı ileri KL (forward KL) hesaplıyordu. Yalanlamayı yapan günlük, yazarların kendi kodu ve verisiyle bile makalenin öne çıkan +4 puanlık sonucunu yeniden üretemedi. Yazarlar arXiv'e güncellenmiş bir sürüm yükledi.
Sırada ne var?
Hugging Face, hackathon sırasında toplanan 35.908 iddialık veri kümesini ve tüm günlükleri kamuya açık şekilde paylaştı. Ekip, otomatik doğrulama ajanlarının bilimsel gözden geçirme sürecindeki rolünün büyüyeceğini ve bu tür toplu yeniden üretim çalışmalarının gelecekteki konferanslar için de tekrarlanabileceğini belirtiyor. Şirket, sonraki adımlarda hangi konferansların benzer bir denetime tabi tutulacağına dair bir takvim açıklamadı.