Ne oldu?
MarkTechPost, 14 Ağustos 2026 tarihinde SupraLabs'ın akıl yürütme korpusunu (reasoning corpus) kullanarak küçük ölçekli bir dil modelinin nasıl ince ayara tabi tutulacağını anlatan pratik bir rehber yayımladı. Rehber, SupraLabs/reasoning-corpus-4K-5M-v1 adlı veri kümesinden Hugging Face Hub üzerinden 8.000 satırlık temsili bir örneklemi akış (streaming) yöntemiyle çekmeyi gösteriyor.
Çalışmada önce veri kümesinin kaynak dağılımı, token uzunluğu örüntüleri, görev bileşimi ve akıl yürütme-yanıt oranları incelendi. Ardından eğitime uygun olmayan örnekleri ayıklamak için token uzunluğu, boş yanıt, aşırı tekrar ve dengesiz akıl yürütme oranına dayalı dört filtre uygulandı.
Neden önemli?
Rehber, kalan örnekleri açık <think> etiketleriyle sohbet tabanlı denetimli ince ayar (supervised fine-tuning) biçimine dönüştürüyor ve bu verilerle HuggingFaceTB/SmolLM2-135M-Instruct modelini TRL kütüphanesinin SFTTrainer aracı üzerinden LoRA (Low-Rank Adaptation) yöntemiyle uyarlıyor. Bu yaklaşım, büyük çok kipli akıl yürütme veri kümelerinin, sınırlı hesaplama kaynaklarıyla kompakt akıl yürütme odaklı modellere dönüştürülebileceğini gösteriyor.
Yöntem, araştırmacıların ve geliştiricilerin kendi Google Colab ortamlarında, tüm veri kümesini indirmeden büyük veri kaynaklarıyla çalışabilmesine olanak tanıyor. Bu da veri erişimi, keşifsel analiz, veri kürasyonu ve parametre-verimli ince ayarı tek bir uçtan uca hattında birleştiriyor.
Süreç hangi adımlardan oluşuyor?
- Hugging Face Hub üzerinden veri kümesinin akış yoluyla örneklenmesi
- Kaynak dağılımı, token uzunluğu ve akıl yürütme oranının görselleştirilmesi
- Token uzunluğu, tekrar oranı ve dengesiz akıl yürütme oranına göre filtreleme
- Verilerin sohbet formatına ve <think> etiketli yapıya dönüştürülmesi
- SmolLM2-135M-Instruct modelinin LoRA ile ince ayara tabi tutulması
- Eğitim verisinin Parquet formatında dışa aktarılması
Sırada ne var?
MarkTechPost'un rehberi bir eğitim materyali niteliğinde olduğundan, SupraLabs'ın veri kümesini genişletme veya yeni sürümler yayımlama planlarına dair kaynakta bilgi bulunmuyor. Rehberin, benzer küçük ölçekli akıl yürütme modelleri geliştirmek isteyen araştırmacılar için bir şablon olarak kullanılması bekleniyor.
Hedef model neden bu kadar küçük
Rehberin ince ayar hedefi SmolLM2-135M-Instruct — 135 milyon parametrelik, bugünün ölçeğinde çok küçük bir model. Bu bir sınırlama değil, rehberin asıl amacı: LoRA ile parametre verimli ayar yapıldığında bütün akış ücretsiz bir Google Colab oturumuna sığıyor. Yani okuyucu kiralık GPU tutmadan, kendi verisiyle uçtan uca bir hattı çalıştırıp görebiliyor.
Kullanılan araçlar da standart: TRL kütüphanesinin SFTTrainer sınıfı ve Parquet biçiminde dışa aktarma. Akışlı veri erişiminden ayıklamaya, ince ayardan yapılandırılmış çıkarıma kadar her adım aynı defterde duruyor.
Format öğrenmek ile akıl yürütmeyi öğrenmek
Burada karıştırılması kolay bir ayrım var. 135 milyon parametrelik bir modeli akıl yürütme izleriyle ince ayara sokmak, o modele akıl yürütmeyi öğretmiyor; <think> etiketleri arasına akıl yürütmeye benzeyen bir metin yazmayı öğretiyor. Biçim taklit edilebiliyor, yetenek edinilemiyor — çünkü yetenek büyük ölçüde ölçekten ve ön eğitimden geliyor.
Bu, rehberin kusuru değil; rehber zaten bir yöntem anlatımı, bir sonuç iddiası değil. Ama bu tür hatların çıktısını değerlendirirken akılda tutmak gerekiyor: küçük bir modelin adım adım düşünüyormuş gibi yazması, adımların doğru olduğu anlamına gelmiyor. Rehberin sunduğu asıl değer de zaten burada — veri ayıklama ölçütlerini görünür kılması.