Ne oldu?

MarkTechPost, 14 Ağustos 2026 tarihinde SupraLabs'ın akıl yürütme korpusunu (reasoning corpus) kullanarak küçük ölçekli bir dil modelinin nasıl ince ayara tabi tutulacağını anlatan pratik bir rehber yayımladı. Rehber, SupraLabs/reasoning-corpus-4K-5M-v1 adlı veri kümesinden Hugging Face Hub üzerinden 8.000 satırlık temsili bir örneklemi akış (streaming) yöntemiyle çekmeyi gösteriyor.

Çalışmada önce veri kümesinin kaynak dağılımı, token uzunluğu örüntüleri, görev bileşimi ve akıl yürütme-yanıt oranları incelendi. Ardından eğitime uygun olmayan örnekleri ayıklamak için token uzunluğu, boş yanıt, aşırı tekrar ve dengesiz akıl yürütme oranına dayalı dört filtre uygulandı.

Neden önemli?

Rehber, kalan örnekleri açık <think> etiketleriyle sohbet tabanlı denetimli ince ayar (supervised fine-tuning) biçimine dönüştürüyor ve bu verilerle HuggingFaceTB/SmolLM2-135M-Instruct modelini TRL kütüphanesinin SFTTrainer aracı üzerinden LoRA (Low-Rank Adaptation) yöntemiyle uyarlıyor. Bu yaklaşım, büyük çok modelli akıl yürütme veri kümelerinin, sınırlı hesaplama kaynaklarıyla kompakt akıl yürütme odaklı modellere dönüştürülebileceğini gösteriyor.

Yöntem, araştırmacıların ve geliştiricilerin kendi Google Colab ortamlarında, tüm veri kümesini indirmeden büyük veri kaynaklarıyla çalışabilmesine olanak tanıyor. Bu da veri erişimi, keşifsel analiz, veri kürasyonu ve parametre-verimli ince ayarı tek bir uçtan uca hattında birleştiriyor.

Süreç hangi adımlardan oluşuyor?

  • Hugging Face Hub üzerinden veri kümesinin akış yoluyla örneklenmesi
  • Kaynak dağılımı, token uzunluğu ve akıl yürütme oranının görselleştirilmesi
  • Token uzunluğu, tekrar oranı ve dengesiz akıl yürütme oranına göre filtreleme
  • Verilerin sohbet formatına ve <think> etiketli yapıya dönüştürülmesi
  • SmolLM2-135M-Instruct modelinin LoRA ile ince ayara tabi tutulması
  • Eğitim verisinin Parquet formatında dışa aktarılması

Sırada ne var?

MarkTechPost'un rehberi bir eğitim materyali niteliğinde olduğundan, SupraLabs'ın veri kümesini genişletme veya yeni sürümler yayımlama planlarına dair kaynakta bilgi bulunmuyor. Rehberin, benzer küçük ölçekli akıl yürütme modelleri geliştirmek isteyen araştırmacılar için bir şablon olarak kullanılması bekleniyor.