HAKKIMDA

Benim için bir sistemin çalışması tek başına yeterli değil. Neden çalıştığını, nerede başarısız olduğunu ve ürettiği sonucun doğru ölçülüp ölçülmediğini anlamak istiyorum.

Bu soruyu Mad Cat Labs'ta Türkçe LLM geliştirme üzerinden yanıtlıyorum. MMX projesinde değerlendirme pipeline'ındaki 12 metrik tutarsızlığını tespit edip 200+ soruluk bir benchmark sıfırdan kurdum. 200.000+ satırlık sentetik veri setini tasarladım; her kaydın kalite ve format kurallarına uygunluğunu otomatik doğrulayan bir JSONL pipeline yazdım. Qwen ailesiyle 2B'den 27B'ye dört model varyantını karşılaştırdım; 27B'nin beklenen performansı vermemesinin nedenini Türkçe tokenizer boşluklarında teşhis ettim.

Bu rolden önce dört yıl dijital analitik ve performans pazarlamasında çalıştım. O dönemde veri okumanın koşullarını ve sınırlarını öğrendim: hangi metrik gerçek bir değişimi gösterir, hangisi gürültüdür, sayı doğru ama yorum yanlış olabilir mi? Bu sorular LLM değerlendirme süreçlerine çok daha somut geçiyor.

Öğrendiklerimi Türkçe paylaşıyorum. Medium'da LLM geliştirme üzerine teknik yazılar yazıyorum; çünkü Türkçe kaynak açığı büyük ve bu açığı kapatmaya katkıda bulunmak istiyorum.

Tuba Çelik portresi, neobrutalist illüstrasyon

İÇERİK ÜRETİYORUM

Türkçe yapay zeka ve teknoloji içerikleri üretiyorum. Karmaşık konuları sade, erişilebilir bir dile çeviriyorum.

@tubac3l1k

Yapay zeka ve teknoloji içerikleri. Gündelik Türkçe paylaşımlar.

Medium Blog

LLM geliştirme, fine-tuning ve veri mühendisliği üzerine teknik yazılar.