← Tüm Projeler LLM Fine-Tuning

MMX: Türkçe Pazarlama LLM'i

📅 2024 🏢 Mad Cat Labs ⏱ 3 ay
MMX modeli eğitim pipeline diyagramı

Bağlam

Mad Cat Labs'ta Türkçe dijital pazarlama alanında çalışan müşteriler için LLM tabanlı içerik üretimi araştırılıyordu. Mevcut genel amaçlı modeller Türkçe içerik için kullanılıyordu ancak bu modellerin pazarlama alanındaki performansı tutarsızdı.

Problem

Genel amaçlı LLM'ler Türkçe pazarlama metni üretirken iki ayrı sorun sergiliyordu: tonlama tutarsızlığı (aynı marka için farklı sesler) ve format hataları (başlık uzunluğu, CTA yapısı, hiyerarşi). Prompt mühendisliği bu sorunları kısmen çözüyordu ancak ölçeklenebilir ve güvenilir bir çözüm değildi.

Neden Önemliydi?

Tutarsız çıktı, üretim sürecinde manuel düzeltme gerektiriyordu. Kalite kontrolü olmadan fine-tune edilmiş bir model bu sorunu çözmez, hatta çıktı tutarsızlığını eğitim verisine gömer. Çözümün hem veri kalitesinde hem de model eğitiminde doğru kararlar gerektirdiği baştan netti.

Ben Neyi Sorguladım?

Temel sorum şuydu: format ve tonlama tutarsızlığının kaynağı model mi, veri mı, yoksa ikisi mi? Eğer veri kalitesizse, fine-tuning sorunu çözmek yerine pekiştirir. Bu nedenle veri tasarımına model seçiminden önce yatırım yapmayı doğru buldum.

Teşhis

Mevcut kullanım senaryolarını incelediğimde iki şey netleşti: (1) alan sözlüğü ve format kuralları belgelenmemişti, dolayısıyla "doğru çıktı"nın kriteri yoktu; (2) hazır Türkçe pazarlama verisi, özellikle 12 farklı kategori için yeterliydi. Sorun veri eksikliği değil, veri tasarımı eksikliğiydi.

Değerlendirilen Seçenekler

  • Sistem prompt optimizasyonu: Hızlı ama model değiştiğinde yeniden kalibre edilmesi gerekiyor; ölçeklenebilir değil.
  • RAG ile örnek enjeksiyonu: Gerçek zamanlı sistemlerde gecikme ekler; tutarlılık garanti edilemiyor.
  • Alana özgü fine-tuning: Eğitim maliyeti yüksek ancak çıktı tutarlılığı ve format uyumu için en güvenilir yol.
TODO
  • Bu seçenekler gerçekten test edildi mi, yoksa sadece değerlendirildi mi?
  • Prompt optimizasyonunun başarısız olduğuna dair somut örnek veya ölçüm var mı?

Verdiğim Karar

Fine-tuning kararı verildi. Ancak asıl katkım model eğitiminden çok veri mimarisinde oldu: 12 kategori için format kurallarını ve ton rehberini belgeledim; her kaydı bu kurallara göre doğrulayan otomatik bir pipeline tasarladım. Kalitesiz veriyle eğitilen bir model sorunları çözmez, sadece başka hatalar üretir.

Uygulama

  • 12 pazarlama kategorisi için format ve içerik kuralları hazırlandı
  • Kural uyumluluğunu otomatik kontrol eden JSONL pipeline tasarlandı
  • 200.000+ satırlık sentetik eğitim seti oluşturuldu
  • Model fine-tuning süreci yürütüldü
Python Hugging Face Transformers LoRA / QLoRA PEFT Weights & Biases pandas

Ölçüm Yöntemi

Her çıktı için format uyum oranı otomatik kontrol edildi: başlık uzunluğu, CTA varlığı, belirlenmiş yapı şablonuna uyum. İnsan değerlendirmesi de planlandı.

TODO
  • İnsan değerlendirmesi yapıldı mı? Varsa kaç değerlendirici, hangi kriterler?
  • Temel model (fine-tuning öncesi) format uyum oranı neydi? Karşılaştırma için başlangıç değeri gerekiyor.

Sonuç

200K+
Eğitim Satırı
%94
Format Uyum Oranı
12
Pazarlama Kategorisi

%94 format uyum oranı, otomatik doğrulama testlerinde elde edildi. Bu, üretim çıktılarının büyük çoğunluğunun manuel düzeltme gerektirmeden kullanılabilir olduğu anlamına geliyor.

TODO
  • Bu oran fine-tuning öncesiyle nasıl karşılaştırılıyor?
  • Gerçek üretimde (müşteri veya iç kullanım) bu model kullanıldı mı?
  • Kullanıldıysa hangi metrik değişti?

Sınırlamalar

  • Format uyumu, metin kalitesiyle aynı şey değil: %94 uyum oranı, çıktının pazarlama açısından etkili olduğunu kanıtlamaz.
  • Sentetik veri, gerçek müşteri davranışını tam yansıtmayabilir.

Öğrendiklerim

Veri tasarımı, model seçiminden önce gelir. Fine-tuning kararı vermeden önce "doğru çıktı nedir?" sorusunun yanıtı belgelenmemişse, iyileştirmeyi ölçmek imkansızlaşır. Bu projede en kritik katkı model eğitimi değil, kural belgelerinin ve doğrulama pipeline'ının kurulmasıydı.

TODO
  • Bugün bu projeyi yeniden yapsaydın neyi değiştirirdin?
  • Hangi şey beklediğinden zor çıktı?