Turkcell’in Mistral 7B tabanlı, 5 milyar token temizlenmiş Türkçe metinle sürekli ön eğitilip LoRA/DORA ile ince ayarlanmış Türkçe dil modeli.
Kıyaslama Skorları
Türkçe MMLU29
Türkçe Dilbilgisi59.6
Akıl Yürütme33.7
Kodlama1.7
Teknik Özellikler
Hızlı Başlangıç
from transformers import AutoModelForCausalLM, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("TURKCELL/Turkcell-LLM-7b-v1")
model = AutoModelForCausalLM.from_pretrained("TURKCELL/Turkcell-LLM-7b-v1")
prompt = "Merhaba, bugün sana nasıl yardımcı olabilirim?"
inputs = tokenizer(prompt, return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(output[0]))Model Ağırlıkları
Hugging Face
İlgili Veri Kümeleri
Türkçe VikipediMetin Üretimi
320 Mn token
OPUS-100 (TR-EN)Çeviri
18 Mn token
TR-NewsÖzetleme
180 Mn token