VNGRS tarafından Türkçe için sıfırdan, 300 milyar token üzerinde eğitilen; dilbilgisi düzeltme ve özetlemede öne çıkan hafif ve açık kaynaklı Kumru dil modeli.
Kıyaslama Skorları
Türkçe MMLU24.9
Türkçe Dilbilgisi46.2
Akıl Yürütme22.8
Kodlama4.3
Teknik Özellikler
Hızlı Başlangıç
from transformers import AutoModelForCausalLM, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("vngrs-ai/Kumru-2B")
model = AutoModelForCausalLM.from_pretrained("vngrs-ai/Kumru-2B")
prompt = "Merhaba, bugün sana nasıl yardımcı olabilirim?"
inputs = tokenizer(prompt, return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(output[0]))Model Ağırlıkları
Hugging Face
İlgili Veri Kümeleri
Türkçe VikipediMetin Üretimi
320 Mn token
OPUS-100 (TR-EN)Çeviri
18 Mn token
TR-NewsÖzetleme
180 Mn token