← Lider Tablosu'na dön
Referans Tabanı

Referans Taban

Referans

Referans Taban, gerçek bir dil modeli değildir. Her soruda, mevcut seçenekler arasından bilgiye dayanmadan rastgele bir yanıt seçen kuramsal bir referanstır. Bir modelin skorunu bu tabanla karşılaştırmak, o modelin gerçekten öğrenip öğrenmediğini anlamanın en temel yoludur: tabanın çevresindeki skorlar, şans eseri elde edilebilecek başarımı gösterir.

Beklenen Skorlar

Türkçe MMLU25
Dilbilgisi50
Akıl Yürütme23.2
Kodlama0
Genel Ortalama24,6

Neden anlamlı?

MMLU · 25Dört şıklı sorularda rastgele seçimin beklenen doğruluğu (≈%25).
Dilbilgisi · 50İki seçenekli kabul edilebilirlik kararlarında yazı-tura beklentisi (≈%50).
Akıl Yürütme · 23,2Çok seçenekli çıkarım görevlerinde şans düzeyi başarım.
Kodlama · 0Rastgele üretilen kodun testleri geçme olasılığı pratikte sıfırdır.

Kıyaslama Veri Kümeleri

Her ölçüt, aşağıdaki Türkçe (ve uyarlanmış) veri kümeleri üzerinde değerlendirilir. Referans Taban da aynı kümeler üzerinde, yanıtları rastgele seçtiği varsayılarak hesaplanır.

Türkçe MMLU

1 veri kümesi

Çok alanlı akademik bilgi ve anlama.

Dilbilgisi

2 veri kümesi

Türkçe dil doğruluğu, dilbilgisi ve kabul edilebilirlik.

Akıl Yürütme

5 veri kümesi

Mantıksal çıkarım, sağduyu ve çok adımlı problem çözme.

Kodlama

6 veri kümesi

Program sentezi ve kod anlama.

bigcode/bigcodebench· v0.1.4newfacade/LeetCodeDataset· train + testmbpp· sanitized + evalplusmbpp-canonical· türetilmişmbpp-mutant· türetilmişopenai/openai_humaneval· + evalplus