KLEJ / Open-PL — 6 zadań
Observations
- protokół: klasyfikacja/MCQ; każdy model na SWOIM rekomendowanym samplingu (Qwen @0.7 default) — real-world defaults, nie handicap ↗
- polish_psc (1078): Qwen-27B (baza) 85.25 · slayer v1 86.55 ↗
- polish_ppc (1000): Qwen-27B (baza) 70.5 · slayer v1 72.6 ↗
- polish_dyk (1029): Qwen-27B (baza) 87.07 · slayer v1 89.02 ↗
- polish_belebele (900): Qwen-27B (baza) 93.89 · slayer v1 92.67 ↗
- polish_8tags (4372): Qwen-27B (baza) 77.7 · slayer v1 78.25 ↗
- polemo2_in (722): Qwen-27B (baza) 77.42 · slayer v1 78.67 ↗
- PL AVG: Qwen-27B (baza) 81.97 · slayer v1 82.96 ↗
- slayer v1 wygrywa średnią bez treningu na tych zadaniach. Wyników v2 nie zestawiamy: trenowany na train-splitach (skażenie, szczegóły w logu eksperymentów). ↗
Related
uses-benchmark: Belebele (PL)
Referenced by
- MCQ (mentions)
- DYK (mentions)
- belebele (mentions)
- PPC (mentions)
- KLEJ (mentions)
- KLEJ (defined-by)
- PSC (mentions)
- AVG (mentions)
Local graph
KLEJ / Open-PL — 6 zadań