Własny polski BPE koduje polski 1.58× gęściej niż Llama-3
Observations
- data: 2026-06-15 ↗
- status: clean ↗
- baza: polish-32k (nasz, byte-level BPE) vs Llama-3 / GPT-2 ↗
- metoda: fertility = tokeny/słowo na 2000 held-out polskich dokumentów (962k słów); identyczny tekst dla wszystkich. BPE trenowany na ~1GB zbalansowanej próbki korpusu (cap legalese bo 71% to prawo), 51s na 16 rdzeniach. ↗
- harness: tokenizers (Rust) encode_batch na identycznej próbce held-out, tok/słowo ↗
- polish-32k (nasz, 32k vocab): 1.738 tok/słowo — 1.00× (baseline) ↗
- Llama-3 (128k vocab): 2.744 tok/słowo — 1.58× gorzej ↗
- GPT-2 (50k vocab): 3.659 tok/słowo — 2.10× gorzej ↗
- Dlaczego ogólne tokenizery słabo: ogólne/multilingual słowniki nigdy nie dostały dedykowanego polskiego; nasz dedykowany BPE bije nawet 4× większy słownik Llamy-3 ↗
- Konsekwencja: przy tym samym vocab (32k) nasz koduje polski znacznie gęściej → więcej tekstu w oknie kontekstu, efektywniejszy trening na token ↗
- Caveat (uczciwie): próbka in-domain (Wikipedia); wszystkie dostały IDENTYCZNY tekst, a skala 1.58× jest za duża by to był artefakt domeny. Pancerny pomiar OOD do dorobienia ↗
Referenced by
Local graph
Własny polski BPE koduje polski 1.58× gęściej niż Llama-3