knowledge_probe_v1 — długi ogon wiedzy o Polsce (smoke)
Observations
- data: 2026-06-11 ↗
- status: clean ↗
- metoda: 71 pytań closed-book z korpusu EntiGraph (38 polonica / 33 ogólne), sędzia: otwarty Qwen3.5-122B vs gold ugruntowany w źródle ↗
- harness: bench/knowledge_probe.py, temp 0, ollama Q4 (Qwen9B) + API bf16 (Qwen27B) ↗
- Qwen9B polonica: 18.4 ↗
- Qwen27B polonica: 15.8 ↗
- Qwen9B ogólne: 30.3 ↗
- Qwen27B ogólne: 33.3 ↗
- Długi ogon (regionalia, lokalne fakty) leży u wszystkich: 16-29%. Baza 27B najsłabsza na polonica przy dobrej wiedzy ogólnej. Wniosek: CPT na zmultiplikowanym syntetycznie ogonie (EntiGraph 10M) ma duże przestrzenie do odzyskania; cel po CPT: znaczący wzrost na polonica. n=71 to smoke: różnice na polonica (n=38) jeszcze nieistotne statystycznie; potwierdzenie na probe 300-500 + drugi niezależny sędzia. Itemy probe = held-out (exclusion list z treningu CPT). ↗
- n_examples: 71 ↗
- miks: polonica 38 · ogolne 33 ↗
Referenced by
Local graph
knowledge_probe_v1 — długi ogon wiedzy o Polsce (smoke)