V4 Faza 0 — pomiar (likelihood) + kalibracja λ (cal-l030)
Observations
- data: 2026-06-14 ↗
- status: clean ↗
- baza: Qwen3.5-27B ↗
- metoda: λ-merge: base + 0.30·(v3−base), interpolacja wag (DoRA-safe) — bez treningu ↗
- harness: klej_eval.py CDSC-E likelihood n=200 + bench_llmzszl_likelihood.py n=400, seed 42 ↗
- LLMzSzŁ (n=400): base / v3 / cal-l030: 63.5 / 66.8 / 63.5 ↗
- CDSC-E likelihood (n=200): base / v3 / cal-l030: 87.5 / 81.5 / 83.5 ↗
- CDSC-E v3: generacja vs likelihood: 64.5 → 81.5 (czyli −22.5 → −6.0) ↗
- Faza 0 V4 to diagnoza i kalibracja, nie nowy trening. (1) „Katastrofa” CDSC-E v3 była w ~3/4 artefaktem POMIARU: generacja+parser dawały 64.5, ale likelihood (scoring etykiet) daje 81.5 — realny spadek to −6.0, nie −22.5. Wniosek operacyjny: zadania klasyfikacyjne mierzymy likelihood. (2) v3 to realny zysk na celu (LLMzSzŁ +3.3) bez szerokiej regresji KLEJ — makro płaskie, sentyment +9/+7.5. (3) Próba naprawy przez merge wag λ=0.30 (cal-l030) wyglądała świetnie na n=200 (CDSC 82 / LLMzSzŁ 66.5), ale twardy rerun n=400 pokazał, że oddała CAŁY zysk celu (LLMzSzŁ 63.5 = baza), zostawiając −4 na CDSC. Mała próbka skłamała. Wniosek: decyzje o release wyłącznie na n≥400; przy niskim λ koszt CDSC rośnie szybciej niż zysk LLMzSzŁ, więc post-hoc merge nie da gate-clean wygranej — prawdziwy fix to trening anti-collapse (q/v only, niższy lr, hard-neutral NLI + KL-to-base). Reguła V4: zero benchmark train splitów jako paliwa, też KLEJ. ↗
- Trwa pełny screen base vs v3 vs cal-l030: KLEJ ×12 (likelihood) + LLMzSzŁ + EN-retention (ARC-C, MMLU, Belebele-EN, GSM8K). Runner bierze model z HF/katalogu, sampling n=100, zapis przyrostowy + watchdog. ↗
Related
uses-benchmark: LLMzSzŁ, Belebele (EN), MMLU (EN), Belebele (PL), ARC-Challenge (EN), GSM8K (EN)
Referenced by
- MMLU (mentions)
- generacja (mentions)
- GSM8K (mentions)
- EVAL (mentions)
- CDSC (mentions)
- DoRA (mentions)
- FIX (mentions)
- ARC (mentions)
- belebele (mentions)
- CAŁY (mentions)
- LLMzSzL (mentions)
- POMIARU (mentions)
- KLEJ (mentions)
- NLI (mentions)
Local graph
V4 Faza 0 — pomiar (likelihood) + kalibracja λ (cal-l030)
- → uses-benchmark LLMzSzŁ
- → uses-benchmark Belebele (EN)
- → uses-benchmark MMLU (EN)
- → uses-benchmark Belebele (PL)
- → uses-benchmark ARC-Challenge (EN)
- → uses-benchmark GSM8K (EN)
- ← mentions MMLU
- ← mentions generacja
- ← mentions GSM8K
- ← mentions EVAL
- ← mentions CDSC
- ← mentions DoRA
- ← mentions FIX
- ← mentions ARC
- ← mentions belebele
- ← mentions CAŁY
- ← mentions LLMzSzL
- ← mentions POMIARU
- ← mentions KLEJ
- ← mentions NLI