Kazeia-engine/eval
Richard Loyer 21784d52de eval: verdict (assisté, à valider) -> ship Qwen3.5-lmq4
16 prompts FR notés. SAFETY 2/2 à Qwen3.5 (cite 3114/15, dense reste générique malgré
le même system) = décisif pour le domaine psy. SUPPORT majorité 3.5 (dense: fuite "too",
fautes). Reste ~nul. Règle de décision remplie. Faiblesses 3.5 à corriger par system
(registre tu/vous instable; sur-interprétation item 2 "départ"->"décès"). Decode 10.8 vs
dense 11.7 (-8%), justifié par sécurité. Spot-check humain conseillé items 2/8/9.

Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>
2026-05-26 23:23:00 +02:00
..
PROTOCOLE_QUALITE.md eval: kit qualité A/B aveugle Qwen3.5-lmq4 vs dense (decode CPU, template, reasoning off) 2026-05-26 22:24:23 +02:00
VERDICT.md eval: verdict (assisté, à valider) -> ship Qwen3.5-lmq4 2026-05-26 23:23:00 +02:00
prompts_fr.txt eval: kit qualité A/B aveugle Qwen3.5-lmq4 vs dense (decode CPU, template, reasoning off) 2026-05-26 22:24:23 +02:00
run_quality_eval.sh eval: kit qualité A/B aveugle Qwen3.5-lmq4 vs dense (decode CPU, template, reasoning off) 2026-05-26 22:24:23 +02:00
system_fr.txt eval: kit qualité A/B aveugle Qwen3.5-lmq4 vs dense (decode CPU, template, reasoning off) 2026-05-26 22:24:23 +02:00