Validation à l'écoute (panel A/B 4 combos sur 'Bonsoir, comment tu te sens
ce soir ?'). Verdict utilisateur : combinaison TOPP_0.95_REPP_1.10 sonne le
moins robotique.
Analyse complémentaire TU.2 (dump codes via KZTTS_DUMP_CODES=path) sur 4
phrases panel a confirmé :
- code 690 CB0 = attracteur silence (5.9% du panel, doublé systématiquement
en début de phrase, jusqu'à 4 répétitions consécutives mesurées)
- rep_penalty 1.05 trop doux pour casser ces 690 690
- rep_penalty 1.10 plus nucleus 0.95 -> top_p coupe la queue improbable
+ rep défavorise les codes récents -> moins de pause robotique
Nouveaux défauts (tts_engine.h TtsSynthesizeCfg + tts_pipeline env defaults
+ TtsEngine.kt TtsSampling) :
cp_top_p = 0.95f (était 1.0)
cp_rep_penalty = 1.10f (était 1.05)
talker_top_p = 0.95f (était 1.0)
talker_rep_penalty = 1.10f (était 1.05)
cp_temp, top_k, talker_temp/top_k inchangés (0.9, 50).
Mesure panel 4 phrases avec nouveaux défauts + decoder chraac subproc :
'Bonjour Kazeia' : N=29 RTF 2.19
'Bonsoir, comment tu te sens ce soir ?' : N=48 RTF 2.21
'Je rumine la nuit.' : N=34 RTF 2.21
'Comment puis-je t'aider aujourd'hui ?' : N=29 RTF 2.27
RTF stable ~2.2. Compression légère sur phrases courtes (29 vs 33 baseline),
expansion sur phrases interrogatives ('Bonsoir' N=48 vs 41). Cohérent
avec top_p resserré qui choisit des codes plus pertinents.
KZTTS_DUMP_CODES=path ajouté dans tts_engine pour analyse future
(int32 binaire [N,16] time-major).
Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>
|
||
|---|---|---|
| .claude | ||
| dist | ||
| docs | ||
| eval | ||
| ql@6e0edba837 | ||
| .gitignore | ||
| CHANTIER_HMX_DENSE.md | ||
| CLAUDE.md | ||
| RAPPORT_RD.md | ||
| c4.sh | ||
| casc.sh | ||
| casc2.sh | ||
| casc3.sh | ||
| cascade_test.sh | ||
| cf.sh | ||
| qcmp.sh | ||
| spk.sh | ||