1.2 KiB
Intégrer Kazeia-Engine dans kazeia-android
Remplace LLM ExecuTorch/Genie par llama.cpp upstream + Hexagon. LLM + TTS sur l'engine ; STT reste ORT-QAIRT (inchangé). Modèles GGUF, pas de .pte.
Bascule clé
--reasoning-budget 0 (sinon Qwen3.5 ramble anglais). Prefill NPU / decode CPU. Speaker+Thinker = même engine, instances séparées ou cache.
libs/ → jniLibs/arm64-v8a
libllama.so, libggml{,-base,-cpu,-hexagon}.so, libggml-htp-v68/69/73/75/79/81.so (sel. auto V79). Statiques: libcommon.a. Headers: include/{llama,ggml,common}.h. Build -march=armv8.6-a+dotprod+fp16+i8mm+bf16.
Modèles (push tablette)
Speaker Qwen3.5-9B-Q4_0 5.0GB (ou 4B 2.4). Thinker Guard-4B Q4_K_M 2.5GB. Cascade 7.5GB OK. tokenizer dans le GGUF.
Perf cible (mesuré)
9B prefill HTP 41 / decode CPU 8.4 ; 4B 55/15. 9B>4B qualité (Speaker=9B reco). cli load -ngl99 -dev HTP0 -t8. ENV: LD_LIBRARY_PATH+ADSP_LIBRARY_PATH=jniLibs.