v4 fix #277: ngl0 CPU decode 14tok/s, 4s/tour, usable

This commit is contained in:
Richard Loyer 2026-05-25 10:18:31 +02:00
parent 7a5780ca1d
commit 9b62420089
3 changed files with 5 additions and 2 deletions

3
dist/README.md vendored
View File

@ -37,3 +37,6 @@ TTS Talker/CP linke vs son libllama.so -> conflit ABI. FIX: libkazeia_engine.so
## v3 utilisable: thinking-off bridge ## v3 utilisable: thinking-off bridge
generate(sys,usr,max): wrap ChatML + <think></think> vide = stop reasoning, decode 4B 15tok/s ~5s/tour. test 4B: "Je suis desole..." 40s(load)+gen. signature 2-arg. cap maxTok 64. dist=libkazeia_engine.so static + htp-v79. #277 fix livre. generate(sys,usr,max): wrap ChatML + <think></think> vide = stop reasoning, decode 4B 15tok/s ~5s/tour. test 4B: "Je suis desole..." 40s(load)+gen. signature 2-arg. cap maxTok 64. dist=libkazeia_engine.so static + htp-v79. #277 fix livre.
## v4 USABLE: ngl0 CPU decode (vrai fix #277)
Hang in-app=0.21tok/s: ngl99 -> decode ping-pong NPU/GDN-CPU. FIX: n_gpu_layers=0 decode CPU pur 14tok/s. test 4B: reponse FR 4s/tour. dev avait raison: pas thinking. cap64 garde. Speaker=4B CPU ngl0. RAM 4.5G. dist=libkazeia_engine.so. utilisable, #277 debloque.

View File

@ -13,7 +13,7 @@ extern "C" JNIEXPORT jlong JNICALL
Java_com_kazeia_llm_EngineJni_load(JNIEnv* e, jobject, jstring path, jint nctx) { Java_com_kazeia_llm_EngineJni_load(JNIEnv* e, jobject, jstring path, jint nctx) {
const char* p = e->GetStringUTFChars(path, 0); const char* p = e->GetStringUTFChars(path, 0);
llama_backend_init(); llama_backend_init();
auto mp = llama_model_default_params(); mp.n_gpu_layers = 99; // prefill HTP auto mp = llama_model_default_params(); mp.n_gpu_layers = 0; // decode CPU pur 14t/s (ngl99=ping-pong 0.2)
auto m = llama_model_load_from_file(p, mp); e->ReleaseStringUTFChars(path, p); auto m = llama_model_load_from_file(p, mp); e->ReleaseStringUTFChars(path, p);
if (!m) return 0; if (!m) return 0;
auto cp = llama_context_default_params(); cp.n_ctx = nctx; cp.n_threads = 8; cp.n_batch = 512; auto cp = llama_context_default_params(); cp.n_ctx = nctx; cp.n_threads = 8; cp.n_batch = 512;

View File

@ -5,7 +5,7 @@
#include "llama.h" #include "llama.h"
int main(int c, char** v){ int main(int c, char** v){
llama_backend_init(); llama_backend_init();
auto mp=llama_model_default_params(); mp.n_gpu_layers=99; auto mp=llama_model_default_params(); mp.n_gpu_layers=0;
auto m=llama_model_load_from_file(v[1],mp); if(!m){printf("nomodel\n");return 1;} auto m=llama_model_load_from_file(v[1],mp); if(!m){printf("nomodel\n");return 1;}
auto cp=llama_context_default_params(); cp.n_ctx=2048; cp.n_threads=8; cp.n_batch=512; auto cp=llama_context_default_params(); cp.n_ctx=2048; cp.n_threads=8; cp.n_batch=512;
auto ctx=llama_init_from_model(m,cp); auto vo=llama_model_get_vocab(m); auto ctx=llama_init_from_model(m,cp); auto vo=llama_model_get_vocab(m);