diff --git a/dist/README.md b/dist/README.md index ad1fedc..c1d9b9f 100644 --- a/dist/README.md +++ b/dist/README.md @@ -37,3 +37,6 @@ TTS Talker/CP linke vs son libllama.so -> conflit ABI. FIX: libkazeia_engine.so ## v3 utilisable: thinking-off bridge generate(sys,usr,max): wrap ChatML + vide = stop reasoning, decode 4B 15tok/s ~5s/tour. test 4B: "Je suis desole..." 40s(load)+gen. signature 2-arg. cap maxTok 64. dist=libkazeia_engine.so static + htp-v79. #277 fix livre. + +## v4 USABLE: ngl0 CPU decode (vrai fix #277) +Hang in-app=0.21tok/s: ngl99 -> decode ping-pong NPU/GDN-CPU. FIX: n_gpu_layers=0 decode CPU pur 14tok/s. test 4B: reponse FR 4s/tour. dev avait raison: pas thinking. cap64 garde. Speaker=4B CPU ngl0. RAM 4.5G. dist=libkazeia_engine.so. utilisable, #277 debloque. diff --git a/dist/jni/kazeia_engine_jni.cpp b/dist/jni/kazeia_engine_jni.cpp index 1b47cf9..5cb7cd6 100644 --- a/dist/jni/kazeia_engine_jni.cpp +++ b/dist/jni/kazeia_engine_jni.cpp @@ -13,7 +13,7 @@ extern "C" JNIEXPORT jlong JNICALL Java_com_kazeia_llm_EngineJni_load(JNIEnv* e, jobject, jstring path, jint nctx) { const char* p = e->GetStringUTFChars(path, 0); llama_backend_init(); - auto mp = llama_model_default_params(); mp.n_gpu_layers = 99; // prefill HTP + auto mp = llama_model_default_params(); mp.n_gpu_layers = 0; // decode CPU pur 14t/s (ngl99=ping-pong 0.2) auto m = llama_model_load_from_file(p, mp); e->ReleaseStringUTFChars(path, p); if (!m) return 0; auto cp = llama_context_default_params(); cp.n_ctx = nctx; cp.n_threads = 8; cp.n_batch = 512; diff --git a/dist/jni/test_native.cpp b/dist/jni/test_native.cpp index 23eb7b7..6717f48 100644 --- a/dist/jni/test_native.cpp +++ b/dist/jni/test_native.cpp @@ -5,7 +5,7 @@ #include "llama.h" int main(int c, char** v){ llama_backend_init(); - auto mp=llama_model_default_params(); mp.n_gpu_layers=99; + auto mp=llama_model_default_params(); mp.n_gpu_layers=0; auto m=llama_model_load_from_file(v[1],mp); if(!m){printf("nomodel\n");return 1;} auto cp=llama_context_default_params(); cp.n_ctx=2048; cp.n_threads=8; cp.n_batch=512; auto ctx=llama_init_from_model(m,cp); auto vo=llama_model_get_vocab(m);