v4 fix #277: ngl0 CPU decode 14tok/s, 4s/tour, usable
This commit is contained in:
parent
7a5780ca1d
commit
9b62420089
|
|
@ -37,3 +37,6 @@ TTS Talker/CP linke vs son libllama.so -> conflit ABI. FIX: libkazeia_engine.so
|
||||||
|
|
||||||
## v3 utilisable: thinking-off bridge
|
## v3 utilisable: thinking-off bridge
|
||||||
generate(sys,usr,max): wrap ChatML + <think></think> vide = stop reasoning, decode 4B 15tok/s ~5s/tour. test 4B: "Je suis desole..." 40s(load)+gen. signature 2-arg. cap maxTok 64. dist=libkazeia_engine.so static + htp-v79. #277 fix livre.
|
generate(sys,usr,max): wrap ChatML + <think></think> vide = stop reasoning, decode 4B 15tok/s ~5s/tour. test 4B: "Je suis desole..." 40s(load)+gen. signature 2-arg. cap maxTok 64. dist=libkazeia_engine.so static + htp-v79. #277 fix livre.
|
||||||
|
|
||||||
|
## v4 USABLE: ngl0 CPU decode (vrai fix #277)
|
||||||
|
Hang in-app=0.21tok/s: ngl99 -> decode ping-pong NPU/GDN-CPU. FIX: n_gpu_layers=0 decode CPU pur 14tok/s. test 4B: reponse FR 4s/tour. dev avait raison: pas thinking. cap64 garde. Speaker=4B CPU ngl0. RAM 4.5G. dist=libkazeia_engine.so. utilisable, #277 debloque.
|
||||||
|
|
|
||||||
|
|
@ -13,7 +13,7 @@ extern "C" JNIEXPORT jlong JNICALL
|
||||||
Java_com_kazeia_llm_EngineJni_load(JNIEnv* e, jobject, jstring path, jint nctx) {
|
Java_com_kazeia_llm_EngineJni_load(JNIEnv* e, jobject, jstring path, jint nctx) {
|
||||||
const char* p = e->GetStringUTFChars(path, 0);
|
const char* p = e->GetStringUTFChars(path, 0);
|
||||||
llama_backend_init();
|
llama_backend_init();
|
||||||
auto mp = llama_model_default_params(); mp.n_gpu_layers = 99; // prefill HTP
|
auto mp = llama_model_default_params(); mp.n_gpu_layers = 0; // decode CPU pur 14t/s (ngl99=ping-pong 0.2)
|
||||||
auto m = llama_model_load_from_file(p, mp); e->ReleaseStringUTFChars(path, p);
|
auto m = llama_model_load_from_file(p, mp); e->ReleaseStringUTFChars(path, p);
|
||||||
if (!m) return 0;
|
if (!m) return 0;
|
||||||
auto cp = llama_context_default_params(); cp.n_ctx = nctx; cp.n_threads = 8; cp.n_batch = 512;
|
auto cp = llama_context_default_params(); cp.n_ctx = nctx; cp.n_threads = 8; cp.n_batch = 512;
|
||||||
|
|
|
||||||
|
|
@ -5,7 +5,7 @@
|
||||||
#include "llama.h"
|
#include "llama.h"
|
||||||
int main(int c, char** v){
|
int main(int c, char** v){
|
||||||
llama_backend_init();
|
llama_backend_init();
|
||||||
auto mp=llama_model_default_params(); mp.n_gpu_layers=99;
|
auto mp=llama_model_default_params(); mp.n_gpu_layers=0;
|
||||||
auto m=llama_model_load_from_file(v[1],mp); if(!m){printf("nomodel\n");return 1;}
|
auto m=llama_model_load_from_file(v[1],mp); if(!m){printf("nomodel\n");return 1;}
|
||||||
auto cp=llama_context_default_params(); cp.n_ctx=2048; cp.n_threads=8; cp.n_batch=512;
|
auto cp=llama_context_default_params(); cp.n_ctx=2048; cp.n_threads=8; cp.n_batch=512;
|
||||||
auto ctx=llama_init_from_model(m,cp); auto vo=llama_model_get_vocab(m);
|
auto ctx=llama_init_from_model(m,cp); auto vo=llama_model_get_vocab(m);
|
||||||
|
|
|
||||||
Loading…
Reference in New Issue