KamoCRM

Eseguire llama-server con un thread per core del suo limite di CPU

FixKlusterServices
Spegnimento
28 settembre 2026 alle ore 02:35 UTC
Autore
Kamo
Impegno
6186ce6

Ollama inizia llama-server senza --threads, così ha contato il 24 fisico di k3m1 core e ha eseguito 24 filetti di calcolo all'interno della quota 8-core del contenitore. The contenitore speso due volte più a lungo throttled come in esecuzione (16 560 s throttled contro 8 405 s usato), i suggerimenti sono andati a ~25 token/s e le risposte a ~3, e un 3 passo agente 600-token non poteva finire dentro AIService 120 s per tentativo. LLAMA ARG THREADS è letto da llama-server (e imposta anche i filetti batch); il L'API verso il basso lo lega a limit.cpu in modo che i due non possano allontanarsi.

Tutte le modifiche

Come quello che vedi la spedizione?

Tutto questo arriva nel vostro spazio di lavoro da solo. Iniziare sul piano gratuito e leggere di nuovo questa pagina in un mese.

Inizia gratis per sempreVisualizza il prezzo