- Spegnimento
- 28 settembre 2026 alle ore 02:35 UTC
- Autore
- Kamo
- Impegno
- 6186ce6
Ollama inizia llama-server senza --threads, così ha contato il 24 fisico di k3m1 core e ha eseguito 24 filetti di calcolo all'interno della quota 8-core del contenitore. The contenitore speso due volte più a lungo throttled come in esecuzione (16 560 s throttled contro 8 405 s usato), i suggerimenti sono andati a ~25 token/s e le risposte a ~3, e un 3 passo agente 600-token non poteva finire dentro AIService 120 s per tentativo. LLAMA ARG THREADS è letto da llama-server (e imposta anche i filetti batch); il L'API verso il basso lo lega a limit.cpu in modo che i due non possano allontanarsi.
