- Expediere
- 28 septembrie 2026 la 02:35 UTC
- Autor
- Kamo
- Comite
- 6186ce6
Ollama începe lama-server fără - fire, astfel încât a numărat k3m1 lui 24 fizic nuclee și a fugit 24 fire de calcul în interiorul cotei de 8-core containerului. ă container petrecut de două ori mai lung accelerat decât rularea (16 560 s accelerat împotriva 8 405 s folosit), prompte a mers la ~25 jetoane / s și răspunsuri la ~3, și a 3 600 token pas agent nu a putut termina în interiorul lui AIService 120 s pe încercare. LLAMA ARG TREADS este citit de lama-server (și stabilește firele de lot prea); API-ul în jos îl leagă de limite.cpu astfel încât cele două nu pot aluneca în afară.
