- Expédié
- 28 septembre 2026 à 02:35 UTC
- Auteur
- Kamo
- Commite
- 6186ce6
Ollama commence le lama-server sans --threads, donc il a compté les 24 physiques de k3m1 les carottes et les 24 fils de calcul à l'intérieur du quota de 8 cœurs du conteneur. Le Conteneur dépensé deux fois plus longtemps étranglé que le fonctionnement (16 560 s s iracté contre 8 405 s utilisés), les messages d'invite se sont déroulés à 25 jetons/s et les réponses à la dose de 3 dollars, et a 3 échelon d'agent de 600 jetons ne pouvaient pas finir à l'intérieur des 120 s par tentative d'AIService. L'on lit LLAMA-ARG-THREADS par le serveur de lama (et sert les fils de lot aussi); L'API vers le bas le lie à limits.cpu pour que les deux ne puissent pas dériver.
