KamoCRM

Exécuter le lama-serveur avec un filetage par noyau de sa limite de CPU

FixKlusterServices
Expédié
28 septembre 2026 à 02:35 UTC
Auteur
Kamo
Commite
6186ce6

Ollama commence le lama-server sans --threads, donc il a compté les 24 physiques de k3m1 les carottes et les 24 fils de calcul à l'intérieur du quota de 8 cœurs du conteneur. Le Conteneur dépensé deux fois plus longtemps étranglé que le fonctionnement (16 560 s s iracté contre 8 405 s utilisés), les messages d'invite se sont déroulés à 25 jetons/s et les réponses à la dose de 3 dollars, et a 3 échelon d'agent de 600 jetons ne pouvaient pas finir à l'intérieur des 120 s par tentative d'AIService. L'on lit LLAMA-ARG-THREADS par le serveur de lama (et sert les fils de lot aussi); L'API vers le bas le lie à limits.cpu pour que les deux ne puissent pas dériver.

Tous les changements

Comme ce que tu vois expédier ?

Tout cela arrive dans votre espace de travail par lui-même. Commencez sur le plan gratuit et relisez cette page dans un mois.

Commencez gratuitement pour toujoursPrix de visualisation