KamoCRM

Rulați lama-server cu un fir pe miez de limita de procesor

FixKlusterServices
Expediere
28 septembrie 2026 la 02:35 UTC
Autor
Kamo
Comite
6186ce6

Ollama începe lama-server fără - fire, astfel încât a numărat k3m1 lui 24 fizic nuclee și a fugit 24 fire de calcul în interiorul cotei de 8-core containerului. ă container petrecut de două ori mai lung accelerat decât rularea (16 560 s accelerat împotriva 8 405 s folosit), prompte a mers la ~25 jetoane / s și răspunsuri la ~3, și a 3 600 token pas agent nu a putut termina în interiorul lui AIService 120 s pe încercare. LLAMA ARG TREADS este citit de lama-server (și stabilește firele de lot prea); API-ul în jos îl leagă de limite.cpu astfel încât cele două nu pot aluneca în afară.

Toate modificările

Ca ceea ce vezi de transport maritim?

Toate acestea ajung în spațiul de lucru pe cont propriu. Începeți cu planul gratuit și citiți această pagină din nou într-o lună.

Pornește gratuit pentru totdeaunaVezi prețurile