KamoCRM

Uruchom llama-serwer z jednym wątkiem na rdzeń limitu CPU

FixKlusterServices
Szycy
28 września 2026 02:35 UTC
Autor
Kamo
Pochęt się
6186ce6

Ollama uruchamia llama-serwer bez --threads, więc liczył 24 ciała k3m1 Rdzenie i uruchomiły 24 nici obliczeniowe wewnątrz 8-rdzeniowej kwoty kontenera. Nat ws. w tym w, poty ot wt. ws. w tym, że w tym w, potyczce o. w tym w, w tym w tym w, w tym w, potyczce, w tym w, potyczce o tym Kontener wydany dwa razy dłużej przepustowotnieł niż biegnący (16 560 s dławiony przeciwko 8 405 s użyte), monity za 25 tokenów / s i odpowiedzi za 3 funty, a 3 600-tenowy krok agenta nie mógł ukończyć w 120 s AIService na próbę. LLAMA_ARG_THREADS jest odczytywane przez llama-serwer (i ustawia wątki wsadowe); W dół API wiąże go do limits.cpu, więc oba nie mogą się od siebie oddalać.

Wszystkie zmiany

Jak to, co widzisz żeglugę?

Wszystko to pojawia się w twoim miejscu pracy na własną rękę. Zacznij od bezpłatnego planu i przeczytaj tę stronę ponownie w miesiącu.

Start Free ForeverZobacz ceny