KamoCRM

Cap llama-server 's short cache below the memory limit, so it stop being OOMKilled

FixKlusterServices
Szycy
28 września 2026 14:09 UTC
Autor
Kamo
Pochęt się
f4d979d

llama-server 's host- RAM speed cache defaults to 8192 MiB (-- cache- ram), the kontener cały limit, więc wzrosła aż jądro zabił ollama: na 2026- 09- 28 to odbyło 14 prompts w 3 548 MiB na ~ 4.4 GiB modelu i 15 OOMKilled (8 powtórzeń w 9.5 h, 502 do każdego połączenia w locie). LLAMA _ ARG _ CACHE _ RAM = 1024 utrzymuje około czterech promptów (agent kroki akcji ~ 340 żetony przedrostka, więc nic nie jest stracone); LLAMA _ ARG _ CTX _ CHECKPOINTS = 8 granice per- slot checkpoints (2-3 per spell at ~ 55 MiB), że domyślnie 32 lewo w 1.7 GiB. Ollama rozpoczyna serwer lama z żadną flagą, a env dociera do niej.

Wszystkie zmiany

Jak to, co widzisz żeglugę?

Wszystko to pojawia się w twoim miejscu pracy na własną rękę. Zacznij od bezpłatnego planu i przeczytaj tę stronę ponownie w miesiącu.

Start Free ForeverZobacz ceny