KamoCRM

Cap lama-server prompt cache sub limita de memorie, astfel încât să nu mai fie OOMKilled

FixKlusterServices
Expediere
28 septembrie 2026 la 14:09 UTC
Autor
Kamo
Comite
f4d979d

lama-server gazdă-RAM prompt cache implicit la 8192 MiB (-cache-ram), Toată limita containerului, aşa că a crescut până când nucleul a ucis-o pe Ollama: 2026-09-28 a avut loc 14 cereri în 3 548 MiB pe un ~4.4 GiB model și 15 Salvare a fost OOMKilled (8 reporniri în 9.5 h, 502 la fiecare apel în zbor). LLAMA ARG CACHE RAM =1024 păstrează aproximativ patru prompte (pașii de agent parts ~340 tokens of prefix, so nothing is lost); LLAMA ARG CTX CHECKpoints=8 lits the puncte de verificare per lot (2-3 per prompt la ~55 MiB) că implicit 32 stânga la 1.7 GiB. Ollama începe lama-server cu nici un steag, iar env ajunge la el.

Toate modificările

Ca ceea ce vezi de transport maritim?

Toate acestea ajung în spațiul de lucru pe cont propriu. Începeți cu planul gratuit și citiți această pagină din nou într-o lună.

Pornește gratuit pentru totdeaunaVezi prețurile