- Navios
- 28 de setembro de 2026 às 14:09 UTC
- Autor
- Kamo
- Enviar
- f4d979d
o cache de prompt lhama-server é padrão para 8192 MiB (-- cache-ram), o todo o limite do recipiente, então ele cresceu até que o kernel matou ollama: em 2026-09-28 realizou 14 prompts em 3 548 MiB em um modelo ~4.4 GiB e o 15o salvo foi OOMKilled (8 reinicia em 9,5 h, um 502 para cada chamada em voo). LLAMA ARG CACHE RAM =1024 mantém cerca de quatro prompts (as etapas do agente compartilham ~340 tokens do prefixo, para que nada seja perdido); LLAMA ARG CTX CHECKPOINTS=8 limita o por- slot checkpoints (2-3 por prompt em ~55 MiB) que o padrão 32 ficou em 1.7 GiB. Ollama inicia lhama-servidor com nenhuma bandeira, e o env alcança-a.
