- Spegnimento
- 28 settembre 2026 alle ore 14:09 UTC
- Autore
- Kamo
- Impegno
- f4d979d
default della cache del prompt host-RAM di llama-server a 8192 MiB (--cache-ram), il il limite intero del contenitore, così è cresciuto fino a quando il kernel ha ucciso ollama: su 2026-09-28 ha tenuto 14 suggerimenti in 3 548 MiB su un modello ~4.4 GiB e il 15 ° salvare era OOMKilled (8 riparte in 9.5 h, un 502 per ogni chiamata in volo). LLAMA ARG CACHE RAM =1024 mantiene circa quattro suggerimenti (partita dei passi di età ~340 gettoni di prefisso, quindi nulla è perso); LLAMA ARG CTX CHECKPOINTS=8 lega i per-slot checkpoints (2-3 per prompt a ~55 MiB) che il default 32 sinistra a 1.7 GiB. Ollama inizia llama-server con nessuna bandiera, e l'inv arriva.
