KamoCRM

Cap llama-server's prompt cache sotto il limite di memoria, quindi smette di essere OOMKilled

FixKlusterServices
Spegnimento
28 settembre 2026 alle ore 14:09 UTC
Autore
Kamo
Impegno
f4d979d

default della cache del prompt host-RAM di llama-server a 8192 MiB (--cache-ram), il il limite intero del contenitore, così è cresciuto fino a quando il kernel ha ucciso ollama: su 2026-09-28 ha tenuto 14 suggerimenti in 3 548 MiB su un modello ~4.4 GiB e il 15 ° salvare era OOMKilled (8 riparte in 9.5 h, un 502 per ogni chiamata in volo). LLAMA ARG CACHE RAM =1024 mantiene circa quattro suggerimenti (partita dei passi di età ~340 gettoni di prefisso, quindi nulla è perso); LLAMA ARG CTX CHECKPOINTS=8 lega i per-slot checkpoints (2-3 per prompt a ~55 MiB) che il default 32 sinistra a 1.7 GiB. Ollama inizia llama-server con nessuna bandiera, e l'inv arriva.

Tutte le modifiche

Come quello che vedi la spedizione?

Tutto questo arriva nel vostro spazio di lavoro da solo. Iniziare sul piano gratuito e leggere di nuovo questa pagina in un mese.

Inizia gratis per sempreVisualizza il prezzo