KamoCRM

Cap lama-server's prompt cache en dessous de la limite de mémoire, donc il cesse d'être OOMKilled

FixKlusterServices
Expédié
28 septembre 2026 à 14:09 UTC
Auteur
Kamo
Commite
f4d979d

par défaut le cache de lama-server host-RAM s'élève à 8192 MiB (--cache-ram), le la limite entière du conteneur, donc il a grandi jusqu'à ce que le noyau tue Ollama: sur 2026-09-28 elle a tenu 14 invites dans 3 548 MiB sur un modèle ~4.4 GiB et le 15ème save a été OOMKilled (8 redémarrages en 9,5 h, un 502 à chaque appel en vol). LLAMA ARG CACHE RAM =1024 conserve environ quatre invites (pas d'agent partager ~340 jetons de préfixe, donc rien n'est perdu); LLAMA ARG CTX CHECKPOINTS=8 limite la points de contrôle par emplacement (2-3 par appel à ~55 Mio) que le 32 par défaut a laissé à 1.7 GiB. Ollama commence lama-serveur avec aucun drapeau, et l'env l'atteint.

Tous les changements

Comme ce que tu vois expédier ?

Tout cela arrive dans votre espace de travail par lui-même. Commencez sur le plan gratuit et relisez cette page dans un mois.

Commencez gratuitement pour toujoursPrix de visualisation