KamoCRM

Cap llama-server's prompten Cache unter der Speichergrenze, so dass es aufhört, OOMKilled zu sein

FixKlusterServices
Verschifft
28. September 2026 um 14:09 UTC
Autor
Kamo
Ausschuss
f4d979d

Der Host-RAM-Protech-Cache des llama-servers steht standardmäßig auf 8192 MiB (--cache-ram), die Container ist die ganze Grenze, so wuchs es, bis der Kernel ollama getötet: auf 2026-09-28 hielt es 14 Prompts in 3 548 MiB auf einem 4,4 GiB-Modell und der 15. speichern war OOMKilled (8 Neustarts in 9,5 h, ein 502 zu jedem Anruf im Flug). LLAMA_ARG_CACHE_RAM=1024 hält etwa vier Aufforderungen (Agent-Schritte teilen sich 340 € Tokens von Präfix, so dass nichts verloren geht); LLAMA_ARG_CTX_CHECKPOINTS=8 begrenzt die pro-Slot-Kontrollpunkte (2-3 pro Prompt bei 55 MiB), die die Standardeinstellung 32 links bei 1.7 GiB. Ollama startet Lama-Server mit keiner Flagge, und das env erreicht es.

Alle Änderungen

Wie, was Sie sehen Versand?

Alles kommt in Ihrem Arbeitsbereich für sich. Starten Sie mit dem kostenlosen Plan und lesen Sie diese Seite in einem Monat wieder.

Free Forever startenPreisgestaltung anzeigen