- Verschifft
- 28. September 2026 um 14:09 UTC
- Autor
- Kamo
- Ausschuss
- f4d979d
Der Host-RAM-Protech-Cache des llama-servers steht standardmäßig auf 8192 MiB (--cache-ram), die Container ist die ganze Grenze, so wuchs es, bis der Kernel ollama getötet: auf 2026-09-28 hielt es 14 Prompts in 3 548 MiB auf einem 4,4 GiB-Modell und der 15. speichern war OOMKilled (8 Neustarts in 9,5 h, ein 502 zu jedem Anruf im Flug). LLAMA_ARG_CACHE_RAM=1024 hält etwa vier Aufforderungen (Agent-Schritte teilen sich 340 € Tokens von Präfix, so dass nichts verloren geht); LLAMA_ARG_CTX_CHECKPOINTS=8 begrenzt die pro-Slot-Kontrollpunkte (2-3 pro Prompt bei 55 MiB), die die Standardeinstellung 32 links bei 1.7 GiB. Ollama startet Lama-Server mit keiner Flagge, und das env erreicht es.
