- Порезанный
- 28 сентября 2026 г. в 14:09 UTC
- Автор
- Kamo
- Обещать
- f4d979d
llama-server's host-RAM prompt cache defaults to 8192 MiB (--cache-ram) Весь предел контейнера, так что он рос, пока ядро не убило Олламу: 2026-09-28 он провел 14 подсказок в 3 548 МиБ на модели ~ 4,4 ГиБ и 15-й Экономия составила OOMKilled (8 перезапусков за 9,5 ч, по 502 на каждый звонок в полете). LLAMA ARG CACHE RAM =1024 сохраняет около четырех подсказок (доля шагов агента ~340) токены префикса, так что ничего не потеряно; LLAMA ARG CTX CHECKPOINTS=8 ограничивает контрольно-пропускные пункты (2-3 на подсказку ~55 МиБ), которые по умолчанию 32 оставили на 1.7 Гиб. Олама начинает лам-сервер без флага, и энв достигает его.
