KamoCRM

Быстрый кэш Cap llama-server ниже предела памяти, поэтому он перестает быть OOMKilled

FixKlusterServices
Порезанный
28 сентября 2026 г. в 14:09 UTC
Автор
Kamo
Обещать
f4d979d

llama-server's host-RAM prompt cache defaults to 8192 MiB (--cache-ram) Весь предел контейнера, так что он рос, пока ядро не убило Олламу: 2026-09-28 он провел 14 подсказок в 3 548 МиБ на модели ~ 4,4 ГиБ и 15-й Экономия составила OOMKilled (8 перезапусков за 9,5 ч, по 502 на каждый звонок в полете). LLAMA ARG CACHE RAM =1024 сохраняет около четырех подсказок (доля шагов агента ~340) токены префикса, так что ничего не потеряно; LLAMA ARG CTX CHECKPOINTS=8 ограничивает контрольно-пропускные пункты (2-3 на подсказку ~55 МиБ), которые по умолчанию 32 оставили на 1.7 Гиб. Олама начинает лам-сервер без флага, и энв достигает его.

Все изменения

Как вы видите судоходство?

Все это приходит в ваше рабочее пространство самостоятельно. Начните с бесплатного плана и прочитайте эту страницу через месяц.

Начните бесплатно навсегдаПосмотреть цены