KamoCRM

Cap llama-server's prompt cache under the Memory limit, 그래서 OOMKilled는 중지

FixKlusterServices
관련 상품
2026년 9월 28일 오후 2:09 UTC
이름 *
Kamo
뚱 베어
f4d979d

llama-server의 호스트-RAM 프롬프트 캐시 기본값은 8192 MiB (--cache-ram), 컨테이너의 전체 한계, 그래서 커널이 ollama를 죽일 때까지 성장: 에 2026-09-28 ~4.4 GiB 모델에서 3 548 MiB에서 14 개의 프롬프트를 개최하고 15th 저장은 OOMKilled (8 9.5 h에서 재시작, 502 비행에서 모든 통화). 라마 ARG CACHE RAM =1024는 대략 4개의 신속한 (시약 단계 몫 ~340를 지킵니다 접두사의 토큰은 손실되지 않습니다. LLAMA ARG CTX CHECKPOINTS=8은 per-slot checkpoints (~55 MiB에서 신속한 당 2-3) 기본값은 32에서 왼쪽 1.7 GiB. Ollama는 플래그를 사용하지 않고 llama-server를 시작하고 env는 도달합니다.

모든 변경 사항

배송을 보는 것과 같이?

모든 것이 자신의 작업 공간에서 도착합니다. 무료 플랜을 시작하고 이 페이지를 다시 한 달에 읽으십시오.

무료 영원히 시작가격 비교