KamoCRM

Cap llama- server 's prompt cache di bawah batas memori, sehingga berhenti menjadi OOMTered

FixKlusterServices
Dikirim
28 September 2026 pukul 14.09 UTC
Penulis
Kamo
Commit
f4d979d

llama- server host-RAM prompt cache baku ke 8192 MiB (--cache-ram), seluruh batas kontainer, sehingga tumbuh sampai kernel membunuh ollama: on 2026-09- 28 itu diadakan 14 prompt di 3548 MiB pada ~ 4.4 GiB model dan tanggal 15 Menyelamatkan adalah OOMOMSAD (8 restarts in 9.5 h, sebuah 502 untuk setiap panggilan dalam penerbangan). LLAMA _ ARG _ CACHE _ RAM = 1024 terus sekitar empat prompt (langkah-langkah agen berbagi ~ 340 token dari awalan, jadi tidak ada yang hilang); LLAMA _ ARG _ CTX _ CHEKPOINTS = 8 batasan per- slot titik pemeriksaan (2- 3 per prompt di ~ 55 MiB) bahwa baku 32 kiri di Olama memulai server tanpa bendera, dan env mencapainya.

Semua perubahan

Seperti apa yang Anda lihat pengiriman?

Semua itu tiba di ruang kerjamu sendiri. Mulailah dengan rencana gratis dan baca halaman ini lagi dalam sebulan.

Mulai Bebas SelamanyaTampilkan Harga