KamoCRM

Jalankan llama- server dengan satu benang per inti batas CPU nya

FixKlusterServices
Dikirim
28 September 2026 pukul 02.35 UTC
Penulis
Kamo
Commit
6186ce6

Ollama mulai lam-server tanpa --thread, sehingga dihitung k3m1 24 fisik core dan berlari 24 benang kompute dalam wadah 8- core kuota. The kontainer menghabiskan dua kali lebih lama berputar sebagai berjalan (16 560 s throttled terhadap 8 405 s digunakan), prompt pergi di ~ 25 token / s dan jawaban di ~ 3, dan sebuah 3 600- langkah agen token tidak bisa menyelesaikan dalam AIService apos; s 120 s per upaya. LLAMA _ ARG _ THREADS dibaca oleh llama- server (dan mengatur thread batch terlalu); Bawah API mengaitkannya dengan Limits.cpu sehingga dua tidak dapat hanyut terpisah.

Semua perubahan

Seperti apa yang Anda lihat pengiriman?

Semua itu tiba di ruang kerjamu sendiri. Mulailah dengan rencana gratis dan baca halaman ini lagi dalam sebulan.

Mulai Bebas SelamanyaTampilkan Harga