- Dikirim
- 28 September 2026 pukul 02.35 UTC
- Penulis
- Kamo
- Commit
- 6186ce6
Ollama mulai lam-server tanpa --thread, sehingga dihitung k3m1 24 fisik core dan berlari 24 benang kompute dalam wadah 8- core kuota. The kontainer menghabiskan dua kali lebih lama berputar sebagai berjalan (16 560 s throttled terhadap 8 405 s digunakan), prompt pergi di ~ 25 token / s dan jawaban di ~ 3, dan sebuah 3 600- langkah agen token tidak bisa menyelesaikan dalam AIService apos; s 120 s per upaya. LLAMA _ ARG _ THREADS dibaca oleh llama- server (dan mengatur thread batch terlalu); Bawah API mengaitkannya dengan Limits.cpu sehingga dua tidak dapat hanyut terpisah.
