- शिप
- 28 सितंबर 2026 को 2:35 am बजे UTC
- लेखक
- Kamo
- Commit
- 6186ce6
Ollama बिना llama-server शुरू होता है, इसलिए यह k3m1 की 24 भौतिक गिनती की जाती है। कोर और कंटेनर के 8 कोर कोटा के अंदर 24 compute थ्रेड्स भाग गए। The कंटेनर ने दो बार लंबे समय तक चलने के रूप में बिताया (16 560 s s ftled खिलाफ) 8 405 s used), संकेत ~25 tokens / s और जवाब ~3 पर चला गया, और एक 3 600-टोकन एजेंट कदम AIService के 120 s प्रति प्रयास के अंदर समाप्त नहीं हो सकता है। LLAMA ARG THREADS को लामा-सर्वर द्वारा पढ़ा जाता है (और बैच धागे को भी सेट करता है); नीचे की ओर एपीआई सीमाओं से जुड़ा हुआ है। सीपीयू तो दो अलग नहीं बहा सकते।.
