- Verschifft
- 28. September 2026 um 02:35 UTC
- Autor
- Kamo
- Ausschuss
- 6186ce6
Ollama startet Lama-Server ohne --Threads, also zählte es k3m1's 24 physical Kerne und liefen 24 Berechnungsfäden innerhalb des Containers 8-Kern-Kontingent. Die Container verbrachte doppelt so lange gedrosselt wie laufen (16 560 s gedrosselt gegen 8 405 s verwendet), Prompts ging bei 25 Tokens/s und Antworten bei 3, und ein 3 600-Token-Agent-Schritt konnte nicht innerhalb von AIService 120 s pro Versuch beenden. LLAMA_ARG_THREADS wird vom Lama-Server gelesen (und setzt auch die Batch-Threads); Downward API bindet es an limits.cpu, so dass die beiden nicht auseinander driften können.
