- Se descapó
- 28 de septiembre de 2026 a las 2:35 UTC
- Autor
- Kamo
- Compromit
- 6186ce6
Ollama comienza llama-servidor sin --threads, por lo que contaba k3m1's 24 físicos núcleos y corrió 24 hilos de cóute dentro de la cuota de 8 núcleos del contenedor. El contenedor pasado el doble de largo acelerador que correr (16 560 estranguló a escondido 8 405 s utilizados), los avisos fueron a 25 fichas y respuestas en el número 3 y a 3 600-token agente no pudo terminar dentro de 120 s por intento de AIService. LLAMA-ARG-THREADS se lee en llama-server (y establece los hilos de lotes también); La API de Down lo vincula a limits.cpu por lo que los dos no pueden separarse.
