- Navios
- 28 de setembro de 2026 às 02:35 UTC
- Autor
- Kamo
- Enviar
- 6186ce6
Ollama inicia lhama-server sem -- threads, então ele contou o 24 físico do k3m1 núcleos e executado 24 linhas de computação dentro da quota 8-core do recipiente. A recipiente gasto duas vezes mais longo estrangulado que correr (16 560 s estrangulado contra 8 405 s usados), prompts foram em ~25 tokens/s e respostas em ~3, e um 3 600 token agente passo não pôde terminar dentro de AIService 120 s por tentativa. LLAMA ARG THREADS é lido pelo servidor lhama (e define os threads em lote também); o A API para baixo a liga ao limits.cpu para que os dois não possam se separar.
