KamoCRM

Ejecute llama-server con un hilo por núcleo de su límite de CPU

FixKlusterServices
Se descapó
28 de septiembre de 2026 a las 2:35 UTC
Autor
Kamo
Compromit
6186ce6

Ollama comienza llama-servidor sin --threads, por lo que contaba k3m1's 24 físicos núcleos y corrió 24 hilos de cóute dentro de la cuota de 8 núcleos del contenedor. El contenedor pasado el doble de largo acelerador que correr (16 560 estranguló a escondido 8 405 s utilizados), los avisos fueron a 25 fichas y respuestas en el número 3 y a 3 600-token agente no pudo terminar dentro de 120 s por intento de AIService. LLAMA-ARG-THREADS se lee en llama-server (y establece los hilos de lotes también); La API de Down lo vincula a limits.cpu por lo que los dos no pueden separarse.

Todos los cambios

Como lo que ves enviaste?

Todo llega a su espacio de trabajo por sí solo. Comience en el plan gratuito y lea esta página de nuevo en un mes.

Arranzar gratis para siempreVer Precios