KamoCRM

Запустите лама-сервер с одним потоком на ядро своего предела процессора

FixKlusterServices
Порезанный
28 сентября 2026 г. в 02:35 UTC
Автор
Kamo
Обещать
6186ce6

Ollama запускает llama-сервер без -потоков, поэтому он насчитал 24 физических k3m1. ядра и 24 вычислительных потока в 8-ядерной квоте контейнера. The Контейнер тратил в два раза больше времени на дросселирование, чем на бег (16 560 с дросселем против Используется 8 405 с), подсказки шли по ~25 токенов / с и ответы по ~3, а 3 600-токеновые агенты не могли закончиться в 120 с за попытку. LLAMA ARG THREADS читается llama-server (и устанавливает пакетные нити); Нисходящий API связывает его с Limits.cpu, поэтому они не могут разойтись.

Все изменения

Как вы видите судоходство?

Все это приходит в ваше рабочее пространство самостоятельно. Начните с бесплатного плана и прочитайте эту страницу через месяц.

Начните бесплатно навсегдаПосмотреть цены