KamoCRM

llama-server mit einem Thread pro Kern des CPU-Limits ausführen

FixKlusterServices
Verschifft
28. September 2026 um 02:35 UTC
Autor
Kamo
Ausschuss
6186ce6

Ollama startet Lama-Server ohne --Threads, also zählte es k3m1's 24 physical Kerne und liefen 24 Berechnungsfäden innerhalb des Containers 8-Kern-Kontingent. Die Container verbrachte doppelt so lange gedrosselt wie laufen (16 560 s gedrosselt gegen 8 405 s verwendet), Prompts ging bei 25 Tokens/s und Antworten bei 3, und ein 3 600-Token-Agent-Schritt konnte nicht innerhalb von AIService 120 s pro Versuch beenden. LLAMA_ARG_THREADS wird vom Lama-Server gelesen (und setzt auch die Batch-Threads); Downward API bindet es an limits.cpu, so dass die beiden nicht auseinander driften können.

Alle Änderungen

Wie, was Sie sehen Versand?

Alles kommt in Ihrem Arbeitsbereich für sich. Starten Sie mit dem kostenlosen Plan und lesen Sie diese Seite in einem Monat wieder.

Free Forever startenPreisgestaltung anzeigen