KamoCRM

Llama-server を実行し、CPU 制限のコアごとに 1 つのスレッドで

FixKlusterServices
出荷済み
2026年9月28日 2:35 UTC
プロフィール
Kamo
コンテンツ
6186ce6

Ollama は --threads なしで llama-server を始めて下さい、従って k3m1's 24 の物理的な計算しました コアとコンテナの 8 コア クォータ内の 24 個の計算スレッドを実行します。 ザ・オブ・ザ・ コンテナは、実行時(16 560 s スロットルド16 560 s スロットルドを2回使用 8 405 s を使用)、プロンプトは ~25 トークン/秒 に移動し、~3 で応答します。 3 600 token エージェントのステップは、AIService の 120 s の 1 回の試行で終了できません。 LLAMA ARG THREADS は llama-server によって読み込まれています (また、バッチスレッドも設定します)。 ダウンワード API はそれを limits.cpu と結びますので、2 はドリフト解除できません.

すべての変更

配送を見るのが好きですか?

自分のワークスペースに到着します。 無料プランをスタートし、月に再度このページをお読みください.

永遠に無料で始める料金を見る