- 出荷済み
- 2026年9月28日 2:35 UTC
- プロフィール
- Kamo
- コンテンツ
- 6186ce6
Ollama は --threads なしで llama-server を始めて下さい、従って k3m1's 24 の物理的な計算しました コアとコンテナの 8 コア クォータ内の 24 個の計算スレッドを実行します。 ザ・オブ・ザ・ コンテナは、実行時(16 560 s スロットルド16 560 s スロットルドを2回使用 8 405 s を使用)、プロンプトは ~25 トークン/秒 に移動し、~3 で応答します。 3 600 token エージェントのステップは、AIService の 120 s の 1 回の試行で終了できません。 LLAMA ARG THREADS は llama-server によって読み込まれています (また、バッチスレッドも設定します)。 ダウンワード API はそれを limits.cpu と結びますので、2 はドリフト解除できません.
