KamoCRM

Run IBM Granite 4.0 H-Tiny à la place de qwen3:4b, sur 16 carottes

FeatureKlusterServices
Expédié
28 septembre 2026 à 04:36 UTC
Auteur
Kamo
Commite
8f24b41

Le propriétaire a demandé un modèle local qui fonctionne sensiblement mieux sur les k3m1 AVX2-seulement Xeons (2026-09-27, décision SP01-LLM-granite4). granit4:tiny-h est un Munga-2/transformateur hybride MoE (7B total, 1B actif): plusieurs fois qwen3:4b prompt et répondre à la vitesse sur CPU, l'appel d'outil natif, et pas de passe-pensée. - postStart tire le granite4:tiny-h; - Limite de l'unité centrale 8 - 16 (LLAMA-ARG-THREADS) suit la demande 2 - 4; - OLLAMA-CONTEXT-LENGTH 8192 - 16384 (les pas d'agent passent de 3 à 5k jetons); - OLLAMA-FLASH-ATTENTION-1. La mémoire reste 8Gi.

Tous les changements

Comme ce que tu vois expédier ?

Tout cela arrive dans votre espace de travail par lui-même. Commencez sur le plan gratuit et relisez cette page dans un mois.

Commencez gratuitement pour toujoursPrix de visualisation