KamoCRM

Eseguire IBM Granite 4.0 H-Tiny al posto di qwen3:4b, su 16 core

FeatureKlusterServices
Spegnimento
28 settembre 2026 alle ore 04:36 UTC
Autore
Kamo
Impegno
8f24b41

Il proprietario ha chiesto un modello locale che funziona sostanzialmente meglio su k3m1 AVX2-solo Xeons (2026-09-27, sentenza SP01-LLM-granite4). granito4: tiny-h è ibrido Mamba-2/transformer MoE (7B totale, ~1B attivo): più volte qwen3:4b rapida e risposta alla velocità sulla CPU, chiamata strumento nativo, e nessun passaggio di pensiero. - postStart tira granito4:tiny-h; - limite di CPU 8 -> 16 (LLAMA ARG THREADS lo segue), richiesta 2 -> 4; - OLLAMA CONTEXT LENGTH 8192 -> 16384 (passi di età eseguire 3-5k token); - OLLAMA FLASH ATTENTION=1.

Tutte le modifiche

Come quello che vedi la spedizione?

Tutto questo arriva nel vostro spazio di lavoro da solo. Iniziare sul piano gratuito e leggere di nuovo questa pagina in un mese.

Inizia gratis per sempreVisualizza il prezzo