KamoCRM

Executar IBM Granite 4.0 H-Tiny no lugar de qwen3:4b, em 16 núcleos

FeatureKlusterServices
Navios
28 de setembro de 2026 às 04:36 UTC
Autor
Kamo
Enviar
8f24b41

O proprietário pediu um modelo local que funciona substancialmente melhor no k3m1 AVX2 apenas Xeons (2026-09-27, SP01-LLM-granite4). granito4: tiny-h é um híbrido Mamba-2/transformer MoE (7B total, ~1B ativo): várias vezes qwen3:4b's velocidade de resposta e prompt na CPU, chamada de ferramenta nativa, e nenhum passe de pensamento. - PostStart puxa granito4:tiny-h; - limite de CPU 8 -> 16 (LLAMA ARG THREADS segue-o), pedido 2 -> 4; - OLLAMA CONTEXT LENGTH 8192 -> 16384 (agentes executam fichas de 3-5k); - OLLAMA FLASH ATENÇÃO=1. A memória fica 8Gi.

Todas as alterações

Como o que vês no transporte?

Tudo isso chega em seu espaço de trabalho por conta própria. Comece no plano gratuito e leia esta página novamente em um mês.

Começar Livre Para SempreVer Preços