KamoCRM

Ejecute IBM Granito 4.0 H-Tiny en lugar de qwen3:4b, en 16 núcleos

FeatureKlusterServices
Se descapó
28 de septiembre de 2026 a las 4:36 UTC
Autor
Kamo
Compromit
8f24b41

El propietario pidió un modelo local que funcione sustancialmente mejor en k3m1's AVX2-ons (2026-09-27, gobierta SP01-LLM-granite4). granito4:tiny-h es un híbrido Mamba-2/transformador MoE (7B total, 1B activo): varias veces qwen3:4b's velocidad de respuesta y rapidez en la CPU, llamativa de herramientas nativas, y sin pases de pensar. - postStart tira de granito4:tiny-h; - Límite de CPU 8 - 16 (LLAMA-ARG-THREADS sigue), solicitar 2 - 4; - OLLAMA-CONTEXT-LENGTH 8192 - 16384 (los pasos de agente ejecutan 3-5k tokens); - OLLAMA-FLASH-ATTENTION=1. La memoria se queda 8Gi.

Todos los cambios

Como lo que ves enviaste?

Todo llega a su espacio de trabajo por sí solo. Comience en el plan gratuito y lea esta página de nuevo en un mes.

Arranzar gratis para siempreVer Precios