- Se descapó
- 28 de septiembre de 2026 a las 4:36 UTC
- Autor
- Kamo
- Compromit
- 8f24b41
El propietario pidió un modelo local que funcione sustancialmente mejor en k3m1's AVX2-ons (2026-09-27, gobierta SP01-LLM-granite4). granito4:tiny-h es un híbrido Mamba-2/transformador MoE (7B total, 1B activo): varias veces qwen3:4b's velocidad de respuesta y rapidez en la CPU, llamativa de herramientas nativas, y sin pases de pensar. - postStart tira de granito4:tiny-h; - Límite de CPU 8 - 16 (LLAMA-ARG-THREADS sigue), solicitar 2 - 4; - OLLAMA-CONTEXT-LENGTH 8192 - 16384 (los pasos de agente ejecutan 3-5k tokens); - OLLAMA-FLASH-ATTENTION=1. La memoria se queda 8Gi.
