- Spegnimento
- 28 settembre 2026 alle ore 04:36 UTC
- Autore
- Kamo
- Impegno
- 8f24b41
Il proprietario ha chiesto un modello locale che funziona sostanzialmente meglio su k3m1 AVX2-solo Xeons (2026-09-27, sentenza SP01-LLM-granite4). granito4: tiny-h è ibrido Mamba-2/transformer MoE (7B totale, ~1B attivo): più volte qwen3:4b rapida e risposta alla velocità sulla CPU, chiamata strumento nativo, e nessun passaggio di pensiero. - postStart tira granito4:tiny-h; - limite di CPU 8 -> 16 (LLAMA ARG THREADS lo segue), richiesta 2 -> 4; - OLLAMA CONTEXT LENGTH 8192 -> 16384 (passi di età eseguire 3-5k token); - OLLAMA FLASH ATTENTION=1.
