- Navios
- 28 de setembro de 2026 às 04:36 UTC
- Autor
- Kamo
- Enviar
- 8f24b41
O proprietário pediu um modelo local que funciona substancialmente melhor no k3m1 AVX2 apenas Xeons (2026-09-27, SP01-LLM-granite4). granito4: tiny-h é um híbrido Mamba-2/transformer MoE (7B total, ~1B ativo): várias vezes qwen3:4b's velocidade de resposta e prompt na CPU, chamada de ferramenta nativa, e nenhum passe de pensamento. - PostStart puxa granito4:tiny-h; - limite de CPU 8 -> 16 (LLAMA ARG THREADS segue-o), pedido 2 -> 4; - OLLAMA CONTEXT LENGTH 8192 -> 16384 (agentes executam fichas de 3-5k); - OLLAMA FLASH ATENÇÃO=1. A memória fica 8Gi.
