- Shipped
- 10 de maio de 2026 às 09:04 UTC
- Author
- Kamo
- Commit
- 929eba5
Uma única réplica é o gargalo para o fluxo de trabalho de sincronização do dicionário: cada trabalhador de Gunicorn lida com um pedido e depois reinicia automaticamente (~5-10s janela de conexão-recusada), e a inferência de limites de 2-CPU - Não. Com chamadas em tempo de execução e uma sincronização de 12k a mesma instância, requisições fila passado TranslateService per-call tempo limite (agora 90s) e a maioria dos blocos tempo limite — a última execução de sincronização completa levou mais de 3 horas e produziu apenas 2,9% chinês em zh.json. Duas réplicas dupla CPU eficaz (4 núcleos totais) e dobro o Gunicorn piscina trabalhador, dando pedidos em algum lugar para pousar, enquanto um O trabalhador está a reciclar. Ambos os pods agendam no k1m1 (apenas o nó com o hostPath /var/lib/libretranslate onde os pacotes argos vivem); k1m1 tem ampla headroom (~92% livre de CPU, ~67% livre de memória).