Sonda de vida nunca poderia passar — causa de 920 reinicia em 35 dias

FixKlusterServices
Navios
5 de agosto de 2026 às 00:11 UTC
Autor
Kamo
Enviar
00ad3ef

Causa raiz: a sonda de vida era `tcpSocket: porto 10000`, mas API REST do Scylla liga- se ao endereço api 127.0.0.1 (o padrão) enquanto uma sonda tcpSocket disca o POD IP. Verificado de dentro do recipiente — /proc/net/tcp mostra apenas :10000 escuta em 0100007F (127.0.0.1), enquanto 9042/9180/7000/19042 se encontram no período de inquérito pod; e Não, não. retorna 200 enquanto o mesmo pedido ao pod IP é recusado (curl exit 7), que é exatamente o que kubelet relatou: "Probe de vida falhou: dial tcp 10.42.0.47:10000: conexão: conexão recusada". Então, a sonda falhou em todas as tentativas e o Kubelet matou o contentor. ciclo: inicialAtrasoSegundos 900 + falhaLista 80 x períodoSegundos 30 = 3300s, correspondente ao período de reinício observado de 55m14s e 920 reinicia / 35 dias (~ uma por 54,7 min). Cada kill executou o preStop `nodetool dreno`, então ele saiu 0 / "Concluída" e parecia um desligamento limpo em vez de um acidente. Os valores anteriores de 900s/80 não foram afinação a frio, como o comentário alegou — Estavam a mascarar isto. Eles apenas esticaram o ciclo de morte; os 60s anteriores/ 6 os valores produziram uma reinicialização a cada ~4 min (~360/dia). Corrigir: sondar a API onde ela realmente escuta, via exec contra 127.0.0.1, e restaurar um limiar significativo (6 x 30s = 3 min). startupProbe já gates Vivência até CQL está para cima, então inicialDelaySeconds é desnecessário. Deliberadamente não setting -- api- address 0.0.0.0, que exporia o administrador não autenticado REST API para a rede pod.

Todas as alterações

Como o que vês no transporte?

Cada uma dessas atualizações pousa automaticamente em seu espaço de trabalho. Comece grátis e veja crescer semana após semana.

Começar Livre Para SempreVer Preços