Sonda di vita non potrebbe mai passare — causa di 920 riavvia in 35 giorni

FixKlusterServices
Spegnimento
5 agosto 2026 alle ore 00:11 UTC
Autore
Kamo
Impegno
00ad3ef

Causa radice: la sonda di liveness era `tcpSocket: port 10000`, ma l'API REST di Scylla lega a api address 127.0.0.1 (il suo default) mentre una sonda tcpSocket compone il POD IP. Verificato dall'interno del contenitore — /proc/net/tcp mostra:10000 solo ascolto il 0100007F (127.0.0.1), mentre 9042/9180/7000/19042 sono sul pod IP; e E' una cosa da fare. restituisce 200 mentre la stessa richiesta al pod IP viene rifiutato (uscita curl 7), che è esattamente ciò che kubelet ha riferito: "Sonda di vita fallita: comporre tcp 10.42.0.47:10000: collegare: connessione rifiutata". Quindi la sonda ha fallito ogni tentativo e il kubelet ha ucciso ogni container ciclo: inizialeDelaySeconds 900 + guastoTreshold 80 x periodoSecondi 30 = 3300s, corrispondente al periodo di riavvio osservato di 55m14s e 920 riparte / 35 giorni (~ uno per 54.7 min). Ogni uccisione ha eseguito il preStop `nodetool scarico`, quindi è uscito 0 / "Completato" e sembrava un arresto pulito piuttosto che un incidente. I primi 900s/80 valori non erano sintonizzazione a freddo come il commento sostenuto — stavano mascherando questo. Hanno solo allungato il ciclo di uccisione; i precedenti 60 / 6 valori prodotti un riavvio ogni ~4 min (~360/giorno). Fisso: sonda l'API dove effettivamente ascolta, tramite exec contro 127.0.0.1, e ripristinare una soglia significativa (6 x 30s = 3 min). startupProbe già cancelli liveness fino a quando CQL è in su, così inizialeDelaySeconds è inutile. Deliberatamente no impostazione --api-address 0.0.0.0, che esporrebbe l'amministratore non autorizzato REST API alla rete pod.

Tutte le modifiche

Come quello che vedi la spedizione?

Ognuno di questi aggiornamenti atterra automaticamente nello spazio di lavoro. Inizia gratis e guardalo crescere settimana dopo settimana.

Inizia gratis per sempreVisualizza il prezzo