- Spegnimento
- 5 agosto 2026 alle ore 00:11 UTC
- Autore
- Kamo
- Impegno
- 00ad3ef
Causa radice: la sonda di liveness era `tcpSocket: port 10000`, ma l'API REST di Scylla lega a api address 127.0.0.1 (il suo default) mentre una sonda tcpSocket compone il POD IP. Verificato dall'interno del contenitore — /proc/net/tcp mostra:10000 solo ascolto il 0100007F (127.0.0.1), mentre 9042/9180/7000/19042 sono sul pod IP; e E' una cosa da fare. restituisce 200 mentre la stessa richiesta al pod IP viene rifiutato (uscita curl 7), che è esattamente ciò che kubelet ha riferito: "Sonda di vita fallita: comporre tcp 10.42.0.47:10000: collegare: connessione rifiutata". Quindi la sonda ha fallito ogni tentativo e il kubelet ha ucciso ogni container ciclo: inizialeDelaySeconds 900 + guastoTreshold 80 x periodoSecondi 30 = 3300s, corrispondente al periodo di riavvio osservato di 55m14s e 920 riparte / 35 giorni (~ uno per 54.7 min). Ogni uccisione ha eseguito il preStop `nodetool scarico`, quindi è uscito 0 / "Completato" e sembrava un arresto pulito piuttosto che un incidente. I primi 900s/80 valori non erano sintonizzazione a freddo come il commento sostenuto — stavano mascherando questo. Hanno solo allungato il ciclo di uccisione; i precedenti 60 / 6 valori prodotti un riavvio ogni ~4 min (~360/giorno). Fisso: sonda l'API dove effettivamente ascolta, tramite exec contro 127.0.0.1, e ripristinare una soglia significativa (6 x 30s = 3 min). startupProbe già cancelli liveness fino a quando CQL è in su, così inizialeDelaySeconds è inutile. Deliberatamente no impostazione --api-address 0.0.0.0, che esporrebbe l'amministratore non autorizzato REST API alla rete pod.