- Verschifft
- 5. August 2026 um 00:11 UTC
- Autor
- Kamo
- Ausschuss
- 00ad3ef
Wurzel Ursache: die Liveness-Sonde war "tcpSocket: port 10000", aber Scylla REST API bindet an api_address 127.0.0.1 (ihre Standardeinstellung) während eine tcpSocket-Sonde den POD wählt IP. Verifiziert aus dem Inneren des Containers - /proc/net/tcp zeigt nur :10000 Hören auf 0100007F (127.0.0.1), während 9042/9180/7000/19042 sind auf der Pod IP; und Cule **************** gibt 200 zurück, während die gleiche Anfrage auf die pod IP verweigert (Curl-Exit 7), das ist genau das, was kubelet berichtet: "Liveness-Sonde ausgefallen: Wählen Sie tcp 10.42.0.47:10000: connect: connect). So scheiterte die Sonde bei jedem Versuch und der Kubelet tötete den Container jeder Zyklus: initialDelaySeconds 900 + AusfallThreshold 80 x periodSeconds 30 = 3300s, passend zur beobachteten Neustart-Periode von 55m14 und 920 Neustarts / 35 Tage (eine pro 54,7 min). Jeder Kill lief die preStop "nodetool drain", so dass es 0 / "Vervollständigt" und sah eher wie ein sauberer Shutdown als wie ein Crash aus. Die früheren 900er/80-Werte waren nicht Kaltstart-Tunierung, wie der Kommentar behauptete sie verschleierten dies. Sie streckten nur den Kill-Zyklus; die vorherigen 60er/6 Werte produzierten einen Neustart pro €4 min (360 €/Tag). Fix: Sonde der API, wo es tatsächlich zuhört, über exec gegen 127.0.0.1, und Wiederherstellen einer sinnvollen Schwelle (6 x 30s = 3 min). Startprobe bereits Tore Lebensfähigkeit bis CQL ist oben, so initialDelaySeconds ist unnötig. Bewusst nicht Einstellung --api-Adresse 0.0.0.0, die den nicht authentifizierten Admin REST aussetzen würde API zum Pod-Netzwerk.