- Dikirim
- 5 Agustus 2026 pukul 00.11 UTC
- Penulis
- Kamo
- Commit
- 00ad3ef
Root penyebab: penyelidikan litness adalah 'tcpSocket: port 10000', tapi Scylla REST API bints to api _ address 127.0.1 (yang baku) while a tcpSocket probe dials the POD IP. Diverifikasi dari dalam wadah - / proc / net / tcp menunjukkan: 10.000 hanya mendengarkan pada 010007F (127.0.0.1), sedangkan 9042 / 9180 / 7000 / 19042 berada di IP pod; dan 'curl * * * * * * * * * * * * * * * * kembali 200 sedangkan permintaan yang sama ke IP pod ditolak (curl exit 7), yang persis apa yang kubelet melaporkan: "Pemrobe perhatian gagal: dial tcp 10.42.0.47: 10000: koneksi ditolak". Jadi probe gagal pada setiap upaya dan kubelet membunuh wadah setiap cycle: initialDelaySeconds 900 + Fruureshold 80 x periodSeconds 30 = 330s, cocok dengan periode restart yang diamati dari 55m14s dan 920 restarts / 35 hari (~ satu per 54.7 menit). Setiap pembunuhan berjalan preStop 'nodetrool drain', sehingga keluar 0 / "Selesai" dan tampak seperti shutdown bersih daripada kecelakaan. Nilai awal 900an / 80 tidak cold- mulai tuning sebagai komentar klaim - Mereka menutupi ini. Mereka hanya meregangkan siklus membunuh; 60-an sebelumnya / 6 nilai dihasilkan restart setiap ~ 4 menit (~ 360 / hari). Perbaiki: probe API di mana ia benar-benar mendengarkan, melalui exec terhadap 127.0.0.1, dan mengembalikan ambang batas yang berarti (6 x 30 = 3 menit). startupProbe sudah gerbang toleran sampai CQL naik, sehingga inisiasi DelaySeconds tidak perlu. Tidak sengaja konfigurasi --api- address 0.0.0, yang akan mengekspos admin REST tidak terotentikasi API ke jaringan pod.