Pemrosetan akal tidak pernah bisa lulus - menyebabkan 920 restarts dalam 35 hari

FixKlusterServices
Dikirim
5 Agustus 2026 pukul 00.11 UTC
Penulis
Kamo
Commit
00ad3ef

Root penyebab: penyelidikan litness adalah 'tcpSocket: port 10000', tapi Scylla REST API bints to api _ address 127.0.1 (yang baku) while a tcpSocket probe dials the POD IP. Diverifikasi dari dalam wadah - / proc / net / tcp menunjukkan: 10.000 hanya mendengarkan pada 010007F (127.0.0.1), sedangkan 9042 / 9180 / 7000 / 19042 berada di IP pod; dan 'curl * * * * * * * * * * * * * * * * kembali 200 sedangkan permintaan yang sama ke IP pod ditolak (curl exit 7), yang persis apa yang kubelet melaporkan: "Pemrobe perhatian gagal: dial tcp 10.42.0.47: 10000: koneksi ditolak". Jadi probe gagal pada setiap upaya dan kubelet membunuh wadah setiap cycle: initialDelaySeconds 900 + Fruureshold 80 x periodSeconds 30 = 330s, cocok dengan periode restart yang diamati dari 55m14s dan 920 restarts / 35 hari (~ satu per 54.7 menit). Setiap pembunuhan berjalan preStop 'nodetrool drain', sehingga keluar 0 / "Selesai" dan tampak seperti shutdown bersih daripada kecelakaan. Nilai awal 900an / 80 tidak cold- mulai tuning sebagai komentar klaim - Mereka menutupi ini. Mereka hanya meregangkan siklus membunuh; 60-an sebelumnya / 6 nilai dihasilkan restart setiap ~ 4 menit (~ 360 / hari). Perbaiki: probe API di mana ia benar-benar mendengarkan, melalui exec terhadap 127.0.0.1, dan mengembalikan ambang batas yang berarti (6 x 30 = 3 menit). startupProbe sudah gerbang toleran sampai CQL naik, sehingga inisiasi DelaySeconds tidak perlu. Tidak sengaja konfigurasi --api- address 0.0.0, yang akan mengekspos admin REST tidak terotentikasi API ke jaringan pod.

Semua perubahan

Seperti apa yang Anda lihat pengiriman?

Semua pembaruan ini secara otomatis mendarat di ruang kerja Anda. Mulai bebas dan menontonnya tumbuh minggu demi minggu.

Mulai Bebas SelamanyaTampilkan Harga