Зонд жизнедеятельности никогда не пройдет — причина 920 перезапусков за 35 дней

FixKlusterServices
Порезанный
5 августа 2026 г. в 00:11 UTC
Автор
Kamo
Обещать
00ad3ef

Основная причина: зонд жизнедеятельности был «tcpSocket: Port 10000», но REST API Сциллы связывается с api address 127.0.0.1 (по умолчанию), в то время как зонд tcpSocket набирает POD IP. Проверено изнутри контейнера - /proc/net/tcp показывает: 10000 прослушивания на 0100007F (127.0.0.1), тогда как 9042/9180/7000/19042 находятся на под IP; и ****************** возвращает 200 при том же запросе В подаче IP отказано (курчавый выход 7), о чем именно и сообщил Кубелет: "Живой зонд вышел из строя: набрать tcp 10.42.0.47:10000: соединить: соединение отказало". Таким образом, зонд провалился при каждой попытке, и кубелет убил контейнер. цикл: начальная задержкаВторые 900 + отказПорог 80 x периодВторые 30 = 3300s, Соответствие наблюдаемого периода перезапуска 55 м14 и 920 перезапусков / 35 дней (по одному на 54,7 мин.) Каждое убийство управляло престопным «утечкой нодетоола», поэтому оно выходило 0 / «Завершено» и выглядело как чистое отключение, а не крушение. Более ранние значения 900/80 не были холодным стартом, как утверждал комментарий. Они маскировали это. Они только растянули цикл убийства; предыдущие 60-е годы. 6.6 Значения производят перезапуск каждые ~ 4 мин (~ 360/день). Исправление: проверьте API, где он на самом деле слушает, через exec против 127.0.0.1, и Восстановить значимый порог (6 х 30 = 3 мин). Стартап Probe уже в пути живость до тех пор, пока CQL не поднимется, поэтому первоначальные задержки не нужны. умышленно не настройка -api-адрес 0.0.0.0, которая разоблачит неавторизованный администратор REST API для сети Pod.

Все изменения

Как вы видите судоходство?

Каждое из этих обновлений автоматически попадает в ваше рабочее пространство. Начните бесплатно и смотрите, как он растет неделю за неделей.

Начните бесплатно навсегдаПосмотреть цены