Smettere di eseguire l'intero bordo della piattaforma su una capsula

FixKlusterServices
Spegnimento
4 settembre 2026 alle ore 19:55 UTC
Autore
Kamo
Impegno
2909805

Traefik ha eseguito una sola replica, così ogni riavvio di esso — un rollout, un OOM, un'evizione — ha preso L'intera piattaforma e' a terra. 192.168.4.22:443 non ha un endpoint locale mentre quel bac è andato (externalTrafficPolicy: Local), il nodo passa al certificato di default di rke2-ingress-nginx, e perché quasi ogni router kamo corrisponde a HostRegexp piuttosto che Host, TLS si risolve puramente SNI contro un TLSStore che non è ancora caricato. Il risultato è ERR CERT AUTHORITY INVALID su ogni org subito per i ~11s che ci vuole per caricare 190 certificati. - repliche 2. Entrambi rimangono pinned a k1m1, che è deliberato: l'indirizzo pubblico NATs là e esternaTrafficPolicy: locale significa che un baccello in qualsiasi altro luogo non può mai rispondere. Questo acquista pod-level ridondanza, non nodo-livello — nodo-livello ha bisogno di un vip galleggiante ed è lavoro separato. - Lo scarico di Traefik, che un sonno preStop non può replicare: su SIGTERM mantiene ACCEPTING per richiestaAcceptGraceTimeout (15s) mentre /ping inizia a rispondere 503, quindi la sonda di prontezza non riesce e kube-proxy lo rimuove dal Servizio mentre serve ancora. Poi fino a GraceTimeOut (30s) finire ciò che è aperto. terminazioneGracePeriodSeconds 30 -> 60 quindi lo scarico non è di per sé E' morto a meta' strada. - minReadySeconds 15, e CI ora aspetta su `rollout status` per traefik. Aggiunge anche una directory PodDisruptionBudget. Lo spazio dei nomi kamo aveva ZERO PDBs mentre altri cinque namespaces su questo cluster li aveva, quindi uno scarico di un nodo per un aggiornamento del kernel evicted tutto su di esso contemporaneamente. README.md registra la regola e, soprattutto, perché una singola domanda non deve mai ottenere uno — minDisponibile: 1 contro le repliche: 1 consente zero interruzioni e cunei drenare per sempre piuttosto che proteggere qualsiasi cosa. Un middleware `retry` è definito e offerto come `kamo-middlewares-retry`, deliberatamente come un catena separata piuttosto che piegato in kamo-middlewares. Retry non è sicuro ovunque: Traefik fa non riavvolgere un corpo di richiesta, quindi riprovare una connessione persa a parte attraverso un allegato 3 GiB invia un troncato uno, e non può distinguere una richiesta che non è mai atterrata da un backend accettato e morì prima di rispondere. interno., applicazioni. e api. quindi rimanere sulla catena normale. auto-cert ora pubblica un certificato predefinito sul TLSStore già possiede, quindi un handshake il cui SNI non risponde nulla con un vero e proprio certificato di piattaforma invece del built-in di Traefik Si autodidatta. Scritto lì piuttosto che come manifesto statico perché auto-cert riscrive che memorizzare ogni ciclo e lo avrebbe sovrascritto.

Tutte le modifiche

Come quello che vedi la spedizione?

Ognuno di questi aggiornamenti atterra automaticamente nello spazio di lavoro. Inizia gratis e guardalo crescere settimana dopo settimana.

Inizia gratis per sempreVisualizza il prezzo