- Spegnimento
- 27 agosto 2026 alle ore 05:09 UTC
- Autore
- Kamo
- Impegno
- 795a0d4
La causa principale dell'incidente non era una perdita. Il 485Mi stato costante che Tenuto inciampare il vecchio limite 512Mi era due cose normali impilati: ~350Mi Go heap in cima a un magazzino GOGC=100 segatura. Misurazione un'ora: picchi a 283Mi, mani indietro 40-80Mi per ciclo GC, pavimento circa 178Mi. Conto di connessione non lo rintraccia (108 conni a 186Mi, 58 conni a 283Mi), quindi non è ritenzione di connessione. ~133Mi pagina cache dal 205 MiB traefik binario testo di richiesta-paging in, che richiede circa un giorno per raggiungere quel livello. Quei due non rientrano in 512Mi. Il limite era sopravvissibile solo mentre il binario era ancora freddo, motivo per cui ha tenuto per mesi e poi ha iniziato fallire ogni ~25 minuti. GOMEMLIMIT=750MiB lega il solo runtime Go, lasciando la cache del binario camera sotto il limite 1Gi (1024 - 205 - 70 slack). È un limite morbido, quindi un futuro aumento del passo-vivo rende Traefik raccogliere più difficile invece di essere SIGKILLed — che conta perché l'uccisione dell'unico pod di ingresso del cluster vuote piattaforma TLS per ~11s. La richiesta di 256Mi è anche gravemente sottovalutata una capsula il cui stato costante è ~270Mi, lasciando l'unico ingresso pod un primo candidato di evizione sotto pressione di memoria nodo. Raso a 512Mi.