Alertă asupra OOMKills, și asupra ocupației care le precede

FeatureKlusterServices
Shipped
16 august 2026 la 01:43 UTC
Author
Kamo
Commit
4fd9a2a

Nimic nu se uita la memorie. MediaService a fost ucis la fiecare câteva ore pentru majoritatea de o zi și EmailService de șase ori, și modul în care cineva a aflat a fost un chat fereastra care a oprit în liniște de încărcare mesaje Repornirea într-o secundă înseamnă o caracteristică ruptă, nu o pană de curent. Trei reguli. ContainerOOMucidere incendii pe eveniment; ContainerOOMKillLoop Separa un one-off de o pod fiind ucis în mod repetat, care reporneşte rapid suficient pentru a arăta încă 1/1 Running. ContainerMemoryNearLimit este cel care ar au capturat aceste zile mai devreme: >85% din limita deținută timp de 30 de minute. Pentru un JVM pe MaxRAMPercentage care nu este o pod ocupat, este un pod așezat la tavanul său morman cu non-heap stivuite pe partea de sus, care este starea de echilibru imediat înainte de kernel-ul intervine. Un al patrulea, informaţional, steaguri containere fără limită la nu pot fi Uciși de propriul lor grup, dar pot lua un nod în jos. Verificat mai degrabă împotriva datelor reale decât presupus: expresiile au fost evaluate pe acest grup, și interogarea ultimele 12 ore arată motiv="OOMKilled" serie pentru kamowsemail exact (18:33-01:28 UTC) și kamowsmedia (21:28-01:03 October) cele două capsule care picau. Regulile ar fi tras critic pe ambele. O alertă care se potriveşte în tăcere cu nimic nu este acelaşi eşec ca nici o alertă, astfel încât verificarea a contat mai mult decât YAML. Aplicat manual; monitorizarea/ nu este o ţintă de aplicare a CI.

All changes

Ca ceea ce vezi de transport maritim?

Fiecare dintre aceste actualizări aterizează automat în spațiul de lucru. Începe gratuit și urmăriți-l crească săptămână după săptămână.

Pornește gratuit pentru totdeaunaVezi prețurile