Zum Hauptinhalt springen
Version: 3.1
Betrieb & Sicherheit

Alertmanager

Gruppiert und verteilt technische Alarme.

Prometheus Alertmanager verarbeitet Alarme, die von Prometheus oder einem kompatiblen Absender erzeugt wurden. Eine Routingstruktur ordnet sie anhand ihrer Labels passenden Empfängern zu. Gruppierung, Deduplizierung und Wiederholungsintervalle verhindern, dass derselbe technische Fehler unkontrolliert viele einzelne Benachrichtigungen auslöst.

Zentrale Konzepte sind:

  • Routes wählen anhand von Labels den zuständigen Empfänger und die Benachrichtigungsintervalle.
  • Receivers beschreiben externe Ziele wie Webhooks, E-Mail- oder Chatkanäle.
  • Grouping fasst zusammengehörige Alarme in einer Nachricht zusammen.
  • Inhibition unterdrückt Folgealarme, wenn bereits eine übergeordnete Ursache aktiv ist.
  • Silences unterbrechen Benachrichtigungen zeitlich begrenzt, ohne die Alarmregel zu löschen.

Alertmanager in der UDSP

Prometheus erkennt technische Abweichungen über Alerting Rules und übergibt die aktiven Alarme an Alertmanager. Die UDSP unterscheidet insbesondere kritische Alarme, Warnungen, Datenbankalarme und – bei aktiviertem Velero – fehlgeschlagene Backups. Für diese Gruppen können getrennte Slack-Webhooks im Inventory hinterlegt werden.

Alertmanager entscheidet nicht, ob ein Messwert problematisch ist; diese Logik liegt in den Prometheus-Regeln. Er steuert die Zustellung und reduziert redundante Meldungen. Runbooks, Eskalationszeiten und die tatsächliche Reaktion bleiben Aufgaben der Betriebsorganisation.

Die Oberfläche ist standardmäßig nicht über einen Ingress veröffentlicht. Wird der optionale Ingress aktiviert, muss sein Zugriff gesondert abgesichert werden; der aktuelle Schalter richtet nicht automatisch eine Keycloak-Anbindung ein.

Konfiguration und Deployment

Unter inv_ml.alertmanager werden Aktivierung, Replikate, persistenter Speicher, optionaler Ingress, Empfänger-Webhooks sowie die Listen kritischer und warnender Alarmnamen gepflegt. Routing- und Inhibition-Regeln liefert die versionsgebundene Plattformkonfiguration.

Die Inventory-Felder sind unter Plattformbasis konfigurieren: Observability und Backup beschrieben. Das fachliche Zusammenspiel mit Prometheus und Grafana zeigt Observability und Monitoring.

Rollen und Rechte

Alertmanager besitzt im aktuellen Rollout keine Keycloak-Client-Rollen. Drei technische Zugriffe sind voneinander zu unterscheiden:

Alarmquelle

Prometheus

Sendet ausgelöste und aufgelöste Alarmzustände an die interne Alertmanager API.

Konfiguration

Plattformbetrieb

Verwaltet Routen, Empfänger, Gruppierung und Inhibition über den Deployment-Prozess.

Externe Zustellung

Webhook-Ziele

Erhalten ausschließlich die ihnen zugeordneten Alarmgruppen über geschützte Ziel-URLs.

Webhook-URLs sind Secrets. Silences und Konfigurationsänderungen beeinflussen die Alarmierung der gesamten Plattform und dürfen deshalb nur durch ausdrücklich berechtigte Betriebsrollen vorgenommen werden.

Referenzen