Einführung und Konfiguration von OpenTelemetry zur Erfassung verteilter Traces, Logs und Metriken
Bereitstellung eines, in C# geschriebenen, Grafana-Teams zu Active-Directory-Gruppen Synchronization Tools um Zugänge für Endbenutzer:Innen sinnvoll zu verwalten
Aufbau eines Observability-Stacks basierend auf dem Grafana Stack (Prometheus (+ Mimir), Loki, Tempo, Grafana)
Visualisierung von System Metriken, Performance-Kennzahlen und Fehlverhalten in provisionierten Dashboards mit Config-As-Code
Entwicklung automatisierter Alerts (mittels Alertmanager und Slack-Integration) zur frühzeitigen Erkennung von Anomalien
Durchführung kontrollierter Ausfälle im Rahmen von Chaos Engineering zur Validierung von Recovery-Strategien
Einbau diverser Fitness-Functions um auch in laufendem Produktivbetrieb eine genauere Darstellung der Systemgesundheit zu ermöglichen
Erstellung strukturierter Incident-Reports und Etablierung von Post-Mortem-Prozessen
Schulung des First-Level-Supports um Dashboards korrekt auswerten zu lassen
Technische Anforderungen:
Betrieb unterschiedlicher Teil-Applikationen in voneinander getrennten Netzwerken und Hosts / Nodes
Betrieb von Teilen der Applikation auf einem abgesicherten K8s-Cluster mit höchsten Security-Anforderungen
Betrieb weiterer Teile auf einem Docker-Host in einem stark abgeschotteten Netz mit restriktiven Traffic-Vorgaben
Sicherstellung der Hochverfügbarkeit aller Applikationsteile hinter Firewalls und Loadbalancern
Zusammensetzen verteilter Informationsquellen zu konsistenten Signalen trotz Netz- und Infrastruktur Trennung
Handling von langlaufenden Client-Verbindungen über mehrere Stunden hinweg
Gewährleistung aussagekräftiger Signale bereits vor Ende laufender Verbindungen
Entwicklung einer eigenen OpenTelemetry-nativen Auto Instrumentierung für TCP-Clients mangels bestehender Lösung
Key Results
Erhöhung der System Transparenz und signifikante Beschleunigung der Fehlerdiagnose
Nachweisbare Verbesserung der Systemstabilität durch Resilienz steigernde Maßnahmen
Ermöglichung einer sinnvollen 24-Stunden Bereitschaft durch leicht verstehbare Aufbereitung der zugrundeliegenden Daten