Grafana Dashboards & Monitoring¶
Grafana ist die zentrale Visualisierungs-Plattform der Open Data Infrastruktur (ODI) zur Überwachung des Systemzustands, der Auslastung und der Fehleranalyse in den Umgebungen Stage und Produktion.
Übersicht der Dashboards¶
1. Dashboard: Fehleranalyse & Logging¶
Das Fehleranalyse-Dashboard ist die primäre Anlaufstelle für den Support und den operativen Betrieb bei der Identifikation und Analyse von Störungen.
Direktlinks zum Fehleranalyse & Request ID Suche Dashboard
Hauptkomponenten:¶
- Fehler-Rate über Zeit (Graph): Visualisiert die Anzahl von
ERROR- undWARN-Einträgen pro Service im zeitlichen Verlauf. - HTTP Status-Codes: Trennung zwischen kritischen Server-Fehlern (
5xx) und Client-Fehlern (4xx). !!! note "Log-Level bei unbekannten Routen (404)" Unbekannte Routen und nicht gefundene Ressourcen (404 Not Found) werden gezielt mit dem Log-LevelWARNgeloggt, um das Fehler-Log frei von Hintergrundrauschen (z. B. fehlerhaften Crawler-Anfragen) zu halten. Echte Server-Fehler (5xx) werden strikt alsERRORerfasst. - Zentraler Log-Stream: Live-Anzeige aller eingehenden JSON-Logs, filterbar nach Service (
context), Umgebungen und Log-Level. - Request ID Filter (Correlation Tracing): Eingabefeld zur Filterung des gesamten Dashboards auf eine spezifische
requestId(siehe Fehleranalyse & Request ID).
2. Service & Cluster Monitoring¶
Diese Dashboards bieten Echtzeit-Einblicke in die Systemleistung und Ressourcennutzung der Kubernetes-Cluster:
- Pod Resource Usage: Auslastung von CPU, Arbeitsspeicher (Memory) und Netzwerk-I/O aller Microservices (
odi-metadata-service,odi-ckan-service,odi-staging-backend,odi-schema-backend,odi-masterportal-serviceusw.). - HTTP Request Rate & Latency: Durchsatz (Requests/sec) und Antwortzeiten (Percentiles p50, p90, p99) pro Endpunkt.
- Container Restarts & Uptime: Früherkennung von OOM-Kills (Out Of Memory) oder Crash-Loops einzelner Microservices.
Zugänge & Umgebungen¶
Grafana ist für befugte Personen über die internen Monitoring-Ingresses der jeweiligen Umgebung erreichbar:
| Umgebung | Grafana Hauptseite | Direktlink: Fehleranalyse (Request ID Suche) |
|---|---|---|
| Produktion (Prod) | https://grafana.odi.schleswig-holstein.de |
🚀 Request ID Suche Dashboard (Prod) |
| Staging (Stage) | https://grafana.odi-stage.schleswig-holstein.de |
🧪 Request ID Suche Dashboard (Stage) |
Tipps zur effizienten Nutzung¶
- Zeitfenster eingrenzen: Verwende oben rechts in Grafana ein enges Zeitfenster (z. B. Last 15 minutes oder den genauen Zeitraum eines gemeldeten Fehlers), um relevante Log-Streams schnell einzugrenzen.
- Auto-Refresh aktivieren: Schalte bei Live-Deployments oder Wartungen das automatische Aktualisierungsintervall (z.B. 5s oder 10s) ein.
- Log-Zeile aufklappen: Klicke im Log-Stream auf eine fehlerhafte Zeile, um den vollständigen interaktiven JSON-Baum mit allen Details zu öffnen.
