Das Praxisbuch für Site Reliability Engineering · Zweisprachige Auszüge
Das Praxisbuch zeigt SRE anhand konkreter Methoden und Fallstudien. Die Auswahl aus Kapitel 2 und 6 verbindet Nutzererfahrung, Fehlerbudget, gemeinsame Ausfälle und die Gesamtkosten der Automatisierung.
Kapitel 2. SLOs umsetzen · Steven Thurgood und David Ferguson
Problem und Vorgehen
Das Kapitel nutzt Service Level Objectives (SLOs) als Grundlage für Entscheidungen zur Zuverlässigkeit. Aus wichtigen Nutzerergebnissen werden Indikatoren, Ziele und Zeitfenster abgeleitet. Produktverantwortliche, Entwicklung und Betrieb vereinbaren anschließend eine Regelung für das Fehlerbudget. Ein Spiel dient als Beispiel für Messungen und Abwägungen. Weitere Themen sind laufende Anpassungen, Nutzerabläufe und Abhängigkeiten: Mehrere Kopien bedeuten nicht automatisch unabhängige Ausfälle.
Kapitel 6. Toil beseitigen · David Challoner und weitere Autoren
Problem und Vorgehen
Das Kapitel misst zunächst Toil und den Aufwand seiner Verringerung. Es behandelt Systemänderungen, teilweise Automatisierung, Selbstbedienung und angepasste Geschäftsprozesse. Zwei Fallstudien betreffen automatisierte Netzwerkreparaturen im Rechenzentrum und die Ablösung alter gemeinsam genutzter Benutzerverzeichnisse. Weniger Handgriffe im eigenen Team reichen nicht: Wartungskosten, Sicherheitsprüfungen, Bedienbarkeit und die Belastung anderer Teams müssen ebenfalls berücksichtigt werden.
Eigenes Buch übersetzen
Übersetzung und Erläuterungen wurden für diese Auswahl mit KI aus dem Englischen erstellt. Dies ist keine offizielle Übersetzung. Überblick und Kommentare gehören nicht zum Zitat.
Eigenes Buch übersetzen ↗