AWS Systems Manager Incident Manager ist nicht mehr offen für neue Kunden. Bestandskunden können den Service weiterhin wie gewohnt nutzen. Weitere Informationen finden Sie unter Änderung der AWS Systems Manager Incident Manager Verfügbarkeit.
Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Vorbereitung auf Vorfälle im Incident Manager
Die Planung eines Vorfalls beginnt lange vor dem Lebenszyklus des Vorfalls. Wie die folgende Abbildung zeigt, bereiten Sie sich vor, bevor Sie mit der Reaktion auf Vorfälle beginnen, indem Sie Chat-Kanäle einrichten, Eskalationspläne erstellen, Kontakte angeben und die Automatisierungs-Runbooks festlegen, die bei der Reaktion auf Vorfälle verwendet werden sollen. Verwenden Sie dann einen Reaktionsplan, der festlegt, wie die Überwachung erfolgt und ob die Reaktionen automatisiert werden. Nach Abschluss der Behebung können Sie den Vorfall und die Reaktion auf den Vorfall analysieren, um Ihren Reaktionsplan für zukünftige Vorfälle weiter zu verfeinern.
Topics
Konfiguration von Replikationssätzen und Ergebnissen im Incident Manager
Verwaltung von Responder-Rotationen mit Bereitschaftszeitplänen in Incident Manager
Erstellung eines Eskalationsplans für die Einbindung von Einsatzkräften in Incident Manager
Chat-Kanäle für Einsatzkräfte in Incident Manager erstellen und integrieren
Integration von Systems Manager Automation-Runbooks in Incident Manager zur Behebung von Vorfällen
Erstellung und Konfiguration von Reaktionsplänen im Incident Manager
Überwachen
Die Überwachung des Zustands Ihrer AWS gehosteten Anwendungen ist entscheidend, um die Verfügbarkeit und Leistung Ihrer Anwendungen sicherzustellen. Beachten Sie bei der Auswahl von Überwachungslösungen Folgendes:
-
Kritikalität der Funktion — Wie kritisch wären die Auswirkungen auf nachgeschaltete Anwender, wenn das System ausfallen würde?
-
Häufigkeit von Ausfällen — Wie häufig fällt ein System aus? Systeme, bei denen häufig eingegriffen werden muss, sollten engmaschig überwacht werden.
-
Höhere Latenz — Um wie viel die Zeit für die Erledigung einer Aufgabe zugenommen oder verringert wurde.
-
Client-side im Vergleich zu serverseitigen Messwerten — Wenn es eine Diskrepanz zwischen verwandten Messobjekten auf dem Client und dem Server gibt.
-
Fehler bei Abhängigkeiten — Fehler, auf die sich Ihr Team vorbereiten kann und sollte.
Nachdem Sie Reaktionspläne erstellt haben, können Sie Ihre Überwachungslösungen verwenden, um Vorfälle automatisch zu verfolgen, sobald sie in Ihrer Umgebung auftreten. Weitere Informationen zur Nachverfolgung und Erstellung von Vorfällen finden Sie unterVorfalldetails in der Incident Manager-Konsole anzeigen.
Weitere Informationen zur Architektur sicherer, leistungsfähiger, belastbarer und effizienter Infrastrukturanwendungen und Workloads finden Sie unter. AWS Well-Architected