View a markdown version of this page

AWS Resilience Hub Konzepte - AWS Resilience Hub

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

AWS Resilience Hub Konzepte

Diese Konzepte können Ihnen helfen, den Ansatz zur Verbesserung AWS Resilience Hub der Anwendungsstabilität und zur Vermeidung von Anwendungsausfällen besser zu verstehen.

Ausfallsicherheit

Die Fähigkeit, die Verfügbarkeit aufrechtzuerhalten und Software- und Betriebsunterbrechungen innerhalb eines bestimmten Zeitrahmens zu beheben.

Recovery Point Objective (RPO)

Die maximal zulässige Zeitspanne seit dem letzten Datenwiederherstellungspunkt. Damit wird festgelegt, was als akzeptabler Datenverlust zwischen dem letzten Wiederherstellungspunkt und der Serviceunterbrechung gilt.

Recovery Time Objective (RTO)

Die maximal zulässige Verzögerung zwischen der Betriebsunterbrechung und der Wiederherstellung des Dienstes. Damit wird festgelegt, was als akzeptables Zeitfenster gilt, wenn der Service nicht verfügbar ist.

Geschätzte Wiederherstellungszeit der Arbeitslast (Ziel)

Das geschätzte Ziel für die Wiederherstellung der Arbeitslast (geschätzte Arbeitslast-RTO) ist das RTO, das Ihre Anwendung auf der Grundlage der importierten Anwendungsdefinition voraussichtlich einhalten wird, und führen Sie anschließend eine Bewertung durch.

Geschätzter Zielwert für die Arbeitslast, den Erholungspunkt

Das geschätzte Ziel für den Workload Recovery Point Objective (geschätzter Workload RPO) ist der RPO, den Ihre Anwendung auf der Grundlage der importierten Anwendungsdefinition voraussichtlich erfüllen wird, und führen Sie anschließend eine Bewertung durch.

Anwendung

Eine AWS Resilience Hub Anwendung ist eine Sammlung AWS unterstützter Ressourcen, die kontinuierlich überwacht und bewertet werden, um ihre Widerstandsfähigkeit zu gewährleisten.

Komponente „Anwendung“

Eine Gruppe verwandter AWS Ressourcen, die als eine Einheit funktionieren und ausfallen. Wenn Sie beispielsweise eine Primär- und eine Replikatdatenbank haben, gehören beide Datenbanken derselben Anwendungskomponente (AppComponent) an.

AWS Resilience Hub bestimmt, welche AWS Ressourcen zu welchem Typ von AppComponent gehören können. Zum Beispiel DBInstance kann a gehören, AWS::ResilienceHub::DatabaseAppComponent aber nicht zuAWS::ResilienceHub::ComputeAppComponent.

Status der Anwendungskonformität

AWS Resilience Hub meldet die folgenden Konformitätsstatustypen für Ihre Anwendungen.

Richtlinie erfüllt

Schätzungen zufolge erfüllt der Antrag die in der Richtlinie festgelegten RTO- und RPO-Ziele. Alle Komponenten erfüllen die definierten politischen Ziele. Sie haben beispielsweise ein RTO- und RPO-Ziel von 24 Stunden für Störungen in verschiedenen Regionen AWS ausgewählt. AWS Resilience Hub kann sehen, dass Ihre Backups in Ihre Ausweichregion kopiert wurden. Es wird weiterhin von Ihnen erwartet, dass Sie eine Wiederherstellung anhand einer Standardbetriebsprozedur (SOP) für Backups durchführen und diese testen und zeitlich festlegen. Dies ist in den Betriebsempfehlungen enthalten und Teil Ihres allgemeinen Resilienzwerts.

Es wurde gegen die Richtlinie verstoßen

Es konnte nicht geschätzt werden, dass die Anwendung die in der Richtlinie definierten RTO- und RPO-Ziele erfüllt. Einer oder mehrere Anträge entsprechen AppComponents nicht den politischen Zielen. Sie haben beispielsweise ein RTO- und RPO-Ziel von 24 Stunden für Unterbrechungen in verschiedenen AWS Regionen ausgewählt, aber Ihre Datenbankkonfiguration beinhaltet keine regionsübergreifende Wiederherstellungsmethode, wie z. B. eine globale Replikation und Sicherungskopien.

Nicht bewertet

Der Antrag erfordert eine Bewertung. Es wird derzeit nicht bewertet oder nachverfolgt.

Es wurden Änderungen festgestellt

Es gibt eine neue veröffentlichte Version der Anwendung, die noch nicht bewertet wurde.

Erkennung von Abweichungen

AWS Resilience Hub führt eine Drift-Benachrichtigung aus, während eine Bewertung für Ihre Anwendung durchgeführt wird, um zu überprüfen, ob sich die AppComponent Konfigurationsänderungen auf den Konformitätsstatus Ihrer Anwendung ausgewirkt haben. Darüber hinaus überprüft und erkennt es Änderungen, z. B. das Hinzufügen oder Löschen von Ressourcen in den Eingabequellen der Anwendung, und benachrichtigt Sie darüber. Zum Vergleich AWS Resilience Hub wird die vorherige Bewertung verwendet, bei der die Anwendungskomponente die Richtlinie erfüllte. AWS Resilience Hub erkennt die folgenden Arten von Abweichungen:

  • Abweichung von den Anwendungsrichtlinien — Dieser Drift-Typ identifiziert alle AppComponents , die bei der vorherigen Bewertung zwar den Richtlinien entsprachen, bei der aktuellen Bewertung jedoch nicht.

  • Drift bei den Anwendungsressourcen — Bei diesem Drift-Typ werden alle Ressourcen in der aktuellen Anwendungsversion identifiziert.

Bewertung der Resilienz

AWS Resilience Hub verwendet eine Liste von Lücken und möglichen Abhilfemaßnahmen, um die Wirksamkeit einer ausgewählten Strategie zur Erholung und zum Fortbestehen nach einer Katastrophe zu messen. Dabei wird der Konformitätsstatus jeder Anwendungskomponente oder Anwendung mit der Richtlinie bewertet. Dieser Bericht enthält Empfehlungen zur Kostenoptimierung und Hinweise auf potenzielle Probleme.

Ausfallsicherheitsergebnis

AWS Resilience Hub generiert eine Bewertung, die angibt, wie genau Ihre Anwendung unsere Empfehlungen zur Einhaltung der Ausfallsicherheitsrichtlinien, Alarme, Standardarbeitsanweisungen (SOPs) und Tests der Anwendung einhält.

Art der Störung

AWS Resilience Hub hilft Ihnen bei der Bewertung der Widerstandsfähigkeit gegenüber den folgenden Arten von Ausfällen:

Anwendung

Die Infrastruktur ist in Ordnung, aber der Anwendungs- oder Software-Stack funktioniert nicht wie gewünscht. Dies kann nach der Bereitstellung von neuem Code, Konfigurationsänderungen, Datenbeschädigung oder Fehlfunktionen nachgelagerter Abhängigkeiten auftreten.

Cloud-Infrastruktur

Die Cloud-Infrastruktur funktioniert aufgrund eines Ausfalls nicht wie erwartet. Ein Ausfall kann aufgrund eines lokalen Fehlers in einer oder mehreren Komponenten auftreten. In den meisten Fällen wird diese Art von Ausfall behoben, indem die defekten Komponenten neu gestartet, recycelt oder neu geladen werden.

Störung der Cloud-Infrastruktur

Eine oder mehrere Availability Zones sind nicht verfügbar. Diese Art von Ausfall kann behoben werden, indem Sie zu einer anderen Availability Zone wechseln.

Vorfall in der Region „Cloud-Infrastruktur“

Eine oder mehrere Regionen sind nicht verfügbar. Diese Art von Vorfall kann gelöst werden, indem Sie zu einer anderen wechseln AWS-Region.

AWS FIS Experimente

AWS Resilience Hub empfiehlt Experimente mit AWS FIS Maßnahmen zur Überprüfung der Widerstandsfähigkeit von Anwendungen gegen verschiedene Arten von Ausfällen. Zu diesen Ausfällen gehören Anwendungen, Infrastruktur, Availability Zones (AZ) oder AWS-Region Vorfälle von Anwendungskomponenten.

Mit diesen Experimenten können Sie Folgendes tun:

  • Injizieren Sie einen Fehler.

  • Stellen Sie sicher, dass Alarme einen Ausfall erkennen können.

  • Stellen Sie sicher, dass die Wiederherstellungsverfahren oder SOPs (Standard Operating Procedures) ordnungsgemäß funktionieren, um die Anwendung nach dem Ausfall wiederherzustellen.

Tests für SOPs messen den geschätzten Workload-RTO und den geschätzten Workload-RPO. Sie können verschiedene Anwendungskonfigurationen testen und messen, ob das Ausgabe-RTO und -RPO die in Ihrer Richtlinie definierten Ziele erfüllen.

STOPPEN

Eine Standardarbeitsanweisung (SOP) besteht aus einer Reihe von Schritten, mit denen Ihre Anwendung im Falle eines Ausfalls oder eines Alarms effizient wiederhergestellt werden kann. Es AWS Resilience Hub empfiehlt auf der Grundlage der Anwendungsbewertung eine Reihe von SOPs. Es wird empfohlen, die SOPs vor einer Störung vorzubereiten, zu testen und zu messen, um eine zeitnahe Wiederherstellung sicherzustellen.