View a markdown version of this page

AWS Resilience Hub konsep - AWS Pusat Ketahanan

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

AWS Resilience Hub konsep

Konsep-konsep ini dapat membantu Anda lebih memahami pendekatan untuk membantu meningkatkan ketahanan aplikasi dan mencegah pemadaman aplikasi. AWS Resilience Hub

Ketahanan

Kemampuan untuk menjaga ketersediaan dan memulihkan dari perangkat lunak dan gangguan operasional dalam kerangka waktu yang ditentukan.

Tujuan titik pemulihan (RPO)

Jumlah waktu maksimum yang dapat diterima sejak titik pemulihan data terakhir. Ini menentukan apa yang dianggap sebagai kehilangan data yang dapat diterima antara titik pemulihan terakhir dan gangguan layanan.

Tujuan waktu pemulihan (RTO)

Penundaan maksimum yang dapat diterima antara gangguan layanan dan pemulihan layanan. Ini menentukan apa yang dianggap sebagai jendela waktu yang dapat diterima ketika layanan tidak tersedia.

Perkiraan tujuan waktu pemulihan beban kerja

Estimasi tujuan waktu pemulihan beban kerja (perkiraan beban kerja RTO) adalah RTO yang diperkirakan akan dipenuhi aplikasi Anda berdasarkan definisi aplikasi yang diimpor dan kemudian menjalankan penilaian.

Perkiraan tujuan titik pemulihan beban kerja

Estimasi tujuan titik pemulihan beban kerja (perkiraan beban kerja RPO) adalah RPO yang diperkirakan akan dipenuhi aplikasi Anda berdasarkan definisi aplikasi yang diimpor dan kemudian menjalankan penilaian.

Aplikasi

AWS Resilience Hub Aplikasi adalah kumpulan sumber daya yang AWS didukung yang terus dipantau dan dinilai untuk mengelola postur ketahanannya.

Komponen Aplikasi

Sekelompok AWS sumber daya terkait yang bekerja dan gagal sebagai satu unit. Misalnya, jika Anda memiliki database primer dan replika, maka kedua database milik Komponen Aplikasi yang sama (AppComponent).

AWS Resilience Hub menentukan AWS sumber daya mana yang dapat dimiliki oleh jenis apa AppComponent. Misalnya, kal DBInstance eng milik AWS::ResilienceHub::DatabaseAppComponent tetapi bukan milikAWS::ResilienceHub::ComputeAppComponent.

Status kepatuhan aplikasi

AWS Resilience Hub melaporkan jenis status kepatuhan berikut untuk aplikasi Anda.

Kebijakan terpenuhi

Aplikasi diperkirakan memenuhi target RTO dan RPO yang ditentukan dalam kebijakan. Semua komponennya memenuhi tujuan kebijakan yang ditentukan. Misalnya, Anda memilih target RTO dan RPO 24 jam untuk gangguan di seluruh AWS Wilayah. AWS Resilience Hub dapat melihat bahwa cadangan Anda disalin ke Wilayah fallback Anda. Anda masih diharapkan untuk mempertahankan pemulihan dari prosedur operasi standar cadangan (SOP), dan untuk menguji dan mengatur waktunya. Ini ada dalam rekomendasi operasional dan bagian dari skor ketahanan Anda secara keseluruhan.

Kebijakan dilanggar

Aplikasi tidak dapat diperkirakan memenuhi target RTO dan RPO yang ditentukan dalam kebijakan. Satu atau lebih dari AppComponents mereka tidak memenuhi tujuan kebijakan. Misalnya, Anda memilih target RTO dan RPO 24 jam untuk gangguan di seluruh Wil AWS ayah, tetapi konfigurasi database Anda tidak menyertakan metode pemulihan lintas wilayah apa pun, seperti replikasi global dan salinan cadangan.

Tidak dinilai

Aplikasi ini membutuhkan penilaian. Saat ini tidak dinilai atau dilacak.

Perubahan terdeteksi

Ada versi aplikasi baru yang diterbitkan yang belum dinilai.

Deteksi penyimpangan

AWS Resilience Hub menjalankan notifikasi drift saat menjalankan penilaian untuk aplikasi Anda untuk memeriksa apakah perubahan AppComponent konfigurasi telah memengaruhi status kepatuhan aplikasi Anda. Selain itu, ia juga memeriksa dan mendeteksi perubahan seperti penambahan atau penghapusan sumber daya dalam sumber input aplikasi dan memberi tahu tentang hal yang sama. Sebagai perbandingan AWS Resilience Hub , gunakan penilaian sebelumnya di mana komponen aplikasi memenuhi kebijakan. AWS Resilience Hub mendeteksi jenis drift berikut:

  • Penyimpangan kebijakan aplikasi — Jenis penyimpangan ini mengidentifikasi semua AppComponents yang mematuhi kebijakan dalam penilaian sebelumnya tetapi gagal mematuhi penilaian saat ini.

  • Penyimpangan sumber daya aplikasi — Jenis penyimpangan ini mengidentifikasi semua sumber daya yang hanyut dalam versi aplikasi saat ini.

Penilaian ketahanan

AWS Resilience Hub menggunakan daftar celah dan solusi potensial untuk mengukur efektivitas kebijakan yang dipilih untuk memulihkan dan melanjutkan dari bencana. Ini mengevaluasi setiap Komponen Aplikasi atau status kepatuhan aplikasi dengan kebijakan. Laporan ini mencakup rekomendasi pengoptimalan biaya dan referensi untuk masalah potensial.

Skor ketahanan

AWS Resilience Hub menghasilkan skor yang menunjukkan seberapa dekat aplikasi Anda mengikuti rekomendasi kami untuk memenuhi kebijakan ketahanan aplikasi, alarm, prosedur operasi standar (SOP), dan pengujian.

Jenis gangguan

AWS Resilience Hub membantu Anda menilai ketahanan terhadap jenis pemadaman berikut:

Aplikasi

Infrastrukturnya sehat, tetapi tumpukan aplikasi atau perangkat lunak tidak beroperasi sesuai kebutuhan. Hal ini dapat terjadi setelah penerapan kode baru, perubahan konfigurasi, kerusakan data, atau kegagalan fungsi dependensi hilir.

Infrastruktur Cloud

Infrastruktur cloud tidak berfungsi seperti yang diharapkan karena pemadaman. Pemadaman dapat terjadi karena kesalahan lokal pada satu atau lebih komponen. Dalam kebanyakan kasus, jenis pemadaman ini diselesaikan dengan me-reboot, daur ulang, atau memuat ulang komponen yang rusak.

Gangguan Infrastruktur Cloud AZ

Satu atau beberapa Zona Ketersediaan tidak tersedia. Jenis pemadaman ini dapat diatasi dengan beralih ke Zona Ketersediaan yang berbeda.

Insiden Wilayah Infrastruktur Cloud

Satu atau lebih Wilayah tidak tersedia. Jenis insiden ini dapat diselesaikan dengan beralih ke yang berbeda Wilayah AWS.

AWS FIS eksperimen

AWS Resilience Hub merekomendasikan eksperimen menggunakan AWS FIS tindakan untuk memverifikasi ketahanan aplikasi terhadap berbagai jenis pemadaman. Pemadaman ini termasuk aplikasi, infrastruktur, Zona Ketersediaan (AZ), atau Wilayah AWS insiden Komponen Aplikasi.

Eksperimen ini memungkinkan Anda melakukan hal berikut:

  • Suntikkan kegagalan.

  • Pastikan alarm dapat mendeteksi pemadaman.

  • Pastikan prosedur pemulihan, atau prosedur operasi standar (SOP), berfungsi dengan benar untuk memulihkan aplikasi dari pemadaman.

Pengujian untuk SOP mengukur perkiraan beban kerja RTO dan perkiraan beban kerja RPO. Anda dapat menguji konfigurasi aplikasi yang berbeda dan mengukur apakah RTO dan RPO keluaran memenuhi tujuan yang ditentukan dalam kebijakan Anda.

SOP

Prosedur operasi standar (SOP) adalah serangkaian langkah preskriptif yang dirancang untuk memulihkan aplikasi Anda secara efisien jika terjadi pemadaman atau alarm. Berdasarkan penilaian aplikasi, AWS Resilience Hub merekomendasikan satu set SOP dan disarankan untuk menyiapkan, menguji, dan mengukur SOP sebelum gangguan untuk memastikan pemulihan tepat waktu.