Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Pemulihan bencana dan cluster global Amazon DocumentDB
Topik
Dengan menggunakan cluster global, Anda dapat pulih dari bencana seperti kegagalan Wilayah dengan cepat. Pemulihan dari bencana biasanya diukur dengan menggunakan nilai untuk RTO dan RPO.
-
Tujuan waktu pemulihan (RTO) — Waktu yang dibutuhkan sistem untuk kembali ke kondisi kerja setelah bencana. Dengan kata lain, RTO mengukur waktu henti. Untuk cluster global, RTO dalam hitungan menit.
-
Tujuan titik pemulihan (RPO) — Jumlah data yang dapat hilang (diukur dalam waktu). Untuk klaster global, RPO biasanya diukur dalam hitungan detik.
-
Untuk memulihkan dari pemadaman yang tidak direncanakan, Anda dapat melakukan failover lintas wilayah ke salah satu sekunder di cluster global Anda. Jika cluster global Anda memiliki beberapa Wilayah sekunder, pastikan Anda melepaskan semua Wilayah sekunder yang ingin Anda promosikan sebagai wilayah primer. Kemudian, Anda mempromosikan salah satu Wilayah sekunder tersebut untuk menjadi primer baru Wilayah AWS. Terakhir, Anda membuat cluster baru di masing-masing Wilayah sekunder lainnya dan melampirkan cluster tersebut ke cluster global Anda.
Melakukan failover terkelola untuk cluster global Amazon DocumentDB
Pendekatan ini ditujukan untuk kelangsungan bisnis saat terjadi bencana alam Regional yang riil atau pemadaman tingkat layanan secara menyeluruh.
Selama failover terkelola, cluster utama gagal dialihkan ke Wilayah sekunder pilihan Anda sementara topologi replikasi cluster global Amazon DocumentDB yang ada dipertahankan. Klaster sekunder yang dipilih mempromosikan salah satu simpul hanya-bacanya ke status penulis penuh. Langkah ini memungkinkan klaster untuk mengambil peran sebagai klaster primer. Basis data Anda tidak akan tersedia untuk sementara saat klaster ini mengambil peran barunya. Data yang tidak direplikasi dari cluster primer lama ke cluster sekunder yang dipilih mungkin hilang ketika sekunder ini menjadi primer baru. Volume primer lama melakukan upaya terbaik untuk mengambil snapshot sebelum menyinkronkan dengan primer baru sehingga data yang tidak direplikasi dipertahankan pada snapshot.
catatan
Anda hanya dapat melakukan failover cluster lintas wilayah terkelola pada cluster global Amazon DocumentDB jika klaster primer dan semua cluster sekunder memiliki versi engine yang sama. Jika versi mesin Anda tidak kompatibel, Anda dapat melakukan failover secara manual dengan mengikuti langkah-langkah dalam Melakukan failover manual untuk cluster global Amazon DocumentDB.
Jika versi mesin Wilayah tidak cocok, failover akan diblokir. Periksa peningkatan yang tertunda dan terapkan untuk memastikan semua versi mesin Region cocok dan failover cluster global tidak diblokir. Untuk informasi selengkapnya, lihat Membuka blokir pengalihan atau failover cluster global.
Untuk meminimalkan kehilangan data, lakukan hal berikut sebelum menggunakan fitur ini:
Lakukan offline aplikasi untuk mencegah penulisan dikirim ke cluster utama cluster global Amazon DocumentDB.
Periksa waktu jeda untuk semua cluster sekunder Amazon DocumentDB. Memilih Wilayah sekunder dengan keterlambatan replikasi minimum dapat meminimalkan kehilangan data dari Wilayah primer yang mengalami kegagalan. Periksa waktu jeda untuk semua cluster sekunder Amazon DocumentDB di cluster global dengan melihat
GlobalClusterReplicationLagmetrik di Amazon CloudWatch. Metrik ini menunjukkan seberapa jauh di belakang (dalam milidetik) replikasi ke cluster sekunder ke cluster utama.Untuk informasi selengkapnya tentang CloudWatch metrik untuk Amazon DocumentDB, lihatMetrik Amazon DocumentDB.
Selama failover terkelola, cluster sekunder yang dipilih dipromosikan ke peran barunya sebagai primer. Namun, itu tidak mewarisi berbagai opsi konfigurasi dari cluster utama. Ketidakcocokan dalam konfigurasi dapat menyebabkan masalah performa, inkompatibilitas beban kerja, dan perilaku anomali lainnya. Untuk menghindari masalah tersebut, selesaikan perbedaan antara cluster global Amazon DocumentDB Anda untuk hal berikut:
Konfigurasikan grup parameter cluster Amazon DocumentDB untuk cluster primer baru, jika perlu — Anda dapat mengonfigurasi grup parameter cluster Amazon DocumentDB secara independen untuk setiap cluster di cluster global Amazon DocumentDB Anda. Oleh karena itu, ketika Anda mempromosikan cluster sekunder untuk mengambil alih peran utama, grup parameter dari kelompok sekunder mungkin dikonfigurasi secara berbeda dari pada yang utama. Jika demikian, ubah grup parameter cluster sekunder yang dipromosikan agar sesuai dengan pengaturan cluster utama Anda. Untuk mempelajari caranya, lihat Memodifikasi grup parameter cluster Amazon DocumentDB.
Konfigurasikan alat dan opsi pemantauan, seperti CloudWatch peristiwa dan alarm Amazon — Konfigurasikan cluster yang dipromosikan dengan kemampuan logging, alarm, dan sebagainya yang sama sesuai kebutuhan untuk cluster global. Seperti grup parameter, konfigurasi untuk fitur ini tidak diwariskan dari klaster primer selama proses failover berlangsung. Beberapa CloudWatch metrik, seperti jeda replikasi, hanya tersedia untuk Wilayah sekunder. Karena itu, failover akan mengubah cara Anda melihat metrik tersebut dan mengatur alarmnya, serta mengharuskan adanya perubahan pada dasbor yang ditentukan sebelumnya. Untuk informasi selengkapnya tentang cluster dan pemantauan Amazon DocumentDB, lihatMemantau dan masuk ke Amazon DocumentDB.
Biasanya, cluster sekunder yang dipilih mengambil peran utama dalam satu menit. Segera setelah simpul penulis Wilayah primer baru tersedia, Anda dapat menghubungkan aplikasi Anda ke simpul tersebut dan melanjutkan beban kerja Anda. Setelah Amazon DocumentDB mempromosikan cluster primer baru, secara otomatis membangun kembali semua cluster Wilayah sekunder tambahan.
Karena cluster global Amazon DocumentDB menggunakan replikasi asinkron, kelambatan replikasi di setiap Wilayah sekunder dapat bervariasi. Amazon DocumentDB membangun kembali Wilayah sekunder ini agar memiliki data point-in-time yang sama persis dengan cluster Wilayah primer baru. Durasi penyelesaian tugas pembangunan ulang dapat memerlukan waktu beberapa menit hingga beberapa jam, bergantung pada ukuran volume penyimpanan dan jarak di antara Wilayah. Saat klaster Wilayah sekunder selesai dibuat ulang dari Wilayah primer yang baru, klaster ini menjadi tersedia untuk akses baca. Segera setelah penulis utama baru dipromosikan dan tersedia, cluster Wilayah utama baru dapat menangani operasi baca dan tulis untuk cluster global Amazon DocumentDB.
Untuk mengembalikan topologi asli cluster global, Amazon DocumentDB memantau ketersediaan Wilayah utama lama. Segera setelah Wilayah itu sehat dan tersedia lagi, Amazon DocumentDB secara otomatis menambahkannya kembali ke cluster global sebagai Wilayah sekunder. Sebelum membuat volume penyimpanan baru di Wilayah utama lama, Amazon DocumentDB mencoba mengambil snapshot dari volume penyimpanan lama pada titik kegagalan. Hal ini dilakukan agar Anda dapat menggunakannya untuk memulihkan setiap data yang hilang. Jika operasi ini berhasil, Amazon DocumentDB menempatkan snapshot ini bernama “rds:docdb-unplanned-global-failover-name-of-old-primary-” di bagian snapshot. DB-cluster-timestamp Konsol Manajemen AWS Anda juga dapat melihat snapshot ini tercantum dalam informasi yang dikembalikan oleh operasi DescribeDBClusterSnapshots API.
catatan
Snapshot dari volume penyimpanan lama adalah snapshot sistem yang tunduk pada periode retensi pencadangan yang dikonfigurasi pada klaster primer yang lama. Untuk mempertahankan snapshot ini di luar periode retensi, Anda dapat menyalin snapshot untuk disimpan sebagai snapshot manual. Untuk mempelajari selengkapnya tentang cara menyalin snapshot, termasuk harga, lihat Menyalin snapshot cluster.
Setelah topologi asli dipulihkan, Anda dapat gagal mengembalikan cluster global Anda ke Wilayah primer asli dengan melakukan operasi peralihan saat yang paling masuk akal untuk bisnis dan beban kerja Anda. Untuk melakukannya, ikuti langkah yang ada di Melakukan peralihan untuk cluster global Amazon DocumentDB.
Anda dapat gagal melewati cluster global Amazon DocumentDB menggunakan Konsol Manajemen AWS, the AWS CLI, atau Amazon DocumentDB API.
Melakukan failover manual untuk cluster global Amazon DocumentDB
Jika seluruh cluster dalam satu cluster Wilayah AWS menjadi tidak tersedia, Anda dapat mempromosikan cluster lain di cluster global untuk memiliki read/write kemampuan.
Anda dapat mengaktifkan mekanisme failover cluster global secara manual jika cluster di cluster yang berbeda Wilayah AWS adalah pilihan yang lebih baik untuk menjadi cluster utama. Misalnya, Anda dapat meningkatkan kapasitas salah satu klaster sekunder dan kemudian mempromosikannya menjadi klaster primer. Atau keseimbangan aktivitas di antara yang Wilayah AWS mungkin berubah, sehingga mengalihkan cluster utama ke yang berbeda Wilayah AWS mungkin memberikan latensi yang lebih rendah untuk operasi penulisan.
Prosedur berikut menguraikan apa yang harus dilakukan untuk mempromosikan salah satu cluster sekunder dalam cluster global Amazon DocumentDB.
Untuk mempromosikan cluster sekunder:
-
Berhenti mengeluarkan pernyataan DML dan operasi penulisan lainnya ke cluster utama saat pem Wilayah AWS adaman.
-
Identifikasi cluster dari sekunder Wilayah AWS untuk digunakan sebagai cluster primer baru. Jika Anda memiliki dua (atau lebih) sekunder Wilayah AWS di cluster global Anda, pilih cluster sekunder yang memiliki waktu jeda paling sedikit.
-
Lepaskan klaster sekunder yang Anda pilih dari klaster global.
Menghapus cluster sekunder dari cluster global segera menghentikan replikasi dari primer ke sekunder ini dan mempromosikannya ke cluster yang disediakan mandiri dengan read/write kemampuan penuh. Cluster sekunder lainnya yang terkait dengan cluster utama di Wilayah dengan pemadaman masih tersedia dan dapat menerima panggilan dari aplikasi Anda. Klaster tersebut juga mengonsumsi sumber daya. Karena Anda membuat ulang klaster global, untuk menghindari otak-terbelah dan masalah lainnya, hapus klaster sekunder lainnya sebelum membuat klaster global baru dalam langkah-langkah berikut.
Untuk langkah-langkah rinci untuk melepaskan, lihat Menghapus klaster dari klaster global Amazon DocumentDB.
-
Klaster ini menjadi klaster primer dari klaster global baru saat Anda mulai menambahkan Wilayah ke dalamnya, pada langkah berikutnya.
-
Tambahkan Wilayah AWS ke cluster. Saat Anda melakukannya, proses replikasi dari klaster primer ke klaster sekunder akan dimulai.
-
Tambahkan lebih banyak Wilayah AWS sesuai kebutuhan untuk membuat kembali topologi yang diperlukan untuk mendukung aplikasi Anda. Pastikan bahwa penulisan aplikasi dikirim ke klaster yang benar sebelum, selama, dan setelah membuat perubahan seperti ini, untuk menghindari inkonsistensi data di antara klaster dalam klaster global (masalah split-brain).
-
Saat pemadaman teratasi dan Anda siap menugaskan Wilayah AWS asli sebagai klaster primer lagi, lakukan langkah yang sama secara terbalik.
-
Hapus salah satu klaster sekunder dari klaster global. Ini akan memungkinkannya untuk melayani read/write lalu lintas.
-
Alihkan ulang semua lalu lintas tulis ke klaster primer di Wilayah AWS asli.
-
Tambahkan Wilayah AWS untuk mengatur satu atau lebih cluster sekunder sama Wilayah AWS seperti sebelumnya.
Cluster global Amazon DocumentDB dapat dikelola menggunakan AWS SDK, memungkinkan Anda membuat solusi untuk mengotomatiskan proses failover cluster global untuk kasus penggunaan Disaster Recovery dan Business Continuity Planning. Salah satu solusi tersebut tersedia untuk pelanggan kami di bawah lisensi Apache 2.0 dan dapat diakses dari repositori alat kami di sini
Melakukan peralihan untuk cluster global Amazon DocumentDB
Dengan menggunakan peralihan, Anda dapat mengubah Wilayah cluster utama Anda secara rutin. Pendekatan ini ditujukan untuk skenario yang terkontrol, seperti pemeliharaan operasional dan prosedur operasional terencana lainnya.
Ada tiga kasus penggunaan umum untuk menggunakan peralihan:
Untuk persyaratan "rotasi regional" yang diberlakukan pada industri tertentu. Misalnya, peraturan layanan keuangan mungkin menginginkan sistem tier-0 untuk beralih ke Wilayah yang berbeda selama beberapa bulan untuk memastikan prosedur pemulihan bencana dilaksanakan secara teratur.
Untuk aplikasi "follow-the-sun" multi-Wilayah. Misalnya, suatu bisnis mungkin ingin menyediakan penulisan dengan latensi lebih rendah di berbagai Wilayah berdasarkan jam kerja di zona waktu yang berbeda.
Sebagai metode zero-data-loss untuk melakukan failback ke Wilayah primer asli setelah failover.
catatan
Peralihan dirancang untuk digunakan pada cluster global Amazon DocumentDB yang sehat. Untuk pulih dari pemadaman yang tak terduga, ikuti prosedur yang sesuai di Melakukan failover manual untuk cluster global Amazon DocumentDB.
Untuk melakukan peralihan, semua Wilayah sekunder harus menjalankan versi engine yang sama persis dengan yang primer. Jika versi mesin Wilayah tidak cocok, peralihan akan diblokir. Periksa peningkatan yang tertunda dan terapkan untuk memastikan semua versi mesin Region cocok dan peralihan cluster global tidak diblokir. Untuk informasi selengkapnya, lihat Membuka blokir pengalihan atau failover cluster global.
Selama peralihan, Amazon DocumentDB mengalihkan cluster utama Anda ke Wilayah sekunder yang Anda pilih sambil mempertahankan topologi replikasi cluster global yang ada. Sebelum memulai proses peralihan, Amazon DocumentDB menunggu semua cluster Wilayah sekunder sepenuhnya disinkronkan dengan cluster Wilayah utama. Selanjutnya, klaster DB di Wilayah primer menjadi klaster hanya-baca, dan klaster sekunder yang dipilih akan mempromosikan salah satu simpul hanya-bacanya menjadi status penulis penuh. Mempromosikan simpul ini menjadi penulis memungkinkan klaster sekunder mengambil peran klaster primer. Karena semua cluster sekunder disinkronkan dengan cluster primer pada awal proses, primer baru melanjutkan operasi untuk cluster global Amazon DocumentDB tanpa kehilangan data apa pun. Basis data Anda tidak tersedia untuk sementara selama klaster primer dan klaster sekunder yang dipilih mengambil peran barunya masing-masing.
Untuk mengoptimalkan ketersediaan aplikasi, lakukan hal berikut sebelum menggunakan fitur ini:
Lakukan operasi ini selama jam nonpeak atau di waktu lain ketika penulisan ke cluster utama minimal.
Lakukan offline aplikasi untuk mencegah penulisan dikirim ke cluster utama cluster global Amazon DocumentDB.
Periksa waktu jeda untuk semua cluster sekunder Amazon DocumentDB di cluster global dengan melihat
GlobalClusterReplicationLagmetrik di Amazon CloudWatch. Metrik ini menunjukkan seberapa jauh di belakang (dalam milidetik) replikasi ke cluster sekunder ke cluster primer. Nilai ini berbanding lurus dengan waktu yang dibutuhkan Amazon DocumentDB untuk menyelesaikan peralihan. Karena itu, semakin besar nilai keterlambatan, semakin lama durasi switchover.Untuk informasi selengkapnya tentang CloudWatch metrik untuk Amazon DocumentDB, lihatMetrik Amazon DocumentDB.
Selama proses switchover, klaster DB sekunder yang dipilih akan dipromosikan ke peran barunya sebagai primer. Namun, klaster ini tidak mewarisi berbagai opsi konfigurasi klaster DB primer. Ketidakcocokan dalam konfigurasi dapat menyebabkan masalah performa, inkompatibilitas beban kerja, dan perilaku anomali lainnya. Untuk menghindari masalah tersebut, selesaikan perbedaan antara cluster global Amazon DocumentDB Anda untuk hal berikut:
Konfigurasikan grup parameter cluster Amazon DocumentDB DB untuk primer baru, jika perlu — Anda dapat mengonfigurasi grup parameter cluster Amazon DocumentDB secara independen untuk setiap cluster di cluster global Amazon DocumentDB Anda. Hal ini berarti ketika Anda mempromosikan klaster DB sekunder untuk mengambil alih peran primer, grup parameter dari klaster sekunder mungkin memiliki konfigurasi yang berbeda dengan klaster primer. Jika demikian, ubah grup parameter klaster DB sekunder yang dipromosikan agar sesuai dengan pengaturan klaster primer Anda. Untuk mempelajari caranya, lihat Mengelola grup parameter cluster Amazon DocumentDB.
Konfigurasikan alat dan opsi pemantauan, seperti Amazon Ev CloudWatch ents dan alarm — Konfigurasikan cluster yang dipromosikan dengan kemampuan logging, alarm, dan sebagainya yang sama sesuai kebutuhan untuk cluster global. Seperti grup parameter, konfigurasi untuk fitur ini tidak diwariskan dari klaster primer selama proses switchover berlangsung. Beberapa CloudWatch metrik, seperti jeda replikasi, hanya tersedia untuk Wilayah utama. Karena itu, switchover akan mengubah cara Anda melihat metrik tersebut dan mengatur alarmnya, serta mengharuskan adanya perubahan pada dasbor yang ditentukan sebelumnya. Untuk informasi selengkapnya, lihat Memantau dan masuk ke Amazon DocumentDB.
catatan
Biasanya, switchover peran dapat memerlukan waktu hingga beberapa menit.
Ketika proses peralihan selesai, cluster Amazon DocumentDB yang dipromosikan dapat menangani operasi penulisan untuk cluster global.
Anda dapat beralih ke cluster global Amazon DocumentDB menggunakan Konsol Manajemen AWS atau: AWS CLI
Membuka blokir pengalihan atau failover cluster global
Peralihan cluster global dan failover diblokir ketika tidak semua cluster regional di cluster global menggunakan versi engine yang sama. Jika versi tidak cocok, Anda mungkin melihat kesalahan ini saat memanggil switchover atau failover: Cluster DB target yang ditentukan menjalankan versi engine dengan level patch yang berbeda dari cluster DB sumber. Secara rutin menerapkan versi mesin terbaru untuk menjaga cluster global Anda dalam keadaan sehat.
Untuk mengatasi kesalahan ini, perbarui semua Wilayah sekunder terlebih dahulu, lalu Wilayah utama ke versi mesin yang sama dengan menerapkan item tindakan pemeliharaan yang tertunda. Untuk melihat item tindakan pemeliharaan yang tertunda, dan untuk menerapkan perubahan yang diperlukan untuk memperbaiki masalah, lakukan instruksi di salah satu tab berikut: