View a markdown version of this page

CloudWatch Alarm yang disarankan untuk OpenSearch Layanan Amazon - OpenSearch Layanan Amazon

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

CloudWatch Alarm yang disarankan untuk OpenSearch Layanan Amazon

CloudWatch alarm melakukan tindakan ketika CloudWatch metrik melebihi nilai yang ditentukan untuk beberapa waktu. Misalnya, Anda mungkin AWS ingin mengirim email jika status kesehatan cluster Anda lebih dari satu menit. red Bagian ini mencakup beberapa alarm yang direkomendasikan untuk OpenSearch Layanan Amazon dan cara menanggapinya.

Anda dapat secara otomatis menerapkan alarm ini menggunakan CloudFormation. Untuk tumpukan sampel, lihat GitHub repositori terkait.

catatan

Jika Anda menerapkan CloudFormation tumpukan, KMSKeyInaccessible alarm KMSKeyError dan akan ada dalam Insufficient Data status karena metrik ini hanya muncul jika domain mengalami masalah dengan kunci enkripsinya.

Untuk informasi selengkapnya tentang mengonfigurasi alarm, lihat Membuat CloudWatch Alarm Amazon di Panduan CloudWatch Pengguna Amazon.

Alarm Masalah
Maksimum ClusterStatus.red adalah > = 1 untuk 1 menit, 1 kali berturut-turut Setidaknya satu serpihan utama dan replika yang tidak dialokasikan untuk simpul. Lihat Status klaster merah.
ClusterStatus.yellowmaksimum adalah >= 1 selama 1 menit, 5 kali berturut-turut Setidaknya satu serpihan replika tidak dialokasikan ke simpul. Lihat Status klaster kuning.
Minimum FreeStorageSpaceadalah <= 20480 selama 1 menit, 1 kali berturut-turut Sebuah simpul di klaster Anda turun ke 20 GiB ruang penyimpanan gratis. Lihat Kurangnya ruang penyimpanan yang tersedia. Nilai ini berdasarkan MiB, jadi bukan 20480, sebaiknya atur ke 25% dari ruang penyimpanan untuk setiap simpul.
ClusterIndexWritesBlocked adalah > = 1 untuk 5 menit, 1 kali berturut-turut Klaster Anda memblokir permintaan tulis. Lihat ClusterBlockException.
Minimum Nodes adalah < x selama 1 hari, 1 kali berturut-turut x adalah jumlah simpul dalam klaster Anda. Alarm ini menunjukkan bahwa setidaknya satu node di cluster Anda tidak dapat dijangkau di beberapa titik dalam satu hari. Lihat Simpul klaster yang gagal.
Maksimum AutomatedSnapshotFailure adalah > = 1 untuk 1 menit, 1 kali berturut-turut Sebuah snapshot otomatis gagal. Kegagalan ini sering merupakan hasil dari status kesehatan klaster merah. Lihat Status klaster merah.

Untuk ringkasan semua snapshot otomatis dan beberapa informasi tentang kegagalan, cobalah salah satu permintaan berikut:

GET domain_endpoint/_snapshot/cs-automated/_all GET domain_endpoint/_snapshot/cs-automated-enc/_all
Maksimum CPUUtilization atau WarmCPUUtilization adalah >= 80% untuk 15 menit, 3 kali berturut-turut Pemanfaatan CPU 100% mungkin terjadi kadang-kadang, tetapi penggunaan tinggi yang berkelanjutan bermasalah. Pertimbangkan untuk menggunakan jenis instans yang lebih besar atau menambahkan instans.
JVMMemoryPressuremaksimum adalah >= 95% selama 1 menit, 3 kali berturut-turut Klaster bisa mengalami kesalahan kehabisan memori jika penggunaan meningkat. Pertimbangkan penskalaan secara vertikal. OpenSearch Layanan menggunakan setengah dari RAM instance untuk heap Java, hingga ukuran heap 32 GiB. Anda dapat menskalakan instans secara vertikal hingga 64 GiB RAM, di mana Anda dapat menskalakan secara horizontal dengan menambahkan instans.
OldGenJVMMemoryPressuremaksimum adalah >= 80% selama 1 menit, 3 kali berturut-turut
Maksimum MasterCPUUtilization adalah > >= 50% untuk 15 menit, 3 kali berturut-turut Pertimbangkan untuk menggunakan tipe instans yang lebih besar untuk simpul utama khusus. Karena perannya dalam stabilitas cluster dan pener blue/green apan, node master khusus harus memiliki penggunaan CPU yang lebih rendah daripada node data.
MasterJVMMemoryPressuremaksimum adalah >= 95% selama 1 menit, 3 kali berturut-turut
MasterOldGenJVMMemoryPressuremaksimum adalah >= 80% selama 1 menit, 3 kali berturut-turut
KMSKeyError adalah > = 1 untuk 1 menit, 1 kali berturut-turut K AWS KMS unci enkripsi yang digunakan untuk mengenkripsi data diam di domain Anda dinonaktifkan. Re-enable untuk mengembalikan operasi normal. Untuk informasi selengkapnya, lihat Enkripsi data diam untuk OpenSearch Layanan Amazon.
KMSKeyInaccessible adalah > = 1 untuk 1 menit, 1 kali berturut-turut K AWS KMS unci enkripsi yang digunakan untuk mengenkripsi data yang tidak ada di domain Anda telah dihapus atau telah mencabut hibahannya kepada OpenSearch Layanan. Anda tidak dapat memulihkan domain yang berada dalam keadaan ini. Namun, jika Anda memiliki snapshot manual, Anda dapat menggunakannya untuk bermigrasi ke domain baru. Untuk mempelajari selengkapnya, lihat Enkripsi data diam untuk OpenSearch Layanan Amazon.
shards.activeadalah >= (25 × ukuran heap JVM dalam GiB × jumlah node data) selama 1 menit, 1 waktu berturut-turut

Jumlah total pecahan primer dan replika aktif melebihi batas yang disarankan 25 pecahan per GiB memori heap Java per node. Misalnya, cluster 3-node dengan heap 32 GiB per node harus memiliki tidak lebih dari 2.400 pecahan (25 × 32 × 3). Anda mungkin terlalu sering memutar indeks Anda. Pertimbangkan untuk menggunakan ISM untuk menghapus indeks setelah mencapai usia tertentu.

5xxalarm >= 10% dari OpenSearchRequests Satu atau lebih node data mungkin kelebihan beban, atau permintaan gagal diselesaikan dalam periode waktu tunggu idle. Pertimbangkan untuk beralih ke jenis instance yang lebih besar atau menambahkan lebih banyak node ke cluster. Konfirmasikan bahwa Anda mengikuti praktik terbaik untuk arsitektur shard dan cluster.
MasterReachableFromNodemaksimum adalah < 1 selama 5 menit, 1 kali berturut-turut

Alarm ini menunjukkan bahwa node master berhenti atau tidak dapat dijangkau. Kegagalan ini biasanya merupakan hasil dari masalah konektivitas jaringan atau masalah AWS ketergantungan.

ThreadpoolWriteQueuerata-rata adalah >= 100 untuk 1 menit, 1 waktu berturut-turut Cluster mengalami konkurensi pengindeksan yang tinggi. Tinjau dan kendalikan permintaan pengindeksan, atau tingkatkan sumber daya cluster.
ThreadpoolSearchQueuerata-rata adalah >= 500 untuk 1 menit, 1 waktu berturut-turut Cluster mengalami konkurensi pencarian yang tinggi. Pertimbangkan untuk menskalakan cluster Anda. Anda juga dapat meningkatkan ukuran antrian pencarian, tetapi meningkatkannya secara berlebihan dapat menyebabkan kesalahan di luar memori.
ThreadpoolSearchQueuemaksimum adalah >= 5000 untuk 1 menit, 1 waktu berturut-turut
Peningkatan ThreadpoolSearchRejected SUM adalah >=1 {ekspresi matematika DIFF ()} selama 1 menit, 1 kali berturut-turut Alarm ini memberi tahu Anda tentang masalah domain yang mungkin memengaruhi kinerja dan stabilitas.
Peningkatan ThreadpoolWriteRejected SUM adalah >=1 {ekspresi matematika DIFF ()} selama 1 menit, 1 kali berturut-turut
catatan

Jika Anda hanya ingin melihat metrik, lihatMemantau metrik OpenSearch klaster dengan Amazon CloudWatch.

Alarm lain yang mungkin Anda pertimbangkan

Pertimbangkan untuk mengonfigurasi alarm berikut tergantung pada fitur OpenSearch Layanan yang Anda gunakan secara teratur.

Alarm Isu
WarmFreeStorageSpaceadalah >= 10% Anda telah mencapai 10% dari total penyimpanan hangat gratis Anda. WarmFreeStorageSpacemengukur jumlah ruang penyimpanan hangat gratis Anda di MiB. UltraWarm menggunakan Amazon S3 daripada disk terpasang.
HotToWarmMigrationQueueSizeadalah >= 20 selama 1 menit, 3 kali berturut-turut

Sejumlah besar indeks secara bersamaan bergerak dari panas ke UltraWarm penyimpanan. Pertimbangkan untuk menskalakan cluster Anda.

HotToWarmMigrationSuccessLatencyadalah >= 1 hari, 1 kali berturut-turut

Konfigurasikan alarm ini sehingga Anda diberi tahu jika latensi HotToWarmMigrationSuccessCount x lebih besar dari 24 jam jika Anda mencoba memutar indeks harian.

WarmJVMMemoryPressuremaksimum adalah >= 95% selama 1 menit, 3 kali berturut-turut Klaster bisa mengalami kesalahan kehabisan memori jika penggunaan meningkat. Pertimbangkan penskalaan vertikal. OpenSearch Layanan menggunakan setengah dari RAM instance untuk heap Java, hingga ukuran heap 32 GiB. Anda dapat menskalakan instans secara vertikal hingga 64 GiB RAM, di mana Anda dapat menskalakan secara horizontal dengan menambahkan instans.
WarmOldGenJVMMemoryPressuremaksimum adalah >= 80% selama 1 menit, 3 kali berturut-turut
WarmToColdMigrationQueueSizeadalah >= 20 selama 1 menit, 3 kali berturut-turut

Sejumlah besar indeks secara bersamaan berpindah dari UltraWarm ke cold storage. Pertimbangkan untuk menskalakan cluster Anda.

HotToWarmMigrationFailureCount adalah > = 1 untuk 1 menit, 1 kali berturut-turut

Migrasi mungkin gagal selama snapshot, relokasi pecahan, atau penggabungan paksa. Kegagalan selama snapshot atau relokasi serpihan biasanya karena kegagalan simpul atau masalah konektivitas S3. Kurangnya ruang disk biasanya menjadi penyebab kegagalan penggabungan paksa.

WarmToColdMigrationFailureCount adalah > = 1 untuk 1 menit, 1 kali berturut-turut Migrasi biasanya gagal ketika upaya untuk memigrasikan metadata indeks ke cold storage gagal. Kegagalan juga dapat terjadi ketika status cluster indeks hangat sedang dihapus.
WarmToColdMigrationLatencyadalah >= 1 hari, 1 kali berturut-turut

Konfigurasikan alarm ini sehingga Anda diberi tahu jika latensi WarmToColdMigrationSuccessCount x lebih besar dari 24 jam jika Anda mencoba memutar indeks harian.

AlertingDegraded adalah > = 1 untuk 1 menit, 1 kali berturut-turut

Entah indeks peringatan berwarna merah, atau satu atau lebih node tidak sesuai jadwal.

ADPluginUnhealthy adalah > = 1 untuk 1 menit, 1 kali berturut-turut

Plugin deteksi anomali tidak berfungsi dengan baik, baik karena tingkat kegagalan yang tinggi atau karena salah satu indeks yang digunakan berwarna merah.

AsynchronousSearchFailureRate adalah > = 1 untuk 1 menit, 1 kali berturut-turut

Setidaknya satu pencarian asinkron gagal pada menit terakhir, yang kemungkinan berarti node koordinator gagal. Siklus hidup permintaan pencarian asinkron dikelola semata-mata pada node koordinator, jadi jika koordinator turun, permintaan gagal.

AsynchronousSearchStoreHealth adalah > = 1 untuk 1 menit, 1 kali berturut-turut

Kesehatan penyimpanan respons pencarian asinkron di indeks persisten berwarna merah. Anda mungkin menyimpan respons asinkron besar, yang dapat mengacaukan cluster. Cobalah untuk membatasi respons pencarian asinkron Anda hingga 10 MB atau kurang.

SQLUnhealthyadalah >= 1 selama 1 menit, 3 kali berturut-turut

Plugin SQL mengembalikan 5 kode respons xx atau meneruskan kueri DSL yang tidak valid ke OpenSearch. Memecahkan masalah permintaan yang dibuat klien Anda ke plugin.

LTRStatus.red adalah > = 1 untuk 1 menit, 1 kali berturut-turut

Setidaknya salah satu indeks yang diperlukan untuk menjalankan plugin Learning to Rank tidak memiliki pecahan primer dan tidak berfungsi.