Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
CloudWatch Alarm yang disarankan untuk OpenSearch Layanan Amazon
CloudWatch alarm melakukan tindakan ketika CloudWatch metrik melebihi nilai yang ditentukan untuk beberapa waktu. Misalnya, Anda mungkin AWS ingin mengirim email jika status kesehatan cluster Anda lebih dari satu menit. red Bagian ini mencakup beberapa alarm yang direkomendasikan untuk OpenSearch Layanan Amazon dan cara menanggapinya.
Anda dapat secara otomatis menerapkan alarm ini menggunakan CloudFormation. Untuk tumpukan sampel, lihat GitHub repositori terkait
catatan
Jika Anda menerapkan CloudFormation tumpukan, KMSKeyInaccessible alarm KMSKeyError dan akan ada dalam Insufficient
Data status karena metrik ini hanya muncul jika domain mengalami masalah dengan kunci enkripsinya.
Untuk informasi selengkapnya tentang mengonfigurasi alarm, lihat Membuat CloudWatch Alarm Amazon di Panduan CloudWatch Pengguna Amazon.
| Alarm | Masalah |
|---|---|
Maksimum ClusterStatus.red adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Setidaknya satu serpihan utama dan replika yang tidak dialokasikan untuk simpul. Lihat Status klaster merah. |
ClusterStatus.yellowmaksimum adalah >= 1 selama 1 menit, 5 kali berturut-turut |
Setidaknya satu serpihan replika tidak dialokasikan ke simpul. Lihat Status klaster kuning. |
Minimum FreeStorageSpaceadalah <= 20480 selama 1 menit, 1 kali berturut-turut |
Sebuah simpul di klaster Anda turun ke 20 GiB ruang penyimpanan gratis. Lihat Kurangnya ruang penyimpanan yang tersedia. Nilai ini berdasarkan MiB, jadi bukan 20480, sebaiknya atur ke 25% dari ruang penyimpanan untuk setiap simpul. |
ClusterIndexWritesBlocked adalah > = 1 untuk 5 menit, 1 kali berturut-turut |
Klaster Anda memblokir permintaan tulis. Lihat ClusterBlockException. |
Minimum Nodes adalah < x selama 1 hari, 1 kali berturut-turut |
x adalah jumlah simpul dalam klaster Anda. Alarm ini menunjukkan bahwa setidaknya satu node di cluster Anda tidak dapat dijangkau di beberapa titik dalam satu hari. Lihat Simpul klaster yang gagal. |
Maksimum AutomatedSnapshotFailure adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Sebuah snapshot otomatis gagal. Kegagalan ini sering merupakan hasil dari status kesehatan klaster merah. Lihat Status klaster merah. Untuk ringkasan semua snapshot otomatis dan beberapa informasi tentang kegagalan, cobalah salah satu permintaan berikut: |
Maksimum CPUUtilization atau WarmCPUUtilization adalah >= 80% untuk 15 menit, 3 kali berturut-turut |
Pemanfaatan CPU 100% mungkin terjadi kadang-kadang, tetapi penggunaan tinggi yang berkelanjutan bermasalah. Pertimbangkan untuk menggunakan jenis instans yang lebih besar atau menambahkan instans. |
JVMMemoryPressuremaksimum adalah >= 95% selama 1 menit, 3 kali berturut-turut |
Klaster bisa mengalami kesalahan kehabisan memori jika penggunaan meningkat. Pertimbangkan penskalaan secara vertikal. OpenSearch Layanan menggunakan setengah dari RAM instance untuk heap Java, hingga ukuran heap 32 GiB. Anda dapat menskalakan instans secara vertikal hingga 64 GiB RAM, di mana Anda dapat menskalakan secara horizontal dengan menambahkan instans. |
OldGenJVMMemoryPressuremaksimum adalah >= 80% selama 1 menit, 3 kali berturut-turut |
|
Maksimum MasterCPUUtilization adalah > >= 50% untuk 15 menit, 3 kali berturut-turut |
Pertimbangkan untuk menggunakan tipe instans yang lebih besar untuk simpul utama khusus. Karena perannya dalam stabilitas cluster dan pener blue/green apan, node master khusus harus memiliki penggunaan CPU yang lebih rendah daripada node data. |
MasterJVMMemoryPressuremaksimum adalah >= 95% selama 1 menit, 3 kali berturut-turut |
|
MasterOldGenJVMMemoryPressuremaksimum adalah >= 80% selama 1 menit, 3 kali berturut-turut |
|
KMSKeyError adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
K AWS KMS unci enkripsi yang digunakan untuk mengenkripsi data diam di domain Anda dinonaktifkan. Re-enable untuk mengembalikan operasi normal. Untuk informasi selengkapnya, lihat Enkripsi data diam untuk OpenSearch Layanan Amazon. |
KMSKeyInaccessible adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
K AWS KMS unci enkripsi yang digunakan untuk mengenkripsi data yang tidak ada di domain Anda telah dihapus atau telah mencabut hibahannya kepada OpenSearch Layanan. Anda tidak dapat memulihkan domain yang berada dalam keadaan ini. Namun, jika Anda memiliki snapshot manual, Anda dapat menggunakannya untuk bermigrasi ke domain baru. Untuk mempelajari selengkapnya, lihat Enkripsi data diam untuk OpenSearch Layanan Amazon. |
shards.activeadalah >= (25 × ukuran heap JVM dalam GiB × jumlah node data) selama 1 menit, 1 waktu berturut-turut |
Jumlah total pecahan primer dan replika aktif melebihi batas yang disarankan 25 pecahan per GiB memori heap Java per node. Misalnya, cluster 3-node dengan heap 32 GiB per node harus memiliki tidak lebih dari 2.400 pecahan (25 × 32 × 3). Anda mungkin terlalu sering memutar indeks Anda. Pertimbangkan untuk menggunakan ISM untuk menghapus indeks setelah mencapai usia tertentu. |
5xxalarm >= 10% dari OpenSearchRequests |
Satu atau lebih node data mungkin kelebihan beban, atau permintaan gagal diselesaikan dalam periode waktu tunggu idle. Pertimbangkan untuk beralih ke jenis instance yang lebih besar atau menambahkan lebih banyak node ke cluster. Konfirmasikan bahwa Anda mengikuti praktik terbaik untuk arsitektur shard dan cluster. |
MasterReachableFromNodemaksimum adalah < 1 selama 5 menit, 1 kali berturut-turut |
Alarm ini menunjukkan bahwa node master berhenti atau tidak dapat dijangkau. Kegagalan ini biasanya merupakan hasil dari masalah konektivitas jaringan atau masalah AWS ketergantungan. |
ThreadpoolWriteQueuerata-rata adalah >= 100 untuk 1 menit, 1 waktu berturut-turut |
Cluster mengalami konkurensi pengindeksan yang tinggi. Tinjau dan kendalikan permintaan pengindeksan, atau tingkatkan sumber daya cluster. |
ThreadpoolSearchQueuerata-rata adalah >= 500 untuk 1 menit, 1 waktu berturut-turut |
Cluster mengalami konkurensi pencarian yang tinggi. Pertimbangkan untuk menskalakan cluster Anda. Anda juga dapat meningkatkan ukuran antrian pencarian, tetapi meningkatkannya secara berlebihan dapat menyebabkan kesalahan di luar memori. |
ThreadpoolSearchQueuemaksimum adalah >= 5000 untuk 1 menit, 1 waktu berturut-turut |
|
Peningkatan ThreadpoolSearchRejected SUM adalah >=1 {ekspresi matematika DIFF ()} selama 1 menit, 1 kali berturut-turut |
Alarm ini memberi tahu Anda tentang masalah domain yang mungkin memengaruhi kinerja dan stabilitas. |
Peningkatan ThreadpoolWriteRejected SUM adalah >=1 {ekspresi matematika DIFF ()} selama 1 menit, 1 kali berturut-turut |
catatan
Jika Anda hanya ingin melihat metrik, lihatMemantau metrik OpenSearch klaster dengan Amazon CloudWatch.
Alarm lain yang mungkin Anda pertimbangkan
Pertimbangkan untuk mengonfigurasi alarm berikut tergantung pada fitur OpenSearch Layanan yang Anda gunakan secara teratur.
| Alarm | Isu |
|---|---|
WarmFreeStorageSpaceadalah >= 10% |
Anda telah mencapai 10% dari total penyimpanan hangat gratis Anda. WarmFreeStorageSpacemengukur jumlah ruang penyimpanan hangat gratis Anda di MiB. UltraWarm menggunakan Amazon S3 daripada disk terpasang. |
HotToWarmMigrationQueueSizeadalah >= 20 selama 1 menit, 3 kali berturut-turut |
Sejumlah besar indeks secara bersamaan bergerak dari panas ke UltraWarm penyimpanan. Pertimbangkan untuk menskalakan cluster Anda. |
HotToWarmMigrationSuccessLatencyadalah >= 1 hari, 1 kali berturut-turut |
Konfigurasikan alarm ini sehingga Anda diberi tahu jika latensi |
WarmJVMMemoryPressuremaksimum adalah >= 95% selama 1 menit, 3 kali berturut-turut |
Klaster bisa mengalami kesalahan kehabisan memori jika penggunaan meningkat. Pertimbangkan penskalaan vertikal. OpenSearch Layanan menggunakan setengah dari RAM instance untuk heap Java, hingga ukuran heap 32 GiB. Anda dapat menskalakan instans secara vertikal hingga 64 GiB RAM, di mana Anda dapat menskalakan secara horizontal dengan menambahkan instans. |
WarmOldGenJVMMemoryPressuremaksimum adalah >= 80% selama 1 menit, 3 kali berturut-turut |
|
WarmToColdMigrationQueueSizeadalah >= 20 selama 1 menit, 3 kali berturut-turut |
Sejumlah besar indeks secara bersamaan berpindah dari UltraWarm ke cold storage. Pertimbangkan untuk menskalakan cluster Anda. |
HotToWarmMigrationFailureCount adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Migrasi mungkin gagal selama snapshot, relokasi pecahan, atau penggabungan paksa. Kegagalan selama snapshot atau relokasi serpihan biasanya karena kegagalan simpul atau masalah konektivitas S3. Kurangnya ruang disk biasanya menjadi penyebab kegagalan penggabungan paksa. |
WarmToColdMigrationFailureCount adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Migrasi biasanya gagal ketika upaya untuk memigrasikan metadata indeks ke cold storage gagal. Kegagalan juga dapat terjadi ketika status cluster indeks hangat sedang dihapus. |
WarmToColdMigrationLatencyadalah >= 1 hari, 1 kali berturut-turut |
Konfigurasikan alarm ini sehingga Anda diberi tahu jika latensi |
AlertingDegraded adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Entah indeks peringatan berwarna merah, atau satu atau lebih node tidak sesuai jadwal. |
ADPluginUnhealthy adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Plugin deteksi anomali tidak berfungsi dengan baik, baik karena tingkat kegagalan yang tinggi atau karena salah satu indeks yang digunakan berwarna merah. |
AsynchronousSearchFailureRate adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Setidaknya satu pencarian asinkron gagal pada menit terakhir, yang kemungkinan berarti node koordinator gagal. Siklus hidup permintaan pencarian asinkron dikelola semata-mata pada node koordinator, jadi jika koordinator turun, permintaan gagal. |
AsynchronousSearchStoreHealth adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Kesehatan penyimpanan respons pencarian asinkron di indeks persisten berwarna merah. Anda mungkin menyimpan respons asinkron besar, yang dapat mengacaukan cluster. Cobalah untuk membatasi respons pencarian asinkron Anda hingga 10 MB atau kurang. |
SQLUnhealthyadalah >= 1 selama 1 menit, 3 kali berturut-turut |
Plugin SQL mengembalikan 5 kode respons xx atau meneruskan kueri DSL yang tidak valid ke OpenSearch. Memecahkan masalah permintaan yang dibuat klien Anda ke plugin. |
LTRStatus.red adalah > = 1 untuk 1 menit, 1 kali berturut-turut |
Setidaknya salah satu indeks yang diperlukan untuk menjalankan plugin Learning to Rank tidak memiliki pecahan primer dan tidak berfungsi. |