本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
針對日誌分析最佳化
針對日誌分析最佳化的 Amazon OpenSearch Service 是一種新引擎選項,可將單欄式分析儲存與全文搜尋結合在單一受管服務中。使用最佳化引擎,您可以大幅提升日誌分析工作負載的價格效能。您也可以保留事件調查的全文搜尋。
概觀
Optimized 引擎是 Amazon OpenSearch Service 中的新引擎模式。您可以使用與一般用途引擎相同的主控台、APIs、安全模型和聯網組態。
使用最佳化引擎,您可以針對日誌分析工作負載進行下列改善:
-
改善價格效能 – 單欄式壓縮和高效率的執行個體使用率可降低大規模執行日誌分析的成本。
-
減少儲存 – 相較於傳統索引結構,Apache Parquet 單欄式格式可大幅壓縮日誌資料。
-
更快擷取 – 向量化的單欄式寫入路徑會增加擷取輸送量。
-
更快速的分析查詢 – 資料欄式資料的向量化執行可加速彙總、篩選條件和趨勢分析。
-
統一搜尋和分析 – 全文搜尋述詞會在單一服務中對相同資料的分析查詢內執行。
下表比較兩種引擎模式。
| 引擎模式 | 最適合 |
|---|---|
| 一般用途 | 頻繁更新的大量搜尋和混合工作負載 (電子商務、內容探索、應用程式搜尋) |
| Optimized (建議用於日誌分析) | 以多 TB 規模附加僅限日誌和日誌分析 |
何時使用每個引擎模式
當您的工作負載由 日誌的彙總、篩選條件和趨勢分析主導時,請使用最佳化引擎,而且您也需要在事件期間進行全文搜尋。範例包括multi-terabyte-per-day 規模的應用程式、基礎設施和安全日誌分析。
當您的工作負載取決於相關性排名、巢狀物件查詢、無色指令碼、地理查詢、向量/語意搜尋或經常就地文件更新時,請使用一般用途引擎。範例包括電子商務搜尋、內容探索和應用程式搜尋。
運作方式
Optimized 引擎會針對每個操作使用最佳資料結構。引擎會以單欄式格式存放日誌資料以供分析。它會保留全文搜尋的搜尋索引,並將每個查詢路由到最適合的元件。
下表說明最佳化引擎的元件。
| 元件 | Role |
|---|---|
| Apache Parquet | 開啟單欄式儲存格式。日誌資料的主要儲存體。與傳統索引結構相比,可大幅降低儲存體。 |
| Lucene 反轉索引 | 保留用於日誌內容的全文搜尋 (片語、模糊、萬用字元比對)。 |
| Apache Calcite | SQL 剖析器、規劃器和最佳化工具。在協調器節點上執行,做為所有查詢語言的單一前端。 |
| DataFusion | 向量化執行引擎 (Rust 型)。對單欄式資料執行分析操作 (彙總、篩選條件、範圍掃描)。 |
| Apache Arrow | 記憶體內單欄格式。啟用零複本資料傳輸和向量化處理。 |
| Amazon S3 | 適用於 Parquet 檔案和反轉索引區段的耐用備份存放區。 |
| OpenSearch UI | 最佳化網域的查詢和視覺化界面 (PPL 查詢列、自然語言查詢協助)。 |
透過現有 REST APIs和用戶端程式庫輸入資料 (不需要新的代理程式或管道)。引擎會將資料寫入單欄 Parquet 進行分析。對於設定為可搜尋的欄位,也會寫入 Lucene 反轉的索引。PPL 和 SQL 透過向量化引擎原生執行。全文搜尋述詞會在反轉的索引上執行,可與單一陳述式中的分析結合。
查詢會流經協調器節點 (規劃和合併) 和資料節點 (執行和存放)。協調器會剖析和最佳化查詢,然後將片段排程到資料節點。在每個資料節點上,分析操作在 DataFusion 引擎上執行,而搜尋操作在 Lucene 引擎上執行。兩者可以交出中查詢,因此搜尋日誌內容並彙總結果執行的查詢無需額外的往返。
區域可用性
針對日誌分析最佳化的 Amazon OpenSearch Service 可在下列 中取得 AWS 區域:
美國東部 (維吉尼亞北部) –
us-east-1美國東部 (俄亥俄) –
us-east-2美國西部 (奧勒岡) –
us-west-2加拿大 (中部) –
ca-central-1亞太地區 (孟買)
亞太地區 (新加坡)
亞太地區 (雪梨)
亞太地區 (東京)
歐洲 (法蘭克福)
歐洲 (愛爾蘭)
歐洲 (倫敦)
歐洲 (西班牙)