View a markdown version of this page

로그 분석에 최적화됨 - Amazon OpenSearch Service

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

로그 분석에 최적화됨

로그 분석에 최적화된 Amazon OpenSearch Service는 열 기반 분석 스토리지와 단일 관리형 서비스의 전체 텍스트 검색을 결합하는 새로운 엔진 옵션입니다. 최적화된 엔진을 사용하면 로그 분석 워크로드의 가격 대비 성능이 크게 향상됩니다. 또한 인시던트 조사를 위한 전체 텍스트 검색을 유지합니다.

개요

최적화된 엔진은 Amazon OpenSearch Service의 새로운 엔진 모드입니다. 범용 엔진에서 이미 사용하고 있는 것과 동일한 콘솔, APIs, 보안 모델 및 네트워킹 구성을 사용합니다.

최적화된 엔진을 사용하면 로그 분석 워크로드를 다음과 같이 개선할 수 있습니다.

  • 가격 대비 성능 향상 - 열 기반 압축 및 효율적인 인스턴스 사용률은 대규모 로그 분석 실행 비용을 줄입니다.

  • 스토리지 감소 - Apache Parquet 열 형식은 기존 인덱싱 구조에 비해 로그 데이터를 크게 압축합니다.

  • 더 빠른 수집 - 벡터화된 열 기반 쓰기 경로는 수집 처리량을 늘립니다.

  • 더 빠른 분석 쿼리 - 열 기반 데이터에 대한 벡터화된 실행은 집계, 필터 및 추세 분석을 가속화합니다.

  • 통합 검색 및 분석 - 전체 텍스트 검색 조건자는 단일 서비스에서 동일한 데이터의 분석 쿼리 내에서 실행됩니다.

다음 표에서는 두 엔진 모드를 비교합니다.

엔진 모드 최적의 용도
범용 자주 업데이트(전자 상거래, 콘텐츠 검색, 애플리케이션 검색)되는 검색이 많고 혼합된 워크로드
최적화됨(로그 분석에 권장) 멀티 테라바이트 규모의 추가 전용 로그 및 로그 분석

각 엔진 모드를 사용해야 하는 경우

로그에 대한 집계, 필터 및 추세 분석이 워크로드를 지배하고 인시던트 발생 시 전체 텍스트 검색이 필요한 경우 최적화된 엔진을 사용합니다. 예를 들어 애플리케이션, 인프라 및 보안 로그 분석이 multi-terabyte-per-day 규모로 제공됩니다.

워크로드가 관련성 순위, 중첩 객체 쿼리, Painless 스크립팅, 지리 쿼리, 벡터/시맨틱 검색 또는 인플레이스 문서 업데이트 빈도에 따라 달라지는 경우 범용 엔진을 사용합니다. 예를 들어 전자 상거래 검색, 콘텐츠 검색 및 애플리케이션 검색이 있습니다.

작동 방식

최적화된 엔진은 각 작업에 최상의 데이터 구조를 사용합니다. 엔진은 분석을 위해 로그 데이터를 열 형식으로 저장합니다. 전체 텍스트 검색을 위한 검색 인덱스를 유지하고 각 쿼리를 가장 적합한 구성 요소로 라우팅합니다.

다음 표에서는 최적화된 엔진의 구성 요소를 설명합니다.

구성 요소 Role
Apache Parquet 열 기반 스토리지 형식을 엽니다. 로그 데이터를 위한 기본 스토리지입니다. 기존 인덱싱 구조에 비해 스토리지를 크게 줄입니다.
Lucene 반전 인덱스 로그 콘텐츠(문구, 퍼지, 와일드카드 일치)에 대한 전체 텍스트 검색을 위해 보관됩니다.
Apache Calcite SQL 구문 분석기, 플래너 및 옵티마이저. 코디네이터 노드에서 모든 쿼리 언어에 대한 단일 프런트 엔드로 실행됩니다.
DataFusion 벡터화된 실행 엔진(러스트 기반). 열 기반 데이터에 대한 분석 작업(집계, 필터, 범위 스캔)을 실행합니다.
Apache Arrow 인 메모리 열 형식입니다. 제로 복사 데이터 전송 및 벡터 처리를 활성화합니다.
Amazon S3 Parquet 파일과 역인덱스 세그먼트 모두에 대한 내구성 있는 백업 저장소입니다.
OpenSearch UI 최적화된 도메인을 위한 쿼리 및 시각화 인터페이스(PPL 쿼리 막대, 자연어 쿼리 지원).

데이터는 기존 REST APIs 및 클라이언트 라이브러리를 통해 입력됩니다(새 에이전트 또는 파이프라인 필요 없음). 엔진은 분석을 위해 열 기반 Parquet에 데이터를 씁니다. 검색 가능한 것으로 구성된 필드의 경우 Lucene 반전 인덱스에도 씁니다. PPL 및 SQL은 벡터화된 엔진을 통해 기본적으로 실행됩니다. 전체 텍스트 검색 조건자는 반전된 인덱스에서 실행되며 단일 문에서 분석과 결합할 수 있습니다.

쿼리는 조정자 노드(계획 및 병합)와 데이터 노드(실행 및 저장)를 통해 흐릅니다. 코디네이터는 쿼리를 구문 분석하고 최적화한 다음 조각을 데이터 노드로 예약합니다. 각 데이터 노드에서 분석 작업은 DataFusion 엔진에서 실행되고 검색 작업은 Lucene 엔진에서 실행됩니다. 두 쿼리는 중간 쿼리를 전달할 수 있으므로 로그 콘텐츠를 검색하고 결과를 집계하는 쿼리는 추가 왕복 없이 실행됩니다.

리전 가용성

로그 분석에 최적화된 Amazon OpenSearch Service는 다음에서 사용할 수 있습니다. AWS 리전

  • 미국 동부(버지니아 북부) – us-east-1

  • 미국 동부(오하이오) – us-east-2

  • 미국 서부(오리건) – us-west-2

  • 캐나다(중부) – ca-central-1

  • 아시아 태평양(뭄바이)

  • 아시아 태평양(싱가포르)

  • 아시아 태평양(시드니)

  • 아시아 태평양(도쿄)

  • 유럽(프랑크푸르트)

  • 유럽(아일랜드)

  • 유럽(런던)

  • 유럽(스페인)