View a markdown version of this page

사용자 지정 쿼리 자습서 - Amazon Textract

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

사용자 지정 쿼리 자습서

이 자습서에서는 어댑터를 생성, 훈련, 평가, 사용 및 관리하는 방법을 보여줍니다.

어댑터를 사용하면 Amazon Textract API 작업의 정확도를 개선하여 자체 요구 사항 및 사용 사례에 맞게 모델의 동작을 사용자 지정할 수 있습니다. 이 자습서를 사용하여 어댑터를 생성한 후 AnalyzeDocument API 작업으로 자체 문서를 분석할 때 이를 사용하고 향후 개선을 위해 어댑터를 재학습할 수도 있습니다.

이 자습서에서는 다음을 수행하는 방법을 알아봅니다.

  • 를 사용하여 어댑터를 생성합니다 AWS Management Console.

  • 어댑터 훈련을 위한 데이터 세트를 생성합니다.

  • 훈련 데이터에 주석을 추가합니다.

  • 훈련 데이터 세트에서 어댑터를 훈련합니다.

  • 어댑터의 성능을 검토합니다.

  • 어댑터를 재학습합니다.

  • 문서 분석에 어댑터를 사용합니다.

  • 어댑터를 삭제합니다.

사전 조건

시작하기 전에를 읽는 것이 좋습니다어댑터 생성.

또한 AWS 계정을 설정하고 AWS SDK를 설치 및 구성해야 합니다. SDK 설정 지침은 섹션을 참조하세요2단계: AWS CLI 및 AWS SDKs 설정.

어댑터 생성

어댑터를 훈련하거나 사용하려면 먼저 어댑터를 생성해야 합니다. 어댑터를 생성하려면:

  1. 에 로그인 AWS Management Console 하고 Amazon Textract 콘솔을 엽니다.

  2. 왼쪽 창에서 사용자 지정 쿼리를 선택합니다. Amazon Textract 사용자 지정 쿼리 랜딩 페이지가 표시됩니다.

    어댑터 생성, 샘플 업로드, 레이블 지정, 모델 훈련, 성능 지표 확인과 같은 이점과 워크플로 단계를 보여주는 아이콘과 함께 비즈니스 문서의 정보 추출 정확도를 개선하기 위한 Amazon Textract Custom Queries 기능을 보여주는 셀프 서비스 인터페이스입니다.
  3. 사용자 지정 쿼리 랜딩 페이지에는 모든 어댑터 목록이 표시되며 어댑터를 생성하는 버튼도 있습니다. 어댑터 생성을 선택하여 어댑터를 생성합니다. 월별로 수행할 수 있는 성공적인 훈련 수는 AWS 계정별로 제한됩니다. 제한에 대한 자세한 내용은 섹션을 참조Amazon Textract에서 할당량 설정하세요.

    어댑터 목록이 비어 있고 "어댑터 없음" 메시지와 "어댑터 생성" 버튼이 표시됩니다.
  4. 다음 페이지에서 어댑터 이름을 입력하고 어댑터를 자동으로 업데이트할지 여부를 선택한 다음 선택적으로 어댑터에 태그를 추가합니다. 그런 다음 어댑터 생성을 선택합니다. '자동 업데이트'를 선택하면 Amazon Textract는 사전 훈련된 쿼리 기능이 업데이트될 때 어댑터를 자동으로 업데이트합니다.

어댑터를 생성한 후에는 어댑터 이름 및 어댑터 ID를 포함하여 해당 어댑터에 대한 세부 정보를 볼 수 있습니다. 이러한 세부 정보가 있으면 어댑터가 성공적으로 생성되었는지 확인합니다.

이제 어댑터를 훈련하고 테스트하는 데 사용할 데이터 세트를 생성할 수 있습니다.

데이터 세트 생성

이 단계에서는 로컬 컴퓨터 또는 Amazon S3 버킷에서 이미지를 업로드하여 훈련 데이터 세트와 테스트 데이터 세트를 생성합니다. 데이터 세트에 대한 자세한 내용은 섹션을 참조하세요. 텍스트 감지 훈련 및 테스트 데이터 세트 준비

로컬 컴퓨터에서 이미지를 업로드할 때 한 번에 최대 30개의 이미지를 업로드할 수 있습니다. 업로드할 이미지가 많은 경우 Amazon S3 버킷에서 이미지를 가져와 데이터 세트를 생성하는 것이 좋습니다.

  1. 데이터 세트 생성을 시작하려면 어댑터 목록에서 어댑터를 선택한 다음 데이터 세트 생성을 선택합니다.

    데이터세트 생성, 쿼리, 문서 확인, 어댑터 훈련, 성능 지표 확인, 어댑터 개선 단계를 보여주는 my-test-adapter의 사용자 지정 쿼리 추출 페이지입니다.
  2. 데이터 세트 구성 섹션에서 수동 분할 또는 자동 분할을 선택합니다. 수동 분할을 사용하면 훈련 및 테스트 데이터 세트의 일부로 개별 이미지를 지정할 수 있습니다. Autosplit을 선택하면 모든 이미지를 업로드할 때 훈련 및 테스트 세트가 자동으로 정의됩니다. 어댑터를 처음 훈련하는 사람에게는 수동 분할이 권장됩니다. 이제 Autosplit을 선택합니다.

    Amazon Textract용 데이터 세트를 생성하는 옵션을 보여주는 인터페이스 - 훈련 및 테스트 세트를 직접 제공하기 위한 수동 분할 또는 Textract가 훈련 및 테스트 세트로 자동 분할되도록 하기 위한 자동 분할. S3 버킷 또는 로컬 파일에서 문서를 가져옵니다.
  3. 훈련 데이터 세트 세부 정보 섹션에서 컴퓨터에서 문서 업로드 또는 S3 버킷에서 문서 가져오기를 선택할 수 있습니다. Amazon S3 버킷에서 문서를 가져오려는 경우 훈련 이미지가 포함된 버킷과 폴더의 경로를 제공하세요. 컴퓨터에서 직접 문서를 업로드하는 경우 한 번에 30개의 문서만 업로드할 수 있습니다. 이 자습서에서는 컴퓨터에서 문서 업로드를 선택합니다.

  4. 데이터 세트 세부 정보 테스트 섹션에서 컴퓨터에서 문서 업로드 또는 S3 버킷에서 문서 가져오기를 선택할 수 있습니다. 이 자습서에서는 컴퓨터에서 문서 업로드를 선택합니다.

  5. 데이터 세트 생성을 선택합니다.

  6. 데이터 세트를 생성한 후 데이터 세트 세부 정보 페이지로 이동합니다. 데이터 세트 세부 정보 페이지에는 전체 데이터 세트의 모든 문서 목록과 문서가 할당된 데이터 세트(훈련 또는 테스트)의 일부가 표시됩니다. 에 할당된 데이터 세트 열에서 이를 확인합니다. 다음을 볼 수도 있습니다.

    • 문서 이름

    • 문서 상태

    • 문서의 페이지 수

    • 문서 유형

    • 문서 크기

    • 문서가 훈련 세트 또는 테스트 세트의 일부인 경우

  7. 데이터세트에 문서 추가를 선택하고 훈련 데이터세트와 테스트 데이터세트 모두에 최소 5개의 문서를 추가합니다. 이전에 Autosplit을 선택한 경우 모든 문서를 한 번에 추가할 수 있습니다.

  8. 데이터 세트에 문서를 더 추가하려면 문서 추가 메뉴를 사용하여 추가합니다.

어댑터 훈련을 시작하려면 먼저 쿼리를 사용하여 훈련 문서에 주석을 달아야 합니다. 이는 매니페스트 파일의 "annotations-ref" 항목을 생성하는 데 필요합니다. 훈련 또는 테스트 세트에 모든 문서를 추가한 후 주석 프로세스를 시작할 수 있습니다.

주석 및 확인

이 단계에서는 훈련 및 테스트 데이터 세트에 업로드한 각 문서에 쿼리와 레이블을 할당합니다. AWS Management Console 주석 도구를 사용하여 쿼리를 문서 페이지의 관련 답변에 연결합니다.

문서에 쿼리와 답변을 할당하려면:

  1. 어댑터 랜딩 페이지에서 쿼리 생성을 선택합니다.

    문서에 자동 주석을 달려면 "쿼리 생성" 버튼을 선택하여 Textract의 사전 훈련된 모델에서 사용할 쿼리를 생성합니다.
  2. 텍스트 상자에 쿼리를 입력하여 쿼리를 추가합니다.

    Amazon Textract에서 쿼리를 생성하기 위한 인터페이스로, "Textract가 필요한 정보를 추출하는 데 사용할 수 있는 쿼리 지정"이라는 텍스트 상자가 있습니다. 표시된 예제 쿼리는 "체크 금액은 얼마입니까?"입니다.
  3. 쿼리를 더 추가하려면 새 쿼리 추가를 선택합니다. 쿼리에는 '원시 텍스트' 응답 또는 '이진 - 예/아니요' 응답이 있을 수 있습니다. 이진 응답으로 쿼리를 생성하려면 고급 설정을 사용합니다.

    문서 파일에 텍스트 추출 쿼리를 생성하기 위한 인터페이스입니다. 각 쿼리 프롬프트에 원시 텍스트 또는 이진(예/아니요) 응답 유형을 지정할 수 있습니다. 인터페이스에는 쿼리 텍스트를 입력하고, 응답 유형을 선택하고, 새 쿼리를 추가하기 위한 필드가 있습니다.
  4. 쿼리를 생성한 후에는 문서에 레이블을 할당해야 합니다. 문서에 대한 레이블을 설정하려면 자동 레이블 지정 또는 수동 레이블 지정을 선택합니다. 어댑터를 처음 훈련할 때는 자동 레이블 지정을 사용하는 것이 좋습니다. 자동 레이블 지정 옵션을 선택한 다음 자동 레이블 지정 시작을 선택합니다.

    권장 배지 및 자동 레이블 지정 시작 버튼을 사용하여 자동 레이블 지정 옵션을 선택합니다.
  5. 자동 레이블 지정 프로세스를 완료하는 데 다소 시간이 걸립니다. 완료되면 "Auto-labeling is now completed"라는 메시지가 표시됩니다. 레이블 지정 프로세스가 완료되면 레이블 지정의 정확성을 확인해야 합니다. 세부 정보 페이지의 어댑터 세부 정보 패널에서 문서 확인을 선택한 다음 데이터 세트 페이지에서 검토 시작을 선택합니다.

    훈련 세트에 10개, 테스트 세트에 6개가 포함된 총 16개의 문서를 보여주는 데이터 세트 분할 개요입니다. 잘못된 파일이 없습니다. 상태는 데이터 세트를 검토할 준비가 되었음을 나타냅니다.
  6. 주석 도구에서 개별 문서를 선택하고 해당 문서 내의 개별 페이지를 볼 수 있습니다. “응답 검토” 섹션에서 문서 페이지에 할당된 쿼리를 선택합니다. 쿼리에 대한 답변이 잘못된 경우 쿼리의 편집 버튼을 클릭하여 응답을 편집할 수 있습니다.

    고객 이름 John Doe의 예제와 분할 상환 유형을 입력하라는 메시지가 표시된 응답 검토 화면입니다. 적용 및 취소 버튼이 포함됩니다.

    예/아니요 응답이 있는 쿼리의 경우 예, 아니요 또는 비어 있음을 선택합니다. 그런 다음 적용을 선택합니다.

    쿼리에 할당된 레이블의 OCR을 편집할 때 제공된 응답을 선택한 다음 문서 이미지의 일부 주위에 경계 상자를 그립니다. 이렇게 하려면 주석 도구 하단의 도구 모음에 있는 “B” 바로 가기 키 또는 경계 상자 도구를 사용합니다. 그런 다음 적용을 선택합니다.

    쿼리에 둘 이상의 응답 요소(응답)가 있어야 하는 경우 응답을 추가할 수 있습니다. 이렇게 하려면 쿼리를 선택한 다음 응답 추가를 선택합니다. 그런 다음 답변이 있는 문서 영역에 경계 상자를 그리라는 메시지가 표시됩니다. 경계 상자의 레이블이 올바른지 확인합니다.

    문서 페이지에 새 쿼리를 추가하려면 쿼리 추가를 선택합니다. 쿼리를 추가하는 경우 추가할 쿼리를 지정한 다음 쿼리 레이블의 경계 상자를 그려야 합니다.

    완료되면 제출 및 다음을 선택하여 다음 문서와 다음 쿼리 및 응답 세트로 이동합니다. 모든 쿼리와 응답을 검토할 때까지 반복합니다.

    모든 쿼리와 응답을 검토하고 평가한 후 제출 및 닫기를 선택합니다.

학습

훈련 세트 또는 테스트 세트에 모든 문서를 추가하고 쿼리에 대해 생성된 응답을 검토한 후 어댑터를 훈련할 수 있습니다.

유효하지 않은 파일이 없는 총 문서 16개, 훈련 세트 10개, 테스트 세트 6개를 보여주는 Amazon Textract 어댑터 데이터 세트 개요입니다. 데이터 세트 상태는 주석 검토 완료입니다.

어댑터를 훈련하려면:

  1. 먼저 데이터 세트 관리 페이지에서 어댑터 훈련을 클릭합니다.

    "Train adapter" 버튼이 있는 어댑터를 훈련시키기에 충분한 문서가 데이터 세트에 있음을 나타내는 알림입니다.
  2. 훈련 프로세스를 시작하는 동안 어댑터 훈련 작업의 출력이 포함된 Amazon S3 버킷을 지정할 수 있습니다. 아직 존재하지 않는 Amazon S3 버킷 위치를 지정하면 버킷 경로가 생성됩니다. 어댑터에 태그를 추가하여 추적하고 암호화 설정을 사용자 지정할 수도 있습니다. 필요에 맞게 어댑터 훈련을 사용자 지정한 다음 어댑터 훈련을 선택합니다.

  3. 다음 페이지에서 어댑터 훈련을 선택하여 훈련 프로세스를 시작할지 확인합니다. 그러면 어댑터의 첫 번째 버전이 생성됩니다.

훈련 프로세스가 시작된 후 어댑터 랜딩 페이지에서 훈련 프로세스 상태를 모니터링할 수 있습니다.

훈련 프로세스가 완료되면 알림을 받습니다. 그런 다음 지표를 검사하여 어댑터의 성능을 평가할 수 있습니다.

어댑터 성능 평가

모델 성능을 평가하려면 왼쪽 탐색 창을 사용하여 평가할 어댑터 버전을 선택합니다.

F1 점수, 정밀도 및 리콜을 모두 94.4%로 보여주는 어댑터 성능 지표입니다.

어댑터의 지표를 검사하여 데이터세트의 문서와 정의한 쿼리에서 어댑터가 어떻게 작동하는지 확인할 수 있습니다. 쿼리, 문서 및 페이지와 같은 훈련 데이터의 다양한 요소에서 어댑터에 대한 F1 점수, 정밀도 및 재현율을 확인할 수 있습니다. 이러한 요소의 성능을 전환하려면 지표 표시 창 아래의 다른 탭을 선택합니다.

기준 지표로 전환 스위치를 전환하여 언제든지 기준 지표를 볼 수도 있습니다.

어댑터 버전 성능 요약에는 어댑터 성능을 개선하는 방법에 대한 몇 가지 팁도 포함되어 있습니다. 언제든지 이러한 팁을 검토하여 어댑터를 개선할 수 있습니다. 어댑터를 관리하고 개선하는 방법에 대한 자세한 내용은 섹션을 참조하세요어댑터 평가 및 개선.

어댑터를 데모하고 문서에서 성능을 보려면:

  1. 어댑터 사용해보기를 선택합니다.

    어댑터 버튼 및 버전 1 드롭다운 메뉴를 사용해 보세요.
  2. 어댑터 사용해 보기 페이지에서 어댑터로 분석할 문서를 선택할 수 있습니다. 문서 선택 버튼을 선택하고 디바이스에서 문서 위치로 이동합니다. 또는 문서를 문서 업로드 창으로 끌어다 놓습니다.

문서를 업로드한 후 어댑터 사용해 보기 페이지가 업데이트되어 쿼리, 쿼리 답변 및 신뢰도 수준을 포함한 어댑터 분석 결과가 표시됩니다. 어댑터의 성능이 만족스러우면 AnalyzeDocument 또는 StartDocumentAnalysis 호출에서 어댑터를 사용하여 추론을 진행할 수 있습니다. 그렇지 않으면 추가 문서로 어댑터를 재학습하여 어댑터의 성능을 개선할 수 있습니다.

어댑터 개선

어댑터의 성능을 개선하려면:

  1. 어댑터 세부 정보 페이지에서 데이터 세트 수정을 선택합니다.

    텍스트 추출을 위한 사용자 지정 데이터 세트를 생성, 확인, 훈련 및 개선하는 단계를 보여주는 워크플로 다이어그램: 1. 데이터 세트를 생성합니다. 2. 쿼리 생성, 3. 문서 확인, 4. 어댑터 훈련, 5. 성능 지표 확인, 6. 어댑터를 개선합니다.
  2. 데이터 세트 개요 페이지에서 문서 추가를 선택합니다. 어댑터를 재학습하려면 훈련 데이터 세트에 문서를 5개 이상 추가합니다.

  3. 문서가 데이터 세트에 추가되었다는 알림을 받습니다. 검토 시작을 선택하여 자동 레이블 지정 프로세스의 결과를 검토합니다.

  4. 쿼리와 응답을 검토합니다. 추가한 문서에 대한 모든 주석을 검토하고 승인한 후 제출 및 닫기를 선택합니다.

  5. 데이터 세트 관리 페이지에서 어댑터 훈련을 선택하여 새 훈련 문서를 포함하여 훈련 데이터 세트의 모든 데이터에 대한 어댑터 훈련을 시작합니다.

실행하는 모든 훈련 작업은 새 버전의 어댑터를 생성합니다. 새 어댑터 버전의 이름을 기록하여 적절한 어댑터 버전의 성능을 평가하고 있는지 확인합니다.

Inference

어댑터를 생성한 후 사용자 지정 어댑터의 ID가 제공됩니다. 동기식 문서 분석을 위해 AnalyzeDocument 작업에이 ID를 제공하거나 비동기식 분석을 위해 StartDocumentAnalysis 작업에이 ID를 제공할 수 있습니다.

어댑터 ID를 제공하면 어댑터가 분석 프로세스에 자동으로 통합되고 이를 사용하여 문서에 대한 예측을 개선합니다. 이렇게 하면 AnalyzeDocument의 기능을 활용하면서 필요에 맞게 사용자 지정할 수 있습니다.

어댑터 및 AnalyzeDocument API 작업을 사용하여 추론을 실행하는 방법의 예는 섹션을 참조하세요Amazon Textract로 문서 텍스트 분석.

동일한 문서의 여러 페이지에 여러 어댑터를 적용해야 하는 경우 API 요청의 일부로 하나 이상의 어댑터(들)와 해당 어댑터 버전을 지정할 수 있습니다. 페이지 파라미터를 사용하여 어댑터를 적용할 페이지를 지정할 수 있습니다.

다음 사항에 유의하세요.

이는 쿼리의 Page 파라미터가 작동하는 방식과 유사합니다. 다음 사항에 유의하세요.

  • 페이지가 지정되지 않은 경우 ["1"] 기본적으로 로 설정됩니다.

  • 파라미터 문자열에 유효한 문자는 입니다1 2 3 4 5 6 7 8 9 - *. 공백은 유효하지 않습니다.

  • *를 사용하여 모든 페이지를 표시할 때는 목록의 유일한 요소여야 합니다.

  • Page 파라미터는 어댑터 간에 겹치지 않습니다. 페이지에는 어댑터가 하나만 적용될 수 있습니다.

어댑터 관리

다음 단계는 (어댑터의 초기 훈련 후) 반복적으로 반복됩니다.

  • Amazon Textract 콘솔의 어댑터 세부 정보 페이지에서 데이터 세트 수정을 선택합니다.

  • 문서 추가를 선택합니다.

  • 훈련 데이터 세트에 문서를 5개 이상 추가하여 어댑터를 재훈련합니다.

  • 문서가 데이터 세트에 추가되었다는 알림을 받습니다. 검토 시작을 선택하여 자동 레이블 지정 프로세스의 결과를 검토합니다.

  • 쿼리와 응답을 검토합니다. 새 문서에 대한 모든 주석을 검토하고 승인한 후 어댑터 훈련을 선택합니다.

  • 어댑터가 새 훈련 라운드를 완료할 때까지 기다린 다음 새 어댑터 버전의 성능 지표를 확인합니다.

모델을 목표 성능 수준으로 훈련한 후 애플리케이션에서 추론에 어댑터를 사용할 수 있습니다.

더 이상 필요하지 않은 어댑터 버전을 삭제해야 합니다. 어댑터를 삭제하려면:

  • 어댑터 랜딩 페이지로 이동하여 어댑터를 선택하고 삭제를 선택합니다.

  • 텍스트 상자에 삭제를 입력한 다음 삭제를 선택합니다.