기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
어댑터 평가 및 개선
훈련 프로세스를 완료하고 어댑터를 생성한 후에는 어댑터가 문서에서 정보를 얼마나 잘 추출하는지 평가하는 것이 중요합니다.
성능 지표
Amazon Textract 콘솔에는 어댑터의 성능을 분석하는 데 도움이 되는 세 가지 지표가 제공됩니다.
-
정밀도 - 정밀도는 정확한 추출된 정보(예측)의 비율을 측정합니다. 정밀도 등급이 높을수록 거짓 긍정이 줄어듭니다.
-
리콜 - 리콜은 모델에서 성공적으로 식별되고 추출된 총 관련 항목의 비율을 측정합니다. 재현율 값이 높을수록 거짓 부정이 적은 것입니다.
-
F1 점수 - F1 점수는 정밀도와 재현율을 단일 지표로 결합하여 전체 추출 정확도에 대한 균형 잡힌 측정을 제공합니다.
이러한 측정 값의 범위는 0~1이며, 1은 완벽한 추출입니다.
이러한 지표는 어댑터에서 추출한 결과를 테스트 세트의 “실측 정보”와 비교하여 계산됩니다. F1, 정밀도 및 재현율을 분석하여 어댑터를 개선해야 하는 위치를 결정할 수 있습니다.
예를 들어 정밀도가 낮으면 모델의 많은 예측이 거짓 긍정이므로 어댑터가 관련 없는 데이터를 추출하고 있음을 의미합니다. 반면 재현율 값이 낮으면 모델이 관련 데이터를 누락한 것입니다. 이러한 인사이트를 사용하여 훈련 데이터를 구체화하고 어댑터를 재훈련하여 성능을 높일 수 있습니다.
지정한 새 문서 및 쿼리로 모델을 테스트하여 모델의 성능을 확인할 수도 있습니다. 콘솔에서 어댑터 사용해 보기 옵션을 사용하여 이러한 문서에 대한 예측을 가져옵니다. 이렇게 하면 자체 테스트 쿼리 및 문서로 어댑터를 평가하고 어댑터의 성능에 대한 실제 예제를 볼 수 있습니다.
SDK 또는 CLI를 사용하여 GetAdapterVersion 작업을 사용하여 어댑터 버전에 대한 지표를 검색할 수도 있습니다. ListAdapterVersions API 작업을 사용하여 지표를 검색하려는 어댑터 목록을 가져옵니다. DeleteAdapterVersion 작업을 사용하여 더 이상 필요하지 않은 어댑터를 삭제합니다.
모델 개선
어댑터 배포는 반복 프로세스입니다. 목표 정확도 수준에 도달하기 위해 여러 번 재학습해야 할 수 있기 때문입니다. 어댑터를 생성하고 훈련한 후에는 다양한 지표 및 쿼리에서 어댑터의 성능을 테스트하고 평가하는 것이 좋습니다.
어댑터의 정확도가 특정 영역에서 부족한 경우 해당 문서의 새 예제를 추가하여 해당 쿼리에 대한 어댑터의 성능을 높입니다. 어댑터에 문제가 발생한 사례를 반영하는 다양한 추가 예제를 제공하세요. 어댑터에 다양한 대표 문서를 제공하면 다양한 실제 예제를 처리할 수 있습니다.
훈련 세트에 새 문서를 추가한 후 어댑터를 다시 훈련합니다. 그런 다음 테스트 세트 및 쿼리를 다시 평가합니다. 어댑터가 원하는 성능 수준에 도달할 때까지 이 프로세스를 반복합니다. 정밀도, 재현율 및 F1 점수는 연속 훈련 반복에 비해 점진적으로 개선되어야 합니다.