View a markdown version of this page

CPT on Amazon Nova 2용 데이터 준비하기 - Amazon Nova

CPT on Amazon Nova 2용 데이터 준비하기

CPT on Amazon Nova 2는 원시 텍스트를 학습하여 모델이 특정 도메인, 용어 및 쓰기 패턴에 대한 심층적인 지식을 얻는 데 도움을 줍니다. 이 페이지에서는 Amazon Nova 2 모델의 CPT 훈련 데이터를 준비하는 것과 관련하여 데이터 형식, 지원되는 기능, 제약 조건, 모범 사례를 설명합니다.

작은 정보

훈련 작업을 시작하기 전에 데이터세트 형식을 검증하려면 검증 도구 섹션을 참조하세요.

데이터 형식

CPT 훈련 및 검증 데이터세트는 각각의 줄이 문자열 값이 있는 단일 text 필드를 포함한 JSON 객체인 JSONL 파일이어야 합니다. 텍스트 항목에는 대상 도메인을 잘 나타내는, 자연스럽게 흐르는 고품질의 콘텐츠가 포함되어야 합니다.

필수 사항입니다. 이 예의 훈련 콘텐츠가 포함된 문자열입니다.

{"text": "training content"}
참고

데이터 혼합을 사용하는 경우 max_steps=2를 사용하여 첫 번째 작업을 실행합니다. 그러면 클러스터에서 데이터 액세스에 대한 최적화를 생성하고 모든 데이터 혼합을 사용할 수 있는지 검증할 수 있습니다.

샘플 입력

다음은 여러 텍스트 샘플이 포함된 기본 CPT JSONL 데이터세트의 예입니다.

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

지원되는 기능

다음 표에는 CPT on Amazon Nova 2의 기능 지원에 대한 내용이 요약되어 있습니다.

CPT 기능 지원
기능 CPT on Amazon Nova 2
텍스트 이해 Nova 2.0 Lite에서 지원됩니다. 일반/텍스트 이해을(를) 참조하세요.
이미지 이해 지원되지 않음
비디오 이해 지원되지 않음
문서 이해 지원되지 않음
도구 직접 호출 지원되지 않음
추론 지원되지 않음

일반/텍스트 이해

이 섹션에는 CPT on Amazon Nova 2 훈련 데이터를 준비할 때 적용되는 일반적인 제약과 모범 사례가 요약되어 있습니다.

제약 조건

일반 데이터세트 제약 조건
제약 조건 세부 사항
데이터세트 형식 text 문자열 필드가 있는 JSONL(줄당 JSON 객체 1개)입니다.
지원되는 양식 텍스트 전용
권장 데이터 볼륨 최상의 결과를 얻기 위한 도메인별 콘텐츠 토큰 수십억 개.

모범 사례:

  • 대상 도메인을 잘 나타내는, 자연스럽게 흐르는 고품질의 콘텐츠를 사용합니다.

  • 훈련 데이터 품질은 지속적인 사전 훈련의 성공을 위한 가장 중요한 결정적인 요소입니다. CPT 데이터는 흔히 '레이블이 없는' 것으로 설명되지만, 데이터의 구조화, 형식 지정 및 표시 방식에 따라 모델이 비즈니스 사용 사례에 필요한 지식과 기술을 획득하는지가 결정됩니다.

  • CPT 후에는 모델이 새로 획득한 지식을 사용하여 유용한 작업을 완료할 수 있도록 추가적인 명령 튜닝(SFT 또는 RFT) 실행을 계획합니다.

샘플 입력

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

CPT에 대한 구조화된 비즈니스 데이터세트 준비

대부분의 비즈니스는 제품 카탈로그, 사용자 프로필, 트랜잭션 로그, 양식 제출, API 직접 호출, 운영 메타데이터 등 정형 데이터의 풍부한 리포지토리를 보유하고 있습니다. 처음에는 표준 사전 훈련에 일반적으로 사용되는 비정형 웹 텍스트와 매우 다르게 보입니다.

정형 비즈니스 데이터를 효과적으로 학습하려면 다운스트림 태스크에 대해 신중하게 생각하고 모델이 올바른 예측 관계를 학습하도록 데이터 프레젠테이션을 설계합니다.

지속적인 사전 훈련의 잠재력을 최대한 활용하려면 다음을 고려합니다.

  • 추론 시 모델이 수행해야 하는 태스크

  • 원시 데이터에 있는 정보

  • 모델이 정보를 올바르게 추출하고 조작하는 방법을 학습하도록 해당 데이터를 정형화하는 방법

훈련에 정형 데이터를 가져오는 것만으로는 모델에서 해당 데이터로 추론하는 방법을 가르칠 수 없습니다. 모델이 학습하는 내용을 안내하기 위해 데이터 프레젠테이션을 적극적으로 구성합니다.

문헌 자료에서 CPT에 대한 정형 데이터

CPT는 도메인 관련 사실을 모델에 패킹할 수 있지만 이 경우 종종 입력 또는 태스크가 이전될 때 해당 팩트를 검색하고 조작할 수 없습니다. 제어된 실험에 따르면, 사전 훈련 중에 다양한 증강이 없으면 모델이 나중에 지침 조정 후에도 추출하기 어려운 취약한 방식으로 사실을 기억하고 훈련 초기에 신호와 같은 지침을 주입하도록 권장합니다. 반정형 데이터의 경우 무작위 직렬화 및 기타 증강은 스키마 과적합을 줄입니다. 이 때문에 CPT를 먼저 실행하고 나중에 IFT를 실행하는 대신, CPT를 지침 스타일 태스크와 함께 사용해야 합니다. 재무 중심의 업무에서는 배치 시점에 CPT와 지침 데이터를 함께 혼합하면 일반화가 개선되고 순차 레시피에 비해 망각이 줄어듭니다. Qwen 기술 보고서는 고품질 지침 데이터를 사전 훈련 자체에 통합하여 동일한 패턴으로 수렴하므로 컨텍스트 학습이 향상되고 새로운 도메인 지식을 획득하는 동시에 다음 지침을 유지합니다.

반정형 코포라에 대해 데이터 증강이 핵심 요소입니다. 합성 그래프 인식 CPT는 추론 시점에 검색을 통해 관계와 합성물을 명시적으로 가르치는 엔터티 연결 코포라로 작은 도메인 세트를 확장합니다. 공동 CPT와 지침을 혼합하면 재무 분야에서 순차 파이프라인보다 뛰어난 성능을 제공하고, 일반 데이터와의 도메인 밸런싱을 통해 일반 기술에서 성능 저하를 줄입니다. 또한 대규모 도메인 CPT는 광범위한 기능을 유지하고 모델 병합을 통한 장단점을 허용할 수 있지만, 여전히 지침 조정을 필수적인 다음 단계로 가리켜 CPT 중에 명령 신호를 도입하는 가치를 강화합니다.

무작위화 및 셔플링을 통한 다양성 주입

정형 및 반정형 데이터세트에서 모델을 효과적으로 가르치는 데 도움이 되는 일반적인 전략은 데이터세트의 필드 순서를 셔플링하고 일부 키를 무작위로 삭제하는 것입니다.

필드를 셔플링하면 모델이 표시되는 위치 대신 각 값의 의미를 읽고 모든 필드 간의 관계를 학습합니다. 예를 들어 Amazon Store에 게시된 비디오 게임의 경우 '타이틀', '플랫폼', '가격', '상태', '에디션'이 서로 다른 순열로 도착하면 모델은 '세 번째 슬롯은 플랫폼'에 의존할 수 없습니다. 레이블을 값에 바인딩하고 속성 사이에서 쌍방 관계(제목 ⇄ 플랫폼, 플랫폼 ⇄ 가격, 상태 ⇄ 가격)를 학습해야 합니다. 따라서 예를 들어 게임 이름과 관찰된 가격에서 가능한 플랫폼을 유추하거나 제목과 플랫폼이 주어지면 타당한 가격 범위를 추정할 수 있습니다.

직렬화 중에 키를 무작위로 삭제하는 경우 기능 드롭아웃처럼 작동합니다. 즉, 한 필드에 대한 공동 적응을 방지하고 강제로 모델이 나머지 증거에서 누락된 정보를 복구합니다. '플랫폼'이 없는 경우 모델은 제목 문자열 또는 호환성 텍스트에서 선택해야 합니다. '가격'이 숨겨져 있는 경우 플랫폼, 에디션 및 상태에서 삼각 관계를 활용해야 합니다. 이러한 방식으로 대칭(A→B 및 B→A), 복잡한 실제 목록에 대한 견고성 그리고 필드 누락, 필드 이름 변경 또는 필드 순서 변경 시 스키마 불변성을 구축합니다.

쇼핑 스타일 예시에서 이를 구체적으로 설명합니다. '제목: 'Elden Ring' | 플랫폼: PlayStation 5 | 상태: 중고 - 거의 새 제품 | 가격: $34.99', '가격: $34.99 | 제목: 'Elden Ring' | 상태: 중고 - 거의 새 제품 | 플랫폼: PlayStation 5'와 같은 순열처럼 동일한 항목을 여러 방법으로 직렬화합니다. 그리고 설명에서 'PS5와 호환 가능'을 그대로 두고 일부 방식에서 '플랫폼'을 삭제하여 전달합니다. {title, price}에서 플랫폼 예측 및 {title, platform}에서 가격 버킷 예측과 같은 보완적 목표를 훈련합니다. 키의 순서와 존재도 달라지기 때문에 유일하게 안정적인 전략은 템플릿을 기억하지 않고 속성 간 실제 관계를 학습하는 것입니다.

중요한 데이터 표시 방식

LLM은 이미 확인한 내용을 바탕으로 다음 토큰을 예측하여 학습합니다. 훈련 중에 표시되는 필드 및 이벤트의 순서에 따라 모델이 학습할 수 있는 내용이 결정됩니다. 훈련 형식이 실제 태스크와 일치하면 정확한 의사 결정 토큰에서 손실이 발생합니다. 필드가 구조 없이 함께 전달되는 경우 모델은 바로 가기를 학습하거나 인기도를 기억한 다음 옵션 중에서 선택하라는 메시지가 표시되면 실패합니다.

상황을 먼저 표시한 다음, 옵션과 의사 결정을 순차적으로 표시합니다. 모델이 결과나 설명에 대해서도 알고 있어야 하는 경우 의사 결정 후에 입력합니다.

CPT에 대한 샘플 패킹

패킹이란 무엇인가요?

패킹은 창이 패딩이 아닌 실제 토큰으로 가득 차도록 훈련 데이터의 각 시퀀스 창을 여러 전체 예제로 채우는 것을 의미합니다.

이것이 중요한 이유

훈련 중 최대 컨텍스트 길이(예: 8,192개의 토큰)가 설정됩니다. 배치는 [배치 크기 × 컨텍스트 길이]로 형성됩니다. 훈련 예제가 컨텍스트 길이보다 짧으면 나머지 위치가 채워집니다(패딩). 패딩은 손실이 마스킹된 경우에도 여전히 어텐션과 MLP 커널을 통해 실행되므로 학습 신호를 전달하지 않는 토큰에 대해 컴퓨팅이 소모됩니다.

패킹하는 방법

여러 샘플을 패킹하려면 샘플의 전체 길이가 원하는 컨텍스트 길이 내로 유지되도록 [DOC] 구분 기호를 사이에 두고 여러 훈련 샘플을 연결합니다([DOC] 앞뒤에 공백 포함).

패킹된 문서의 예는 다음과 같습니다.

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}