View a markdown version of this page

Preparando dados para CPT no Amazon Nova 2 - Amazon Nova

Preparando dados para CPT no Amazon Nova 2

O CPT no Amazon Nova 2 treina em texto bruto para ajudar o modelo a adquirir um conhecimento mais profundo de domínios, terminologia e padrões de escrita específicos. Esta página descreve o formato dos dados, os recursos compatíveis, as restrições e as melhores práticas para preparar dados de treinamento de CPT para os modelos Amazon Nova 2.

dica

Para validar o formato do conjunto de dados antes de iniciar uma tarefa de treinamento, consulte Ferramentas de validação.

Formato de dados

Os conjuntos de dados de treinamento e validação do CPT devem ser arquivos JSONL em que cada linha é um objeto JSON contendo um único campo text com um valor de string. As entradas de texto devem ter um conteúdo de alta qualidade que flua naturalmente e represente seu domínio de destino.

Obrigatório. Uma string contendo o conteúdo de treinamento deste exemplo.

{"text": "training content"}
nota

Ao usar o datamixing, execute a primeira tarefa com max_steps=2. Isso ajudará a criar otimizações no cluster para acesso aos dados e a validar se todos os datamixes estão disponíveis.

Exemplos de entrada

A seguir, é mostrado um conjunto de dados CPT JSONL básico com várias amostras de texto:

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Recursos compatíveis

A tabela a seguir resume o suporte de recursos para CPT no Amazon Nova 2.

Suporte a recursos do CPT
Recurso CPT no Amazon Nova 2
Compreensão de texto Compatível com Nova 2.0 Lite. Consulte Compreensão geral/de texto.
Compreensão de imagens Não compatível
Compreensão de vídeos Não compatível
Compreensão do documento Não compatível
Chamada de ferramentas Não compatível
Reasoning Não compatível

Compreensão geral/de texto

Esta seção resume as restrições gerais e as melhores práticas para preparar os dados de treinamento de CPT no Amazon Nova 2.

Restrições

Restrições gerais de conjunto de dados
Restrição Detalhes
Formato dos conjuntos de dados JSONL (um objeto JSON por linha) com um campo de string text.
Modalidades oferecidas Somente texto
Volume de dados recomendado Dezenas de bilhões de tokens de conteúdo específico de domínio para obter os melhores resultados.

Práticas recomendadas

  • Use conteúdo de alta qualidade e fluido que represente seu domínio de destino.

  • A qualidade dos dados de treinamento é o fator determinante mais importante para o sucesso do pré-treinamento contínuo. Embora os dados de CPT sejam frequentemente descritos como "não rotulados", a forma como os dados são estruturados, formatados e apresentados determina se o modelo vai adquirir o conhecimento e as habilidades necessárias para o caso de uso do negócio.

  • Após o CPT, planeje executar ajustes adicionais de instruções (SFT ou RFT) para que o modelo possa usar o conhecimento recém-adquirido para concluir tarefas úteis.

Exemplo de entrada

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Preparação de conjuntos de dados empresariais estruturados para CPT

A maioria das empresas possui repositórios robustos de dados estruturados: catálogos de produtos, perfis de usuários, logs de transações, envios de formulários, chamadas de API e metadados operacionais. À primeira vista, isso parece ser muito diferente em relação aos textos não estruturados da web, comumente utilizados no pré-treinamento padrão.

Para aprender de forma eficaz com dados empresariais estruturados, pense cuidadosamente nas tarefas downstream e projete a apresentação dos dados para forçar o modelo a aprender as relações preditivas corretas.

Para o aproveitamento total do potencial do pré-treinamento contínuo, considere:

  • Quais tarefas o modelo deve realizar no momento da inferência

  • Quais informações estão presentes nos dados brutos

  • Como estruturar esses dados para que o modelo aprenda a extrair e manipular as informações corretamente

Simplesmente despejar dados estruturados no treinamento não ensinará o modelo a raciocinar sobre isso. Molde ativamente a apresentação dos dados para orientar o que o modelo aprende.

Dados estruturados para o CPT na literatura

O CPT pode incluir fatos de domínio no modelo, mas geralmente falha em tornar esses fatos recuperáveis e manipuláveis quando as entradas ou tarefas mudam. Experimentos controlados mostram que, sem um aumento diverso durante o pré-treinamento, os modelos memorizam fatos de maneiras frágeis que permanecem difíceis de extrair mesmo após o ajuste posterior das instruções, e recomendam injetar sinais semelhantes a instruções no início do treinamento. Para dados semiestruturados, a serialização randomizada e outros aumentos reduzem o sobreajuste do esquema, e é por isso que o CPT deve ser intercalado com tarefas de estilo de instrução em vez de ser executado primeiro e o IFT depois. Trabalhos com foco em finanças indicam que a combinação conjunta de dados de CPT e de instrução no momento do lote promove a melhoria da generalização e a redução do esquecimento em comparação ao método sequencial. O relatório técnico da Qwen converge para o mesmo padrão ao integrar dados de instrução de alta qualidade ao próprio pré-treinamento, o que aumenta o aprendizado contextual e preserva o acompanhamento das instruções enquanto adquire novos conhecimentos de domínio.

O aumento de dados para corpora semiestruturadas é uma alavanca fundamental. O CPT com reconhecimento de gráficos sintéticos expande pequenos conjuntos de domínios em corpora vinculados a entidades que ensinam explicitamente relações e compostos com recuperação em tempo de inferência. A combinação conjunta de CPT e instruções apresenta desempenho superior a pipelines sequenciais em finanças, e o equilíbrio entre dados de domínio e dados gerais promove a redução da degradação de habilidades gerais. O CPT de domínio de altíssima escala também pode manter uma ampla capacidade e até mesmo permitir compensações por meio da mesclagem de modelos, mas ainda aponta o ajuste de instruções como uma próxima etapa essencial, reforçando o valor da introdução de sinais de instrução durante o CPT.

Injeção de diversidade por meio de randomização e embaralhamento

Uma estratégia geral que ajuda a ensinar o modelo de forma eficaz dos conjuntos de dados estruturados e semiestruturados é alterar a ordem dos campos nos conjuntos de dados e também excluir de forma randomizada algumas chaves.

Embaralhar os campos força o modelo a ler o que cada valor significa em vez de onde ele aparece e a aprender as relações entre todos os campos. Por exemplo, no caso de um videogame publicado na loja da Amazon, em que “Título”, “Plataforma”, “Preço”, “Condição” e “Edição” apresentam ordens variadas, o modelo fica impedido de utilizar a dependência posicional, como a suposição de que a “terceira posição corresponde à plataforma”; ele deve vincular rótulos a valores e aprender as relações bilaterais entre atributos: título ⇄ plataforma, plataforma ⇄ preço, condição ⇄ preço. Assim, ele pode, por exemplo, inferir uma plataforma provável do nome de um jogo e de um preço observado, ou estimar uma faixa de preço plausível considerando um título e uma plataforma.

O descarte randomizado de chaves durante a serialização atua como um descarte de recursos: evita a coadaptação em qualquer campo e força o modelo a recuperar as informações perdidas das evidências restantes. Se “Plataforma” estiver ausente, o modelo deverá retirá-la da string de título ou do texto de compatibilidade; se “Preço” estiver oculto, ele deverá triangular da plataforma, edição e condição. Essa abordagem cria simetria (A → B e B → A), robustez diante de listagens confusas do mundo real e invariância de esquema quando os campos estão ausentes, renomeados ou reordenados.

Um exemplo de estilo de compra torna isso concreto. Serialize o mesmo item de várias maneiras (“Título: ‘Elden Ring’ | Plataforma: PlayStation 5 | Condição: Usado - Como novo | Preço: USD 34,99” e uma permutação como “Preço: USD 34,99 | Título: ‘Elden Ring’ | Condição: Usado - Como novo | Plataforma: PlayStation 5”) e, em certas iterações, omita “Plataforma” deixando “Compatível com PS5” na descrição. Treine objetivos complementares, como predição da plataforma de {title, price} e estimativa de um bucket de preços de {title, platform}. Como a ordem e até mesmo a presença das chaves variam, a única estratégia estável é aprender as verdadeiras relações entre os atributos em vez de memorizar um modelo.

A forma como os dados são apresentados é importante

O aprendizado de LLMs ocorre por meio da predição do próximo token com base no conteúdo previamente processado. A ordem dos campos e eventos mostrados durante o treinamento decide o que o modelo pode aprender. Se o formato do treinamento corresponder à tarefa real, a perda incidirá sobre os tokens de decisão exatos. Se os campos forem agrupados sem estrutura, o modelo aprenderá atalhos ou memorizará a popularidade e, em seguida, falhará quando solicitado a escolher entre as opções.

Mostre primeiro a situação, depois as opções e então a decisão. Se o modelo também precisar aprender sobre resultados ou explicações, coloque-os após a decisão.

Exemplos de empacotamento de dados para o CPT

O que é empacotamento de dados?

Empacotar significa preencher cada janela de sequência nos dados de treinamento com vários exemplos completos para que a janela fique densa com tokens reais, não com preenchimento.

Por que isso importa?

Durante o treinamento, um tamanho máximo de contexto é definido, por exemplo, 8.192 tokens. Os lotes são moldados para [tamanho do lote × extensão do contexto]. Se um exemplo de treinamento for menor que a extensão do contexto, as posições restantes serão preenchidas. O preenchimento mantém a execução via kernels de atenção e MLP, ainda que haja o mascaramento da função de perda, então a computação é paga por tokens que não transmitem nenhum sinal de aprendizado.

Como realizar o empacotamento?

Para empacotar várias amostras, concatene vários exemplos de treinamento com um separador [DOC] entre eles (observe o espaço antes e depois de [DOC]) de forma que a extensão total permaneça dentro da extensão de contexto desejada.

Um exemplo de documento empacotado seria assim:

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}