Preparando dados para CPT no Amazon Nova 2
O CPT no Amazon Nova 2 treina em texto bruto para ajudar o modelo a adquirir um conhecimento mais profundo de domínios, terminologia e padrões de escrita específicos. Esta página descreve o formato dos dados, os recursos compatíveis, as restrições e as melhores práticas para preparar dados de treinamento de CPT para os modelos Amazon Nova 2.
dica
Para validar o formato do conjunto de dados antes de iniciar uma tarefa de treinamento, consulte Ferramentas de validação.
Tópicos
Formato de dados
Os conjuntos de dados de treinamento e validação do CPT devem ser arquivos JSONL em que cada linha é um objeto JSON contendo um único campo text com um valor de string. As entradas de texto devem ter um conteúdo de alta qualidade que flua naturalmente e represente seu domínio de destino.
Obrigatório. Uma string contendo o conteúdo de treinamento deste exemplo.
{"text": "training content"}
nota
Ao usar o datamixing, execute a primeira tarefa com max_steps=2. Isso ajudará a criar otimizações no cluster para acesso aos dados e a validar se todos os datamixes estão disponíveis.
Exemplos de entrada
A seguir, é mostrado um conjunto de dados CPT JSONL básico com várias amostras de texto:
{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}
Recursos compatíveis
A tabela a seguir resume o suporte de recursos para CPT no Amazon Nova 2.
| Recurso | CPT no Amazon Nova 2 |
|---|---|
| Compreensão de texto | Compatível com Nova 2.0 Lite. Consulte Compreensão geral/de texto. |
| Compreensão de imagens | Não compatível |
| Compreensão de vídeos | Não compatível |
| Compreensão do documento | Não compatível |
| Chamada de ferramentas | Não compatível |
| Reasoning | Não compatível |
Compreensão geral/de texto
Esta seção resume as restrições gerais e as melhores práticas para preparar os dados de treinamento de CPT no Amazon Nova 2.
Restrições
| Restrição | Detalhes |
|---|---|
| Formato dos conjuntos de dados | JSONL (um objeto JSON por linha) com um campo de string text. |
| Modalidades oferecidas | Somente texto |
| Volume de dados recomendado | Dezenas de bilhões de tokens de conteúdo específico de domínio para obter os melhores resultados. |
Práticas recomendadas
Use conteúdo de alta qualidade e fluido que represente seu domínio de destino.
A qualidade dos dados de treinamento é o fator determinante mais importante para o sucesso do pré-treinamento contínuo. Embora os dados de CPT sejam frequentemente descritos como "não rotulados", a forma como os dados são estruturados, formatados e apresentados determina se o modelo vai adquirir o conhecimento e as habilidades necessárias para o caso de uso do negócio.
Após o CPT, planeje executar ajustes adicionais de instruções (SFT ou RFT) para que o modelo possa usar o conhecimento recém-adquirido para concluir tarefas úteis.
Exemplo de entrada
{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}
Preparação de conjuntos de dados empresariais estruturados para CPT
A maioria das empresas possui repositórios robustos de dados estruturados: catálogos de produtos, perfis de usuários, logs de transações, envios de formulários, chamadas de API e metadados operacionais. À primeira vista, isso parece ser muito diferente em relação aos textos não estruturados da web, comumente utilizados no pré-treinamento padrão.
Para aprender de forma eficaz com dados empresariais estruturados, pense cuidadosamente nas tarefas downstream e projete a apresentação dos dados para forçar o modelo a aprender as relações preditivas corretas.
Para o aproveitamento total do potencial do pré-treinamento contínuo, considere:
Quais tarefas o modelo deve realizar no momento da inferência
Quais informações estão presentes nos dados brutos
Como estruturar esses dados para que o modelo aprenda a extrair e manipular as informações corretamente
Simplesmente despejar dados estruturados no treinamento não ensinará o modelo a raciocinar sobre isso. Molde ativamente a apresentação dos dados para orientar o que o modelo aprende.
Dados estruturados para o CPT na literatura
O CPT pode incluir fatos de domínio no modelo, mas geralmente falha em tornar esses fatos recuperáveis e manipuláveis quando as entradas ou tarefas mudam. Experimentos controlados mostram que, sem um aumento diverso durante o pré-treinamento, os modelos memorizam fatos de maneiras frágeis que permanecem difíceis de extrair mesmo após o ajuste posterior das instruções, e recomendam injetar sinais semelhantes a instruções no início do treinamento. Para dados semiestruturados, a serialização randomizada e outros aumentos reduzem o sobreajuste do esquema, e é por isso que o CPT deve ser intercalado com tarefas de estilo de instrução em vez de ser executado primeiro e o IFT depois. Trabalhos com foco em finanças indicam que a combinação conjunta de dados de CPT e de instrução no momento do lote promove a melhoria da generalização e a redução do esquecimento em comparação ao método sequencial. O relatório técnico da Qwen converge para o mesmo padrão ao integrar dados de instrução de alta qualidade ao próprio pré-treinamento, o que aumenta o aprendizado contextual e preserva o acompanhamento das instruções enquanto adquire novos conhecimentos de domínio.
O aumento de dados para corpora semiestruturadas é uma alavanca fundamental. O CPT com reconhecimento de gráficos sintéticos expande pequenos conjuntos de domínios em corpora vinculados a entidades que ensinam explicitamente relações e compostos com recuperação em tempo de inferência. A combinação conjunta de CPT e instruções apresenta desempenho superior a pipelines sequenciais em finanças, e o equilíbrio entre dados de domínio e dados gerais promove a redução da degradação de habilidades gerais. O CPT de domínio de altíssima escala também pode manter uma ampla capacidade e até mesmo permitir compensações por meio da mesclagem de modelos, mas ainda aponta o ajuste de instruções como uma próxima etapa essencial, reforçando o valor da introdução de sinais de instrução durante o CPT.
Injeção de diversidade por meio de randomização e embaralhamento
Uma estratégia geral que ajuda a ensinar o modelo de forma eficaz dos conjuntos de dados estruturados e semiestruturados é alterar a ordem dos campos nos conjuntos de dados e também excluir de forma randomizada algumas chaves.
Embaralhar os campos força o modelo a ler o que cada valor significa em vez de onde ele aparece e a aprender as relações entre todos os campos. Por exemplo, no caso de um videogame publicado na loja da Amazon, em que “Título”, “Plataforma”, “Preço”, “Condição” e “Edição” apresentam ordens variadas, o modelo fica impedido de utilizar a dependência posicional, como a suposição de que a “terceira posição corresponde à plataforma”; ele deve vincular rótulos a valores e aprender as relações bilaterais entre atributos: título ⇄ plataforma, plataforma ⇄ preço, condição ⇄ preço. Assim, ele pode, por exemplo, inferir uma plataforma provável do nome de um jogo e de um preço observado, ou estimar uma faixa de preço plausível considerando um título e uma plataforma.
O descarte randomizado de chaves durante a serialização atua como um descarte de recursos: evita a coadaptação em qualquer campo e força o modelo a recuperar as informações perdidas das evidências restantes. Se “Plataforma” estiver ausente, o modelo deverá retirá-la da string de título ou do texto de compatibilidade; se “Preço” estiver oculto, ele deverá triangular da plataforma, edição e condição. Essa abordagem cria simetria (A → B e B → A), robustez diante de listagens confusas do mundo real e invariância de esquema quando os campos estão ausentes, renomeados ou reordenados.
Um exemplo de estilo de compra torna isso concreto. Serialize o mesmo item de várias maneiras (“Título: ‘Elden Ring’ | Plataforma: PlayStation 5 | Condição: Usado - Como novo | Preço: USD 34,99” e uma permutação como “Preço: USD 34,99 | Título: ‘Elden Ring’ | Condição: Usado - Como novo | Plataforma: PlayStation 5”) e, em certas iterações, omita “Plataforma” deixando “Compatível com PS5” na descrição. Treine objetivos complementares, como predição da plataforma de {title, price} e estimativa de um bucket de preços de {title, platform}. Como a ordem e até mesmo a presença das chaves variam, a única estratégia estável é aprender as verdadeiras relações entre os atributos em vez de memorizar um modelo.
A forma como os dados são apresentados é importante
O aprendizado de LLMs ocorre por meio da predição do próximo token com base no conteúdo previamente processado. A ordem dos campos e eventos mostrados durante o treinamento decide o que o modelo pode aprender. Se o formato do treinamento corresponder à tarefa real, a perda incidirá sobre os tokens de decisão exatos. Se os campos forem agrupados sem estrutura, o modelo aprenderá atalhos ou memorizará a popularidade e, em seguida, falhará quando solicitado a escolher entre as opções.
Mostre primeiro a situação, depois as opções e então a decisão. Se o modelo também precisar aprender sobre resultados ou explicações, coloque-os após a decisão.
Exemplos de empacotamento de dados para o CPT
O que é empacotamento de dados?
Empacotar significa preencher cada janela de sequência nos dados de treinamento com vários exemplos completos para que a janela fique densa com tokens reais, não com preenchimento.
Por que isso importa?
Durante o treinamento, um tamanho máximo de contexto é definido, por exemplo, 8.192 tokens. Os lotes são moldados para [tamanho do lote × extensão do contexto]. Se um exemplo de treinamento for menor que a extensão do contexto, as posições restantes serão preenchidas. O preenchimento mantém a execução via kernels de atenção e MLP, ainda que haja o mascaramento da função de perda, então a computação é paga por tokens que não transmitem nenhum sinal de aprendizado.
Como realizar o empacotamento?
Para empacotar várias amostras, concatene vários exemplos de treinamento com um separador [DOC] entre eles (observe o espaço antes e depois de [DOC]) de forma que a extensão total permaneça dentro da extensão de contexto desejada.
Um exemplo de documento empacotado seria assim:
{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}