View a markdown version of this page

Personalização contínua - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Personalização contínua

Com a personalização contínua, você pode desenvolver um modelo previamente personalizado aplicando treinamento adicional — seja com uma técnica diferente ou com a mesma técnica com novos dados. Por exemplo, comece com o SFT para ensinar conhecimento de domínio, depois aplique o DPO para se alinhar às preferências do usuário e, em seguida, aplique o RLVR para melhorar a precisão factual.

Importante

A personalização contínua é diferente do MTRL (Multi-Turn Reinforcement Learning). A personalização contínua encadeia trabalhos de treinamento em todas as técnicas. A MTRL treina agentes para tarefas de uso de ferramentas em várias etapas em um único trabalho de treinamento.

Como funciona

  • Carrega pesos do adaptador LoRa de um trabalho de treinamento anterior

  • Redefine o otimizador, o agendador e o contador de passos (novo treinamento com nova técnica ou dados)

  • O resultado do trabalho anterior se torna o ponto de partida para a nova execução do treinamento

nota

Atualmente, a personalização contínua está disponível por meio do MTRL e dos fluxos de trabalho de personalização contínua usando somente o SDK. Python É compatível com o tipo de treinamento LoRa. A personalização contínua em diferentes técnicas com FFT não é suportada.

Transições técnicas suportadas

A tabela a seguir mostra todas as combinações suportadas para personalização contínua:

Da técnica Para a técnica Compatível
SFTDPO
SFTRLVR
SFTRALIF
SFTSFT (novos dados)
SFTMTRL
DPODPO (novos dados)
DPORLVR
DPORALIF
DPOSFT
RLVRDPO
RLVRRLVR (novos dados)
RALIFDPO
RALIFRLAIF (novos dados)

Personalização contínua versus currículo de treinamento

Personalização contínua Retomar o treinamento
Técnica Técnica diferente ou mesma Apenas a mesma técnica
Estado do otimizador Reiniciar (novo começo) Restaurado a partir do ponto de verificação
Caso de uso Técnicas de cadeia (SFT → DPO → RLVR) Continue o treinamento interrompido
Tipo de treinamento Somente LoRa Somente LoRa

Introdução

A personalização contínua está disponível por meio do Python SDK. Forneça o caminho de saída de um trabalho de treinamento anterior como resume_from_path o da próxima técnica.

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

Exemplo de fluxos de trabalho

SFT → DPO

Ensine primeiro o conhecimento do domínio e, em seguida, alinhe-o às preferências do usuário

SFT → RLVR

Ensine primeiro o formato da tarefa e depois otimize para obter a correção factual

SFT → DPO → RLVR

Pipeline completo — conhecimento → preferências → precisão

SFT → MTRL

Ensine capacidades básicas e, em seguida, treine para tarefas de agente de vários turnos

DPO → DPO (novos dados)

Refine iterativamente as preferências com novos dados de feedback