View a markdown version of this page

Personalização contínua - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Personalização contínua

Com a personalização contínua, você pode desenvolver um modelo previamente personalizado aplicando treinamento adicional — seja com uma técnica diferente ou com a mesma técnica com novos dados. Por exemplo, comece com o SFT para ensinar conhecimento de domínio, depois aplique o DPO para se alinhar às preferências do usuário e, em seguida, aplique o RLVR para melhorar a precisão factual.

Importante

A personalização contínua é diferente do MTRL (Multi-Turn Reinforcement Learning). A personalização contínua encadeia trabalhos de treinamento em todas as técnicas. A MTRL treina agentes para tarefas de uso de ferramentas em várias etapas em um único trabalho de treinamento.

Como funciona

  • Carrega pesos do adaptador LoRa de um trabalho de treinamento anterior

  • Redefine o otimizador, o agendador e o contador de passos (novo treinamento com nova técnica ou dados)

  • O resultado do trabalho anterior se torna o ponto de partida para a nova execução do treinamento

nota

Atualmente, a personalização contínua está disponível por meio do MTRL e dos fluxos de trabalho de personalização contínua usando somente o SDK. Python É compatível com o tipo de treinamento LoRa. A personalização contínua em diferentes técnicas com FFT não é suportada.

Transições técnicas suportadas

A tabela a seguir mostra todas as combinações suportadas para personalização contínua:

Da técnica Para a técnica Compatível
SFTDPO✓
SFTRLVR✓
SFTRALIF✓
SFTSFT (novos dados)✓
SFTMTRL✓
DPODPO (novos dados)✓
DPORLVR✓
DPORALIF✓
DPOSFT✓
RLVRDPO✓
RLVRRLVR (novos dados)✓
RALIFDPO✓
RALIFRLAIF (novos dados)✓

Personalização contínua versus currículo de treinamento

Personalização contínua Retomar o treinamento
Técnica Técnica diferente ou mesma Apenas a mesma técnica
Estado do otimizador Reiniciar (novo começo) Restaurado a partir do ponto de verificação
Caso de uso Técnicas de cadeia (SFT → DPO → RLVR) Continue o treinamento interrompido
Tipo de treinamento Somente LoRa Somente LoRa

Introdução

A personalização contínua está disponível por meio do Python SDK. Forneça o caminho de saída de um trabalho de treinamento anterior como resume_from_path o da próxima técnica.

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

Exemplo de fluxos de trabalho

SFT → DPO

Ensine primeiro o conhecimento do domínio e, em seguida, alinhe-o às preferências do usuário

SFT → RLVR

Ensine primeiro o formato da tarefa e depois otimize para obter a correção factual

SFT → DPO → RLVR

Pipeline completo — conhecimento → preferências → precisão

SFT → MTRL

Ensine capacidades básicas e, em seguida, treine para tarefas de agente de vários turnos

DPO → DPO (novos dados)

Refine iterativamente as preferências com novos dados de feedback