As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Personalização contínua
Com a personalização contínua, você pode desenvolver um modelo previamente personalizado aplicando treinamento adicional — seja com uma técnica diferente ou com a mesma técnica com novos dados. Por exemplo, comece com o SFT para ensinar conhecimento de domínio, depois aplique o DPO para se alinhar às preferências do usuário e, em seguida, aplique o RLVR para melhorar a precisão factual.
Importante
A personalização contínua é diferente do MTRL (Multi-Turn Reinforcement Learning). A personalização contínua encadeia trabalhos de treinamento em todas as técnicas. A MTRL treina agentes para tarefas de uso de ferramentas em várias etapas em um único trabalho de treinamento.
Como funciona
Carrega pesos do adaptador LoRa de um trabalho de treinamento anterior
Redefine o otimizador, o agendador e o contador de passos (novo treinamento com nova técnica ou dados)
O resultado do trabalho anterior se torna o ponto de partida para a nova execução do treinamento
nota
Atualmente, a personalização contínua está disponível por meio do MTRL e dos fluxos de trabalho de personalização contínua usando somente o SDK. Python É compatível com o tipo de treinamento LoRa. A personalização contínua em diferentes técnicas com FFT não é suportada.
Transições técnicas suportadas
A tabela a seguir mostra todas as combinações suportadas para personalização contínua:
| Da técnica | Para a técnica | Compatível |
|---|---|---|
| SFT | DPO | ✓ |
| SFT | RLVR | ✓ |
| SFT | RALIF | ✓ |
| SFT | SFT (novos dados) | ✓ |
| SFT | MTRL | ✓ |
| DPO | DPO (novos dados) | ✓ |
| DPO | RLVR | ✓ |
| DPO | RALIF | ✓ |
| DPO | SFT | ✓ |
| RLVR | DPO | ✓ |
| RLVR | RLVR (novos dados) | ✓ |
| RALIF | DPO | ✓ |
| RALIF | RLAIF (novos dados) | ✓ |
Personalização contínua versus currículo de treinamento
| Personalização contínua | Retomar o treinamento | |
|---|---|---|
| Técnica | Técnica diferente ou mesma | Apenas a mesma técnica |
| Estado do otimizador | Reiniciar (novo começo) | Restaurado a partir do ponto de verificação |
| Caso de uso | Técnicas de cadeia (SFT → DPO → RLVR) | Continue o treinamento interrompido |
| Tipo de treinamento | Somente LoRa | Somente LoRa |
Introdução
A personalização contínua está disponível por meio do Python SDK. Forneça o caminho de saída de um trabalho de treinamento anterior como resume_from_path o da próxima técnica.
from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()
Exemplo de fluxos de trabalho
- SFT → DPO
Ensine primeiro o conhecimento do domínio e, em seguida, alinhe-o às preferências do usuário
- SFT → RLVR
Ensine primeiro o formato da tarefa e depois otimize para obter a correção factual
- SFT → DPO → RLVR
Pipeline completo — conhecimento → preferências → precisão
- SFT → MTRL
Ensine capacidades básicas e, em seguida, treine para tarefas de agente de vários turnos
- DPO → DPO (novos dados)
Refine iterativamente as preferências com novos dados de feedback