As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
SFT
O Supervisioned Fine-Tuning treina um modelo em pares de entrada-saída rotulados para alinhar seu comportamento com exemplos específicos. O modelo aprende a produzir respostas que correspondam aos seus dados de treinamento.
Quando usar
Você tem pares de resposta rápida de alta qualidade para sua tarefa alvo
Você quer que o modelo aprenda um estilo, formato ou conhecimento de domínio específico
Você precisa de um comportamento consistente em tarefas bem definidas (resumo, classificação, perguntas e respostas)
O que ela alcança
O modelo aprende a imitar os padrões em seus exemplos de treinamento, produzindo resultados que correspondem ao estilo, formato e conteúdo dos dados rotulados.
Formato do conjunto de dados
O SFT oferece suporte a dois formatos de conjunto de dados. Todos os conjuntos de dados devem estar no formato JSONL (um objeto JSON por linha). Uma system mensagem é opcional em ambos os formatos.
Formato 1: mensagens
Represente a conversa como uma lista de mensagens marcadas por função. Se incluída, a system mensagem deve ser o primeiro elemento.
{ "messages": [ {"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ] }
Formato 2: prompt/conclusão
Forneça a entrada e a saída esperada como campos separados, com um system campo opcional de nível superior.
{ "system": "...", "prompt": "...", "completion": "..." }
nota
A system mensagem é opcional. Garanta a diversidade nas solicitações e nos estilos de resposta.
Hiperparâmetros
nota
As tabelas abaixo mostram os hiperparâmetros disponíveis quando você usa a personalização do modelo sem servidor. Outros hiperparâmetros são predefinidos pela Amazon SageMaker AI usando padrões otimizados. Ao usar o SageMaker AI Training Jobs ou HyperPod, você pode acessar a lista completa de hiperparâmetros disponíveis nas receitas. Consulte o repositório SageMaker AI Recipes
SFT LoRa
| Parâmetro | Tipo | Obrigatório? | Intervalo/Valores | Description |
|---|---|---|---|---|
max_epochs | integer | Obrigatório | 1–100 | Número de passagens completas pelo conjunto de dados de treinamento. |
global_batch_size | integer | Obrigatório | 8, 16, 32, 64, 128, 256, 512, 1024 | Total de amostras processadas por etapa do otimizador em todas as instâncias. |
learning_rate | flutuação | Obrigatório | 5e-07—1e-04 | Tamanho da etapa para atualizações de peso durante a otimização. |
lr_scheduler | string | Obrigatório | cosseno, constante | Cronograma de declínio da taxa de aprendizado durante o treinamento. |
lr_warmup_steps_ratio | flutuação | Obrigatório | 0—1 | Fração do total de etapas gastas aumentando a taxa de aprendizado de 0. |
weight_decay | flutuação | Obrigatório | 0, 0 a 1,0 | Coeficiente de regularização L2. Ajuda a evitar o sobreajuste. |
gradient_clipping | booleano | Obrigatório | true, false | Reduza os gradientes se a norma exceder o limite. |
gradient_clipping_threshold | flutuação | Obrigatório | 0,0—5,0 | Norma de gradiente máxima permitida. |
dataset_max_len | integer | Obrigatório | 256—131072 | Tamanho máximo de sequência em tokens. As sequências mais longas são truncadas. |
seed | integer | Obrigatório | 0–2147483647 | Semente aleatória para reprodutibilidade. |
logging_steps | integer | Obrigatório | 1–100 | Frequência do registro de métricas nas etapas do otimizador. |
lora_rank | integer | Obrigatório | 8, 16, 32, 64, 128 | Dimensionalidade de matrizes de baixa classificação. Menor = menos parâmetros treináveis. |
lora_dropout | flutuação | Obrigatório | 0, 0 a 1,0 | Probabilidade de abandono para camadas LoRA adaptadoras. |
lora_alpha | integer | Obrigatório | 16, 32, 64, 128, 256 | LoRAfator de escala. O LR eficaz é escalado como alpha/rank. |
merge_weights | booleano | Obrigatório | true, false | Combine LoRA pesos no modelo básico após o treinamento. |
train_val_split_ratio | flutuação | Opcional | 0, 0 a 1,0 | Fração alocada para treinamento versus validação. |
temperature | flutuação | Obrigatório | 0,0—2,0 | Temperatura de amostragem para avaliação. |
PÉS MACIOS
| Parâmetro | Tipo | Obrigatório? | Intervalo/Valores | Description |
|---|---|---|---|---|
max_epochs | integer | Obrigatório | 1–100 | Número de passagens completas pelo conjunto de dados de treinamento. |
global_batch_size | integer | Obrigatório | 8, 16, 32, 64, 128, 256, 512, 1024 | Total de amostras processadas por etapa do otimizador. |
learning_rate | flutuação | Obrigatório | 5e-07—1e-04 | Tamanho da etapa para atualizações de peso. |
lr_scheduler | string | Obrigatório | cosseno, constante | Cronograma de decaimento da taxa de aprendizado. |
lr_warmup_steps_ratio | flutuação | Obrigatório | 0—1 | Fração de etapas para aquecimento do LR. |
weight_decay | flutuação | Obrigatório | 0, 0 a 1,0 | Coeficiente de regularização L2. |
gradient_clipping | booleano | Obrigatório | true, false | Reduza os gradientes se a norma exceder o limite. |
gradient_clipping_threshold | flutuação | Obrigatório | 0,0—5,0 | Norma de gradiente máxima permitida. |
dataset_max_len | integer | Obrigatório | 256—131072 | Tamanho máximo de sequência em tokens. |
max_response_length | integer | Obrigatório | 100—200000 | Máximo de tokens para resposta gerada. |
seed | integer | Obrigatório | 0–2147483647 | Semente aleatória para reprodutibilidade. |
logging_steps | integer | Obrigatório | 1–100 | Frequência do registro métrico. |
train_val_split_ratio | flutuação | Opcional | 0, 0 a 1,0 | Fração alocada para treinamento versus validação. |
temperature | flutuação | Obrigatório | 0,0—2,0 | Temperatura de amostragem para avaliação. |