RFTHyperParameters¶
Structure Class¶
RFTHyperParameters
dataclass
¶
Hyperparameters for controlling the reinforcement fine-tuning training process, including learning settings and evaluation intervals.
Attributes¶
batch_size
class-attribute
instance-attribute
¶
batch_size: int | None = None
Number of training samples processed in each batch during reinforcement fine-tuning (RFT) training. Larger batches may improve training stability.
epoch_count
class-attribute
instance-attribute
¶
epoch_count: int | None = None
Number of training epochs to run during reinforcement fine-tuning. Higher values may improve performance but increase training time.
eval_interval
class-attribute
instance-attribute
¶
eval_interval: int | None = None
Interval between evaluation runs during RFT training, measured in training steps. More frequent evaluation provides better monitoring.
inference_max_tokens
class-attribute
instance-attribute
¶
inference_max_tokens: int | None = None
Maximum number of tokens the model can generate in response to each prompt during RFT training.
learning_rate
class-attribute
instance-attribute
¶
learning_rate: float | None = None
Learning rate for the reinforcement fine-tuning. Controls how quickly the model adapts to reward signals.
max_prompt_length
class-attribute
instance-attribute
¶
max_prompt_length: int | None = None
Maximum length of input prompts during RFT training, measured in tokens. Longer prompts allow more context but increase memory usage and training-time.
reasoning_effort
class-attribute
instance-attribute
¶
reasoning_effort: ReasoningEffort | None = None
Level of reasoning effort applied during RFT training. Higher values may improve response quality but increase training time.
training_sample_per_prompt
class-attribute
instance-attribute
¶
training_sample_per_prompt: int | None = None
Number of response samples generated per prompt during RFT training. More samples provide better reward signal estimation.