训练参数
TrainingArguments
训练过程与精度
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
输出目录 |
|
|
|
基础 micro-batch 大小 |
|
|
|
默认 |
|
|
|
最大序列长度 |
|
|
|
训练及优化器插件使用的学习率 |
|
|
|
训练轮数 |
|
|
|
设置后使用 step 作为终止条件 |
|
|
|
梯度裁剪阈值 |
|
|
|
是否使用 bf16 |
|
|
|
随机种子 |
|
|
|
是否启用完整确定性模式 |
global_batch_size 与 micro_batch_size 共同决定每次参数更新需要累积多少个 micro-batch。省略 global_batch_size 时,每个 DP 进程每次更新处理一个 micro-batch;显式设置时,它必须能被 dp_size × micro_batch_size 整除,每个进程的累积次数为 global_batch_size / (dp_size × micro_batch_size)。
例如,dp_size: 4、micro_batch_size: 2、global_batch_size: 32 对应每个 DP 进程累积 4 个 micro-batch。固定样本数策略下,一次更新共使用 32 条样本;动态策略中的实际样本数随长度变化,global_batch_size 仍决定累积次数,token 预算见批处理策略。
批处理配置
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
|
|
|
|
数据加载 worker 数 |
|
|
|
是否启用激活值重算 |
各策略的 token 预算和使用约束见批处理策略。
分布式与优化器
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
FSDP2、FSDPTurbo 或 DeepSpeed 配置 |
|
|
|
默认由 world size 和 |
|
|
|
Context Parallel 大小 |
|
|
|
Context Parallel 实现 |
|
|
|
FSDP 二维 Mesh 的参数复制维度大小 |
|
|
|
FSDP 二维 Mesh 的参数分片维度大小;默认由 world size 推导 |
|
|
|
进程组初始化超时,秒 |
|
|
|
优化器插件 |
|
|
|
学习率调度插件;当前没有内置实现 |
Checkpoint 与日志配置
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
checkpoint 路径或 |
|
|
|
每 N 个全局 step 保存 |
|
|
|
每 N 个 epoch 保存 |
|
|
|
是否在中间 checkpoint 中额外保存 HF 格式模型 |
|
|
|
最多保留数量 |
|
|
|
日志间隔 |
偏好优化参数
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
|
|
|
|
DPO beta |
|
|
|
SFT 损失系数 |
|
|
|
SimPO reward margin |
|
|
|
cDPO label smoothing |
|
|
|
LD-DPO 长度差异权重 |
dist_config
FSDP2
设置 name: fsdp2:
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
forward 后是否重新分片 |
|
|
|
是否 offload 参数 |
|
|
|
是否使用 pinned memory |
|
|
|
初始化 DCP 权重路径 |
DeepSpeed
设置 name: deepspeed:
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
必填 |
DeepSpeed JSON 配置 |
FSDPTurbo
设置 name: fsdpturbo:
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
forward 后是否重新分片 |
|
|
|
是否 offload 参数 |
|
|
|
是否使用 pinned memory |
|
|
|
初始化 DCP 权重路径 |
|
|
|
专家并行组大小 |
|
|
|
专家 token dispatcher |
|
|
|
外层 FSDP2 忽略的额外模块 |
|
|
|
EFSDP hook 的模块模式 |
|
|
|
|
dp_size、cp_size、mp_replicate_size 和 mp_shard_size 是 TrainingArguments 字段,不放在 dist_config 中。
optim_config
设置 name: muon:
字段 |
类型 |
默认值 |
说明 |
|---|---|---|---|
|
|
|
weight decay |
|
|
|
Muon momentum |
|
|
|
是否启用 Nesterov |
|
|
|
Newton-Schulz 步数 |
|
|
|
内部 AdamW betas |
|
|
|
内部 AdamW epsilon |
学习率统一使用顶层 learning_rate。
Muon 的完整配置示例见优化器。