LlamaFactory
Getting Started
快速开始
Feature Guide
功能指南
数据准备
监督微调(SFT)
偏好优化(DPO)
奖励模型训练(RM)
批处理策略
分布式训练
优化器
模型保存与恢复
模型导出
推理
融合算子加速
Configuration
参数说明
数据参数
模型参数
训练参数
推理参数
Developer Guide
开发者指南
整体架构
Core(核心模块)
插件注册机制
插件实现
Multi-Backend
Ascend NPU
LlamaFactory
LlamaFactory v1 文档
查看页面源码
LlamaFactory v1 文档
Getting Started
快速开始
Feature Guide
功能指南
训练任务
训练效率与扩展
模型保存与使用
数据准备
配置训练数据集
SFT 数据格式
DPO/RM 数据格式
组合多个数据集
转换现有数据格式
监督微调(SFT)
全参训练
LoRA
Freeze
QLoRA
激活值重算
偏好优化(DPO)
运行 DPO
训练配置
偏好损失
参考模型
奖励模型训练(RM)
训练配置
训练约束
批处理策略
配置示例
使用约束
分布式训练
数据并行
FSDP2
FSDPTurbo
DeepSpeed
Ulysses Context Parallel
配置并行拓扑
配置多机启动
优化器
Muon
模型保存与恢复
保存训练 Checkpoint
从 Checkpoint 恢复训练
不同后端的保存格式
初始化权重与恢复训练
模型导出
导出配置
合并多个 Adapter
推理
启动 CLI 对话
覆盖模型 Chat Template
使用 LoRA Adapter
使用训练或合并后的模型
融合算子加速
自动配置
Liger Kernel
CUDA Fused MoE
Flash Linear Attention
组合多个加速实现
Configuration
参数说明
参数分类
数据参数
DataArguments
DatasetInfo
模型参数
ModelArguments
peft_config
quant_config
init_config
kernel_config
训练参数
TrainingArguments
dist_config
optim_config
推理参数
SampleArguments
Developer Guide
开发者指南
架构
Core(核心模块)
Plugin(插件系统)
整体架构
模块分层
调用关系
数据如何到达训练循环
状态与实现分别由谁管理
Core(核心模块)
插件注册机制
插件类型、路由对象与实现
注册与调用流程
函数实现
类实现(静态方法组)
两种实现形式的选择
参数解析
插件实现
Multi-Backend
Ascend NPU
手动安装
功能范围
量化支持
融合算子加速
Liger Kernel
分布式训练