fix: 修复VLA设备与损失计算逻辑,并优化Transformer默认训练参数
This commit is contained in:
@@ -10,7 +10,7 @@ defaults:
|
||||
train:
|
||||
# 基础训练参数
|
||||
batch_size: 8 # 批次大小
|
||||
lr: 1e-4 # 学习率
|
||||
lr: 5e-5 # 学习率(Transformer建议更小)
|
||||
max_steps: 100000 # 最大训练步数
|
||||
device: "cuda" # 设备: "cuda" 或 "cpu"
|
||||
|
||||
@@ -24,7 +24,7 @@ train:
|
||||
save_freq: 2000 # 保存检查点频率(步数)
|
||||
|
||||
# 学习率调度器(带预热)
|
||||
warmup_steps: 500 # 预热步数
|
||||
warmup_steps: 2000 # 预热步数(Transformer建议更长)
|
||||
scheduler_type: "cosine" # 预热后的调度器: "constant" 或 "cosine"
|
||||
min_lr: 1e-6 # 最小学习率(用于余弦退火)
|
||||
|
||||
@@ -41,4 +41,4 @@ train:
|
||||
experiment:
|
||||
name: "vla_diffusion" # 实验名称
|
||||
notes: "" # 实验备注
|
||||
tags: [] # 实验标签
|
||||
tags: [] # 实验标签
|
||||
|
||||
Reference in New Issue
Block a user