fix: 修复VLA设备与损失计算逻辑,并优化Transformer默认训练参数

This commit is contained in:
gouhanke
2026-03-03 17:56:12 +08:00
parent cdb887c9bf
commit 8bcad5844e
4 changed files with 49 additions and 51 deletions
+6 -3
View File
@@ -248,8 +248,11 @@ def main(cfg: DictConfig):
# =========================================================================
# 4. 设置优化器与学习率调度器
# =========================================================================
optimizer = AdamW(agent.parameters(), lr=cfg.train.lr, weight_decay=1e-5)
log.info(f"🔧 优化器: AdamW (学习率={cfg.train.lr})")
weight_decay = float(cfg.train.get('weight_decay', 1e-5))
grad_clip = float(cfg.train.get('grad_clip', 1.0))
optimizer = AdamW(agent.parameters(), lr=cfg.train.lr, weight_decay=weight_decay)
log.info(f"🔧 优化器: AdamW (学习率={cfg.train.lr}, weight_decay={weight_decay})")
# 设置带预热的学習率调度器
warmup_steps = int(cfg.train.get('warmup_steps', 500))
@@ -353,7 +356,7 @@ def main(cfg: DictConfig):
loss.backward()
# 梯度裁剪以稳定训练
torch.nn.utils.clip_grad_norm_(agent.parameters(), max_norm=1.0)
torch.nn.utils.clip_grad_norm_(agent.parameters(), max_norm=grad_clip)
optimizer.step()
scheduler.step()