fix: 修复VLA设备与损失计算逻辑,并优化Transformer默认训练参数
This commit is contained in:
@@ -248,8 +248,11 @@ def main(cfg: DictConfig):
|
||||
# =========================================================================
|
||||
# 4. 设置优化器与学习率调度器
|
||||
# =========================================================================
|
||||
optimizer = AdamW(agent.parameters(), lr=cfg.train.lr, weight_decay=1e-5)
|
||||
log.info(f"🔧 优化器: AdamW (学习率={cfg.train.lr})")
|
||||
weight_decay = float(cfg.train.get('weight_decay', 1e-5))
|
||||
grad_clip = float(cfg.train.get('grad_clip', 1.0))
|
||||
|
||||
optimizer = AdamW(agent.parameters(), lr=cfg.train.lr, weight_decay=weight_decay)
|
||||
log.info(f"🔧 优化器: AdamW (学习率={cfg.train.lr}, weight_decay={weight_decay})")
|
||||
|
||||
# 设置带预热的学習率调度器
|
||||
warmup_steps = int(cfg.train.get('warmup_steps', 500))
|
||||
@@ -353,7 +356,7 @@ def main(cfg: DictConfig):
|
||||
loss.backward()
|
||||
|
||||
# 梯度裁剪以稳定训练
|
||||
torch.nn.utils.clip_grad_norm_(agent.parameters(), max_norm=1.0)
|
||||
torch.nn.utils.clip_grad_norm_(agent.parameters(), max_norm=grad_clip)
|
||||
|
||||
optimizer.step()
|
||||
scheduler.step()
|
||||
|
||||
Reference in New Issue
Block a user