37 lines
675 B
YAML
37 lines
675 B
YAML
# @package agent
|
|
defaults:
|
|
- /backbone@vision_backbone: resnet_diffusion
|
|
- _self_
|
|
|
|
_target_: roboimi.vla.agent_act.ACTAgent
|
|
|
|
action_dim: 16
|
|
obs_dim: 16
|
|
normalization_type: "min_max"
|
|
|
|
pred_horizon: 16
|
|
obs_horizon: 1
|
|
num_action_steps: 8
|
|
|
|
camera_names: ${data.camera_names}
|
|
num_cams: 3
|
|
|
|
vision_backbone:
|
|
num_cameras: ${agent.num_cams}
|
|
camera_names: ${agent.camera_names}
|
|
input_shape: [3, 224, 224]
|
|
output_tokens_per_camera: true
|
|
|
|
head:
|
|
_target_: roboimi.vla.models.heads.act.ACTPolicyHead
|
|
_partial_: true
|
|
hidden_dim: 256
|
|
nheads: 8
|
|
enc_layers: 4
|
|
dec_layers: 6
|
|
dim_feedforward: 2048
|
|
latent_dim: 32
|
|
dropout: 0.1
|
|
kl_weight: 10.0
|
|
activation: "gelu"
|