omidrezaheidari commited on
Commit
8c8fd8d
·
verified ·
1 Parent(s): 3951174

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ wandb/run-20260202_064313-i4545kqj/run-i4545kqj.wandb filter=lfs diff=lfs merge=lfs -text
.hydra/config.yaml ADDED
@@ -0,0 +1,179 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ dataset:
2
+ to_name: gberseth/bridge-data-64px-test
3
+ num_episodes: 0
4
+ chunk_size: 1
5
+ buffer_size: 50000
6
+ encode_with_t5: false
7
+ t5_version: t5-small
8
+ chars_list:
9
+ - ' '
10
+ - ','
11
+ - .
12
+ - '0'
13
+ - '1'
14
+ - '2'
15
+ - '3'
16
+ - '4'
17
+ - '5'
18
+ - '6'
19
+ - '7'
20
+ - '8'
21
+ - '9'
22
+ - '!'
23
+ - '?'
24
+ - '"'
25
+ - ''''
26
+ - (
27
+ - )
28
+ - '-'
29
+ - _
30
+ - ':'
31
+ - ;
32
+ - '@'
33
+ - '#'
34
+ - $
35
+ - '%'
36
+ - '&'
37
+ - '*'
38
+ - +
39
+ - '='
40
+ - <
41
+ - '>'
42
+ - /
43
+ - \\
44
+ - '|'
45
+ - '~'
46
+ - '`'
47
+ - A
48
+ - B
49
+ - C
50
+ - D
51
+ - E
52
+ - F
53
+ - G
54
+ - H
55
+ - I
56
+ - J
57
+ - K
58
+ - L
59
+ - M
60
+ - 'N'
61
+ - O
62
+ - P
63
+ - Q
64
+ - R
65
+ - S
66
+ - T
67
+ - U
68
+ - V
69
+ - W
70
+ - X
71
+ - 'Y'
72
+ - Z
73
+ - a
74
+ - b
75
+ - c
76
+ - d
77
+ - e
78
+ - f
79
+ - g
80
+ - h
81
+ - i
82
+ - j
83
+ - k
84
+ - l
85
+ - m
86
+ - 'n'
87
+ - o
88
+ - p
89
+ - q
90
+ - r
91
+ - s
92
+ - t
93
+ - u
94
+ - v
95
+ - w
96
+ - x
97
+ - 'y'
98
+ - z
99
+ load_dataset: true
100
+ download_all: false
101
+ save_initial_dataset: false
102
+ use_generator: false
103
+ dataset_indicies:
104
+ gs://gresearch/robotics/bridge/0.1.0/:
105
+ start: 0
106
+ weight: 1.0
107
+ dataset_key: bridge_oxe
108
+ scale: 1.0
109
+ action_std:
110
+ - 0.0118407579138875
111
+ - 0.01651778072118759
112
+ - 0.01558756735175848
113
+ - 0.03479960933327675
114
+ - 0.03878577798604965
115
+ - 0.05862835422158241
116
+ - 0.5686280727386475
117
+ action_mean:
118
+ - 0.00032659756834618747
119
+ - 0.0002364425890846178
120
+ - -0.0001985691487789154
121
+ - -0.0003516025608405471
122
+ - -0.0005819069338031113
123
+ - 0.0006634143064729869
124
+ - 0.659541130065918
125
+ gripper_closed_std: 1.0
126
+ experiment:
127
+ name: grp_stat_3
128
+ project: mini-grp
129
+ description: simple env with 64pix images and pose data
130
+ model:
131
+ type: transformer
132
+ batch_size: 256
133
+ max_block_size: 16
134
+ vocab_size: 32
135
+ n_patches: 8
136
+ patch_size: 8
137
+ max_iters: 25000
138
+ eval_interval: 100
139
+ learning_rate: 0.0003
140
+ lr_schedule: linear
141
+ eval_iters: 5
142
+ policy:
143
+ action_stacking: 1
144
+ obs_stacking: 3
145
+ use_image_augmentations: false
146
+ dtype: float32
147
+ use_pose_data: 1
148
+ random_masking_enabled: false
149
+ testing: false
150
+ eval_vid_iters: 2500
151
+ gradient_accumulation_steps: 1
152
+ simEval: []
153
+ sim:
154
+ eval_episodes: 1
155
+ eval_tasks:
156
+ - 0
157
+ - 1
158
+ - 2
159
+ - 3
160
+ episode length: 500
161
+ r_seed: 1337
162
+ device: cuda
163
+ n_embd: 512
164
+ n_head: 16
165
+ n_blocks: 4
166
+ dropout: 0.2
167
+ action_dim: 7
168
+ load_action_bounds: true
169
+ image_shape:
170
+ - 64
171
+ - 64
172
+ - 3
173
+ data_shuffel_interval: 1000
174
+ profiler:
175
+ enable: false
176
+ params:
177
+ profile_memory: true
178
+ with_stack: true
179
+ use_cuda: true
.hydra/hydra.yaml ADDED
@@ -0,0 +1,158 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ hydra:
2
+ run:
3
+ dir: outputs/${now:%Y-%m-%d}/${now:%H-%M-%S}
4
+ sweep:
5
+ dir: multirun/${now:%Y-%m-%d}/${now:%H-%M-%S}
6
+ subdir: ${hydra.job.num}
7
+ launcher:
8
+ _target_: hydra._internal.core_plugins.basic_launcher.BasicLauncher
9
+ sweeper:
10
+ _target_: hydra._internal.core_plugins.basic_sweeper.BasicSweeper
11
+ max_batch_size: null
12
+ params: null
13
+ help:
14
+ app_name: ${hydra.job.name}
15
+ header: '${hydra.help.app_name} is powered by Hydra.
16
+
17
+ '
18
+ footer: 'Powered by Hydra (https://hydra.cc)
19
+
20
+ Use --hydra-help to view Hydra specific help
21
+
22
+ '
23
+ template: '${hydra.help.header}
24
+
25
+ == Configuration groups ==
26
+
27
+ Compose your configuration from those groups (group=option)
28
+
29
+
30
+ $APP_CONFIG_GROUPS
31
+
32
+
33
+ == Config ==
34
+
35
+ Override anything in the config (foo.bar=value)
36
+
37
+
38
+ $CONFIG
39
+
40
+
41
+ ${hydra.help.footer}
42
+
43
+ '
44
+ hydra_help:
45
+ template: 'Hydra (${hydra.runtime.version})
46
+
47
+ See https://hydra.cc for more info.
48
+
49
+
50
+ == Flags ==
51
+
52
+ $FLAGS_HELP
53
+
54
+
55
+ == Configuration groups ==
56
+
57
+ Compose your configuration from those groups (For example, append hydra/job_logging=disabled
58
+ to command line)
59
+
60
+
61
+ $HYDRA_CONFIG_GROUPS
62
+
63
+
64
+ Use ''--cfg hydra'' to Show the Hydra config.
65
+
66
+ '
67
+ hydra_help: ???
68
+ hydra_logging:
69
+ version: 1
70
+ formatters:
71
+ simple:
72
+ format: '[%(asctime)s][HYDRA] %(message)s'
73
+ handlers:
74
+ console:
75
+ class: logging.StreamHandler
76
+ formatter: simple
77
+ stream: ext://sys.stdout
78
+ root:
79
+ level: INFO
80
+ handlers:
81
+ - console
82
+ loggers:
83
+ logging_example:
84
+ level: DEBUG
85
+ disable_existing_loggers: false
86
+ job_logging:
87
+ version: 1
88
+ formatters:
89
+ simple:
90
+ format: '[%(asctime)s][%(name)s][%(levelname)s] - %(message)s'
91
+ handlers:
92
+ console:
93
+ class: logging.StreamHandler
94
+ formatter: simple
95
+ stream: ext://sys.stdout
96
+ file:
97
+ class: logging.FileHandler
98
+ formatter: simple
99
+ filename: ${hydra.runtime.output_dir}/${hydra.job.name}.log
100
+ root:
101
+ level: INFO
102
+ handlers:
103
+ - console
104
+ - file
105
+ disable_existing_loggers: false
106
+ env: {}
107
+ mode: RUN
108
+ searchpath: []
109
+ callbacks: {}
110
+ output_subdir: .hydra
111
+ overrides:
112
+ hydra:
113
+ - hydra.mode=RUN
114
+ task:
115
+ - simEval=[]
116
+ - policy.obs_stacking=3
117
+ - experiment.name=grp_stat_3
118
+ job:
119
+ name: mini_grp
120
+ chdir: null
121
+ override_dirname: experiment.name=grp_stat_3,policy.obs_stacking=3,simEval=[]
122
+ id: ???
123
+ num: ???
124
+ config_name: 64pix-pose
125
+ env_set: {}
126
+ env_copy: []
127
+ config:
128
+ override_dirname:
129
+ kv_sep: '='
130
+ item_sep: ','
131
+ exclude_keys: []
132
+ runtime:
133
+ version: 1.2.0
134
+ version_base: '1.1'
135
+ cwd: /home/o_heidar/robot_learning_2026
136
+ config_sources:
137
+ - path: hydra.conf
138
+ schema: pkg
139
+ provider: hydra
140
+ - path: /home/o_heidar/robot_learning_2026/mini-grp/conf
141
+ schema: file
142
+ provider: main
143
+ - path: ''
144
+ schema: structured
145
+ provider: schema
146
+ output_dir: /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12
147
+ choices:
148
+ dataset: fast
149
+ hydra/env: default
150
+ hydra/callbacks: null
151
+ hydra/job_logging: default
152
+ hydra/hydra_logging: default
153
+ hydra/hydra_help: default
154
+ hydra/help: default
155
+ hydra/sweeper: basic
156
+ hydra/launcher: basic
157
+ hydra/output: default
158
+ verbose: false
.hydra/overrides.yaml ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ - simEval=[]
2
+ - policy.obs_stacking=3
3
+ - experiment.name=grp_stat_3
checkpoints/grp_stat_3.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:938de5cc2651702efe41171b52d2b5f12832c31056d501c1bb82e9137a9362b9
3
+ size 51756846
mini_grp.log ADDED
@@ -0,0 +1 @@
 
 
1
+ [2026-02-02 06:43:22,259][datasets][INFO] - TensorFlow version 2.15.0 available.
wandb/debug-internal.log ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-02-02T06:43:14.373523076-05:00","level":"INFO","msg":"stream: starting","core version":"0.24.1"}
2
+ {"time":"2026-02-02T06:43:14.555022188-05:00","level":"INFO","msg":"stream: created new stream","id":"i4545kqj"}
3
+ {"time":"2026-02-02T06:43:14.555098169-05:00","level":"INFO","msg":"handler: started","stream_id":"i4545kqj"}
4
+ {"time":"2026-02-02T06:43:14.558136687-05:00","level":"INFO","msg":"stream: started","id":"i4545kqj"}
5
+ {"time":"2026-02-02T06:43:14.55822855-05:00","level":"INFO","msg":"writer: started","stream_id":"i4545kqj"}
6
+ {"time":"2026-02-02T06:43:14.558251165-05:00","level":"INFO","msg":"sender: started","stream_id":"i4545kqj"}
7
+ {"time":"2026-02-02T12:42:50.293657146-05:00","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
8
+ {"time":"2026-02-02T12:42:50.512070299-05:00","level":"INFO","msg":"handler: operation stats","stats":{}}
9
+ {"time":"2026-02-02T12:42:50.529012161-05:00","level":"INFO","msg":"stream: closing","id":"i4545kqj"}
10
+ {"time":"2026-02-02T12:42:50.529025813-05:00","level":"INFO","msg":"handler: closed","stream_id":"i4545kqj"}
11
+ {"time":"2026-02-02T12:42:50.531105801-05:00","level":"INFO","msg":"sender: closed","stream_id":"i4545kqj"}
12
+ {"time":"2026-02-02T12:42:50.531120425-05:00","level":"INFO","msg":"stream: closed","id":"i4545kqj"}
wandb/debug.log ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-02-02 06:43:14,007 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Current SDK version is 0.24.1
2
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Configure stats pid to 1212388
3
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Loading settings from environment variables
4
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():717] Logging user logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug.log
5
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():718] Logging internal logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log
6
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():844] calling init triggers
7
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():849] wandb.init called with sweep_config: {}
8
+ config: {'dataset': {'to_name': 'gberseth/bridge-data-64px-test', 'num_episodes': 0, 'chunk_size': 1, 'buffer_size': 50000, 'encode_with_t5': False, 't5_version': 't5-small', 'chars_list': [' ', ',', '.', '0', '1', '2', '3', '4', '5', '6', '7', '8', '9', '!', '?', '"', "'", '(', ')', '-', '_', ':', ';', '@', '#', '$', '%', '&', '*', '+', '=', '<', '>', '/', '\\\\', '|', '~', '`', 'A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T', 'U', 'V', 'W', 'X', 'Y', 'Z', 'a', 'b', 'c', 'd', 'e', 'f', 'g', 'h', 'i', 'j', 'k', 'l', 'm', 'n', 'o', 'p', 'q', 'r', 's', 't', 'u', 'v', 'w', 'x', 'y', 'z'], 'load_dataset': True, 'download_all': False, 'save_initial_dataset': False, 'use_generator': False, 'dataset_indicies': {'gs://gresearch/robotics/bridge/0.1.0/': {'start': 0, 'weight': 1.0, 'dataset_key': 'bridge_oxe', 'scale': 1.0}}, 'action_std': [0.0118407579138875, 0.01651778072118759, 0.01558756735175848, 0.03479960933327675, 0.03878577798604965, 0.05862835422158241, 0.5686280727386475], 'action_mean': [0.00032659756834618747, 0.0002364425890846178, -0.0001985691487789154, -0.0003516025608405471, -0.0005819069338031113, 0.0006634143064729869, 0.659541130065918], 'gripper_closed_std': 1.0}, 'experiment': {'name': 'grp_stat_3', 'project': 'mini-grp', 'description': 'simple env with 64pix images and pose data'}, 'model': {'type': 'transformer'}, 'batch_size': 256, 'max_block_size': 16, 'vocab_size': 32, 'n_patches': 8, 'patch_size': 8, 'max_iters': 25000, 'eval_interval': 100, 'learning_rate': 0.0003, 'lr_schedule': 'linear', 'eval_iters': 5, 'policy': {'action_stacking': 1, 'obs_stacking': 3, 'use_image_augmentations': False, 'dtype': 'float32', 'use_pose_data': 1, 'random_masking_enabled': False}, 'testing': False, 'eval_vid_iters': 2500, 'gradient_accumulation_steps': 1, 'simEval': [], 'sim': {'eval_episodes': 1, 'eval_tasks': [0, 1, 2, 3], 'episode length': 500}, 'r_seed': 1337, 'device': 'cuda', 'n_embd': 512, 'n_head': 16, 'n_blocks': 4, 'dropout': 0.2, 'action_dim': 7, 'load_action_bounds': True, 'image_shape': [64, 64, 3], 'data_shuffel_interval': 1000, 'profiler': {'enable': False, 'params': {'profile_memory': True, 'with_stack': True, 'use_cuda': True}}, '_wandb': {}}
9
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():892] starting backend
10
+ 2026-02-02 06:43:14,361 INFO MainThread:1212388 [wandb_init.py:init():895] sending inform_init request
11
+ 2026-02-02 06:43:14,370 INFO MainThread:1212388 [wandb_init.py:init():903] backend started and connected
12
+ 2026-02-02 06:43:14,372 INFO MainThread:1212388 [wandb_init.py:init():973] updated telemetry
13
+ 2026-02-02 06:43:14,390 INFO MainThread:1212388 [wandb_init.py:init():997] communicating run to backend with 90.0 second timeout
14
+ 2026-02-02 06:43:14,776 INFO MainThread:1212388 [wandb_init.py:init():1042] starting run threads in backend
15
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_console_start():2529] atexit reg
16
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2377] redirect: wrap_raw
17
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2446] Wrapping output streams.
18
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2469] Redirects installed.
19
+ 2026-02-02 06:43:15,172 INFO MainThread:1212388 [wandb_init.py:init():1082] run started, returning control to user process
20
+ 2026-02-02 12:42:49,802 INFO MainThread:1212388 [wandb_run.py:_finish():2295] finishing run omidrezaheidari-concordia-university/mini-grp/i4545kqj
21
+ 2026-02-02 12:42:49,804 INFO MainThread:1212388 [wandb_run.py:_atexit_cleanup():2494] got exitcode: 0
22
+ 2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2476] restore
23
+ 2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2482] restore done
24
+ 2026-02-02 12:42:50,515 INFO MainThread:1212388 [wandb_run.py:_footer_sync_info():3871] logging synced files
wandb/run-20260202_064313-i4545kqj/files/config.yaml ADDED
@@ -0,0 +1,326 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _wandb:
2
+ value:
3
+ cli_version: 0.24.1
4
+ e:
5
+ q4xofvz8clyq1g2jr4zr21tj3a4wrrs3:
6
+ args:
7
+ - simEval=[]
8
+ - policy.obs_stacking=3
9
+ - experiment.name=grp_stat_3
10
+ codePath: mini-grp/mini_grp.py
11
+ cpu_count: 36
12
+ cpu_count_logical: 72
13
+ cudaVersion: "12.9"
14
+ disk:
15
+ /:
16
+ total: "470272819200"
17
+ used: "31232614400"
18
+ email: omid.orh@gmail.com
19
+ executable: /home/o_heidar/rbenv/bin/python
20
+ git:
21
+ commit: a1e45b9ec95f0f09f151f485ba23961058153e48
22
+ remote: https://github.com/omid-reza/robot_learning_2026.git
23
+ gpu: Tesla V100-PCIE-32GB
24
+ gpu_count: 2
25
+ gpu_nvidia:
26
+ - architecture: Volta
27
+ cudaCores: 5120
28
+ memoryTotal: "34359738368"
29
+ name: Tesla V100-PCIE-32GB
30
+ uuid: GPU-28f0e524-a7c5-f287-d873-73f15fb0d817
31
+ - architecture: Volta
32
+ cudaCores: 5120
33
+ memoryTotal: "34359738368"
34
+ name: Tesla V100-PCIE-32GB
35
+ uuid: GPU-6b13b007-765f-fea0-26ee-f1842182916d
36
+ host: virya1
37
+ memory:
38
+ total: "405360889856"
39
+ os: Linux-6.8.0-79-generic-x86_64-with-glibc2.39
40
+ program: /home/o_heidar/robot_learning_2026/mini-grp/mini_grp.py
41
+ python: CPython 3.10.19
42
+ root: /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12
43
+ slurm:
44
+ array_job_id: "59114"
45
+ array_task_count: "5"
46
+ array_task_id: "1"
47
+ array_task_max: "4"
48
+ array_task_min: "0"
49
+ array_task_step: "1"
50
+ cluster_name: clstr1
51
+ conf: /etc/slurm/slurm.conf
52
+ cpus_on_node: "10"
53
+ gpus: "2"
54
+ gpus_on_node: "2"
55
+ gtids: "0"
56
+ job_account: yang-wang
57
+ job_cpus_per_node: "10"
58
+ job_end_time: "1770637382"
59
+ job_gid: "2184"
60
+ job_gpus: 0,3
61
+ job_id: "59116"
62
+ job_name: H1Stat
63
+ job_nodelist: virya1
64
+ job_num_nodes: "1"
65
+ job_partition: all
66
+ job_qos: standard
67
+ job_start_time: "1770032582"
68
+ job_uid: "2184"
69
+ job_user: o_heidar
70
+ jobid: "59116"
71
+ localid: "0"
72
+ mem_per_node: "102400"
73
+ nnodes: "1"
74
+ nodeid: "0"
75
+ nodelist: virya1
76
+ prio_process: "0"
77
+ procid: "0"
78
+ script_context: prolog_task
79
+ submit_dir: /home/o_heidar/robot_learning_2026/jobs
80
+ submit_host: viryasubmit2
81
+ task_pid: "1212375"
82
+ tasks_per_node: "10"
83
+ topology_addr: virya1
84
+ topology_addr_pattern: node
85
+ startedAt: "2026-02-02T11:43:13.984688Z"
86
+ writerId: q4xofvz8clyq1g2jr4zr21tj3a4wrrs3
87
+ m: []
88
+ python_version: 3.10.19
89
+ t:
90
+ "1":
91
+ - 1
92
+ - 5
93
+ - 11
94
+ - 49
95
+ - 50
96
+ - 53
97
+ "2":
98
+ - 1
99
+ - 2
100
+ - 3
101
+ - 5
102
+ - 11
103
+ - 41
104
+ - 49
105
+ - 50
106
+ - 51
107
+ - 53
108
+ "3":
109
+ - 2
110
+ - 13
111
+ - 16
112
+ - 61
113
+ "4": 3.10.19
114
+ "5": 0.24.1
115
+ "6": 4.48.1
116
+ "12": 0.24.1
117
+ "13": linux-x86_64
118
+ action_dim:
119
+ value: 7
120
+ batch_size:
121
+ value: 256
122
+ data_shuffel_interval:
123
+ value: 1000
124
+ dataset:
125
+ value:
126
+ action_mean:
127
+ - 0.00032659756834618747
128
+ - 0.0002364425890846178
129
+ - -0.0001985691487789154
130
+ - -0.0003516025608405471
131
+ - -0.0005819069338031113
132
+ - 0.0006634143064729869
133
+ - 0.659541130065918
134
+ action_std:
135
+ - 0.0118407579138875
136
+ - 0.01651778072118759
137
+ - 0.01558756735175848
138
+ - 0.03479960933327675
139
+ - 0.03878577798604965
140
+ - 0.05862835422158241
141
+ - 0.5686280727386475
142
+ buffer_size: 50000
143
+ chars_list:
144
+ - ' '
145
+ - ','
146
+ - .
147
+ - "0"
148
+ - "1"
149
+ - "2"
150
+ - "3"
151
+ - "4"
152
+ - "5"
153
+ - "6"
154
+ - "7"
155
+ - "8"
156
+ - "9"
157
+ - '!'
158
+ - '?'
159
+ - '"'
160
+ - ''''
161
+ - (
162
+ - )
163
+ - '-'
164
+ - _
165
+ - ':'
166
+ - ;
167
+ - '@'
168
+ - '#'
169
+ - $
170
+ - '%'
171
+ - '&'
172
+ - '*'
173
+ - +
174
+ - =
175
+ - <
176
+ - '>'
177
+ - /
178
+ - \\
179
+ - '|'
180
+ - "~"
181
+ - '`'
182
+ - A
183
+ - B
184
+ - C
185
+ - D
186
+ - E
187
+ - F
188
+ - G
189
+ - H
190
+ - I
191
+ - J
192
+ - K
193
+ - L
194
+ - M
195
+ - "N"
196
+ - O
197
+ - P
198
+ - Q
199
+ - R
200
+ - S
201
+ - T
202
+ - U
203
+ - V
204
+ - W
205
+ - X
206
+ - "Y"
207
+ - Z
208
+ - a
209
+ - b
210
+ - c
211
+ - d
212
+ - e
213
+ - f
214
+ - g
215
+ - h
216
+ - i
217
+ - j
218
+ - k
219
+ - l
220
+ - m
221
+ - "n"
222
+ - o
223
+ - p
224
+ - q
225
+ - r
226
+ - s
227
+ - t
228
+ - u
229
+ - v
230
+ - w
231
+ - x
232
+ - "y"
233
+ - z
234
+ chunk_size: 1
235
+ dataset_indicies:
236
+ gs://gresearch/robotics/bridge/0.1.0/:
237
+ dataset_key: bridge_oxe
238
+ scale: 1
239
+ start: 0
240
+ weight: 1
241
+ download_all: false
242
+ encode_with_t5: false
243
+ gripper_closed_std: 1
244
+ load_dataset: true
245
+ num_episodes: 0
246
+ save_initial_dataset: false
247
+ t5_version: t5-small
248
+ to_name: gberseth/bridge-data-64px-test
249
+ use_generator: false
250
+ device:
251
+ value: cuda
252
+ dropout:
253
+ value: 0.2
254
+ eval_interval:
255
+ value: 100
256
+ eval_iters:
257
+ value: 5
258
+ eval_vid_iters:
259
+ value: 2500
260
+ experiment:
261
+ value:
262
+ description: simple env with 64pix images and pose data
263
+ name: grp_stat_3
264
+ project: mini-grp
265
+ gradient_accumulation_steps:
266
+ value: 1
267
+ image_shape:
268
+ value:
269
+ - 64
270
+ - 64
271
+ - 3
272
+ learning_rate:
273
+ value: 0.0003
274
+ load_action_bounds:
275
+ value: true
276
+ lr_schedule:
277
+ value: linear
278
+ max_block_size:
279
+ value: 16
280
+ max_iters:
281
+ value: 25000
282
+ model:
283
+ value:
284
+ type: transformer
285
+ n_blocks:
286
+ value: 4
287
+ n_embd:
288
+ value: 512
289
+ n_head:
290
+ value: 16
291
+ n_patches:
292
+ value: 8
293
+ patch_size:
294
+ value: 8
295
+ policy:
296
+ value:
297
+ action_stacking: 1
298
+ dtype: float32
299
+ obs_stacking: 3
300
+ random_masking_enabled: false
301
+ use_image_augmentations: false
302
+ use_pose_data: 1
303
+ profiler:
304
+ value:
305
+ enable: false
306
+ params:
307
+ profile_memory: true
308
+ use_cuda: true
309
+ with_stack: true
310
+ r_seed:
311
+ value: 1337
312
+ sim:
313
+ value:
314
+ episode length: 500
315
+ eval_episodes: 1
316
+ eval_tasks:
317
+ - 0
318
+ - 1
319
+ - 2
320
+ - 3
321
+ simEval:
322
+ value: []
323
+ testing:
324
+ value: false
325
+ vocab_size:
326
+ value: 32
wandb/run-20260202_064313-i4545kqj/files/output.log ADDED
@@ -0,0 +1,296 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ wandb: WARNING No relevant files were detected in the specified directory. No code will be logged to your run.
2
+ /home/o_heidar/robot_learning_2026/mini-grp/mini_shuffel_buffer.py:614: UserWarning:
3
+ The version_base parameter is not specified.
4
+ Please specify a compatability version level, or None.
5
+ Will assume defaults for version 1.1
6
+ @hydra.main(config_path="./conf", config_name="64pix-pose")
7
+ Using Transformer model
8
+ vocab_size: 90
9
+ [2026-02-02 06:43:22,259][datasets][INFO] - TensorFlow version 2.15.0 available.
10
+ Time to load huggingface dataset: 2.516728639602661
11
+ Time to load huggingface data and copy: 24.613126277923584
12
+ Loaded dataset with size: 50000
13
+ 12.893191 M parameters
14
+ Memory used by the model: 1289.755136 MB
15
+ Memory used by the dataset cBuffer: 0.445692 MB
16
+ Memory used by the dataset cBuffer image: 0.000184 MB
17
+ Memory used by the dataset cBuffer goal image: 0.000184 MB
18
+ Memory used by the dataset cBuffer: t5_language_embedding 1.6e-05 MB
19
+ num <queue.Queue object at 0x7d1d2c793c40>
20
+ step 0: train loss 1.2561, val loss 1.2331, memory 1298.27 MB
21
+ Model saved to ./checkpoints/grp_stat_3.pth
22
+ step 100: train loss 0.7189, val loss 0.6812, memory 1460.79 MB
23
+ step 200: train loss 0.6676, val loss 0.6790, memory 1460.79 MB
24
+ step 300: train loss 0.6857, val loss 0.6692, memory 1460.79 MB
25
+ step 400: train loss 0.6532, val loss 0.6879, memory 1460.79 MB
26
+ step 500: train loss 0.7244, val loss 0.6382, memory 1460.79 MB
27
+ step 600: train loss 0.6103, val loss 0.5972, memory 1460.79 MB
28
+ step 700: train loss 0.6218, val loss 0.6448, memory 1460.79 MB
29
+ step 800: train loss 0.6331, val loss 0.5831, memory 1460.79 MB
30
+ step 900: train loss 0.6193, val loss 0.5889, memory 1460.79 MB
31
+ step 1000: train loss 0.6111, val loss 0.6234, memory 1460.79 MB
32
+ Model saved to ./checkpoints/grp_stat_3.pth
33
+ step 1100: train loss 0.6461, val loss 0.6237, memory 1460.79 MB
34
+ step 1200: train loss 0.6076, val loss 0.6209, memory 1460.79 MB
35
+ step 1300: train loss 0.6120, val loss 0.6172, memory 1460.79 MB
36
+ step 1400: train loss 0.6117, val loss 0.6226, memory 1460.79 MB
37
+ step 1500: train loss 0.6216, val loss 0.6008, memory 1460.79 MB
38
+ step 1600: train loss 0.5858, val loss 0.5804, memory 1460.79 MB
39
+ step 1700: train loss 0.5621, val loss 0.6078, memory 1460.79 MB
40
+ step 1800: train loss 0.5562, val loss 0.5873, memory 1460.79 MB
41
+ step 1900: train loss 0.5499, val loss 0.6078, memory 1460.79 MB
42
+ step 2000: train loss 0.5819, val loss 0.5531, memory 1460.79 MB
43
+ Model saved to ./checkpoints/grp_stat_3.pth
44
+ step 2100: train loss 0.5583, val loss 0.5453, memory 1460.79 MB
45
+ step 2200: train loss 0.5972, val loss 0.5706, memory 1460.79 MB
46
+ step 2300: train loss 0.5570, val loss 0.5305, memory 1460.79 MB
47
+ step 2400: train loss 0.5272, val loss 0.5677, memory 1460.79 MB
48
+ step 2500: train loss 0.5377, val loss 0.5141, memory 1460.79 MB
49
+ step 2600: train loss 0.4698, val loss 0.5408, memory 1460.79 MB
50
+ step 2700: train loss 0.5047, val loss 0.5272, memory 1460.79 MB
51
+ step 2800: train loss 0.4769, val loss 0.5125, memory 1460.79 MB
52
+ step 2900: train loss 0.4855, val loss 0.4887, memory 1460.79 MB
53
+ step 3000: train loss 0.4516, val loss 0.4883, memory 1460.79 MB
54
+ Model saved to ./checkpoints/grp_stat_3.pth
55
+ step 3100: train loss 0.4782, val loss 0.4545, memory 1460.79 MB
56
+ step 3200: train loss 0.4456, val loss 0.4884, memory 1460.79 MB
57
+ step 3300: train loss 0.4679, val loss 0.4463, memory 1460.79 MB
58
+ step 3400: train loss 0.4192, val loss 0.4447, memory 1460.79 MB
59
+ step 3500: train loss 0.4444, val loss 0.4410, memory 1460.79 MB
60
+ step 3600: train loss 0.3920, val loss 0.4080, memory 1460.79 MB
61
+ step 3700: train loss 0.4098, val loss 0.3948, memory 1460.79 MB
62
+ step 3800: train loss 0.4099, val loss 0.4020, memory 1460.79 MB
63
+ step 3900: train loss 0.3880, val loss 0.3558, memory 1460.79 MB
64
+ step 4000: train loss 0.3801, val loss 0.3811, memory 1460.79 MB
65
+ Model saved to ./checkpoints/grp_stat_3.pth
66
+ step 4100: train loss 0.3663, val loss 0.3879, memory 1460.79 MB
67
+ step 4200: train loss 0.3574, val loss 0.3740, memory 1460.79 MB
68
+ step 4300: train loss 0.3654, val loss 0.3690, memory 1460.79 MB
69
+ step 4400: train loss 0.3572, val loss 0.3526, memory 1460.79 MB
70
+ step 4500: train loss 0.3552, val loss 0.3322, memory 1460.79 MB
71
+ step 4600: train loss 0.3343, val loss 0.3532, memory 1460.79 MB
72
+ step 4700: train loss 0.3262, val loss 0.3365, memory 1460.79 MB
73
+ step 4800: train loss 0.3208, val loss 0.3511, memory 1460.79 MB
74
+ step 4900: train loss 0.3113, val loss 0.3042, memory 1460.79 MB
75
+ step 5000: train loss 0.3160, val loss 0.3016, memory 1460.79 MB
76
+ Model saved to ./checkpoints/grp_stat_3.pth
77
+ step 5100: train loss 0.2975, val loss 0.2929, memory 1460.79 MB
78
+ step 5200: train loss 0.2701, val loss 0.3149, memory 1460.79 MB
79
+ step 5300: train loss 0.2722, val loss 0.2676, memory 1460.79 MB
80
+ step 5400: train loss 0.2793, val loss 0.2865, memory 1460.79 MB
81
+ step 5500: train loss 0.2713, val loss 0.2626, memory 1460.79 MB
82
+ step 5600: train loss 0.2775, val loss 0.2568, memory 1460.79 MB
83
+ step 5700: train loss 0.2875, val loss 0.2646, memory 1460.79 MB
84
+ step 5800: train loss 0.2501, val loss 0.2609, memory 1460.79 MB
85
+ step 5900: train loss 0.2606, val loss 0.2473, memory 1460.79 MB
86
+ step 6000: train loss 0.2359, val loss 0.2412, memory 1460.79 MB
87
+ Model saved to ./checkpoints/grp_stat_3.pth
88
+ step 6100: train loss 0.2321, val loss 0.2516, memory 1460.79 MB
89
+ step 6200: train loss 0.2383, val loss 0.2271, memory 1460.79 MB
90
+ step 6300: train loss 0.2332, val loss 0.2418, memory 1460.79 MB
91
+ step 6400: train loss 0.2387, val loss 0.2397, memory 1460.79 MB
92
+ step 6500: train loss 0.2234, val loss 0.2346, memory 1460.79 MB
93
+ step 6600: train loss 0.2276, val loss 0.2122, memory 1460.79 MB
94
+ step 6700: train loss 0.2049, val loss 0.2185, memory 1460.79 MB
95
+ step 6800: train loss 0.1979, val loss 0.2095, memory 1460.79 MB
96
+ step 6900: train loss 0.2009, val loss 0.2111, memory 1460.79 MB
97
+ step 7000: train loss 0.2004, val loss 0.2184, memory 1460.79 MB
98
+ Model saved to ./checkpoints/grp_stat_3.pth
99
+ step 7100: train loss 0.1855, val loss 0.1974, memory 1460.79 MB
100
+ step 7200: train loss 0.1934, val loss 0.1869, memory 1460.79 MB
101
+ step 7300: train loss 0.1823, val loss 0.1964, memory 1460.79 MB
102
+ step 7400: train loss 0.1751, val loss 0.1777, memory 1460.79 MB
103
+ step 7500: train loss 0.1797, val loss 0.1771, memory 1460.79 MB
104
+ step 7600: train loss 0.1783, val loss 0.1752, memory 1460.79 MB
105
+ step 7700: train loss 0.1677, val loss 0.1797, memory 1460.79 MB
106
+ step 7800: train loss 0.1790, val loss 0.1733, memory 1460.79 MB
107
+ step 7900: train loss 0.1732, val loss 0.1665, memory 1460.79 MB
108
+ step 8000: train loss 0.1663, val loss 0.1714, memory 1460.79 MB
109
+ Model saved to ./checkpoints/grp_stat_3.pth
110
+ step 8100: train loss 0.1691, val loss 0.1583, memory 1460.79 MB
111
+ step 8200: train loss 0.1601, val loss 0.1618, memory 1460.79 MB
112
+ step 8300: train loss 0.1620, val loss 0.1706, memory 1460.79 MB
113
+ step 8400: train loss 0.1582, val loss 0.1601, memory 1460.79 MB
114
+ step 8500: train loss 0.1543, val loss 0.1548, memory 1460.79 MB
115
+ step 8600: train loss 0.1489, val loss 0.1563, memory 1460.79 MB
116
+ step 8700: train loss 0.1514, val loss 0.1545, memory 1460.79 MB
117
+ step 8800: train loss 0.1465, val loss 0.1428, memory 1460.79 MB
118
+ step 8900: train loss 0.1435, val loss 0.1434, memory 1460.79 MB
119
+ step 9000: train loss 0.1448, val loss 0.1430, memory 1460.79 MB
120
+ Model saved to ./checkpoints/grp_stat_3.pth
121
+ step 9100: train loss 0.1363, val loss 0.1359, memory 1460.79 MB
122
+ step 9200: train loss 0.1371, val loss 0.1419, memory 1460.79 MB
123
+ step 9300: train loss 0.1538, val loss 0.1536, memory 1460.79 MB
124
+ step 9400: train loss 0.1368, val loss 0.1464, memory 1460.79 MB
125
+ step 9500: train loss 0.1357, val loss 0.1397, memory 1460.79 MB
126
+ step 9600: train loss 0.1292, val loss 0.1311, memory 1460.79 MB
127
+ step 9700: train loss 0.1449, val loss 0.1281, memory 1460.79 MB
128
+ step 9800: train loss 0.1317, val loss 0.1258, memory 1460.79 MB
129
+ step 9900: train loss 0.1257, val loss 0.1362, memory 1460.79 MB
130
+ step 10000: train loss 0.1301, val loss 0.1294, memory 1460.79 MB
131
+ Model saved to ./checkpoints/grp_stat_3.pth
132
+ step 10100: train loss 0.1274, val loss 0.1299, memory 1460.79 MB
133
+ step 10200: train loss 0.1281, val loss 0.1251, memory 1460.79 MB
134
+ step 10300: train loss 0.1183, val loss 0.1240, memory 1460.79 MB
135
+ step 10400: train loss 0.1250, val loss 0.1221, memory 1460.79 MB
136
+ step 10500: train loss 0.1208, val loss 0.1174, memory 1460.79 MB
137
+ step 10600: train loss 0.1162, val loss 0.1250, memory 1460.79 MB
138
+ step 10700: train loss 0.1062, val loss 0.1123, memory 1460.79 MB
139
+ step 10800: train loss 0.1136, val loss 0.1104, memory 1460.79 MB
140
+ step 10900: train loss 0.1165, val loss 0.1146, memory 1460.79 MB
141
+ step 11000: train loss 0.1109, val loss 0.1181, memory 1460.79 MB
142
+ Model saved to ./checkpoints/grp_stat_3.pth
143
+ step 11100: train loss 0.1099, val loss 0.1029, memory 1460.79 MB
144
+ step 11200: train loss 0.1096, val loss 0.1062, memory 1460.79 MB
145
+ step 11300: train loss 0.1060, val loss 0.1040, memory 1460.79 MB
146
+ step 11400: train loss 0.1087, val loss 0.1150, memory 1460.79 MB
147
+ step 11500: train loss 0.0981, val loss 0.1008, memory 1460.79 MB
148
+ step 11600: train loss 0.1054, val loss 0.0998, memory 1460.79 MB
149
+ step 11700: train loss 0.0960, val loss 0.1015, memory 1460.79 MB
150
+ step 11800: train loss 0.1002, val loss 0.1023, memory 1460.79 MB
151
+ step 11900: train loss 0.1119, val loss 0.1163, memory 1460.79 MB
152
+ step 12000: train loss 0.1042, val loss 0.0973, memory 1460.79 MB
153
+ Model saved to ./checkpoints/grp_stat_3.pth
154
+ step 12100: train loss 0.0945, val loss 0.0941, memory 1460.79 MB
155
+ step 12200: train loss 0.0948, val loss 0.0967, memory 1460.79 MB
156
+ step 12300: train loss 0.1010, val loss 0.1024, memory 1460.79 MB
157
+ step 12400: train loss 0.0969, val loss 0.1015, memory 1460.79 MB
158
+ step 12500: train loss 0.0985, val loss 0.0940, memory 1460.79 MB
159
+ step 12600: train loss 0.0956, val loss 0.0938, memory 1460.79 MB
160
+ step 12700: train loss 0.0965, val loss 0.1038, memory 1460.79 MB
161
+ step 12800: train loss 0.0963, val loss 0.0992, memory 1460.79 MB
162
+ step 12900: train loss 0.1070, val loss 0.1038, memory 1460.79 MB
163
+ step 13000: train loss 0.0954, val loss 0.0925, memory 1460.79 MB
164
+ Model saved to ./checkpoints/grp_stat_3.pth
165
+ step 13100: train loss 0.0886, val loss 0.0903, memory 1460.79 MB
166
+ step 13200: train loss 0.0916, val loss 0.0961, memory 1460.79 MB
167
+ step 13300: train loss 0.0888, val loss 0.0881, memory 1460.79 MB
168
+ step 13400: train loss 0.0819, val loss 0.0901, memory 1460.79 MB
169
+ step 13500: train loss 0.0883, val loss 0.0817, memory 1460.79 MB
170
+ step 13600: train loss 0.0935, val loss 0.0927, memory 1460.79 MB
171
+ step 13700: train loss 0.0920, val loss 0.0883, memory 1460.79 MB
172
+ step 13800: train loss 0.0837, val loss 0.0832, memory 1460.79 MB
173
+ step 13900: train loss 0.0873, val loss 0.0831, memory 1460.79 MB
174
+ step 14000: train loss 0.0841, val loss 0.0814, memory 1460.79 MB
175
+ Model saved to ./checkpoints/grp_stat_3.pth
176
+ step 14100: train loss 0.0899, val loss 0.0906, memory 1460.79 MB
177
+ step 14200: train loss 0.0847, val loss 0.0806, memory 1460.79 MB
178
+ step 14300: train loss 0.0820, val loss 0.0833, memory 1460.79 MB
179
+ step 14400: train loss 0.0789, val loss 0.0728, memory 1460.79 MB
180
+ step 14500: train loss 0.0899, val loss 0.0858, memory 1460.79 MB
181
+ step 14600: train loss 0.0744, val loss 0.0775, memory 1460.79 MB
182
+ step 14700: train loss 0.0804, val loss 0.0819, memory 1460.79 MB
183
+ step 14800: train loss 0.0845, val loss 0.0861, memory 1460.79 MB
184
+ step 14900: train loss 0.0777, val loss 0.0793, memory 1460.79 MB
185
+ step 15000: train loss 0.0909, val loss 0.0827, memory 1460.79 MB
186
+ Model saved to ./checkpoints/grp_stat_3.pth
187
+ step 15100: train loss 0.0856, val loss 0.0824, memory 1460.79 MB
188
+ step 15200: train loss 0.0719, val loss 0.0800, memory 1460.79 MB
189
+ step 15300: train loss 0.0759, val loss 0.0792, memory 1460.79 MB
190
+ step 15400: train loss 0.0800, val loss 0.0787, memory 1460.79 MB
191
+ step 15500: train loss 0.0875, val loss 0.0789, memory 1460.79 MB
192
+ step 15600: train loss 0.0754, val loss 0.0782, memory 1460.79 MB
193
+ step 15700: train loss 0.0754, val loss 0.0784, memory 1460.79 MB
194
+ step 15800: train loss 0.0766, val loss 0.0771, memory 1460.79 MB
195
+ step 15900: train loss 0.0732, val loss 0.0775, memory 1460.79 MB
196
+ step 16000: train loss 0.0749, val loss 0.0712, memory 1460.79 MB
197
+ Model saved to ./checkpoints/grp_stat_3.pth
198
+ step 16100: train loss 0.0693, val loss 0.0694, memory 1460.79 MB
199
+ step 16200: train loss 0.0736, val loss 0.0785, memory 1460.79 MB
200
+ step 16300: train loss 0.0781, val loss 0.0776, memory 1460.79 MB
201
+ step 16400: train loss 0.0694, val loss 0.0737, memory 1460.79 MB
202
+ step 16500: train loss 0.0744, val loss 0.0779, memory 1460.79 MB
203
+ step 16600: train loss 0.0691, val loss 0.0694, memory 1460.79 MB
204
+ step 16700: train loss 0.0712, val loss 0.0807, memory 1460.79 MB
205
+ step 16800: train loss 0.0732, val loss 0.0764, memory 1460.79 MB
206
+ step 16900: train loss 0.0784, val loss 0.0750, memory 1460.79 MB
207
+ step 17000: train loss 0.0702, val loss 0.0710, memory 1460.79 MB
208
+ Model saved to ./checkpoints/grp_stat_3.pth
209
+ step 17100: train loss 0.0700, val loss 0.0707, memory 1460.79 MB
210
+ step 17200: train loss 0.0693, val loss 0.0717, memory 1460.79 MB
211
+ step 17300: train loss 0.0683, val loss 0.0668, memory 1460.79 MB
212
+ step 17400: train loss 0.0710, val loss 0.0755, memory 1460.79 MB
213
+ step 17500: train loss 0.0669, val loss 0.0653, memory 1460.79 MB
214
+ step 17600: train loss 0.0703, val loss 0.0677, memory 1460.79 MB
215
+ step 17700: train loss 0.0675, val loss 0.0645, memory 1460.79 MB
216
+ step 17800: train loss 0.0726, val loss 0.0678, memory 1460.79 MB
217
+ step 17900: train loss 0.0711, val loss 0.0682, memory 1460.79 MB
218
+ step 18000: train loss 0.0678, val loss 0.0726, memory 1460.79 MB
219
+ Model saved to ./checkpoints/grp_stat_3.pth
220
+ step 18100: train loss 0.0668, val loss 0.0661, memory 1460.79 MB
221
+ step 18200: train loss 0.0703, val loss 0.0685, memory 1460.79 MB
222
+ step 18300: train loss 0.0673, val loss 0.0644, memory 1460.79 MB
223
+ step 18400: train loss 0.0675, val loss 0.0661, memory 1460.79 MB
224
+ step 18500: train loss 0.0688, val loss 0.0697, memory 1460.79 MB
225
+ step 18600: train loss 0.0677, val loss 0.0648, memory 1460.79 MB
226
+ step 18700: train loss 0.0643, val loss 0.0602, memory 1460.79 MB
227
+ step 18800: train loss 0.0629, val loss 0.0622, memory 1460.79 MB
228
+ step 18900: train loss 0.0597, val loss 0.0630, memory 1460.79 MB
229
+ step 19000: train loss 0.0665, val loss 0.0696, memory 1460.79 MB
230
+ Model saved to ./checkpoints/grp_stat_3.pth
231
+ step 19100: train loss 0.0626, val loss 0.0617, memory 1460.79 MB
232
+ step 19200: train loss 0.0612, val loss 0.0595, memory 1460.79 MB
233
+ step 19300: train loss 0.0608, val loss 0.0632, memory 1460.79 MB
234
+ step 19400: train loss 0.0556, val loss 0.0599, memory 1460.79 MB
235
+ step 19500: train loss 0.0544, val loss 0.0580, memory 1460.79 MB
236
+ step 19600: train loss 0.0631, val loss 0.0612, memory 1460.79 MB
237
+ step 19700: train loss 0.0607, val loss 0.0625, memory 1460.79 MB
238
+ step 19800: train loss 0.0672, val loss 0.0644, memory 1460.79 MB
239
+ step 19900: train loss 0.0598, val loss 0.0593, memory 1460.79 MB
240
+ step 20000: train loss 0.0630, val loss 0.0627, memory 1460.79 MB
241
+ Model saved to ./checkpoints/grp_stat_3.pth
242
+ step 20100: train loss 0.0612, val loss 0.0596, memory 1460.79 MB
243
+ step 20200: train loss 0.0635, val loss 0.0598, memory 1460.79 MB
244
+ step 20300: train loss 0.0585, val loss 0.0535, memory 1460.79 MB
245
+ step 20400: train loss 0.0556, val loss 0.0560, memory 1460.79 MB
246
+ step 20500: train loss 0.0620, val loss 0.0649, memory 1460.79 MB
247
+ step 20600: train loss 0.0602, val loss 0.0626, memory 1460.79 MB
248
+ step 20700: train loss 0.0580, val loss 0.0559, memory 1460.79 MB
249
+ step 20800: train loss 0.0558, val loss 0.0596, memory 1460.79 MB
250
+ step 20900: train loss 0.0586, val loss 0.0568, memory 1460.79 MB
251
+ step 21000: train loss 0.0585, val loss 0.0599, memory 1460.79 MB
252
+ Model saved to ./checkpoints/grp_stat_3.pth
253
+ step 21100: train loss 0.0558, val loss 0.0544, memory 1460.79 MB
254
+ step 21200: train loss 0.0588, val loss 0.0583, memory 1460.79 MB
255
+ step 21300: train loss 0.0546, val loss 0.0584, memory 1460.79 MB
256
+ step 21400: train loss 0.0541, val loss 0.0524, memory 1460.79 MB
257
+ step 21500: train loss 0.0545, val loss 0.0603, memory 1460.79 MB
258
+ step 21600: train loss 0.0579, val loss 0.0561, memory 1460.79 MB
259
+ step 21700: train loss 0.0593, val loss 0.0601, memory 1460.79 MB
260
+ step 21800: train loss 0.0504, val loss 0.0516, memory 1460.79 MB
261
+ step 21900: train loss 0.0530, val loss 0.0507, memory 1460.79 MB
262
+ step 22000: train loss 0.0583, val loss 0.0604, memory 1460.79 MB
263
+ Model saved to ./checkpoints/grp_stat_3.pth
264
+ step 22100: train loss 0.0569, val loss 0.0583, memory 1460.79 MB
265
+ step 22200: train loss 0.0523, val loss 0.0506, memory 1460.79 MB
266
+ step 22300: train loss 0.0543, val loss 0.0574, memory 1460.79 MB
267
+ step 22400: train loss 0.0561, val loss 0.0541, memory 1460.79 MB
268
+ step 22500: train loss 0.0568, val loss 0.0548, memory 1460.79 MB
269
+ step 22600: train loss 0.0553, val loss 0.0519, memory 1460.79 MB
270
+ step 22700: train loss 0.0544, val loss 0.0543, memory 1460.79 MB
271
+ step 22800: train loss 0.0570, val loss 0.0561, memory 1460.79 MB
272
+ step 22900: train loss 0.0563, val loss 0.0556, memory 1460.79 MB
273
+ step 23000: train loss 0.0506, val loss 0.0529, memory 1460.79 MB
274
+ Model saved to ./checkpoints/grp_stat_3.pth
275
+ step 23100: train loss 0.0521, val loss 0.0511, memory 1460.79 MB
276
+ step 23200: train loss 0.0575, val loss 0.0574, memory 1460.79 MB
277
+ step 23300: train loss 0.0554, val loss 0.0509, memory 1460.79 MB
278
+ step 23400: train loss 0.0573, val loss 0.0539, memory 1460.79 MB
279
+ step 23500: train loss 0.0550, val loss 0.0547, memory 1460.79 MB
280
+ step 23600: train loss 0.0545, val loss 0.0524, memory 1460.79 MB
281
+ step 23700: train loss 0.0504, val loss 0.0529, memory 1460.79 MB
282
+ step 23800: train loss 0.0465, val loss 0.0516, memory 1460.79 MB
283
+ step 23900: train loss 0.0510, val loss 0.0502, memory 1460.79 MB
284
+ step 24000: train loss 0.0497, val loss 0.0490, memory 1460.79 MB
285
+ Model saved to ./checkpoints/grp_stat_3.pth
286
+ step 24100: train loss 0.0533, val loss 0.0567, memory 1460.79 MB
287
+ step 24200: train loss 0.0532, val loss 0.0540, memory 1460.79 MB
288
+ step 24300: train loss 0.0453, val loss 0.0507, memory 1460.79 MB
289
+ step 24400: train loss 0.0473, val loss 0.0528, memory 1460.79 MB
290
+ step 24500: train loss 0.0509, val loss 0.0537, memory 1460.79 MB
291
+ step 24600: train loss 0.0527, val loss 0.0562, memory 1460.79 MB
292
+ step 24700: train loss 0.0546, val loss 0.0554, memory 1460.79 MB
293
+ step 24800: train loss 0.0490, val loss 0.0484, memory 1460.79 MB
294
+ step 24900: train loss 0.0476, val loss 0.0493, memory 1460.79 MB
295
+ step 24999: train loss 0.0538, val loss 0.0502, memory 1460.79 MB
296
+ Model saved to ./checkpoints/grp_stat_3.pth
wandb/run-20260202_064313-i4545kqj/files/requirements.txt ADDED
@@ -0,0 +1,249 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ httpx==0.27.2
2
+ marshmallow==3.20.2
3
+ sniffio==1.3.1
4
+ optree==0.11.0
5
+ multiprocess==0.70.16
6
+ biom-format==2.1.16
7
+ typing-inspect==0.9.0
8
+ kornia_rs==0.1.7
9
+ loky==3.4.1
10
+ llama_stack_client==0.0.54
11
+ randaugment==1.0.2
12
+ numba==0.60.0
13
+ annotated-types==0.7.0
14
+ llama_stack==0.0.54
15
+ tomli==2.2.1
16
+ kornia==0.7.4
17
+ terminaltables==3.1.10
18
+ tensorrt-cu12==10.6.0
19
+ schedule==1.2.2
20
+ mdurl==0.1.2
21
+ responses==0.18.0
22
+ awscli==1.32.41
23
+ libclang==18.1.1
24
+ torchvision==0.20.1
25
+ timm==0.9.16
26
+ addict==2.4.0
27
+ pyarrow-hotfix==0.6
28
+ tensorboard-data-server==0.7.2
29
+ threadpoolctl==3.4.0
30
+ contourpy==1.3.1
31
+ blobfile==3.0.0
32
+ llama_models==0.0.54
33
+ python-dateutil==2.8.2
34
+ mypy-extensions==1.0.0
35
+ moviepy==1.0.3
36
+ namex==0.0.7
37
+ pyaml==24.9.0
38
+ s3transfer==0.10.0
39
+ rouge-score==0.1.2
40
+ httpcore==1.0.7
41
+ pycryptodomex==3.21.0
42
+ jmespath==1.0.1
43
+ docutils==0.16
44
+ h11==0.14.0
45
+ ete3==3.1.3
46
+ boto3==1.34.44
47
+ MarkupSafe==3.0.2
48
+ tensorrt==10.6.0
49
+ nltk==3.9.1
50
+ tiktoken==0.8.0
51
+ pbr==6.1.0
52
+ Pygments==2.17.2
53
+ pydantic_core==2.27.1
54
+ ego4d==1.6.1
55
+ tensorrt-cu12-bindings==10.6.0
56
+ tensorrt-cu12-libs==10.6.0
57
+ bgzip==0.5.0
58
+ cogent3==2024.11.29a2
59
+ dataclasses-json==0.6.4
60
+ platformdirs==4.3.8
61
+ exceptiongroup==1.2.2
62
+ mpmath==1.3.0
63
+ inquirerpy==0.3.4
64
+ packaging==23.2
65
+ inplace-abn==1.1.0
66
+ astunparse==1.6.3
67
+ google-pasta==0.2.0
68
+ joblib==1.3.2
69
+ prompt_toolkit==3.0.48
70
+ llvmlite==0.43.0
71
+ torchaudio==2.5.1
72
+ pydantic==2.10.1
73
+ scikit-learn==1.6.1
74
+ fire==0.7.0
75
+ Werkzeug==3.1.3
76
+ scitrack==2024.10.8
77
+ pfzy==0.3.4
78
+ cvbase==0.5.5
79
+ pysam==0.22.1
80
+ tensorboardX==2.6.2.2
81
+ bert-score==0.3.13
82
+ anyio==4.6.2.post1
83
+ evaluate==0.4.1
84
+ yapf==0.43.0
85
+ wheel==0.41.2
86
+ iopath==0.1.10
87
+ dominate==2.9.1
88
+ cycler==0.12.1
89
+ meteor==2.0.17
90
+ portalocker==2.8.2
91
+ lxml==5.3.0
92
+ decord==0.6.0
93
+ keras==2.15.0
94
+ nvidia-nvtx-cu12==12.4.127
95
+ kiwisolver==1.4.9
96
+ decorator==4.4.2
97
+ nvidia-cudnn-cu12==9.1.0.70
98
+ huggingface==0.0.1
99
+ cliff==4.11.0
100
+ nvidia-cusolver-cu12==11.6.1.9
101
+ packaging==25.0
102
+ frozenlist==1.7.0
103
+ Farama-Notifications==0.0.4
104
+ fsspec==2025.9.0
105
+ pyarrow==21.0.0
106
+ Pympler==1.1
107
+ tensorboard==2.15.2
108
+ einops==0.8.0
109
+ wandb==0.24.1
110
+ rich==14.1.0
111
+ colorlog==6.9.0
112
+ hydra-optuna-sweeper==1.2.0
113
+ absl-py==2.3.1
114
+ gymnasium==0.28.1
115
+ nvidia-cublas-cu12==12.4.5.8
116
+ hydra-submitit-launcher==1.2.0
117
+ psutil==7.2.2
118
+ urllib3==2.5.0
119
+ opencv-python==4.11.0.86
120
+ python-box==7.3.2
121
+ nvidia-cuda-nvrtc-cu12==12.4.127
122
+ smmap==5.0.2
123
+ cmaes==0.12.0
124
+ xxhash==3.5.0
125
+ hydra-core==1.2.0
126
+ PyYAML==6.0.2
127
+ tensorflow==2.15.0
128
+ filelock==3.19.1
129
+ rlds==0.1.8
130
+ tensorflow-estimator==2.15.0
131
+ termcolor==3.1.0
132
+ tensorflow-datasets==4.9.2
133
+ sentry-sdk==2.38.0
134
+ typing_extensions==4.15.0
135
+ requests==2.32.5
136
+ antlr4-python3-runtime==4.9.3
137
+ flatbuffers==25.2.10
138
+ rich-argparse==1.7.1
139
+ stevedore==5.5.0
140
+ aiohappyeyeballs==2.6.1
141
+ pandas==2.2.2
142
+ Jinja2==3.1.4
143
+ dm-tree==0.1.9
144
+ SQLAlchemy==2.0.43
145
+ zipp==3.23.0
146
+ rsa==4.9.1
147
+ hf-xet==1.1.10
148
+ networkx==3.3
149
+ pyasn1==0.6.1
150
+ gast==0.6.0
151
+ async-timeout==5.0.1
152
+ charset-normalizer==3.4.3
153
+ transformers==4.48.1
154
+ wcwidth==0.2.13
155
+ opt_einsum==3.4.0
156
+ safetensors==0.6.2
157
+ google-auth-oauthlib==1.2.2
158
+ imageio-ffmpeg==0.6.0
159
+ docker-pycreds==0.4.0
160
+ cmd2==2.7.0
161
+ optuna==2.10.1
162
+ gitdb==4.0.12
163
+ aiosignal==1.4.0
164
+ propcache==0.3.2
165
+ pytz==2025.2
166
+ pyasn1_modules==0.4.2
167
+ regex==2025.9.18
168
+ prettytable==3.16.0
169
+ protobuf==3.20.3
170
+ nvidia-cufft-cu12==11.2.1.3
171
+ yarl==1.20.1
172
+ dill==0.4.0
173
+ tensorflow-io-gcs-filesystem==0.37.1
174
+ nvidia-curand-cu12==10.3.5.147
175
+ certifi==2025.8.3
176
+ proglog==0.1.12
177
+ attrs==25.3.0
178
+ idna==3.10
179
+ ml-dtypes==0.2.0
180
+ matplotlib==3.5.3
181
+ nvidia-cusparse-cu12==12.3.1.170
182
+ greenlet==3.2.4
183
+ imageio==2.37.0
184
+ scipy==1.15.3
185
+ setproctitle==1.3.7
186
+ dm-reverb==0.14.0
187
+ triton==3.1.0
188
+ jax-jumpy==1.0.0
189
+ torch==2.5.1
190
+ pathtools==0.1.2
191
+ tzdata==2025.2
192
+ tokenizers==0.21.4
193
+ tqdm==4.67.1
194
+ numpy==1.26.4
195
+ cachetools==5.5.2
196
+ submitit==1.5.3
197
+ cloudpickle==3.1.1
198
+ wheel==0.46.3
199
+ oauthlib==3.3.1
200
+ aiohttp==3.12.15
201
+ setuptools==80.10.1
202
+ tensorflow-metadata==1.16.1
203
+ six==1.17.0
204
+ fonttools==4.60.0
205
+ omegaconf==2.3.0
206
+ shortuuid==1.0.13
207
+ nvidia-cuda-cupti-cu12==12.4.127
208
+ markdown-it-py==4.0.0
209
+ promise==2.3
210
+ h5py==3.14.0
211
+ pip==26.0
212
+ nvidia-nvjitlink-cu12==12.4.127
213
+ google-auth==2.40.3
214
+ nvidia-cuda-runtime-cu12==12.4.127
215
+ nvidia-nccl-cu12==2.21.5
216
+ autopage==0.5.2
217
+ click==8.3.0
218
+ array_record==0.8.1
219
+ multidict==6.6.4
220
+ Mako==1.3.10
221
+ etils==1.13.0
222
+ pyparsing==3.2.4
223
+ Markdown==3.9
224
+ huggingface-hub==0.35.0
225
+ datasets==4.1.1
226
+ portpicker==1.6.0
227
+ sympy==1.13.1
228
+ Pillow==9.4.0
229
+ grpcio==1.75.0
230
+ requests-oauthlib==2.0.0
231
+ sentencepiece==0.2.0
232
+ GitPython==3.1.45
233
+ wrapt==1.14.2
234
+ toml==0.10.2
235
+ alembic==1.16.5
236
+ importlib_resources==6.5.2
237
+ pyperclip==1.10.0
238
+ more-itertools==10.8.0
239
+ jaraco.context==6.1.0
240
+ zipp==3.23.0
241
+ backports.tarfile==1.2.0
242
+ jaraco.functools==4.4.0
243
+ autocommand==2.2.2
244
+ jaraco.text==4.0.0
245
+ wheel==0.45.1
246
+ tomli==2.4.0
247
+ platformdirs==4.4.0
248
+ importlib_metadata==8.7.1
249
+ packaging==25.0
wandb/run-20260202_064313-i4545kqj/files/wandb-metadata.json ADDED
@@ -0,0 +1,94 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "os": "Linux-6.8.0-79-generic-x86_64-with-glibc2.39",
3
+ "python": "CPython 3.10.19",
4
+ "startedAt": "2026-02-02T11:43:13.984688Z",
5
+ "args": [
6
+ "simEval=[]",
7
+ "policy.obs_stacking=3",
8
+ "experiment.name=grp_stat_3"
9
+ ],
10
+ "program": "/home/o_heidar/robot_learning_2026/mini-grp/mini_grp.py",
11
+ "codePath": "mini-grp/mini_grp.py",
12
+ "git": {
13
+ "remote": "https://github.com/omid-reza/robot_learning_2026.git",
14
+ "commit": "a1e45b9ec95f0f09f151f485ba23961058153e48"
15
+ },
16
+ "email": "omid.orh@gmail.com",
17
+ "root": "/home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12",
18
+ "host": "virya1",
19
+ "executable": "/home/o_heidar/rbenv/bin/python",
20
+ "cpu_count": 36,
21
+ "cpu_count_logical": 72,
22
+ "gpu": "Tesla V100-PCIE-32GB",
23
+ "gpu_count": 2,
24
+ "disk": {
25
+ "/": {
26
+ "total": "470272819200",
27
+ "used": "31232614400"
28
+ }
29
+ },
30
+ "memory": {
31
+ "total": "405360889856"
32
+ },
33
+ "gpu_nvidia": [
34
+ {
35
+ "name": "Tesla V100-PCIE-32GB",
36
+ "memoryTotal": "34359738368",
37
+ "cudaCores": 5120,
38
+ "architecture": "Volta",
39
+ "uuid": "GPU-28f0e524-a7c5-f287-d873-73f15fb0d817"
40
+ },
41
+ {
42
+ "name": "Tesla V100-PCIE-32GB",
43
+ "memoryTotal": "34359738368",
44
+ "cudaCores": 5120,
45
+ "architecture": "Volta",
46
+ "uuid": "GPU-6b13b007-765f-fea0-26ee-f1842182916d"
47
+ }
48
+ ],
49
+ "cudaVersion": "12.9",
50
+ "slurm": {
51
+ "array_job_id": "59114",
52
+ "array_task_count": "5",
53
+ "array_task_id": "1",
54
+ "array_task_max": "4",
55
+ "array_task_min": "0",
56
+ "array_task_step": "1",
57
+ "cluster_name": "clstr1",
58
+ "conf": "/etc/slurm/slurm.conf",
59
+ "cpus_on_node": "10",
60
+ "gpus": "2",
61
+ "gpus_on_node": "2",
62
+ "gtids": "0",
63
+ "job_account": "yang-wang",
64
+ "job_cpus_per_node": "10",
65
+ "job_end_time": "1770637382",
66
+ "job_gid": "2184",
67
+ "job_gpus": "0,3",
68
+ "job_id": "59116",
69
+ "job_name": "H1Stat",
70
+ "job_nodelist": "virya1",
71
+ "job_num_nodes": "1",
72
+ "job_partition": "all",
73
+ "job_qos": "standard",
74
+ "job_start_time": "1770032582",
75
+ "job_uid": "2184",
76
+ "job_user": "o_heidar",
77
+ "jobid": "59116",
78
+ "localid": "0",
79
+ "mem_per_node": "102400",
80
+ "nnodes": "1",
81
+ "nodeid": "0",
82
+ "nodelist": "virya1",
83
+ "prio_process": "0",
84
+ "procid": "0",
85
+ "script_context": "prolog_task",
86
+ "submit_dir": "/home/o_heidar/robot_learning_2026/jobs",
87
+ "submit_host": "viryasubmit2",
88
+ "task_pid": "1212375",
89
+ "tasks_per_node": "10",
90
+ "topology_addr": "virya1",
91
+ "topology_addr_pattern": "node"
92
+ },
93
+ "writerId": "q4xofvz8clyq1g2jr4zr21tj3a4wrrs3"
94
+ }
wandb/run-20260202_064313-i4545kqj/files/wandb-summary.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"memory":1460.792832,"buffer_size":6.139024,"_timestamp":1.7700541689873946e+09,"_step":24999,"_wandb":{"runtime":21575},"_runtime":21575.028241367,"train loss":0.05379915237426758,"val loss":0.05018728971481323}
wandb/run-20260202_064313-i4545kqj/logs/debug-core.log ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-02-02T06:43:14.178755309-05:00","level":"INFO","msg":"main: starting server","port-filename":"/data/scratch/59116/tmpv5gcseoc/port-1212388.txt","pid":1212388,"log-level":0,"disable-analytics":false,"shutdown-on-parent-exit":false,"enable-dcgm-profiling":false}
2
+ {"time":"2026-02-02T06:43:14.179492502-05:00","level":"INFO","msg":"server: will exit if parent process dies","ppid":1212388}
3
+ {"time":"2026-02-02T06:43:14.179479484-05:00","level":"INFO","msg":"server: accepting connections","addr":{"Name":"/data/scratch/59116/wandb-1212388-1212414-3650282769/socket","Net":"unix"}}
4
+ {"time":"2026-02-02T06:43:14.36183203-05:00","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"1(@)"}
5
+ {"time":"2026-02-02T06:43:14.372324765-05:00","level":"INFO","msg":"handleInformInit: received","streamId":"i4545kqj","id":"1(@)"}
6
+ {"time":"2026-02-02T06:43:14.558146241-05:00","level":"INFO","msg":"handleInformInit: stream started","streamId":"i4545kqj","id":"1(@)"}
7
+ {"time":"2026-02-02T06:43:20.172246764-05:00","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"3rrl05d4577k"}
8
+ {"time":"2026-02-02T12:42:49.805601091-05:00","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"3rrl05d4577k"}
9
+ {"time":"2026-02-02T12:42:50.515546133-05:00","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"3rrl05d4577k"}
10
+ {"time":"2026-02-02T12:42:50.528979645-05:00","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i4545kqj","id":"1(@)"}
11
+ {"time":"2026-02-02T12:42:50.539325608-05:00","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i4545kqj","id":"1(@)"}
12
+ {"time":"2026-02-02T12:42:50.539352327-05:00","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
13
+ {"time":"2026-02-02T12:42:50.53937482-05:00","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
14
+ {"time":"2026-02-02T12:42:50.539393953-05:00","level":"INFO","msg":"connection: closing","id":"1(@)"}
15
+ {"time":"2026-02-02T12:42:50.539410057-05:00","level":"INFO","msg":"server is shutting down"}
16
+ {"time":"2026-02-02T12:42:50.539463306-05:00","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
17
+ {"time":"2026-02-02T12:42:50.539474128-05:00","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
18
+ {"time":"2026-02-02T12:42:50.539587306-05:00","level":"INFO","msg":"server: listener closed","addr":{"Name":"/data/scratch/59116/wandb-1212388-1212414-3650282769/socket","Net":"unix"}}
19
+ {"time":"2026-02-02T12:42:50.539642147-05:00","level":"INFO","msg":"server is closed"}
wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-02-02T06:43:14.373523076-05:00","level":"INFO","msg":"stream: starting","core version":"0.24.1"}
2
+ {"time":"2026-02-02T06:43:14.555022188-05:00","level":"INFO","msg":"stream: created new stream","id":"i4545kqj"}
3
+ {"time":"2026-02-02T06:43:14.555098169-05:00","level":"INFO","msg":"handler: started","stream_id":"i4545kqj"}
4
+ {"time":"2026-02-02T06:43:14.558136687-05:00","level":"INFO","msg":"stream: started","id":"i4545kqj"}
5
+ {"time":"2026-02-02T06:43:14.55822855-05:00","level":"INFO","msg":"writer: started","stream_id":"i4545kqj"}
6
+ {"time":"2026-02-02T06:43:14.558251165-05:00","level":"INFO","msg":"sender: started","stream_id":"i4545kqj"}
7
+ {"time":"2026-02-02T12:42:50.293657146-05:00","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
8
+ {"time":"2026-02-02T12:42:50.512070299-05:00","level":"INFO","msg":"handler: operation stats","stats":{}}
9
+ {"time":"2026-02-02T12:42:50.529012161-05:00","level":"INFO","msg":"stream: closing","id":"i4545kqj"}
10
+ {"time":"2026-02-02T12:42:50.529025813-05:00","level":"INFO","msg":"handler: closed","stream_id":"i4545kqj"}
11
+ {"time":"2026-02-02T12:42:50.531105801-05:00","level":"INFO","msg":"sender: closed","stream_id":"i4545kqj"}
12
+ {"time":"2026-02-02T12:42:50.531120425-05:00","level":"INFO","msg":"stream: closed","id":"i4545kqj"}
wandb/run-20260202_064313-i4545kqj/logs/debug.log ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-02-02 06:43:14,007 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Current SDK version is 0.24.1
2
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Configure stats pid to 1212388
3
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Loading settings from environment variables
4
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():717] Logging user logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug.log
5
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():718] Logging internal logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log
6
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():844] calling init triggers
7
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():849] wandb.init called with sweep_config: {}
8
+ config: {'dataset': {'to_name': 'gberseth/bridge-data-64px-test', 'num_episodes': 0, 'chunk_size': 1, 'buffer_size': 50000, 'encode_with_t5': False, 't5_version': 't5-small', 'chars_list': [' ', ',', '.', '0', '1', '2', '3', '4', '5', '6', '7', '8', '9', '!', '?', '"', "'", '(', ')', '-', '_', ':', ';', '@', '#', '$', '%', '&', '*', '+', '=', '<', '>', '/', '\\\\', '|', '~', '`', 'A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T', 'U', 'V', 'W', 'X', 'Y', 'Z', 'a', 'b', 'c', 'd', 'e', 'f', 'g', 'h', 'i', 'j', 'k', 'l', 'm', 'n', 'o', 'p', 'q', 'r', 's', 't', 'u', 'v', 'w', 'x', 'y', 'z'], 'load_dataset': True, 'download_all': False, 'save_initial_dataset': False, 'use_generator': False, 'dataset_indicies': {'gs://gresearch/robotics/bridge/0.1.0/': {'start': 0, 'weight': 1.0, 'dataset_key': 'bridge_oxe', 'scale': 1.0}}, 'action_std': [0.0118407579138875, 0.01651778072118759, 0.01558756735175848, 0.03479960933327675, 0.03878577798604965, 0.05862835422158241, 0.5686280727386475], 'action_mean': [0.00032659756834618747, 0.0002364425890846178, -0.0001985691487789154, -0.0003516025608405471, -0.0005819069338031113, 0.0006634143064729869, 0.659541130065918], 'gripper_closed_std': 1.0}, 'experiment': {'name': 'grp_stat_3', 'project': 'mini-grp', 'description': 'simple env with 64pix images and pose data'}, 'model': {'type': 'transformer'}, 'batch_size': 256, 'max_block_size': 16, 'vocab_size': 32, 'n_patches': 8, 'patch_size': 8, 'max_iters': 25000, 'eval_interval': 100, 'learning_rate': 0.0003, 'lr_schedule': 'linear', 'eval_iters': 5, 'policy': {'action_stacking': 1, 'obs_stacking': 3, 'use_image_augmentations': False, 'dtype': 'float32', 'use_pose_data': 1, 'random_masking_enabled': False}, 'testing': False, 'eval_vid_iters': 2500, 'gradient_accumulation_steps': 1, 'simEval': [], 'sim': {'eval_episodes': 1, 'eval_tasks': [0, 1, 2, 3], 'episode length': 500}, 'r_seed': 1337, 'device': 'cuda', 'n_embd': 512, 'n_head': 16, 'n_blocks': 4, 'dropout': 0.2, 'action_dim': 7, 'load_action_bounds': True, 'image_shape': [64, 64, 3], 'data_shuffel_interval': 1000, 'profiler': {'enable': False, 'params': {'profile_memory': True, 'with_stack': True, 'use_cuda': True}}, '_wandb': {}}
9
+ 2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():892] starting backend
10
+ 2026-02-02 06:43:14,361 INFO MainThread:1212388 [wandb_init.py:init():895] sending inform_init request
11
+ 2026-02-02 06:43:14,370 INFO MainThread:1212388 [wandb_init.py:init():903] backend started and connected
12
+ 2026-02-02 06:43:14,372 INFO MainThread:1212388 [wandb_init.py:init():973] updated telemetry
13
+ 2026-02-02 06:43:14,390 INFO MainThread:1212388 [wandb_init.py:init():997] communicating run to backend with 90.0 second timeout
14
+ 2026-02-02 06:43:14,776 INFO MainThread:1212388 [wandb_init.py:init():1042] starting run threads in backend
15
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_console_start():2529] atexit reg
16
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2377] redirect: wrap_raw
17
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2446] Wrapping output streams.
18
+ 2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2469] Redirects installed.
19
+ 2026-02-02 06:43:15,172 INFO MainThread:1212388 [wandb_init.py:init():1082] run started, returning control to user process
20
+ 2026-02-02 12:42:49,802 INFO MainThread:1212388 [wandb_run.py:_finish():2295] finishing run omidrezaheidari-concordia-university/mini-grp/i4545kqj
21
+ 2026-02-02 12:42:49,804 INFO MainThread:1212388 [wandb_run.py:_atexit_cleanup():2494] got exitcode: 0
22
+ 2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2476] restore
23
+ 2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2482] restore done
24
+ 2026-02-02 12:42:50,515 INFO MainThread:1212388 [wandb_run.py:_footer_sync_info():3871] logging synced files
wandb/run-20260202_064313-i4545kqj/run-i4545kqj.wandb ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d7e21e67c3d2de80457b1ae740def25c1cca64da32bc8a606ed980259d2aee2a
3
+ size 1964255