Upload folder using huggingface_hub
Browse files- .gitattributes +1 -0
- .hydra/config.yaml +179 -0
- .hydra/hydra.yaml +158 -0
- .hydra/overrides.yaml +3 -0
- checkpoints/grp_stat_3.pth +3 -0
- mini_grp.log +1 -0
- wandb/debug-internal.log +12 -0
- wandb/debug.log +24 -0
- wandb/run-20260202_064313-i4545kqj/files/config.yaml +326 -0
- wandb/run-20260202_064313-i4545kqj/files/output.log +296 -0
- wandb/run-20260202_064313-i4545kqj/files/requirements.txt +249 -0
- wandb/run-20260202_064313-i4545kqj/files/wandb-metadata.json +94 -0
- wandb/run-20260202_064313-i4545kqj/files/wandb-summary.json +1 -0
- wandb/run-20260202_064313-i4545kqj/logs/debug-core.log +19 -0
- wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log +12 -0
- wandb/run-20260202_064313-i4545kqj/logs/debug.log +24 -0
- wandb/run-20260202_064313-i4545kqj/run-i4545kqj.wandb +3 -0
.gitattributes
CHANGED
|
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
|
|
|
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
| 36 |
+
wandb/run-20260202_064313-i4545kqj/run-i4545kqj.wandb filter=lfs diff=lfs merge=lfs -text
|
.hydra/config.yaml
ADDED
|
@@ -0,0 +1,179 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
dataset:
|
| 2 |
+
to_name: gberseth/bridge-data-64px-test
|
| 3 |
+
num_episodes: 0
|
| 4 |
+
chunk_size: 1
|
| 5 |
+
buffer_size: 50000
|
| 6 |
+
encode_with_t5: false
|
| 7 |
+
t5_version: t5-small
|
| 8 |
+
chars_list:
|
| 9 |
+
- ' '
|
| 10 |
+
- ','
|
| 11 |
+
- .
|
| 12 |
+
- '0'
|
| 13 |
+
- '1'
|
| 14 |
+
- '2'
|
| 15 |
+
- '3'
|
| 16 |
+
- '4'
|
| 17 |
+
- '5'
|
| 18 |
+
- '6'
|
| 19 |
+
- '7'
|
| 20 |
+
- '8'
|
| 21 |
+
- '9'
|
| 22 |
+
- '!'
|
| 23 |
+
- '?'
|
| 24 |
+
- '"'
|
| 25 |
+
- ''''
|
| 26 |
+
- (
|
| 27 |
+
- )
|
| 28 |
+
- '-'
|
| 29 |
+
- _
|
| 30 |
+
- ':'
|
| 31 |
+
- ;
|
| 32 |
+
- '@'
|
| 33 |
+
- '#'
|
| 34 |
+
- $
|
| 35 |
+
- '%'
|
| 36 |
+
- '&'
|
| 37 |
+
- '*'
|
| 38 |
+
- +
|
| 39 |
+
- '='
|
| 40 |
+
- <
|
| 41 |
+
- '>'
|
| 42 |
+
- /
|
| 43 |
+
- \\
|
| 44 |
+
- '|'
|
| 45 |
+
- '~'
|
| 46 |
+
- '`'
|
| 47 |
+
- A
|
| 48 |
+
- B
|
| 49 |
+
- C
|
| 50 |
+
- D
|
| 51 |
+
- E
|
| 52 |
+
- F
|
| 53 |
+
- G
|
| 54 |
+
- H
|
| 55 |
+
- I
|
| 56 |
+
- J
|
| 57 |
+
- K
|
| 58 |
+
- L
|
| 59 |
+
- M
|
| 60 |
+
- 'N'
|
| 61 |
+
- O
|
| 62 |
+
- P
|
| 63 |
+
- Q
|
| 64 |
+
- R
|
| 65 |
+
- S
|
| 66 |
+
- T
|
| 67 |
+
- U
|
| 68 |
+
- V
|
| 69 |
+
- W
|
| 70 |
+
- X
|
| 71 |
+
- 'Y'
|
| 72 |
+
- Z
|
| 73 |
+
- a
|
| 74 |
+
- b
|
| 75 |
+
- c
|
| 76 |
+
- d
|
| 77 |
+
- e
|
| 78 |
+
- f
|
| 79 |
+
- g
|
| 80 |
+
- h
|
| 81 |
+
- i
|
| 82 |
+
- j
|
| 83 |
+
- k
|
| 84 |
+
- l
|
| 85 |
+
- m
|
| 86 |
+
- 'n'
|
| 87 |
+
- o
|
| 88 |
+
- p
|
| 89 |
+
- q
|
| 90 |
+
- r
|
| 91 |
+
- s
|
| 92 |
+
- t
|
| 93 |
+
- u
|
| 94 |
+
- v
|
| 95 |
+
- w
|
| 96 |
+
- x
|
| 97 |
+
- 'y'
|
| 98 |
+
- z
|
| 99 |
+
load_dataset: true
|
| 100 |
+
download_all: false
|
| 101 |
+
save_initial_dataset: false
|
| 102 |
+
use_generator: false
|
| 103 |
+
dataset_indicies:
|
| 104 |
+
gs://gresearch/robotics/bridge/0.1.0/:
|
| 105 |
+
start: 0
|
| 106 |
+
weight: 1.0
|
| 107 |
+
dataset_key: bridge_oxe
|
| 108 |
+
scale: 1.0
|
| 109 |
+
action_std:
|
| 110 |
+
- 0.0118407579138875
|
| 111 |
+
- 0.01651778072118759
|
| 112 |
+
- 0.01558756735175848
|
| 113 |
+
- 0.03479960933327675
|
| 114 |
+
- 0.03878577798604965
|
| 115 |
+
- 0.05862835422158241
|
| 116 |
+
- 0.5686280727386475
|
| 117 |
+
action_mean:
|
| 118 |
+
- 0.00032659756834618747
|
| 119 |
+
- 0.0002364425890846178
|
| 120 |
+
- -0.0001985691487789154
|
| 121 |
+
- -0.0003516025608405471
|
| 122 |
+
- -0.0005819069338031113
|
| 123 |
+
- 0.0006634143064729869
|
| 124 |
+
- 0.659541130065918
|
| 125 |
+
gripper_closed_std: 1.0
|
| 126 |
+
experiment:
|
| 127 |
+
name: grp_stat_3
|
| 128 |
+
project: mini-grp
|
| 129 |
+
description: simple env with 64pix images and pose data
|
| 130 |
+
model:
|
| 131 |
+
type: transformer
|
| 132 |
+
batch_size: 256
|
| 133 |
+
max_block_size: 16
|
| 134 |
+
vocab_size: 32
|
| 135 |
+
n_patches: 8
|
| 136 |
+
patch_size: 8
|
| 137 |
+
max_iters: 25000
|
| 138 |
+
eval_interval: 100
|
| 139 |
+
learning_rate: 0.0003
|
| 140 |
+
lr_schedule: linear
|
| 141 |
+
eval_iters: 5
|
| 142 |
+
policy:
|
| 143 |
+
action_stacking: 1
|
| 144 |
+
obs_stacking: 3
|
| 145 |
+
use_image_augmentations: false
|
| 146 |
+
dtype: float32
|
| 147 |
+
use_pose_data: 1
|
| 148 |
+
random_masking_enabled: false
|
| 149 |
+
testing: false
|
| 150 |
+
eval_vid_iters: 2500
|
| 151 |
+
gradient_accumulation_steps: 1
|
| 152 |
+
simEval: []
|
| 153 |
+
sim:
|
| 154 |
+
eval_episodes: 1
|
| 155 |
+
eval_tasks:
|
| 156 |
+
- 0
|
| 157 |
+
- 1
|
| 158 |
+
- 2
|
| 159 |
+
- 3
|
| 160 |
+
episode length: 500
|
| 161 |
+
r_seed: 1337
|
| 162 |
+
device: cuda
|
| 163 |
+
n_embd: 512
|
| 164 |
+
n_head: 16
|
| 165 |
+
n_blocks: 4
|
| 166 |
+
dropout: 0.2
|
| 167 |
+
action_dim: 7
|
| 168 |
+
load_action_bounds: true
|
| 169 |
+
image_shape:
|
| 170 |
+
- 64
|
| 171 |
+
- 64
|
| 172 |
+
- 3
|
| 173 |
+
data_shuffel_interval: 1000
|
| 174 |
+
profiler:
|
| 175 |
+
enable: false
|
| 176 |
+
params:
|
| 177 |
+
profile_memory: true
|
| 178 |
+
with_stack: true
|
| 179 |
+
use_cuda: true
|
.hydra/hydra.yaml
ADDED
|
@@ -0,0 +1,158 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
hydra:
|
| 2 |
+
run:
|
| 3 |
+
dir: outputs/${now:%Y-%m-%d}/${now:%H-%M-%S}
|
| 4 |
+
sweep:
|
| 5 |
+
dir: multirun/${now:%Y-%m-%d}/${now:%H-%M-%S}
|
| 6 |
+
subdir: ${hydra.job.num}
|
| 7 |
+
launcher:
|
| 8 |
+
_target_: hydra._internal.core_plugins.basic_launcher.BasicLauncher
|
| 9 |
+
sweeper:
|
| 10 |
+
_target_: hydra._internal.core_plugins.basic_sweeper.BasicSweeper
|
| 11 |
+
max_batch_size: null
|
| 12 |
+
params: null
|
| 13 |
+
help:
|
| 14 |
+
app_name: ${hydra.job.name}
|
| 15 |
+
header: '${hydra.help.app_name} is powered by Hydra.
|
| 16 |
+
|
| 17 |
+
'
|
| 18 |
+
footer: 'Powered by Hydra (https://hydra.cc)
|
| 19 |
+
|
| 20 |
+
Use --hydra-help to view Hydra specific help
|
| 21 |
+
|
| 22 |
+
'
|
| 23 |
+
template: '${hydra.help.header}
|
| 24 |
+
|
| 25 |
+
== Configuration groups ==
|
| 26 |
+
|
| 27 |
+
Compose your configuration from those groups (group=option)
|
| 28 |
+
|
| 29 |
+
|
| 30 |
+
$APP_CONFIG_GROUPS
|
| 31 |
+
|
| 32 |
+
|
| 33 |
+
== Config ==
|
| 34 |
+
|
| 35 |
+
Override anything in the config (foo.bar=value)
|
| 36 |
+
|
| 37 |
+
|
| 38 |
+
$CONFIG
|
| 39 |
+
|
| 40 |
+
|
| 41 |
+
${hydra.help.footer}
|
| 42 |
+
|
| 43 |
+
'
|
| 44 |
+
hydra_help:
|
| 45 |
+
template: 'Hydra (${hydra.runtime.version})
|
| 46 |
+
|
| 47 |
+
See https://hydra.cc for more info.
|
| 48 |
+
|
| 49 |
+
|
| 50 |
+
== Flags ==
|
| 51 |
+
|
| 52 |
+
$FLAGS_HELP
|
| 53 |
+
|
| 54 |
+
|
| 55 |
+
== Configuration groups ==
|
| 56 |
+
|
| 57 |
+
Compose your configuration from those groups (For example, append hydra/job_logging=disabled
|
| 58 |
+
to command line)
|
| 59 |
+
|
| 60 |
+
|
| 61 |
+
$HYDRA_CONFIG_GROUPS
|
| 62 |
+
|
| 63 |
+
|
| 64 |
+
Use ''--cfg hydra'' to Show the Hydra config.
|
| 65 |
+
|
| 66 |
+
'
|
| 67 |
+
hydra_help: ???
|
| 68 |
+
hydra_logging:
|
| 69 |
+
version: 1
|
| 70 |
+
formatters:
|
| 71 |
+
simple:
|
| 72 |
+
format: '[%(asctime)s][HYDRA] %(message)s'
|
| 73 |
+
handlers:
|
| 74 |
+
console:
|
| 75 |
+
class: logging.StreamHandler
|
| 76 |
+
formatter: simple
|
| 77 |
+
stream: ext://sys.stdout
|
| 78 |
+
root:
|
| 79 |
+
level: INFO
|
| 80 |
+
handlers:
|
| 81 |
+
- console
|
| 82 |
+
loggers:
|
| 83 |
+
logging_example:
|
| 84 |
+
level: DEBUG
|
| 85 |
+
disable_existing_loggers: false
|
| 86 |
+
job_logging:
|
| 87 |
+
version: 1
|
| 88 |
+
formatters:
|
| 89 |
+
simple:
|
| 90 |
+
format: '[%(asctime)s][%(name)s][%(levelname)s] - %(message)s'
|
| 91 |
+
handlers:
|
| 92 |
+
console:
|
| 93 |
+
class: logging.StreamHandler
|
| 94 |
+
formatter: simple
|
| 95 |
+
stream: ext://sys.stdout
|
| 96 |
+
file:
|
| 97 |
+
class: logging.FileHandler
|
| 98 |
+
formatter: simple
|
| 99 |
+
filename: ${hydra.runtime.output_dir}/${hydra.job.name}.log
|
| 100 |
+
root:
|
| 101 |
+
level: INFO
|
| 102 |
+
handlers:
|
| 103 |
+
- console
|
| 104 |
+
- file
|
| 105 |
+
disable_existing_loggers: false
|
| 106 |
+
env: {}
|
| 107 |
+
mode: RUN
|
| 108 |
+
searchpath: []
|
| 109 |
+
callbacks: {}
|
| 110 |
+
output_subdir: .hydra
|
| 111 |
+
overrides:
|
| 112 |
+
hydra:
|
| 113 |
+
- hydra.mode=RUN
|
| 114 |
+
task:
|
| 115 |
+
- simEval=[]
|
| 116 |
+
- policy.obs_stacking=3
|
| 117 |
+
- experiment.name=grp_stat_3
|
| 118 |
+
job:
|
| 119 |
+
name: mini_grp
|
| 120 |
+
chdir: null
|
| 121 |
+
override_dirname: experiment.name=grp_stat_3,policy.obs_stacking=3,simEval=[]
|
| 122 |
+
id: ???
|
| 123 |
+
num: ???
|
| 124 |
+
config_name: 64pix-pose
|
| 125 |
+
env_set: {}
|
| 126 |
+
env_copy: []
|
| 127 |
+
config:
|
| 128 |
+
override_dirname:
|
| 129 |
+
kv_sep: '='
|
| 130 |
+
item_sep: ','
|
| 131 |
+
exclude_keys: []
|
| 132 |
+
runtime:
|
| 133 |
+
version: 1.2.0
|
| 134 |
+
version_base: '1.1'
|
| 135 |
+
cwd: /home/o_heidar/robot_learning_2026
|
| 136 |
+
config_sources:
|
| 137 |
+
- path: hydra.conf
|
| 138 |
+
schema: pkg
|
| 139 |
+
provider: hydra
|
| 140 |
+
- path: /home/o_heidar/robot_learning_2026/mini-grp/conf
|
| 141 |
+
schema: file
|
| 142 |
+
provider: main
|
| 143 |
+
- path: ''
|
| 144 |
+
schema: structured
|
| 145 |
+
provider: schema
|
| 146 |
+
output_dir: /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12
|
| 147 |
+
choices:
|
| 148 |
+
dataset: fast
|
| 149 |
+
hydra/env: default
|
| 150 |
+
hydra/callbacks: null
|
| 151 |
+
hydra/job_logging: default
|
| 152 |
+
hydra/hydra_logging: default
|
| 153 |
+
hydra/hydra_help: default
|
| 154 |
+
hydra/help: default
|
| 155 |
+
hydra/sweeper: basic
|
| 156 |
+
hydra/launcher: basic
|
| 157 |
+
hydra/output: default
|
| 158 |
+
verbose: false
|
.hydra/overrides.yaml
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
- simEval=[]
|
| 2 |
+
- policy.obs_stacking=3
|
| 3 |
+
- experiment.name=grp_stat_3
|
checkpoints/grp_stat_3.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:938de5cc2651702efe41171b52d2b5f12832c31056d501c1bb82e9137a9362b9
|
| 3 |
+
size 51756846
|
mini_grp.log
ADDED
|
@@ -0,0 +1 @@
|
|
|
|
|
|
|
| 1 |
+
[2026-02-02 06:43:22,259][datasets][INFO] - TensorFlow version 2.15.0 available.
|
wandb/debug-internal.log
ADDED
|
@@ -0,0 +1,12 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"time":"2026-02-02T06:43:14.373523076-05:00","level":"INFO","msg":"stream: starting","core version":"0.24.1"}
|
| 2 |
+
{"time":"2026-02-02T06:43:14.555022188-05:00","level":"INFO","msg":"stream: created new stream","id":"i4545kqj"}
|
| 3 |
+
{"time":"2026-02-02T06:43:14.555098169-05:00","level":"INFO","msg":"handler: started","stream_id":"i4545kqj"}
|
| 4 |
+
{"time":"2026-02-02T06:43:14.558136687-05:00","level":"INFO","msg":"stream: started","id":"i4545kqj"}
|
| 5 |
+
{"time":"2026-02-02T06:43:14.55822855-05:00","level":"INFO","msg":"writer: started","stream_id":"i4545kqj"}
|
| 6 |
+
{"time":"2026-02-02T06:43:14.558251165-05:00","level":"INFO","msg":"sender: started","stream_id":"i4545kqj"}
|
| 7 |
+
{"time":"2026-02-02T12:42:50.293657146-05:00","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
|
| 8 |
+
{"time":"2026-02-02T12:42:50.512070299-05:00","level":"INFO","msg":"handler: operation stats","stats":{}}
|
| 9 |
+
{"time":"2026-02-02T12:42:50.529012161-05:00","level":"INFO","msg":"stream: closing","id":"i4545kqj"}
|
| 10 |
+
{"time":"2026-02-02T12:42:50.529025813-05:00","level":"INFO","msg":"handler: closed","stream_id":"i4545kqj"}
|
| 11 |
+
{"time":"2026-02-02T12:42:50.531105801-05:00","level":"INFO","msg":"sender: closed","stream_id":"i4545kqj"}
|
| 12 |
+
{"time":"2026-02-02T12:42:50.531120425-05:00","level":"INFO","msg":"stream: closed","id":"i4545kqj"}
|
wandb/debug.log
ADDED
|
@@ -0,0 +1,24 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
2026-02-02 06:43:14,007 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Current SDK version is 0.24.1
|
| 2 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Configure stats pid to 1212388
|
| 3 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Loading settings from environment variables
|
| 4 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():717] Logging user logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug.log
|
| 5 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():718] Logging internal logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log
|
| 6 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():844] calling init triggers
|
| 7 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():849] wandb.init called with sweep_config: {}
|
| 8 |
+
config: {'dataset': {'to_name': 'gberseth/bridge-data-64px-test', 'num_episodes': 0, 'chunk_size': 1, 'buffer_size': 50000, 'encode_with_t5': False, 't5_version': 't5-small', 'chars_list': [' ', ',', '.', '0', '1', '2', '3', '4', '5', '6', '7', '8', '9', '!', '?', '"', "'", '(', ')', '-', '_', ':', ';', '@', '#', '$', '%', '&', '*', '+', '=', '<', '>', '/', '\\\\', '|', '~', '`', 'A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T', 'U', 'V', 'W', 'X', 'Y', 'Z', 'a', 'b', 'c', 'd', 'e', 'f', 'g', 'h', 'i', 'j', 'k', 'l', 'm', 'n', 'o', 'p', 'q', 'r', 's', 't', 'u', 'v', 'w', 'x', 'y', 'z'], 'load_dataset': True, 'download_all': False, 'save_initial_dataset': False, 'use_generator': False, 'dataset_indicies': {'gs://gresearch/robotics/bridge/0.1.0/': {'start': 0, 'weight': 1.0, 'dataset_key': 'bridge_oxe', 'scale': 1.0}}, 'action_std': [0.0118407579138875, 0.01651778072118759, 0.01558756735175848, 0.03479960933327675, 0.03878577798604965, 0.05862835422158241, 0.5686280727386475], 'action_mean': [0.00032659756834618747, 0.0002364425890846178, -0.0001985691487789154, -0.0003516025608405471, -0.0005819069338031113, 0.0006634143064729869, 0.659541130065918], 'gripper_closed_std': 1.0}, 'experiment': {'name': 'grp_stat_3', 'project': 'mini-grp', 'description': 'simple env with 64pix images and pose data'}, 'model': {'type': 'transformer'}, 'batch_size': 256, 'max_block_size': 16, 'vocab_size': 32, 'n_patches': 8, 'patch_size': 8, 'max_iters': 25000, 'eval_interval': 100, 'learning_rate': 0.0003, 'lr_schedule': 'linear', 'eval_iters': 5, 'policy': {'action_stacking': 1, 'obs_stacking': 3, 'use_image_augmentations': False, 'dtype': 'float32', 'use_pose_data': 1, 'random_masking_enabled': False}, 'testing': False, 'eval_vid_iters': 2500, 'gradient_accumulation_steps': 1, 'simEval': [], 'sim': {'eval_episodes': 1, 'eval_tasks': [0, 1, 2, 3], 'episode length': 500}, 'r_seed': 1337, 'device': 'cuda', 'n_embd': 512, 'n_head': 16, 'n_blocks': 4, 'dropout': 0.2, 'action_dim': 7, 'load_action_bounds': True, 'image_shape': [64, 64, 3], 'data_shuffel_interval': 1000, 'profiler': {'enable': False, 'params': {'profile_memory': True, 'with_stack': True, 'use_cuda': True}}, '_wandb': {}}
|
| 9 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():892] starting backend
|
| 10 |
+
2026-02-02 06:43:14,361 INFO MainThread:1212388 [wandb_init.py:init():895] sending inform_init request
|
| 11 |
+
2026-02-02 06:43:14,370 INFO MainThread:1212388 [wandb_init.py:init():903] backend started and connected
|
| 12 |
+
2026-02-02 06:43:14,372 INFO MainThread:1212388 [wandb_init.py:init():973] updated telemetry
|
| 13 |
+
2026-02-02 06:43:14,390 INFO MainThread:1212388 [wandb_init.py:init():997] communicating run to backend with 90.0 second timeout
|
| 14 |
+
2026-02-02 06:43:14,776 INFO MainThread:1212388 [wandb_init.py:init():1042] starting run threads in backend
|
| 15 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_console_start():2529] atexit reg
|
| 16 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2377] redirect: wrap_raw
|
| 17 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2446] Wrapping output streams.
|
| 18 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2469] Redirects installed.
|
| 19 |
+
2026-02-02 06:43:15,172 INFO MainThread:1212388 [wandb_init.py:init():1082] run started, returning control to user process
|
| 20 |
+
2026-02-02 12:42:49,802 INFO MainThread:1212388 [wandb_run.py:_finish():2295] finishing run omidrezaheidari-concordia-university/mini-grp/i4545kqj
|
| 21 |
+
2026-02-02 12:42:49,804 INFO MainThread:1212388 [wandb_run.py:_atexit_cleanup():2494] got exitcode: 0
|
| 22 |
+
2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2476] restore
|
| 23 |
+
2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2482] restore done
|
| 24 |
+
2026-02-02 12:42:50,515 INFO MainThread:1212388 [wandb_run.py:_footer_sync_info():3871] logging synced files
|
wandb/run-20260202_064313-i4545kqj/files/config.yaml
ADDED
|
@@ -0,0 +1,326 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
_wandb:
|
| 2 |
+
value:
|
| 3 |
+
cli_version: 0.24.1
|
| 4 |
+
e:
|
| 5 |
+
q4xofvz8clyq1g2jr4zr21tj3a4wrrs3:
|
| 6 |
+
args:
|
| 7 |
+
- simEval=[]
|
| 8 |
+
- policy.obs_stacking=3
|
| 9 |
+
- experiment.name=grp_stat_3
|
| 10 |
+
codePath: mini-grp/mini_grp.py
|
| 11 |
+
cpu_count: 36
|
| 12 |
+
cpu_count_logical: 72
|
| 13 |
+
cudaVersion: "12.9"
|
| 14 |
+
disk:
|
| 15 |
+
/:
|
| 16 |
+
total: "470272819200"
|
| 17 |
+
used: "31232614400"
|
| 18 |
+
email: omid.orh@gmail.com
|
| 19 |
+
executable: /home/o_heidar/rbenv/bin/python
|
| 20 |
+
git:
|
| 21 |
+
commit: a1e45b9ec95f0f09f151f485ba23961058153e48
|
| 22 |
+
remote: https://github.com/omid-reza/robot_learning_2026.git
|
| 23 |
+
gpu: Tesla V100-PCIE-32GB
|
| 24 |
+
gpu_count: 2
|
| 25 |
+
gpu_nvidia:
|
| 26 |
+
- architecture: Volta
|
| 27 |
+
cudaCores: 5120
|
| 28 |
+
memoryTotal: "34359738368"
|
| 29 |
+
name: Tesla V100-PCIE-32GB
|
| 30 |
+
uuid: GPU-28f0e524-a7c5-f287-d873-73f15fb0d817
|
| 31 |
+
- architecture: Volta
|
| 32 |
+
cudaCores: 5120
|
| 33 |
+
memoryTotal: "34359738368"
|
| 34 |
+
name: Tesla V100-PCIE-32GB
|
| 35 |
+
uuid: GPU-6b13b007-765f-fea0-26ee-f1842182916d
|
| 36 |
+
host: virya1
|
| 37 |
+
memory:
|
| 38 |
+
total: "405360889856"
|
| 39 |
+
os: Linux-6.8.0-79-generic-x86_64-with-glibc2.39
|
| 40 |
+
program: /home/o_heidar/robot_learning_2026/mini-grp/mini_grp.py
|
| 41 |
+
python: CPython 3.10.19
|
| 42 |
+
root: /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12
|
| 43 |
+
slurm:
|
| 44 |
+
array_job_id: "59114"
|
| 45 |
+
array_task_count: "5"
|
| 46 |
+
array_task_id: "1"
|
| 47 |
+
array_task_max: "4"
|
| 48 |
+
array_task_min: "0"
|
| 49 |
+
array_task_step: "1"
|
| 50 |
+
cluster_name: clstr1
|
| 51 |
+
conf: /etc/slurm/slurm.conf
|
| 52 |
+
cpus_on_node: "10"
|
| 53 |
+
gpus: "2"
|
| 54 |
+
gpus_on_node: "2"
|
| 55 |
+
gtids: "0"
|
| 56 |
+
job_account: yang-wang
|
| 57 |
+
job_cpus_per_node: "10"
|
| 58 |
+
job_end_time: "1770637382"
|
| 59 |
+
job_gid: "2184"
|
| 60 |
+
job_gpus: 0,3
|
| 61 |
+
job_id: "59116"
|
| 62 |
+
job_name: H1Stat
|
| 63 |
+
job_nodelist: virya1
|
| 64 |
+
job_num_nodes: "1"
|
| 65 |
+
job_partition: all
|
| 66 |
+
job_qos: standard
|
| 67 |
+
job_start_time: "1770032582"
|
| 68 |
+
job_uid: "2184"
|
| 69 |
+
job_user: o_heidar
|
| 70 |
+
jobid: "59116"
|
| 71 |
+
localid: "0"
|
| 72 |
+
mem_per_node: "102400"
|
| 73 |
+
nnodes: "1"
|
| 74 |
+
nodeid: "0"
|
| 75 |
+
nodelist: virya1
|
| 76 |
+
prio_process: "0"
|
| 77 |
+
procid: "0"
|
| 78 |
+
script_context: prolog_task
|
| 79 |
+
submit_dir: /home/o_heidar/robot_learning_2026/jobs
|
| 80 |
+
submit_host: viryasubmit2
|
| 81 |
+
task_pid: "1212375"
|
| 82 |
+
tasks_per_node: "10"
|
| 83 |
+
topology_addr: virya1
|
| 84 |
+
topology_addr_pattern: node
|
| 85 |
+
startedAt: "2026-02-02T11:43:13.984688Z"
|
| 86 |
+
writerId: q4xofvz8clyq1g2jr4zr21tj3a4wrrs3
|
| 87 |
+
m: []
|
| 88 |
+
python_version: 3.10.19
|
| 89 |
+
t:
|
| 90 |
+
"1":
|
| 91 |
+
- 1
|
| 92 |
+
- 5
|
| 93 |
+
- 11
|
| 94 |
+
- 49
|
| 95 |
+
- 50
|
| 96 |
+
- 53
|
| 97 |
+
"2":
|
| 98 |
+
- 1
|
| 99 |
+
- 2
|
| 100 |
+
- 3
|
| 101 |
+
- 5
|
| 102 |
+
- 11
|
| 103 |
+
- 41
|
| 104 |
+
- 49
|
| 105 |
+
- 50
|
| 106 |
+
- 51
|
| 107 |
+
- 53
|
| 108 |
+
"3":
|
| 109 |
+
- 2
|
| 110 |
+
- 13
|
| 111 |
+
- 16
|
| 112 |
+
- 61
|
| 113 |
+
"4": 3.10.19
|
| 114 |
+
"5": 0.24.1
|
| 115 |
+
"6": 4.48.1
|
| 116 |
+
"12": 0.24.1
|
| 117 |
+
"13": linux-x86_64
|
| 118 |
+
action_dim:
|
| 119 |
+
value: 7
|
| 120 |
+
batch_size:
|
| 121 |
+
value: 256
|
| 122 |
+
data_shuffel_interval:
|
| 123 |
+
value: 1000
|
| 124 |
+
dataset:
|
| 125 |
+
value:
|
| 126 |
+
action_mean:
|
| 127 |
+
- 0.00032659756834618747
|
| 128 |
+
- 0.0002364425890846178
|
| 129 |
+
- -0.0001985691487789154
|
| 130 |
+
- -0.0003516025608405471
|
| 131 |
+
- -0.0005819069338031113
|
| 132 |
+
- 0.0006634143064729869
|
| 133 |
+
- 0.659541130065918
|
| 134 |
+
action_std:
|
| 135 |
+
- 0.0118407579138875
|
| 136 |
+
- 0.01651778072118759
|
| 137 |
+
- 0.01558756735175848
|
| 138 |
+
- 0.03479960933327675
|
| 139 |
+
- 0.03878577798604965
|
| 140 |
+
- 0.05862835422158241
|
| 141 |
+
- 0.5686280727386475
|
| 142 |
+
buffer_size: 50000
|
| 143 |
+
chars_list:
|
| 144 |
+
- ' '
|
| 145 |
+
- ','
|
| 146 |
+
- .
|
| 147 |
+
- "0"
|
| 148 |
+
- "1"
|
| 149 |
+
- "2"
|
| 150 |
+
- "3"
|
| 151 |
+
- "4"
|
| 152 |
+
- "5"
|
| 153 |
+
- "6"
|
| 154 |
+
- "7"
|
| 155 |
+
- "8"
|
| 156 |
+
- "9"
|
| 157 |
+
- '!'
|
| 158 |
+
- '?'
|
| 159 |
+
- '"'
|
| 160 |
+
- ''''
|
| 161 |
+
- (
|
| 162 |
+
- )
|
| 163 |
+
- '-'
|
| 164 |
+
- _
|
| 165 |
+
- ':'
|
| 166 |
+
- ;
|
| 167 |
+
- '@'
|
| 168 |
+
- '#'
|
| 169 |
+
- $
|
| 170 |
+
- '%'
|
| 171 |
+
- '&'
|
| 172 |
+
- '*'
|
| 173 |
+
- +
|
| 174 |
+
- =
|
| 175 |
+
- <
|
| 176 |
+
- '>'
|
| 177 |
+
- /
|
| 178 |
+
- \\
|
| 179 |
+
- '|'
|
| 180 |
+
- "~"
|
| 181 |
+
- '`'
|
| 182 |
+
- A
|
| 183 |
+
- B
|
| 184 |
+
- C
|
| 185 |
+
- D
|
| 186 |
+
- E
|
| 187 |
+
- F
|
| 188 |
+
- G
|
| 189 |
+
- H
|
| 190 |
+
- I
|
| 191 |
+
- J
|
| 192 |
+
- K
|
| 193 |
+
- L
|
| 194 |
+
- M
|
| 195 |
+
- "N"
|
| 196 |
+
- O
|
| 197 |
+
- P
|
| 198 |
+
- Q
|
| 199 |
+
- R
|
| 200 |
+
- S
|
| 201 |
+
- T
|
| 202 |
+
- U
|
| 203 |
+
- V
|
| 204 |
+
- W
|
| 205 |
+
- X
|
| 206 |
+
- "Y"
|
| 207 |
+
- Z
|
| 208 |
+
- a
|
| 209 |
+
- b
|
| 210 |
+
- c
|
| 211 |
+
- d
|
| 212 |
+
- e
|
| 213 |
+
- f
|
| 214 |
+
- g
|
| 215 |
+
- h
|
| 216 |
+
- i
|
| 217 |
+
- j
|
| 218 |
+
- k
|
| 219 |
+
- l
|
| 220 |
+
- m
|
| 221 |
+
- "n"
|
| 222 |
+
- o
|
| 223 |
+
- p
|
| 224 |
+
- q
|
| 225 |
+
- r
|
| 226 |
+
- s
|
| 227 |
+
- t
|
| 228 |
+
- u
|
| 229 |
+
- v
|
| 230 |
+
- w
|
| 231 |
+
- x
|
| 232 |
+
- "y"
|
| 233 |
+
- z
|
| 234 |
+
chunk_size: 1
|
| 235 |
+
dataset_indicies:
|
| 236 |
+
gs://gresearch/robotics/bridge/0.1.0/:
|
| 237 |
+
dataset_key: bridge_oxe
|
| 238 |
+
scale: 1
|
| 239 |
+
start: 0
|
| 240 |
+
weight: 1
|
| 241 |
+
download_all: false
|
| 242 |
+
encode_with_t5: false
|
| 243 |
+
gripper_closed_std: 1
|
| 244 |
+
load_dataset: true
|
| 245 |
+
num_episodes: 0
|
| 246 |
+
save_initial_dataset: false
|
| 247 |
+
t5_version: t5-small
|
| 248 |
+
to_name: gberseth/bridge-data-64px-test
|
| 249 |
+
use_generator: false
|
| 250 |
+
device:
|
| 251 |
+
value: cuda
|
| 252 |
+
dropout:
|
| 253 |
+
value: 0.2
|
| 254 |
+
eval_interval:
|
| 255 |
+
value: 100
|
| 256 |
+
eval_iters:
|
| 257 |
+
value: 5
|
| 258 |
+
eval_vid_iters:
|
| 259 |
+
value: 2500
|
| 260 |
+
experiment:
|
| 261 |
+
value:
|
| 262 |
+
description: simple env with 64pix images and pose data
|
| 263 |
+
name: grp_stat_3
|
| 264 |
+
project: mini-grp
|
| 265 |
+
gradient_accumulation_steps:
|
| 266 |
+
value: 1
|
| 267 |
+
image_shape:
|
| 268 |
+
value:
|
| 269 |
+
- 64
|
| 270 |
+
- 64
|
| 271 |
+
- 3
|
| 272 |
+
learning_rate:
|
| 273 |
+
value: 0.0003
|
| 274 |
+
load_action_bounds:
|
| 275 |
+
value: true
|
| 276 |
+
lr_schedule:
|
| 277 |
+
value: linear
|
| 278 |
+
max_block_size:
|
| 279 |
+
value: 16
|
| 280 |
+
max_iters:
|
| 281 |
+
value: 25000
|
| 282 |
+
model:
|
| 283 |
+
value:
|
| 284 |
+
type: transformer
|
| 285 |
+
n_blocks:
|
| 286 |
+
value: 4
|
| 287 |
+
n_embd:
|
| 288 |
+
value: 512
|
| 289 |
+
n_head:
|
| 290 |
+
value: 16
|
| 291 |
+
n_patches:
|
| 292 |
+
value: 8
|
| 293 |
+
patch_size:
|
| 294 |
+
value: 8
|
| 295 |
+
policy:
|
| 296 |
+
value:
|
| 297 |
+
action_stacking: 1
|
| 298 |
+
dtype: float32
|
| 299 |
+
obs_stacking: 3
|
| 300 |
+
random_masking_enabled: false
|
| 301 |
+
use_image_augmentations: false
|
| 302 |
+
use_pose_data: 1
|
| 303 |
+
profiler:
|
| 304 |
+
value:
|
| 305 |
+
enable: false
|
| 306 |
+
params:
|
| 307 |
+
profile_memory: true
|
| 308 |
+
use_cuda: true
|
| 309 |
+
with_stack: true
|
| 310 |
+
r_seed:
|
| 311 |
+
value: 1337
|
| 312 |
+
sim:
|
| 313 |
+
value:
|
| 314 |
+
episode length: 500
|
| 315 |
+
eval_episodes: 1
|
| 316 |
+
eval_tasks:
|
| 317 |
+
- 0
|
| 318 |
+
- 1
|
| 319 |
+
- 2
|
| 320 |
+
- 3
|
| 321 |
+
simEval:
|
| 322 |
+
value: []
|
| 323 |
+
testing:
|
| 324 |
+
value: false
|
| 325 |
+
vocab_size:
|
| 326 |
+
value: 32
|
wandb/run-20260202_064313-i4545kqj/files/output.log
ADDED
|
@@ -0,0 +1,296 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
wandb: WARNING No relevant files were detected in the specified directory. No code will be logged to your run.
|
| 2 |
+
/home/o_heidar/robot_learning_2026/mini-grp/mini_shuffel_buffer.py:614: UserWarning:
|
| 3 |
+
The version_base parameter is not specified.
|
| 4 |
+
Please specify a compatability version level, or None.
|
| 5 |
+
Will assume defaults for version 1.1
|
| 6 |
+
@hydra.main(config_path="./conf", config_name="64pix-pose")
|
| 7 |
+
Using Transformer model
|
| 8 |
+
vocab_size: 90
|
| 9 |
+
[2026-02-02 06:43:22,259][datasets][INFO] - TensorFlow version 2.15.0 available.
|
| 10 |
+
Time to load huggingface dataset: 2.516728639602661
|
| 11 |
+
Time to load huggingface data and copy: 24.613126277923584
|
| 12 |
+
Loaded dataset with size: 50000
|
| 13 |
+
12.893191 M parameters
|
| 14 |
+
Memory used by the model: 1289.755136 MB
|
| 15 |
+
Memory used by the dataset cBuffer: 0.445692 MB
|
| 16 |
+
Memory used by the dataset cBuffer image: 0.000184 MB
|
| 17 |
+
Memory used by the dataset cBuffer goal image: 0.000184 MB
|
| 18 |
+
Memory used by the dataset cBuffer: t5_language_embedding 1.6e-05 MB
|
| 19 |
+
num <queue.Queue object at 0x7d1d2c793c40>
|
| 20 |
+
step 0: train loss 1.2561, val loss 1.2331, memory 1298.27 MB
|
| 21 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 22 |
+
step 100: train loss 0.7189, val loss 0.6812, memory 1460.79 MB
|
| 23 |
+
step 200: train loss 0.6676, val loss 0.6790, memory 1460.79 MB
|
| 24 |
+
step 300: train loss 0.6857, val loss 0.6692, memory 1460.79 MB
|
| 25 |
+
step 400: train loss 0.6532, val loss 0.6879, memory 1460.79 MB
|
| 26 |
+
step 500: train loss 0.7244, val loss 0.6382, memory 1460.79 MB
|
| 27 |
+
step 600: train loss 0.6103, val loss 0.5972, memory 1460.79 MB
|
| 28 |
+
step 700: train loss 0.6218, val loss 0.6448, memory 1460.79 MB
|
| 29 |
+
step 800: train loss 0.6331, val loss 0.5831, memory 1460.79 MB
|
| 30 |
+
step 900: train loss 0.6193, val loss 0.5889, memory 1460.79 MB
|
| 31 |
+
step 1000: train loss 0.6111, val loss 0.6234, memory 1460.79 MB
|
| 32 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 33 |
+
step 1100: train loss 0.6461, val loss 0.6237, memory 1460.79 MB
|
| 34 |
+
step 1200: train loss 0.6076, val loss 0.6209, memory 1460.79 MB
|
| 35 |
+
step 1300: train loss 0.6120, val loss 0.6172, memory 1460.79 MB
|
| 36 |
+
step 1400: train loss 0.6117, val loss 0.6226, memory 1460.79 MB
|
| 37 |
+
step 1500: train loss 0.6216, val loss 0.6008, memory 1460.79 MB
|
| 38 |
+
step 1600: train loss 0.5858, val loss 0.5804, memory 1460.79 MB
|
| 39 |
+
step 1700: train loss 0.5621, val loss 0.6078, memory 1460.79 MB
|
| 40 |
+
step 1800: train loss 0.5562, val loss 0.5873, memory 1460.79 MB
|
| 41 |
+
step 1900: train loss 0.5499, val loss 0.6078, memory 1460.79 MB
|
| 42 |
+
step 2000: train loss 0.5819, val loss 0.5531, memory 1460.79 MB
|
| 43 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 44 |
+
step 2100: train loss 0.5583, val loss 0.5453, memory 1460.79 MB
|
| 45 |
+
step 2200: train loss 0.5972, val loss 0.5706, memory 1460.79 MB
|
| 46 |
+
step 2300: train loss 0.5570, val loss 0.5305, memory 1460.79 MB
|
| 47 |
+
step 2400: train loss 0.5272, val loss 0.5677, memory 1460.79 MB
|
| 48 |
+
step 2500: train loss 0.5377, val loss 0.5141, memory 1460.79 MB
|
| 49 |
+
step 2600: train loss 0.4698, val loss 0.5408, memory 1460.79 MB
|
| 50 |
+
step 2700: train loss 0.5047, val loss 0.5272, memory 1460.79 MB
|
| 51 |
+
step 2800: train loss 0.4769, val loss 0.5125, memory 1460.79 MB
|
| 52 |
+
step 2900: train loss 0.4855, val loss 0.4887, memory 1460.79 MB
|
| 53 |
+
step 3000: train loss 0.4516, val loss 0.4883, memory 1460.79 MB
|
| 54 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 55 |
+
step 3100: train loss 0.4782, val loss 0.4545, memory 1460.79 MB
|
| 56 |
+
step 3200: train loss 0.4456, val loss 0.4884, memory 1460.79 MB
|
| 57 |
+
step 3300: train loss 0.4679, val loss 0.4463, memory 1460.79 MB
|
| 58 |
+
step 3400: train loss 0.4192, val loss 0.4447, memory 1460.79 MB
|
| 59 |
+
step 3500: train loss 0.4444, val loss 0.4410, memory 1460.79 MB
|
| 60 |
+
step 3600: train loss 0.3920, val loss 0.4080, memory 1460.79 MB
|
| 61 |
+
step 3700: train loss 0.4098, val loss 0.3948, memory 1460.79 MB
|
| 62 |
+
step 3800: train loss 0.4099, val loss 0.4020, memory 1460.79 MB
|
| 63 |
+
step 3900: train loss 0.3880, val loss 0.3558, memory 1460.79 MB
|
| 64 |
+
step 4000: train loss 0.3801, val loss 0.3811, memory 1460.79 MB
|
| 65 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 66 |
+
step 4100: train loss 0.3663, val loss 0.3879, memory 1460.79 MB
|
| 67 |
+
step 4200: train loss 0.3574, val loss 0.3740, memory 1460.79 MB
|
| 68 |
+
step 4300: train loss 0.3654, val loss 0.3690, memory 1460.79 MB
|
| 69 |
+
step 4400: train loss 0.3572, val loss 0.3526, memory 1460.79 MB
|
| 70 |
+
step 4500: train loss 0.3552, val loss 0.3322, memory 1460.79 MB
|
| 71 |
+
step 4600: train loss 0.3343, val loss 0.3532, memory 1460.79 MB
|
| 72 |
+
step 4700: train loss 0.3262, val loss 0.3365, memory 1460.79 MB
|
| 73 |
+
step 4800: train loss 0.3208, val loss 0.3511, memory 1460.79 MB
|
| 74 |
+
step 4900: train loss 0.3113, val loss 0.3042, memory 1460.79 MB
|
| 75 |
+
step 5000: train loss 0.3160, val loss 0.3016, memory 1460.79 MB
|
| 76 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 77 |
+
step 5100: train loss 0.2975, val loss 0.2929, memory 1460.79 MB
|
| 78 |
+
step 5200: train loss 0.2701, val loss 0.3149, memory 1460.79 MB
|
| 79 |
+
step 5300: train loss 0.2722, val loss 0.2676, memory 1460.79 MB
|
| 80 |
+
step 5400: train loss 0.2793, val loss 0.2865, memory 1460.79 MB
|
| 81 |
+
step 5500: train loss 0.2713, val loss 0.2626, memory 1460.79 MB
|
| 82 |
+
step 5600: train loss 0.2775, val loss 0.2568, memory 1460.79 MB
|
| 83 |
+
step 5700: train loss 0.2875, val loss 0.2646, memory 1460.79 MB
|
| 84 |
+
step 5800: train loss 0.2501, val loss 0.2609, memory 1460.79 MB
|
| 85 |
+
step 5900: train loss 0.2606, val loss 0.2473, memory 1460.79 MB
|
| 86 |
+
step 6000: train loss 0.2359, val loss 0.2412, memory 1460.79 MB
|
| 87 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 88 |
+
step 6100: train loss 0.2321, val loss 0.2516, memory 1460.79 MB
|
| 89 |
+
step 6200: train loss 0.2383, val loss 0.2271, memory 1460.79 MB
|
| 90 |
+
step 6300: train loss 0.2332, val loss 0.2418, memory 1460.79 MB
|
| 91 |
+
step 6400: train loss 0.2387, val loss 0.2397, memory 1460.79 MB
|
| 92 |
+
step 6500: train loss 0.2234, val loss 0.2346, memory 1460.79 MB
|
| 93 |
+
step 6600: train loss 0.2276, val loss 0.2122, memory 1460.79 MB
|
| 94 |
+
step 6700: train loss 0.2049, val loss 0.2185, memory 1460.79 MB
|
| 95 |
+
step 6800: train loss 0.1979, val loss 0.2095, memory 1460.79 MB
|
| 96 |
+
step 6900: train loss 0.2009, val loss 0.2111, memory 1460.79 MB
|
| 97 |
+
step 7000: train loss 0.2004, val loss 0.2184, memory 1460.79 MB
|
| 98 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 99 |
+
step 7100: train loss 0.1855, val loss 0.1974, memory 1460.79 MB
|
| 100 |
+
step 7200: train loss 0.1934, val loss 0.1869, memory 1460.79 MB
|
| 101 |
+
step 7300: train loss 0.1823, val loss 0.1964, memory 1460.79 MB
|
| 102 |
+
step 7400: train loss 0.1751, val loss 0.1777, memory 1460.79 MB
|
| 103 |
+
step 7500: train loss 0.1797, val loss 0.1771, memory 1460.79 MB
|
| 104 |
+
step 7600: train loss 0.1783, val loss 0.1752, memory 1460.79 MB
|
| 105 |
+
step 7700: train loss 0.1677, val loss 0.1797, memory 1460.79 MB
|
| 106 |
+
step 7800: train loss 0.1790, val loss 0.1733, memory 1460.79 MB
|
| 107 |
+
step 7900: train loss 0.1732, val loss 0.1665, memory 1460.79 MB
|
| 108 |
+
step 8000: train loss 0.1663, val loss 0.1714, memory 1460.79 MB
|
| 109 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 110 |
+
step 8100: train loss 0.1691, val loss 0.1583, memory 1460.79 MB
|
| 111 |
+
step 8200: train loss 0.1601, val loss 0.1618, memory 1460.79 MB
|
| 112 |
+
step 8300: train loss 0.1620, val loss 0.1706, memory 1460.79 MB
|
| 113 |
+
step 8400: train loss 0.1582, val loss 0.1601, memory 1460.79 MB
|
| 114 |
+
step 8500: train loss 0.1543, val loss 0.1548, memory 1460.79 MB
|
| 115 |
+
step 8600: train loss 0.1489, val loss 0.1563, memory 1460.79 MB
|
| 116 |
+
step 8700: train loss 0.1514, val loss 0.1545, memory 1460.79 MB
|
| 117 |
+
step 8800: train loss 0.1465, val loss 0.1428, memory 1460.79 MB
|
| 118 |
+
step 8900: train loss 0.1435, val loss 0.1434, memory 1460.79 MB
|
| 119 |
+
step 9000: train loss 0.1448, val loss 0.1430, memory 1460.79 MB
|
| 120 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 121 |
+
step 9100: train loss 0.1363, val loss 0.1359, memory 1460.79 MB
|
| 122 |
+
step 9200: train loss 0.1371, val loss 0.1419, memory 1460.79 MB
|
| 123 |
+
step 9300: train loss 0.1538, val loss 0.1536, memory 1460.79 MB
|
| 124 |
+
step 9400: train loss 0.1368, val loss 0.1464, memory 1460.79 MB
|
| 125 |
+
step 9500: train loss 0.1357, val loss 0.1397, memory 1460.79 MB
|
| 126 |
+
step 9600: train loss 0.1292, val loss 0.1311, memory 1460.79 MB
|
| 127 |
+
step 9700: train loss 0.1449, val loss 0.1281, memory 1460.79 MB
|
| 128 |
+
step 9800: train loss 0.1317, val loss 0.1258, memory 1460.79 MB
|
| 129 |
+
step 9900: train loss 0.1257, val loss 0.1362, memory 1460.79 MB
|
| 130 |
+
step 10000: train loss 0.1301, val loss 0.1294, memory 1460.79 MB
|
| 131 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 132 |
+
step 10100: train loss 0.1274, val loss 0.1299, memory 1460.79 MB
|
| 133 |
+
step 10200: train loss 0.1281, val loss 0.1251, memory 1460.79 MB
|
| 134 |
+
step 10300: train loss 0.1183, val loss 0.1240, memory 1460.79 MB
|
| 135 |
+
step 10400: train loss 0.1250, val loss 0.1221, memory 1460.79 MB
|
| 136 |
+
step 10500: train loss 0.1208, val loss 0.1174, memory 1460.79 MB
|
| 137 |
+
step 10600: train loss 0.1162, val loss 0.1250, memory 1460.79 MB
|
| 138 |
+
step 10700: train loss 0.1062, val loss 0.1123, memory 1460.79 MB
|
| 139 |
+
step 10800: train loss 0.1136, val loss 0.1104, memory 1460.79 MB
|
| 140 |
+
step 10900: train loss 0.1165, val loss 0.1146, memory 1460.79 MB
|
| 141 |
+
step 11000: train loss 0.1109, val loss 0.1181, memory 1460.79 MB
|
| 142 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 143 |
+
step 11100: train loss 0.1099, val loss 0.1029, memory 1460.79 MB
|
| 144 |
+
step 11200: train loss 0.1096, val loss 0.1062, memory 1460.79 MB
|
| 145 |
+
step 11300: train loss 0.1060, val loss 0.1040, memory 1460.79 MB
|
| 146 |
+
step 11400: train loss 0.1087, val loss 0.1150, memory 1460.79 MB
|
| 147 |
+
step 11500: train loss 0.0981, val loss 0.1008, memory 1460.79 MB
|
| 148 |
+
step 11600: train loss 0.1054, val loss 0.0998, memory 1460.79 MB
|
| 149 |
+
step 11700: train loss 0.0960, val loss 0.1015, memory 1460.79 MB
|
| 150 |
+
step 11800: train loss 0.1002, val loss 0.1023, memory 1460.79 MB
|
| 151 |
+
step 11900: train loss 0.1119, val loss 0.1163, memory 1460.79 MB
|
| 152 |
+
step 12000: train loss 0.1042, val loss 0.0973, memory 1460.79 MB
|
| 153 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 154 |
+
step 12100: train loss 0.0945, val loss 0.0941, memory 1460.79 MB
|
| 155 |
+
step 12200: train loss 0.0948, val loss 0.0967, memory 1460.79 MB
|
| 156 |
+
step 12300: train loss 0.1010, val loss 0.1024, memory 1460.79 MB
|
| 157 |
+
step 12400: train loss 0.0969, val loss 0.1015, memory 1460.79 MB
|
| 158 |
+
step 12500: train loss 0.0985, val loss 0.0940, memory 1460.79 MB
|
| 159 |
+
step 12600: train loss 0.0956, val loss 0.0938, memory 1460.79 MB
|
| 160 |
+
step 12700: train loss 0.0965, val loss 0.1038, memory 1460.79 MB
|
| 161 |
+
step 12800: train loss 0.0963, val loss 0.0992, memory 1460.79 MB
|
| 162 |
+
step 12900: train loss 0.1070, val loss 0.1038, memory 1460.79 MB
|
| 163 |
+
step 13000: train loss 0.0954, val loss 0.0925, memory 1460.79 MB
|
| 164 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 165 |
+
step 13100: train loss 0.0886, val loss 0.0903, memory 1460.79 MB
|
| 166 |
+
step 13200: train loss 0.0916, val loss 0.0961, memory 1460.79 MB
|
| 167 |
+
step 13300: train loss 0.0888, val loss 0.0881, memory 1460.79 MB
|
| 168 |
+
step 13400: train loss 0.0819, val loss 0.0901, memory 1460.79 MB
|
| 169 |
+
step 13500: train loss 0.0883, val loss 0.0817, memory 1460.79 MB
|
| 170 |
+
step 13600: train loss 0.0935, val loss 0.0927, memory 1460.79 MB
|
| 171 |
+
step 13700: train loss 0.0920, val loss 0.0883, memory 1460.79 MB
|
| 172 |
+
step 13800: train loss 0.0837, val loss 0.0832, memory 1460.79 MB
|
| 173 |
+
step 13900: train loss 0.0873, val loss 0.0831, memory 1460.79 MB
|
| 174 |
+
step 14000: train loss 0.0841, val loss 0.0814, memory 1460.79 MB
|
| 175 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 176 |
+
step 14100: train loss 0.0899, val loss 0.0906, memory 1460.79 MB
|
| 177 |
+
step 14200: train loss 0.0847, val loss 0.0806, memory 1460.79 MB
|
| 178 |
+
step 14300: train loss 0.0820, val loss 0.0833, memory 1460.79 MB
|
| 179 |
+
step 14400: train loss 0.0789, val loss 0.0728, memory 1460.79 MB
|
| 180 |
+
step 14500: train loss 0.0899, val loss 0.0858, memory 1460.79 MB
|
| 181 |
+
step 14600: train loss 0.0744, val loss 0.0775, memory 1460.79 MB
|
| 182 |
+
step 14700: train loss 0.0804, val loss 0.0819, memory 1460.79 MB
|
| 183 |
+
step 14800: train loss 0.0845, val loss 0.0861, memory 1460.79 MB
|
| 184 |
+
step 14900: train loss 0.0777, val loss 0.0793, memory 1460.79 MB
|
| 185 |
+
step 15000: train loss 0.0909, val loss 0.0827, memory 1460.79 MB
|
| 186 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 187 |
+
step 15100: train loss 0.0856, val loss 0.0824, memory 1460.79 MB
|
| 188 |
+
step 15200: train loss 0.0719, val loss 0.0800, memory 1460.79 MB
|
| 189 |
+
step 15300: train loss 0.0759, val loss 0.0792, memory 1460.79 MB
|
| 190 |
+
step 15400: train loss 0.0800, val loss 0.0787, memory 1460.79 MB
|
| 191 |
+
step 15500: train loss 0.0875, val loss 0.0789, memory 1460.79 MB
|
| 192 |
+
step 15600: train loss 0.0754, val loss 0.0782, memory 1460.79 MB
|
| 193 |
+
step 15700: train loss 0.0754, val loss 0.0784, memory 1460.79 MB
|
| 194 |
+
step 15800: train loss 0.0766, val loss 0.0771, memory 1460.79 MB
|
| 195 |
+
step 15900: train loss 0.0732, val loss 0.0775, memory 1460.79 MB
|
| 196 |
+
step 16000: train loss 0.0749, val loss 0.0712, memory 1460.79 MB
|
| 197 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 198 |
+
step 16100: train loss 0.0693, val loss 0.0694, memory 1460.79 MB
|
| 199 |
+
step 16200: train loss 0.0736, val loss 0.0785, memory 1460.79 MB
|
| 200 |
+
step 16300: train loss 0.0781, val loss 0.0776, memory 1460.79 MB
|
| 201 |
+
step 16400: train loss 0.0694, val loss 0.0737, memory 1460.79 MB
|
| 202 |
+
step 16500: train loss 0.0744, val loss 0.0779, memory 1460.79 MB
|
| 203 |
+
step 16600: train loss 0.0691, val loss 0.0694, memory 1460.79 MB
|
| 204 |
+
step 16700: train loss 0.0712, val loss 0.0807, memory 1460.79 MB
|
| 205 |
+
step 16800: train loss 0.0732, val loss 0.0764, memory 1460.79 MB
|
| 206 |
+
step 16900: train loss 0.0784, val loss 0.0750, memory 1460.79 MB
|
| 207 |
+
step 17000: train loss 0.0702, val loss 0.0710, memory 1460.79 MB
|
| 208 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 209 |
+
step 17100: train loss 0.0700, val loss 0.0707, memory 1460.79 MB
|
| 210 |
+
step 17200: train loss 0.0693, val loss 0.0717, memory 1460.79 MB
|
| 211 |
+
step 17300: train loss 0.0683, val loss 0.0668, memory 1460.79 MB
|
| 212 |
+
step 17400: train loss 0.0710, val loss 0.0755, memory 1460.79 MB
|
| 213 |
+
step 17500: train loss 0.0669, val loss 0.0653, memory 1460.79 MB
|
| 214 |
+
step 17600: train loss 0.0703, val loss 0.0677, memory 1460.79 MB
|
| 215 |
+
step 17700: train loss 0.0675, val loss 0.0645, memory 1460.79 MB
|
| 216 |
+
step 17800: train loss 0.0726, val loss 0.0678, memory 1460.79 MB
|
| 217 |
+
step 17900: train loss 0.0711, val loss 0.0682, memory 1460.79 MB
|
| 218 |
+
step 18000: train loss 0.0678, val loss 0.0726, memory 1460.79 MB
|
| 219 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 220 |
+
step 18100: train loss 0.0668, val loss 0.0661, memory 1460.79 MB
|
| 221 |
+
step 18200: train loss 0.0703, val loss 0.0685, memory 1460.79 MB
|
| 222 |
+
step 18300: train loss 0.0673, val loss 0.0644, memory 1460.79 MB
|
| 223 |
+
step 18400: train loss 0.0675, val loss 0.0661, memory 1460.79 MB
|
| 224 |
+
step 18500: train loss 0.0688, val loss 0.0697, memory 1460.79 MB
|
| 225 |
+
step 18600: train loss 0.0677, val loss 0.0648, memory 1460.79 MB
|
| 226 |
+
step 18700: train loss 0.0643, val loss 0.0602, memory 1460.79 MB
|
| 227 |
+
step 18800: train loss 0.0629, val loss 0.0622, memory 1460.79 MB
|
| 228 |
+
step 18900: train loss 0.0597, val loss 0.0630, memory 1460.79 MB
|
| 229 |
+
step 19000: train loss 0.0665, val loss 0.0696, memory 1460.79 MB
|
| 230 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 231 |
+
step 19100: train loss 0.0626, val loss 0.0617, memory 1460.79 MB
|
| 232 |
+
step 19200: train loss 0.0612, val loss 0.0595, memory 1460.79 MB
|
| 233 |
+
step 19300: train loss 0.0608, val loss 0.0632, memory 1460.79 MB
|
| 234 |
+
step 19400: train loss 0.0556, val loss 0.0599, memory 1460.79 MB
|
| 235 |
+
step 19500: train loss 0.0544, val loss 0.0580, memory 1460.79 MB
|
| 236 |
+
step 19600: train loss 0.0631, val loss 0.0612, memory 1460.79 MB
|
| 237 |
+
step 19700: train loss 0.0607, val loss 0.0625, memory 1460.79 MB
|
| 238 |
+
step 19800: train loss 0.0672, val loss 0.0644, memory 1460.79 MB
|
| 239 |
+
step 19900: train loss 0.0598, val loss 0.0593, memory 1460.79 MB
|
| 240 |
+
step 20000: train loss 0.0630, val loss 0.0627, memory 1460.79 MB
|
| 241 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 242 |
+
step 20100: train loss 0.0612, val loss 0.0596, memory 1460.79 MB
|
| 243 |
+
step 20200: train loss 0.0635, val loss 0.0598, memory 1460.79 MB
|
| 244 |
+
step 20300: train loss 0.0585, val loss 0.0535, memory 1460.79 MB
|
| 245 |
+
step 20400: train loss 0.0556, val loss 0.0560, memory 1460.79 MB
|
| 246 |
+
step 20500: train loss 0.0620, val loss 0.0649, memory 1460.79 MB
|
| 247 |
+
step 20600: train loss 0.0602, val loss 0.0626, memory 1460.79 MB
|
| 248 |
+
step 20700: train loss 0.0580, val loss 0.0559, memory 1460.79 MB
|
| 249 |
+
step 20800: train loss 0.0558, val loss 0.0596, memory 1460.79 MB
|
| 250 |
+
step 20900: train loss 0.0586, val loss 0.0568, memory 1460.79 MB
|
| 251 |
+
step 21000: train loss 0.0585, val loss 0.0599, memory 1460.79 MB
|
| 252 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 253 |
+
step 21100: train loss 0.0558, val loss 0.0544, memory 1460.79 MB
|
| 254 |
+
step 21200: train loss 0.0588, val loss 0.0583, memory 1460.79 MB
|
| 255 |
+
step 21300: train loss 0.0546, val loss 0.0584, memory 1460.79 MB
|
| 256 |
+
step 21400: train loss 0.0541, val loss 0.0524, memory 1460.79 MB
|
| 257 |
+
step 21500: train loss 0.0545, val loss 0.0603, memory 1460.79 MB
|
| 258 |
+
step 21600: train loss 0.0579, val loss 0.0561, memory 1460.79 MB
|
| 259 |
+
step 21700: train loss 0.0593, val loss 0.0601, memory 1460.79 MB
|
| 260 |
+
step 21800: train loss 0.0504, val loss 0.0516, memory 1460.79 MB
|
| 261 |
+
step 21900: train loss 0.0530, val loss 0.0507, memory 1460.79 MB
|
| 262 |
+
step 22000: train loss 0.0583, val loss 0.0604, memory 1460.79 MB
|
| 263 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 264 |
+
step 22100: train loss 0.0569, val loss 0.0583, memory 1460.79 MB
|
| 265 |
+
step 22200: train loss 0.0523, val loss 0.0506, memory 1460.79 MB
|
| 266 |
+
step 22300: train loss 0.0543, val loss 0.0574, memory 1460.79 MB
|
| 267 |
+
step 22400: train loss 0.0561, val loss 0.0541, memory 1460.79 MB
|
| 268 |
+
step 22500: train loss 0.0568, val loss 0.0548, memory 1460.79 MB
|
| 269 |
+
step 22600: train loss 0.0553, val loss 0.0519, memory 1460.79 MB
|
| 270 |
+
step 22700: train loss 0.0544, val loss 0.0543, memory 1460.79 MB
|
| 271 |
+
step 22800: train loss 0.0570, val loss 0.0561, memory 1460.79 MB
|
| 272 |
+
step 22900: train loss 0.0563, val loss 0.0556, memory 1460.79 MB
|
| 273 |
+
step 23000: train loss 0.0506, val loss 0.0529, memory 1460.79 MB
|
| 274 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 275 |
+
step 23100: train loss 0.0521, val loss 0.0511, memory 1460.79 MB
|
| 276 |
+
step 23200: train loss 0.0575, val loss 0.0574, memory 1460.79 MB
|
| 277 |
+
step 23300: train loss 0.0554, val loss 0.0509, memory 1460.79 MB
|
| 278 |
+
step 23400: train loss 0.0573, val loss 0.0539, memory 1460.79 MB
|
| 279 |
+
step 23500: train loss 0.0550, val loss 0.0547, memory 1460.79 MB
|
| 280 |
+
step 23600: train loss 0.0545, val loss 0.0524, memory 1460.79 MB
|
| 281 |
+
step 23700: train loss 0.0504, val loss 0.0529, memory 1460.79 MB
|
| 282 |
+
step 23800: train loss 0.0465, val loss 0.0516, memory 1460.79 MB
|
| 283 |
+
step 23900: train loss 0.0510, val loss 0.0502, memory 1460.79 MB
|
| 284 |
+
step 24000: train loss 0.0497, val loss 0.0490, memory 1460.79 MB
|
| 285 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
| 286 |
+
step 24100: train loss 0.0533, val loss 0.0567, memory 1460.79 MB
|
| 287 |
+
step 24200: train loss 0.0532, val loss 0.0540, memory 1460.79 MB
|
| 288 |
+
step 24300: train loss 0.0453, val loss 0.0507, memory 1460.79 MB
|
| 289 |
+
step 24400: train loss 0.0473, val loss 0.0528, memory 1460.79 MB
|
| 290 |
+
step 24500: train loss 0.0509, val loss 0.0537, memory 1460.79 MB
|
| 291 |
+
step 24600: train loss 0.0527, val loss 0.0562, memory 1460.79 MB
|
| 292 |
+
step 24700: train loss 0.0546, val loss 0.0554, memory 1460.79 MB
|
| 293 |
+
step 24800: train loss 0.0490, val loss 0.0484, memory 1460.79 MB
|
| 294 |
+
step 24900: train loss 0.0476, val loss 0.0493, memory 1460.79 MB
|
| 295 |
+
step 24999: train loss 0.0538, val loss 0.0502, memory 1460.79 MB
|
| 296 |
+
Model saved to ./checkpoints/grp_stat_3.pth
|
wandb/run-20260202_064313-i4545kqj/files/requirements.txt
ADDED
|
@@ -0,0 +1,249 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
httpx==0.27.2
|
| 2 |
+
marshmallow==3.20.2
|
| 3 |
+
sniffio==1.3.1
|
| 4 |
+
optree==0.11.0
|
| 5 |
+
multiprocess==0.70.16
|
| 6 |
+
biom-format==2.1.16
|
| 7 |
+
typing-inspect==0.9.0
|
| 8 |
+
kornia_rs==0.1.7
|
| 9 |
+
loky==3.4.1
|
| 10 |
+
llama_stack_client==0.0.54
|
| 11 |
+
randaugment==1.0.2
|
| 12 |
+
numba==0.60.0
|
| 13 |
+
annotated-types==0.7.0
|
| 14 |
+
llama_stack==0.0.54
|
| 15 |
+
tomli==2.2.1
|
| 16 |
+
kornia==0.7.4
|
| 17 |
+
terminaltables==3.1.10
|
| 18 |
+
tensorrt-cu12==10.6.0
|
| 19 |
+
schedule==1.2.2
|
| 20 |
+
mdurl==0.1.2
|
| 21 |
+
responses==0.18.0
|
| 22 |
+
awscli==1.32.41
|
| 23 |
+
libclang==18.1.1
|
| 24 |
+
torchvision==0.20.1
|
| 25 |
+
timm==0.9.16
|
| 26 |
+
addict==2.4.0
|
| 27 |
+
pyarrow-hotfix==0.6
|
| 28 |
+
tensorboard-data-server==0.7.2
|
| 29 |
+
threadpoolctl==3.4.0
|
| 30 |
+
contourpy==1.3.1
|
| 31 |
+
blobfile==3.0.0
|
| 32 |
+
llama_models==0.0.54
|
| 33 |
+
python-dateutil==2.8.2
|
| 34 |
+
mypy-extensions==1.0.0
|
| 35 |
+
moviepy==1.0.3
|
| 36 |
+
namex==0.0.7
|
| 37 |
+
pyaml==24.9.0
|
| 38 |
+
s3transfer==0.10.0
|
| 39 |
+
rouge-score==0.1.2
|
| 40 |
+
httpcore==1.0.7
|
| 41 |
+
pycryptodomex==3.21.0
|
| 42 |
+
jmespath==1.0.1
|
| 43 |
+
docutils==0.16
|
| 44 |
+
h11==0.14.0
|
| 45 |
+
ete3==3.1.3
|
| 46 |
+
boto3==1.34.44
|
| 47 |
+
MarkupSafe==3.0.2
|
| 48 |
+
tensorrt==10.6.0
|
| 49 |
+
nltk==3.9.1
|
| 50 |
+
tiktoken==0.8.0
|
| 51 |
+
pbr==6.1.0
|
| 52 |
+
Pygments==2.17.2
|
| 53 |
+
pydantic_core==2.27.1
|
| 54 |
+
ego4d==1.6.1
|
| 55 |
+
tensorrt-cu12-bindings==10.6.0
|
| 56 |
+
tensorrt-cu12-libs==10.6.0
|
| 57 |
+
bgzip==0.5.0
|
| 58 |
+
cogent3==2024.11.29a2
|
| 59 |
+
dataclasses-json==0.6.4
|
| 60 |
+
platformdirs==4.3.8
|
| 61 |
+
exceptiongroup==1.2.2
|
| 62 |
+
mpmath==1.3.0
|
| 63 |
+
inquirerpy==0.3.4
|
| 64 |
+
packaging==23.2
|
| 65 |
+
inplace-abn==1.1.0
|
| 66 |
+
astunparse==1.6.3
|
| 67 |
+
google-pasta==0.2.0
|
| 68 |
+
joblib==1.3.2
|
| 69 |
+
prompt_toolkit==3.0.48
|
| 70 |
+
llvmlite==0.43.0
|
| 71 |
+
torchaudio==2.5.1
|
| 72 |
+
pydantic==2.10.1
|
| 73 |
+
scikit-learn==1.6.1
|
| 74 |
+
fire==0.7.0
|
| 75 |
+
Werkzeug==3.1.3
|
| 76 |
+
scitrack==2024.10.8
|
| 77 |
+
pfzy==0.3.4
|
| 78 |
+
cvbase==0.5.5
|
| 79 |
+
pysam==0.22.1
|
| 80 |
+
tensorboardX==2.6.2.2
|
| 81 |
+
bert-score==0.3.13
|
| 82 |
+
anyio==4.6.2.post1
|
| 83 |
+
evaluate==0.4.1
|
| 84 |
+
yapf==0.43.0
|
| 85 |
+
wheel==0.41.2
|
| 86 |
+
iopath==0.1.10
|
| 87 |
+
dominate==2.9.1
|
| 88 |
+
cycler==0.12.1
|
| 89 |
+
meteor==2.0.17
|
| 90 |
+
portalocker==2.8.2
|
| 91 |
+
lxml==5.3.0
|
| 92 |
+
decord==0.6.0
|
| 93 |
+
keras==2.15.0
|
| 94 |
+
nvidia-nvtx-cu12==12.4.127
|
| 95 |
+
kiwisolver==1.4.9
|
| 96 |
+
decorator==4.4.2
|
| 97 |
+
nvidia-cudnn-cu12==9.1.0.70
|
| 98 |
+
huggingface==0.0.1
|
| 99 |
+
cliff==4.11.0
|
| 100 |
+
nvidia-cusolver-cu12==11.6.1.9
|
| 101 |
+
packaging==25.0
|
| 102 |
+
frozenlist==1.7.0
|
| 103 |
+
Farama-Notifications==0.0.4
|
| 104 |
+
fsspec==2025.9.0
|
| 105 |
+
pyarrow==21.0.0
|
| 106 |
+
Pympler==1.1
|
| 107 |
+
tensorboard==2.15.2
|
| 108 |
+
einops==0.8.0
|
| 109 |
+
wandb==0.24.1
|
| 110 |
+
rich==14.1.0
|
| 111 |
+
colorlog==6.9.0
|
| 112 |
+
hydra-optuna-sweeper==1.2.0
|
| 113 |
+
absl-py==2.3.1
|
| 114 |
+
gymnasium==0.28.1
|
| 115 |
+
nvidia-cublas-cu12==12.4.5.8
|
| 116 |
+
hydra-submitit-launcher==1.2.0
|
| 117 |
+
psutil==7.2.2
|
| 118 |
+
urllib3==2.5.0
|
| 119 |
+
opencv-python==4.11.0.86
|
| 120 |
+
python-box==7.3.2
|
| 121 |
+
nvidia-cuda-nvrtc-cu12==12.4.127
|
| 122 |
+
smmap==5.0.2
|
| 123 |
+
cmaes==0.12.0
|
| 124 |
+
xxhash==3.5.0
|
| 125 |
+
hydra-core==1.2.0
|
| 126 |
+
PyYAML==6.0.2
|
| 127 |
+
tensorflow==2.15.0
|
| 128 |
+
filelock==3.19.1
|
| 129 |
+
rlds==0.1.8
|
| 130 |
+
tensorflow-estimator==2.15.0
|
| 131 |
+
termcolor==3.1.0
|
| 132 |
+
tensorflow-datasets==4.9.2
|
| 133 |
+
sentry-sdk==2.38.0
|
| 134 |
+
typing_extensions==4.15.0
|
| 135 |
+
requests==2.32.5
|
| 136 |
+
antlr4-python3-runtime==4.9.3
|
| 137 |
+
flatbuffers==25.2.10
|
| 138 |
+
rich-argparse==1.7.1
|
| 139 |
+
stevedore==5.5.0
|
| 140 |
+
aiohappyeyeballs==2.6.1
|
| 141 |
+
pandas==2.2.2
|
| 142 |
+
Jinja2==3.1.4
|
| 143 |
+
dm-tree==0.1.9
|
| 144 |
+
SQLAlchemy==2.0.43
|
| 145 |
+
zipp==3.23.0
|
| 146 |
+
rsa==4.9.1
|
| 147 |
+
hf-xet==1.1.10
|
| 148 |
+
networkx==3.3
|
| 149 |
+
pyasn1==0.6.1
|
| 150 |
+
gast==0.6.0
|
| 151 |
+
async-timeout==5.0.1
|
| 152 |
+
charset-normalizer==3.4.3
|
| 153 |
+
transformers==4.48.1
|
| 154 |
+
wcwidth==0.2.13
|
| 155 |
+
opt_einsum==3.4.0
|
| 156 |
+
safetensors==0.6.2
|
| 157 |
+
google-auth-oauthlib==1.2.2
|
| 158 |
+
imageio-ffmpeg==0.6.0
|
| 159 |
+
docker-pycreds==0.4.0
|
| 160 |
+
cmd2==2.7.0
|
| 161 |
+
optuna==2.10.1
|
| 162 |
+
gitdb==4.0.12
|
| 163 |
+
aiosignal==1.4.0
|
| 164 |
+
propcache==0.3.2
|
| 165 |
+
pytz==2025.2
|
| 166 |
+
pyasn1_modules==0.4.2
|
| 167 |
+
regex==2025.9.18
|
| 168 |
+
prettytable==3.16.0
|
| 169 |
+
protobuf==3.20.3
|
| 170 |
+
nvidia-cufft-cu12==11.2.1.3
|
| 171 |
+
yarl==1.20.1
|
| 172 |
+
dill==0.4.0
|
| 173 |
+
tensorflow-io-gcs-filesystem==0.37.1
|
| 174 |
+
nvidia-curand-cu12==10.3.5.147
|
| 175 |
+
certifi==2025.8.3
|
| 176 |
+
proglog==0.1.12
|
| 177 |
+
attrs==25.3.0
|
| 178 |
+
idna==3.10
|
| 179 |
+
ml-dtypes==0.2.0
|
| 180 |
+
matplotlib==3.5.3
|
| 181 |
+
nvidia-cusparse-cu12==12.3.1.170
|
| 182 |
+
greenlet==3.2.4
|
| 183 |
+
imageio==2.37.0
|
| 184 |
+
scipy==1.15.3
|
| 185 |
+
setproctitle==1.3.7
|
| 186 |
+
dm-reverb==0.14.0
|
| 187 |
+
triton==3.1.0
|
| 188 |
+
jax-jumpy==1.0.0
|
| 189 |
+
torch==2.5.1
|
| 190 |
+
pathtools==0.1.2
|
| 191 |
+
tzdata==2025.2
|
| 192 |
+
tokenizers==0.21.4
|
| 193 |
+
tqdm==4.67.1
|
| 194 |
+
numpy==1.26.4
|
| 195 |
+
cachetools==5.5.2
|
| 196 |
+
submitit==1.5.3
|
| 197 |
+
cloudpickle==3.1.1
|
| 198 |
+
wheel==0.46.3
|
| 199 |
+
oauthlib==3.3.1
|
| 200 |
+
aiohttp==3.12.15
|
| 201 |
+
setuptools==80.10.1
|
| 202 |
+
tensorflow-metadata==1.16.1
|
| 203 |
+
six==1.17.0
|
| 204 |
+
fonttools==4.60.0
|
| 205 |
+
omegaconf==2.3.0
|
| 206 |
+
shortuuid==1.0.13
|
| 207 |
+
nvidia-cuda-cupti-cu12==12.4.127
|
| 208 |
+
markdown-it-py==4.0.0
|
| 209 |
+
promise==2.3
|
| 210 |
+
h5py==3.14.0
|
| 211 |
+
pip==26.0
|
| 212 |
+
nvidia-nvjitlink-cu12==12.4.127
|
| 213 |
+
google-auth==2.40.3
|
| 214 |
+
nvidia-cuda-runtime-cu12==12.4.127
|
| 215 |
+
nvidia-nccl-cu12==2.21.5
|
| 216 |
+
autopage==0.5.2
|
| 217 |
+
click==8.3.0
|
| 218 |
+
array_record==0.8.1
|
| 219 |
+
multidict==6.6.4
|
| 220 |
+
Mako==1.3.10
|
| 221 |
+
etils==1.13.0
|
| 222 |
+
pyparsing==3.2.4
|
| 223 |
+
Markdown==3.9
|
| 224 |
+
huggingface-hub==0.35.0
|
| 225 |
+
datasets==4.1.1
|
| 226 |
+
portpicker==1.6.0
|
| 227 |
+
sympy==1.13.1
|
| 228 |
+
Pillow==9.4.0
|
| 229 |
+
grpcio==1.75.0
|
| 230 |
+
requests-oauthlib==2.0.0
|
| 231 |
+
sentencepiece==0.2.0
|
| 232 |
+
GitPython==3.1.45
|
| 233 |
+
wrapt==1.14.2
|
| 234 |
+
toml==0.10.2
|
| 235 |
+
alembic==1.16.5
|
| 236 |
+
importlib_resources==6.5.2
|
| 237 |
+
pyperclip==1.10.0
|
| 238 |
+
more-itertools==10.8.0
|
| 239 |
+
jaraco.context==6.1.0
|
| 240 |
+
zipp==3.23.0
|
| 241 |
+
backports.tarfile==1.2.0
|
| 242 |
+
jaraco.functools==4.4.0
|
| 243 |
+
autocommand==2.2.2
|
| 244 |
+
jaraco.text==4.0.0
|
| 245 |
+
wheel==0.45.1
|
| 246 |
+
tomli==2.4.0
|
| 247 |
+
platformdirs==4.4.0
|
| 248 |
+
importlib_metadata==8.7.1
|
| 249 |
+
packaging==25.0
|
wandb/run-20260202_064313-i4545kqj/files/wandb-metadata.json
ADDED
|
@@ -0,0 +1,94 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"os": "Linux-6.8.0-79-generic-x86_64-with-glibc2.39",
|
| 3 |
+
"python": "CPython 3.10.19",
|
| 4 |
+
"startedAt": "2026-02-02T11:43:13.984688Z",
|
| 5 |
+
"args": [
|
| 6 |
+
"simEval=[]",
|
| 7 |
+
"policy.obs_stacking=3",
|
| 8 |
+
"experiment.name=grp_stat_3"
|
| 9 |
+
],
|
| 10 |
+
"program": "/home/o_heidar/robot_learning_2026/mini-grp/mini_grp.py",
|
| 11 |
+
"codePath": "mini-grp/mini_grp.py",
|
| 12 |
+
"git": {
|
| 13 |
+
"remote": "https://github.com/omid-reza/robot_learning_2026.git",
|
| 14 |
+
"commit": "a1e45b9ec95f0f09f151f485ba23961058153e48"
|
| 15 |
+
},
|
| 16 |
+
"email": "omid.orh@gmail.com",
|
| 17 |
+
"root": "/home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12",
|
| 18 |
+
"host": "virya1",
|
| 19 |
+
"executable": "/home/o_heidar/rbenv/bin/python",
|
| 20 |
+
"cpu_count": 36,
|
| 21 |
+
"cpu_count_logical": 72,
|
| 22 |
+
"gpu": "Tesla V100-PCIE-32GB",
|
| 23 |
+
"gpu_count": 2,
|
| 24 |
+
"disk": {
|
| 25 |
+
"/": {
|
| 26 |
+
"total": "470272819200",
|
| 27 |
+
"used": "31232614400"
|
| 28 |
+
}
|
| 29 |
+
},
|
| 30 |
+
"memory": {
|
| 31 |
+
"total": "405360889856"
|
| 32 |
+
},
|
| 33 |
+
"gpu_nvidia": [
|
| 34 |
+
{
|
| 35 |
+
"name": "Tesla V100-PCIE-32GB",
|
| 36 |
+
"memoryTotal": "34359738368",
|
| 37 |
+
"cudaCores": 5120,
|
| 38 |
+
"architecture": "Volta",
|
| 39 |
+
"uuid": "GPU-28f0e524-a7c5-f287-d873-73f15fb0d817"
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"name": "Tesla V100-PCIE-32GB",
|
| 43 |
+
"memoryTotal": "34359738368",
|
| 44 |
+
"cudaCores": 5120,
|
| 45 |
+
"architecture": "Volta",
|
| 46 |
+
"uuid": "GPU-6b13b007-765f-fea0-26ee-f1842182916d"
|
| 47 |
+
}
|
| 48 |
+
],
|
| 49 |
+
"cudaVersion": "12.9",
|
| 50 |
+
"slurm": {
|
| 51 |
+
"array_job_id": "59114",
|
| 52 |
+
"array_task_count": "5",
|
| 53 |
+
"array_task_id": "1",
|
| 54 |
+
"array_task_max": "4",
|
| 55 |
+
"array_task_min": "0",
|
| 56 |
+
"array_task_step": "1",
|
| 57 |
+
"cluster_name": "clstr1",
|
| 58 |
+
"conf": "/etc/slurm/slurm.conf",
|
| 59 |
+
"cpus_on_node": "10",
|
| 60 |
+
"gpus": "2",
|
| 61 |
+
"gpus_on_node": "2",
|
| 62 |
+
"gtids": "0",
|
| 63 |
+
"job_account": "yang-wang",
|
| 64 |
+
"job_cpus_per_node": "10",
|
| 65 |
+
"job_end_time": "1770637382",
|
| 66 |
+
"job_gid": "2184",
|
| 67 |
+
"job_gpus": "0,3",
|
| 68 |
+
"job_id": "59116",
|
| 69 |
+
"job_name": "H1Stat",
|
| 70 |
+
"job_nodelist": "virya1",
|
| 71 |
+
"job_num_nodes": "1",
|
| 72 |
+
"job_partition": "all",
|
| 73 |
+
"job_qos": "standard",
|
| 74 |
+
"job_start_time": "1770032582",
|
| 75 |
+
"job_uid": "2184",
|
| 76 |
+
"job_user": "o_heidar",
|
| 77 |
+
"jobid": "59116",
|
| 78 |
+
"localid": "0",
|
| 79 |
+
"mem_per_node": "102400",
|
| 80 |
+
"nnodes": "1",
|
| 81 |
+
"nodeid": "0",
|
| 82 |
+
"nodelist": "virya1",
|
| 83 |
+
"prio_process": "0",
|
| 84 |
+
"procid": "0",
|
| 85 |
+
"script_context": "prolog_task",
|
| 86 |
+
"submit_dir": "/home/o_heidar/robot_learning_2026/jobs",
|
| 87 |
+
"submit_host": "viryasubmit2",
|
| 88 |
+
"task_pid": "1212375",
|
| 89 |
+
"tasks_per_node": "10",
|
| 90 |
+
"topology_addr": "virya1",
|
| 91 |
+
"topology_addr_pattern": "node"
|
| 92 |
+
},
|
| 93 |
+
"writerId": "q4xofvz8clyq1g2jr4zr21tj3a4wrrs3"
|
| 94 |
+
}
|
wandb/run-20260202_064313-i4545kqj/files/wandb-summary.json
ADDED
|
@@ -0,0 +1 @@
|
|
|
|
|
|
|
| 1 |
+
{"memory":1460.792832,"buffer_size":6.139024,"_timestamp":1.7700541689873946e+09,"_step":24999,"_wandb":{"runtime":21575},"_runtime":21575.028241367,"train loss":0.05379915237426758,"val loss":0.05018728971481323}
|
wandb/run-20260202_064313-i4545kqj/logs/debug-core.log
ADDED
|
@@ -0,0 +1,19 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"time":"2026-02-02T06:43:14.178755309-05:00","level":"INFO","msg":"main: starting server","port-filename":"/data/scratch/59116/tmpv5gcseoc/port-1212388.txt","pid":1212388,"log-level":0,"disable-analytics":false,"shutdown-on-parent-exit":false,"enable-dcgm-profiling":false}
|
| 2 |
+
{"time":"2026-02-02T06:43:14.179492502-05:00","level":"INFO","msg":"server: will exit if parent process dies","ppid":1212388}
|
| 3 |
+
{"time":"2026-02-02T06:43:14.179479484-05:00","level":"INFO","msg":"server: accepting connections","addr":{"Name":"/data/scratch/59116/wandb-1212388-1212414-3650282769/socket","Net":"unix"}}
|
| 4 |
+
{"time":"2026-02-02T06:43:14.36183203-05:00","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"1(@)"}
|
| 5 |
+
{"time":"2026-02-02T06:43:14.372324765-05:00","level":"INFO","msg":"handleInformInit: received","streamId":"i4545kqj","id":"1(@)"}
|
| 6 |
+
{"time":"2026-02-02T06:43:14.558146241-05:00","level":"INFO","msg":"handleInformInit: stream started","streamId":"i4545kqj","id":"1(@)"}
|
| 7 |
+
{"time":"2026-02-02T06:43:20.172246764-05:00","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"3rrl05d4577k"}
|
| 8 |
+
{"time":"2026-02-02T12:42:49.805601091-05:00","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"3rrl05d4577k"}
|
| 9 |
+
{"time":"2026-02-02T12:42:50.515546133-05:00","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"3rrl05d4577k"}
|
| 10 |
+
{"time":"2026-02-02T12:42:50.528979645-05:00","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i4545kqj","id":"1(@)"}
|
| 11 |
+
{"time":"2026-02-02T12:42:50.539325608-05:00","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i4545kqj","id":"1(@)"}
|
| 12 |
+
{"time":"2026-02-02T12:42:50.539352327-05:00","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
|
| 13 |
+
{"time":"2026-02-02T12:42:50.53937482-05:00","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
|
| 14 |
+
{"time":"2026-02-02T12:42:50.539393953-05:00","level":"INFO","msg":"connection: closing","id":"1(@)"}
|
| 15 |
+
{"time":"2026-02-02T12:42:50.539410057-05:00","level":"INFO","msg":"server is shutting down"}
|
| 16 |
+
{"time":"2026-02-02T12:42:50.539463306-05:00","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
|
| 17 |
+
{"time":"2026-02-02T12:42:50.539474128-05:00","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
|
| 18 |
+
{"time":"2026-02-02T12:42:50.539587306-05:00","level":"INFO","msg":"server: listener closed","addr":{"Name":"/data/scratch/59116/wandb-1212388-1212414-3650282769/socket","Net":"unix"}}
|
| 19 |
+
{"time":"2026-02-02T12:42:50.539642147-05:00","level":"INFO","msg":"server is closed"}
|
wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log
ADDED
|
@@ -0,0 +1,12 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"time":"2026-02-02T06:43:14.373523076-05:00","level":"INFO","msg":"stream: starting","core version":"0.24.1"}
|
| 2 |
+
{"time":"2026-02-02T06:43:14.555022188-05:00","level":"INFO","msg":"stream: created new stream","id":"i4545kqj"}
|
| 3 |
+
{"time":"2026-02-02T06:43:14.555098169-05:00","level":"INFO","msg":"handler: started","stream_id":"i4545kqj"}
|
| 4 |
+
{"time":"2026-02-02T06:43:14.558136687-05:00","level":"INFO","msg":"stream: started","id":"i4545kqj"}
|
| 5 |
+
{"time":"2026-02-02T06:43:14.55822855-05:00","level":"INFO","msg":"writer: started","stream_id":"i4545kqj"}
|
| 6 |
+
{"time":"2026-02-02T06:43:14.558251165-05:00","level":"INFO","msg":"sender: started","stream_id":"i4545kqj"}
|
| 7 |
+
{"time":"2026-02-02T12:42:50.293657146-05:00","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
|
| 8 |
+
{"time":"2026-02-02T12:42:50.512070299-05:00","level":"INFO","msg":"handler: operation stats","stats":{}}
|
| 9 |
+
{"time":"2026-02-02T12:42:50.529012161-05:00","level":"INFO","msg":"stream: closing","id":"i4545kqj"}
|
| 10 |
+
{"time":"2026-02-02T12:42:50.529025813-05:00","level":"INFO","msg":"handler: closed","stream_id":"i4545kqj"}
|
| 11 |
+
{"time":"2026-02-02T12:42:50.531105801-05:00","level":"INFO","msg":"sender: closed","stream_id":"i4545kqj"}
|
| 12 |
+
{"time":"2026-02-02T12:42:50.531120425-05:00","level":"INFO","msg":"stream: closed","id":"i4545kqj"}
|
wandb/run-20260202_064313-i4545kqj/logs/debug.log
ADDED
|
@@ -0,0 +1,24 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
2026-02-02 06:43:14,007 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Current SDK version is 0.24.1
|
| 2 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Configure stats pid to 1212388
|
| 3 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_setup.py:_flush():81] Loading settings from environment variables
|
| 4 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():717] Logging user logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug.log
|
| 5 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:setup_run_log_directory():718] Logging internal logs to /home/o_heidar/robot_learning_2026/outputs/2026-02-02/06-43-12/wandb/run-20260202_064313-i4545kqj/logs/debug-internal.log
|
| 6 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():844] calling init triggers
|
| 7 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():849] wandb.init called with sweep_config: {}
|
| 8 |
+
config: {'dataset': {'to_name': 'gberseth/bridge-data-64px-test', 'num_episodes': 0, 'chunk_size': 1, 'buffer_size': 50000, 'encode_with_t5': False, 't5_version': 't5-small', 'chars_list': [' ', ',', '.', '0', '1', '2', '3', '4', '5', '6', '7', '8', '9', '!', '?', '"', "'", '(', ')', '-', '_', ':', ';', '@', '#', '$', '%', '&', '*', '+', '=', '<', '>', '/', '\\\\', '|', '~', '`', 'A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T', 'U', 'V', 'W', 'X', 'Y', 'Z', 'a', 'b', 'c', 'd', 'e', 'f', 'g', 'h', 'i', 'j', 'k', 'l', 'm', 'n', 'o', 'p', 'q', 'r', 's', 't', 'u', 'v', 'w', 'x', 'y', 'z'], 'load_dataset': True, 'download_all': False, 'save_initial_dataset': False, 'use_generator': False, 'dataset_indicies': {'gs://gresearch/robotics/bridge/0.1.0/': {'start': 0, 'weight': 1.0, 'dataset_key': 'bridge_oxe', 'scale': 1.0}}, 'action_std': [0.0118407579138875, 0.01651778072118759, 0.01558756735175848, 0.03479960933327675, 0.03878577798604965, 0.05862835422158241, 0.5686280727386475], 'action_mean': [0.00032659756834618747, 0.0002364425890846178, -0.0001985691487789154, -0.0003516025608405471, -0.0005819069338031113, 0.0006634143064729869, 0.659541130065918], 'gripper_closed_std': 1.0}, 'experiment': {'name': 'grp_stat_3', 'project': 'mini-grp', 'description': 'simple env with 64pix images and pose data'}, 'model': {'type': 'transformer'}, 'batch_size': 256, 'max_block_size': 16, 'vocab_size': 32, 'n_patches': 8, 'patch_size': 8, 'max_iters': 25000, 'eval_interval': 100, 'learning_rate': 0.0003, 'lr_schedule': 'linear', 'eval_iters': 5, 'policy': {'action_stacking': 1, 'obs_stacking': 3, 'use_image_augmentations': False, 'dtype': 'float32', 'use_pose_data': 1, 'random_masking_enabled': False}, 'testing': False, 'eval_vid_iters': 2500, 'gradient_accumulation_steps': 1, 'simEval': [], 'sim': {'eval_episodes': 1, 'eval_tasks': [0, 1, 2, 3], 'episode length': 500}, 'r_seed': 1337, 'device': 'cuda', 'n_embd': 512, 'n_head': 16, 'n_blocks': 4, 'dropout': 0.2, 'action_dim': 7, 'load_action_bounds': True, 'image_shape': [64, 64, 3], 'data_shuffel_interval': 1000, 'profiler': {'enable': False, 'params': {'profile_memory': True, 'with_stack': True, 'use_cuda': True}}, '_wandb': {}}
|
| 9 |
+
2026-02-02 06:43:14,008 INFO MainThread:1212388 [wandb_init.py:init():892] starting backend
|
| 10 |
+
2026-02-02 06:43:14,361 INFO MainThread:1212388 [wandb_init.py:init():895] sending inform_init request
|
| 11 |
+
2026-02-02 06:43:14,370 INFO MainThread:1212388 [wandb_init.py:init():903] backend started and connected
|
| 12 |
+
2026-02-02 06:43:14,372 INFO MainThread:1212388 [wandb_init.py:init():973] updated telemetry
|
| 13 |
+
2026-02-02 06:43:14,390 INFO MainThread:1212388 [wandb_init.py:init():997] communicating run to backend with 90.0 second timeout
|
| 14 |
+
2026-02-02 06:43:14,776 INFO MainThread:1212388 [wandb_init.py:init():1042] starting run threads in backend
|
| 15 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_console_start():2529] atexit reg
|
| 16 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2377] redirect: wrap_raw
|
| 17 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2446] Wrapping output streams.
|
| 18 |
+
2026-02-02 06:43:15,167 INFO MainThread:1212388 [wandb_run.py:_redirect():2469] Redirects installed.
|
| 19 |
+
2026-02-02 06:43:15,172 INFO MainThread:1212388 [wandb_init.py:init():1082] run started, returning control to user process
|
| 20 |
+
2026-02-02 12:42:49,802 INFO MainThread:1212388 [wandb_run.py:_finish():2295] finishing run omidrezaheidari-concordia-university/mini-grp/i4545kqj
|
| 21 |
+
2026-02-02 12:42:49,804 INFO MainThread:1212388 [wandb_run.py:_atexit_cleanup():2494] got exitcode: 0
|
| 22 |
+
2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2476] restore
|
| 23 |
+
2026-02-02 12:42:49,805 INFO MainThread:1212388 [wandb_run.py:_restore():2482] restore done
|
| 24 |
+
2026-02-02 12:42:50,515 INFO MainThread:1212388 [wandb_run.py:_footer_sync_info():3871] logging synced files
|
wandb/run-20260202_064313-i4545kqj/run-i4545kqj.wandb
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d7e21e67c3d2de80457b1ae740def25c1cca64da32bc8a606ed980259d2aee2a
|
| 3 |
+
size 1964255
|