File size: 15,211 Bytes
1c5b1f4 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 148 149 150 151 152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 169 170 171 172 173 174 175 176 177 178 179 180 181 182 183 184 185 186 187 188 189 190 191 192 193 194 195 196 197 198 199 200 201 202 203 204 205 206 207 208 209 210 211 212 213 214 215 216 217 218 219 220 221 222 223 224 225 226 227 228 229 230 231 232 233 234 235 236 237 238 239 240 241 242 243 244 245 246 247 248 249 250 251 252 253 254 255 256 257 258 259 260 261 262 263 264 265 266 267 268 269 270 271 272 273 274 275 276 277 278 279 280 281 282 283 284 285 286 287 288 289 290 291 292 293 294 295 296 297 298 299 300 301 302 303 304 305 306 307 308 309 310 311 312 313 314 315 316 317 318 319 320 321 322 323 324 325 326 327 328 329 330 331 332 333 334 335 336 337 338 339 340 341 342 343 344 345 346 347 348 349 350 351 352 353 354 | {
"final_step": 90000,
"final": {
"steps_per_second": 2.264137356582644,
"throughput/samples_per_s": 579.6191632851569,
"lr": 9.999999747378752e-05,
"grad_norm": 2.907674429702759,
"dataloader_wait_frac": 0.014950468752680034,
"gpu_util": 97.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.6041066646575928,
"train/latent_dynamics": 0.034288667142391205,
"train/reward": 0.091888926923275,
"train/value": 0.1268676519393921,
"train/action": 1.3510606288909912,
"test/loss": 0.36793431639671326,
"test/latent_dynamics": 0.027841078117489815,
"test/reward": 0.08893612772226334,
"test/value": 0.05607955902814865,
"test/action": 0.19507770240306854,
"test/dataloader_wait_frac": 0.07222307166565173,
"train/unweighted/latent_dynamics": 0.034288667142391205,
"train/unweighted/reward": 0.091888926923275,
"train/unweighted/value": 0.1268676519393921,
"train/unweighted/action": 0.3377651572227478,
"test/unweighted/latent_dynamics": 0.027841078117489815,
"test/unweighted/reward": 0.08893612772226334,
"test/unweighted/value": 0.05607955902814865,
"test/unweighted/action": 0.048769425600767136,
"eval/latent_rollout_error/h1": 0.016440856154076755,
"eval/latent_rollout_error/h2": 0.02284725825302303,
"eval/latent_rollout_error/h3": 0.028287908528000116,
"eval/latent_rollout_error/h4": 0.03440041467547417,
"eval/latent_rollout_error/h5": 0.03848161967471242,
"eval/latent_rollout_error_mean": 0.028091611457057297,
"eval/latent_variance/encoder": 0.36949001252651215,
"eval/latent_variance/predicted": 0.3481830880045891,
"eval/reward_r2": 0.8640634588769904,
"eval/reward_explained_variance": 0.8640658966140121,
"eval/reward_pearson_r": 0.9299749404804377,
"eval/value_r2": 0.9040185561929274,
"eval/value_explained_variance": 0.904381994157503,
"eval/value_pearson_r": 0.9510478076222231,
"eval/bc_action_mse": 0.11875594078199576,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.734375,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
},
"history": [
{
"step": 77500,
"steps_per_second": 2.223805761615172,
"throughput/samples_per_s": 569.294274973484,
"lr": 0.00010590485180728137,
"grad_norm": 2.959945218408108,
"dataloader_wait_frac": 0.014640432691202972,
"gpu_util": 10.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.8115915060043335,
"train/latent_dynamics": 0.03509516268968582,
"train/reward": 0.09630102664232254,
"train/value": 0.11673177033662796,
"train/action": 1.563463568687439,
"test/loss": 0.3625366985797882,
"test/latent_dynamics": 0.03166506066918373,
"test/reward": 0.09030120074748993,
"test/value": 0.04829816520214081,
"test/action": 0.19227223098278046,
"test/dataloader_wait_frac": 0.09258119643627996,
"train/unweighted/latent_dynamics": 0.03509516268968582,
"train/unweighted/reward": 0.09630102664232254,
"train/unweighted/value": 0.11673177033662796,
"train/unweighted/action": 0.39086589217185974,
"test/unweighted/latent_dynamics": 0.03166506066918373,
"test/unweighted/reward": 0.09030120074748993,
"test/unweighted/value": 0.04829816520214081,
"test/unweighted/action": 0.048068057745695114,
"eval/latent_rollout_error/h1": 0.01902947691269219,
"eval/latent_rollout_error/h2": 0.02590755606070161,
"eval/latent_rollout_error/h3": 0.03208049386739731,
"eval/latent_rollout_error/h4": 0.03829987347126007,
"eval/latent_rollout_error/h5": 0.04329092847183347,
"eval/latent_rollout_error_mean": 0.03172166575677693,
"eval/latent_variance/encoder": 0.4032224379479885,
"eval/latent_variance/predicted": 0.3734528236091137,
"eval/reward_r2": 0.8657696363367613,
"eval/reward_explained_variance": 0.8659159601879088,
"eval/reward_pearson_r": 0.9307447939651985,
"eval/value_r2": 0.952680986841906,
"eval/value_explained_variance": 0.9537749228122561,
"eval/value_pearson_r": 0.9769653645368003,
"eval/bc_action_mse": 0.11979678725108049,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.7265625,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 0
},
{
"step": 80000,
"steps_per_second": 2.1858953369386933,
"throughput/samples_per_s": 559.5892062563055,
"lr": 0.00010380676394561306,
"grad_norm": 3.2097072541236877,
"dataloader_wait_frac": 0.014587272505527778,
"gpu_util": 2.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.997807264328003,
"train/latent_dynamics": 0.03491310775279999,
"train/reward": 0.09499596059322357,
"train/value": 0.11520768702030182,
"train/action": 1.752692699432373,
"test/loss": 0.3552946448326111,
"test/latent_dynamics": 0.02962455525994301,
"test/reward": 0.0906500443816185,
"test/value": 0.04775635525584221,
"test/action": 0.18726356327533722,
"test/dataloader_wait_frac": 0.0860506894259314,
"train/unweighted/latent_dynamics": 0.03491310775279999,
"train/unweighted/reward": 0.09499596059322357,
"train/unweighted/value": 0.11520768702030182,
"train/unweighted/action": 0.43817317485809326,
"test/unweighted/latent_dynamics": 0.02962455525994301,
"test/unweighted/reward": 0.0906500443816185,
"test/unweighted/value": 0.04775635525584221,
"test/unweighted/action": 0.046815890818834305,
"eval/latent_rollout_error/h1": 0.01721197832375765,
"eval/latent_rollout_error/h2": 0.02369445562362671,
"eval/latent_rollout_error/h3": 0.029701126739382744,
"eval/latent_rollout_error/h4": 0.03565819235518575,
"eval/latent_rollout_error/h5": 0.040975292678922415,
"eval/latent_rollout_error_mean": 0.029448209144175053,
"eval/latent_variance/encoder": 0.3933471292257309,
"eval/latent_variance/predicted": 0.36553169414401054,
"eval/reward_r2": 0.8562007289002663,
"eval/reward_explained_variance": 0.8562415056168066,
"eval/reward_pearson_r": 0.9254635251792452,
"eval/value_r2": 0.9272054893510393,
"eval/value_explained_variance": 0.9277184746148723,
"eval/value_pearson_r": 0.9664026867583859,
"eval/bc_action_mse": 0.12010589994723948,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.67578125,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 0
},
{
"step": 82500,
"steps_per_second": 2.2369057112938946,
"throughput/samples_per_s": 572.647862091237,
"lr": 0.00010215354996034876,
"grad_norm": 2.6193276660084726,
"dataloader_wait_frac": 0.014656386422210654,
"gpu_util": 100.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 2.909078598022461,
"train/latent_dynamics": 0.035124197602272034,
"train/reward": 0.09476357698440552,
"train/value": 0.11448501795530319,
"train/action": 2.664710283279419,
"test/loss": 0.35246652364730835,
"test/latent_dynamics": 0.028428947553038597,
"test/reward": 0.09076973795890808,
"test/value": 0.050183434039354324,
"test/action": 0.18308432400226593,
"test/dataloader_wait_frac": 0.07403307832759255,
"train/unweighted/latent_dynamics": 0.035124197602272034,
"train/unweighted/reward": 0.09476357698440552,
"train/unweighted/value": 0.11448501795530319,
"train/unweighted/action": 0.6661775708198547,
"test/unweighted/latent_dynamics": 0.028428947553038597,
"test/unweighted/reward": 0.09076973795890808,
"test/unweighted/value": 0.050183434039354324,
"test/unweighted/action": 0.04577108100056648,
"eval/latent_rollout_error/h1": 0.01649195305071771,
"eval/latent_rollout_error/h2": 0.02295673405751586,
"eval/latent_rollout_error/h3": 0.029069016920402646,
"eval/latent_rollout_error/h4": 0.034896362805739045,
"eval/latent_rollout_error/h5": 0.03929050685837865,
"eval/latent_rollout_error_mean": 0.028540914738550784,
"eval/latent_variance/encoder": 0.3801327235996723,
"eval/latent_variance/predicted": 0.3579341322183609,
"eval/reward_r2": 0.8451192732026092,
"eval/reward_explained_variance": 0.845189836195351,
"eval/reward_pearson_r": 0.9197788819037257,
"eval/value_r2": 0.9305456669299486,
"eval/value_explained_variance": 0.9381005530969181,
"eval/value_pearson_r": 0.970501224975795,
"eval/bc_action_mse": 0.11969463255469778,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.72265625,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 0
},
{
"step": 85000,
"steps_per_second": 2.191051559261465,
"throughput/samples_per_s": 560.909199170935,
"lr": 0.00010096110781887546,
"grad_norm": 2.664278527867794,
"dataloader_wait_frac": 0.01972621496386623,
"gpu_util": 12.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.2923389673233032,
"train/latent_dynamics": 0.03426206484436989,
"train/reward": 0.09400884062051773,
"train/value": 0.11071474850177765,
"train/action": 1.0533535480499268,
"test/loss": 0.3499971330165863,
"test/latent_dynamics": 0.029449978843331337,
"test/reward": 0.09152733534574509,
"test/value": 0.04927626624703407,
"test/action": 0.17974364757537842,
"test/dataloader_wait_frac": 0.06768066026471253,
"train/unweighted/latent_dynamics": 0.03426206484436989,
"train/unweighted/reward": 0.09400884062051773,
"train/unweighted/value": 0.11071474850177765,
"train/unweighted/action": 0.2633383870124817,
"test/unweighted/latent_dynamics": 0.029449978843331337,
"test/unweighted/reward": 0.09152733534574509,
"test/unweighted/value": 0.04927626624703407,
"test/unweighted/action": 0.044935911893844604,
"eval/latent_rollout_error/h1": 0.017256082966923714,
"eval/latent_rollout_error/h2": 0.02419969066977501,
"eval/latent_rollout_error/h3": 0.029760430799797177,
"eval/latent_rollout_error/h4": 0.03685018629767001,
"eval/latent_rollout_error/h5": 0.041485327295958996,
"eval/latent_rollout_error_mean": 0.02991034360602498,
"eval/latent_variance/encoder": 0.3935634419322014,
"eval/latent_variance/predicted": 0.3752981536090374,
"eval/reward_r2": 0.8555056676006516,
"eval/reward_explained_variance": 0.8578352471332622,
"eval/reward_pearson_r": 0.9264707654358145,
"eval/value_r2": 0.9153592203993111,
"eval/value_explained_variance": 0.9153896076849279,
"eval/value_pearson_r": 0.9645543510214282,
"eval/bc_action_mse": 0.11925048275634284,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.66015625,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
},
{
"step": 87500,
"steps_per_second": 2.2855638775837877,
"throughput/samples_per_s": 585.1043526614496,
"lr": 0.00010024095536209643,
"grad_norm": 3.9284848890066146,
"dataloader_wait_frac": 0.014968870037864667,
"gpu_util": 0.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.6484307050704956,
"train/latent_dynamics": 0.03258352354168892,
"train/reward": 0.09275206923484802,
"train/value": 0.13881859183311462,
"train/action": 1.3842756748199463,
"test/loss": 0.351699560880661,
"test/latent_dynamics": 0.02748098410665989,
"test/reward": 0.08842066675424576,
"test/value": 0.04794136807322502,
"test/action": 0.187856525182724,
"test/dataloader_wait_frac": 0.061164046657752824,
"train/unweighted/latent_dynamics": 0.03258352354168892,
"train/unweighted/reward": 0.09275206923484802,
"train/unweighted/value": 0.13881859183311462,
"train/unweighted/action": 0.3460689187049866,
"test/unweighted/latent_dynamics": 0.02748098410665989,
"test/unweighted/reward": 0.08842066675424576,
"test/unweighted/value": 0.04794136807322502,
"test/unweighted/action": 0.046964131295681,
"eval/latent_rollout_error/h1": 0.015983542893081903,
"eval/latent_rollout_error/h2": 0.02256822888739407,
"eval/latent_rollout_error/h3": 0.02805278543382883,
"eval/latent_rollout_error/h4": 0.03399595757946372,
"eval/latent_rollout_error/h5": 0.0383128160610795,
"eval/latent_rollout_error_mean": 0.027782666170969604,
"eval/latent_variance/encoder": 0.37536946311593056,
"eval/latent_variance/predicted": 0.3522566817700863,
"eval/reward_r2": 0.8542284460554775,
"eval/reward_explained_variance": 0.8542324616235485,
"eval/reward_pearson_r": 0.9244794870134933,
"eval/value_r2": 0.9435963573705607,
"eval/value_explained_variance": 0.9441889662994097,
"eval/value_pearson_r": 0.9723895464029698,
"eval/bc_action_mse": 0.11862212250780478,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.7578125,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
},
{
"step": 90000,
"steps_per_second": 2.264137356582644,
"throughput/samples_per_s": 579.6191632851569,
"lr": 9.999999747378752e-05,
"grad_norm": 2.907674429702759,
"dataloader_wait_frac": 0.014950468752680034,
"gpu_util": 97.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.6041066646575928,
"train/latent_dynamics": 0.034288667142391205,
"train/reward": 0.091888926923275,
"train/value": 0.1268676519393921,
"train/action": 1.3510606288909912,
"test/loss": 0.36793431639671326,
"test/latent_dynamics": 0.027841078117489815,
"test/reward": 0.08893612772226334,
"test/value": 0.05607955902814865,
"test/action": 0.19507770240306854,
"test/dataloader_wait_frac": 0.07222307166565173,
"train/unweighted/latent_dynamics": 0.034288667142391205,
"train/unweighted/reward": 0.091888926923275,
"train/unweighted/value": 0.1268676519393921,
"train/unweighted/action": 0.3377651572227478,
"test/unweighted/latent_dynamics": 0.027841078117489815,
"test/unweighted/reward": 0.08893612772226334,
"test/unweighted/value": 0.05607955902814865,
"test/unweighted/action": 0.048769425600767136,
"eval/latent_rollout_error/h1": 0.016440856154076755,
"eval/latent_rollout_error/h2": 0.02284725825302303,
"eval/latent_rollout_error/h3": 0.028287908528000116,
"eval/latent_rollout_error/h4": 0.03440041467547417,
"eval/latent_rollout_error/h5": 0.03848161967471242,
"eval/latent_rollout_error_mean": 0.028091611457057297,
"eval/latent_variance/encoder": 0.36949001252651215,
"eval/latent_variance/predicted": 0.3481830880045891,
"eval/reward_r2": 0.8640634588769904,
"eval/reward_explained_variance": 0.8640658966140121,
"eval/reward_pearson_r": 0.9299749404804377,
"eval/value_r2": 0.9040185561929274,
"eval/value_explained_variance": 0.904381994157503,
"eval/value_pearson_r": 0.9510478076222231,
"eval/bc_action_mse": 0.11875594078199576,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.734375,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
}
]
} |