domrachev03's picture
Trained SimDist world model: 24.8M steps, 90k updates, latent_dynamics 0.0278
1c5b1f4 verified
Raw
History Blame Contribute Delete
15.2 kB
{
"final_step": 90000,
"final": {
"steps_per_second": 2.264137356582644,
"throughput/samples_per_s": 579.6191632851569,
"lr": 9.999999747378752e-05,
"grad_norm": 2.907674429702759,
"dataloader_wait_frac": 0.014950468752680034,
"gpu_util": 97.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.6041066646575928,
"train/latent_dynamics": 0.034288667142391205,
"train/reward": 0.091888926923275,
"train/value": 0.1268676519393921,
"train/action": 1.3510606288909912,
"test/loss": 0.36793431639671326,
"test/latent_dynamics": 0.027841078117489815,
"test/reward": 0.08893612772226334,
"test/value": 0.05607955902814865,
"test/action": 0.19507770240306854,
"test/dataloader_wait_frac": 0.07222307166565173,
"train/unweighted/latent_dynamics": 0.034288667142391205,
"train/unweighted/reward": 0.091888926923275,
"train/unweighted/value": 0.1268676519393921,
"train/unweighted/action": 0.3377651572227478,
"test/unweighted/latent_dynamics": 0.027841078117489815,
"test/unweighted/reward": 0.08893612772226334,
"test/unweighted/value": 0.05607955902814865,
"test/unweighted/action": 0.048769425600767136,
"eval/latent_rollout_error/h1": 0.016440856154076755,
"eval/latent_rollout_error/h2": 0.02284725825302303,
"eval/latent_rollout_error/h3": 0.028287908528000116,
"eval/latent_rollout_error/h4": 0.03440041467547417,
"eval/latent_rollout_error/h5": 0.03848161967471242,
"eval/latent_rollout_error_mean": 0.028091611457057297,
"eval/latent_variance/encoder": 0.36949001252651215,
"eval/latent_variance/predicted": 0.3481830880045891,
"eval/reward_r2": 0.8640634588769904,
"eval/reward_explained_variance": 0.8640658966140121,
"eval/reward_pearson_r": 0.9299749404804377,
"eval/value_r2": 0.9040185561929274,
"eval/value_explained_variance": 0.904381994157503,
"eval/value_pearson_r": 0.9510478076222231,
"eval/bc_action_mse": 0.11875594078199576,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.734375,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
},
"history": [
{
"step": 77500,
"steps_per_second": 2.223805761615172,
"throughput/samples_per_s": 569.294274973484,
"lr": 0.00010590485180728137,
"grad_norm": 2.959945218408108,
"dataloader_wait_frac": 0.014640432691202972,
"gpu_util": 10.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.8115915060043335,
"train/latent_dynamics": 0.03509516268968582,
"train/reward": 0.09630102664232254,
"train/value": 0.11673177033662796,
"train/action": 1.563463568687439,
"test/loss": 0.3625366985797882,
"test/latent_dynamics": 0.03166506066918373,
"test/reward": 0.09030120074748993,
"test/value": 0.04829816520214081,
"test/action": 0.19227223098278046,
"test/dataloader_wait_frac": 0.09258119643627996,
"train/unweighted/latent_dynamics": 0.03509516268968582,
"train/unweighted/reward": 0.09630102664232254,
"train/unweighted/value": 0.11673177033662796,
"train/unweighted/action": 0.39086589217185974,
"test/unweighted/latent_dynamics": 0.03166506066918373,
"test/unweighted/reward": 0.09030120074748993,
"test/unweighted/value": 0.04829816520214081,
"test/unweighted/action": 0.048068057745695114,
"eval/latent_rollout_error/h1": 0.01902947691269219,
"eval/latent_rollout_error/h2": 0.02590755606070161,
"eval/latent_rollout_error/h3": 0.03208049386739731,
"eval/latent_rollout_error/h4": 0.03829987347126007,
"eval/latent_rollout_error/h5": 0.04329092847183347,
"eval/latent_rollout_error_mean": 0.03172166575677693,
"eval/latent_variance/encoder": 0.4032224379479885,
"eval/latent_variance/predicted": 0.3734528236091137,
"eval/reward_r2": 0.8657696363367613,
"eval/reward_explained_variance": 0.8659159601879088,
"eval/reward_pearson_r": 0.9307447939651985,
"eval/value_r2": 0.952680986841906,
"eval/value_explained_variance": 0.9537749228122561,
"eval/value_pearson_r": 0.9769653645368003,
"eval/bc_action_mse": 0.11979678725108049,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.7265625,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 0
},
{
"step": 80000,
"steps_per_second": 2.1858953369386933,
"throughput/samples_per_s": 559.5892062563055,
"lr": 0.00010380676394561306,
"grad_norm": 3.2097072541236877,
"dataloader_wait_frac": 0.014587272505527778,
"gpu_util": 2.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.997807264328003,
"train/latent_dynamics": 0.03491310775279999,
"train/reward": 0.09499596059322357,
"train/value": 0.11520768702030182,
"train/action": 1.752692699432373,
"test/loss": 0.3552946448326111,
"test/latent_dynamics": 0.02962455525994301,
"test/reward": 0.0906500443816185,
"test/value": 0.04775635525584221,
"test/action": 0.18726356327533722,
"test/dataloader_wait_frac": 0.0860506894259314,
"train/unweighted/latent_dynamics": 0.03491310775279999,
"train/unweighted/reward": 0.09499596059322357,
"train/unweighted/value": 0.11520768702030182,
"train/unweighted/action": 0.43817317485809326,
"test/unweighted/latent_dynamics": 0.02962455525994301,
"test/unweighted/reward": 0.0906500443816185,
"test/unweighted/value": 0.04775635525584221,
"test/unweighted/action": 0.046815890818834305,
"eval/latent_rollout_error/h1": 0.01721197832375765,
"eval/latent_rollout_error/h2": 0.02369445562362671,
"eval/latent_rollout_error/h3": 0.029701126739382744,
"eval/latent_rollout_error/h4": 0.03565819235518575,
"eval/latent_rollout_error/h5": 0.040975292678922415,
"eval/latent_rollout_error_mean": 0.029448209144175053,
"eval/latent_variance/encoder": 0.3933471292257309,
"eval/latent_variance/predicted": 0.36553169414401054,
"eval/reward_r2": 0.8562007289002663,
"eval/reward_explained_variance": 0.8562415056168066,
"eval/reward_pearson_r": 0.9254635251792452,
"eval/value_r2": 0.9272054893510393,
"eval/value_explained_variance": 0.9277184746148723,
"eval/value_pearson_r": 0.9664026867583859,
"eval/bc_action_mse": 0.12010589994723948,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.67578125,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 0
},
{
"step": 82500,
"steps_per_second": 2.2369057112938946,
"throughput/samples_per_s": 572.647862091237,
"lr": 0.00010215354996034876,
"grad_norm": 2.6193276660084726,
"dataloader_wait_frac": 0.014656386422210654,
"gpu_util": 100.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 2.909078598022461,
"train/latent_dynamics": 0.035124197602272034,
"train/reward": 0.09476357698440552,
"train/value": 0.11448501795530319,
"train/action": 2.664710283279419,
"test/loss": 0.35246652364730835,
"test/latent_dynamics": 0.028428947553038597,
"test/reward": 0.09076973795890808,
"test/value": 0.050183434039354324,
"test/action": 0.18308432400226593,
"test/dataloader_wait_frac": 0.07403307832759255,
"train/unweighted/latent_dynamics": 0.035124197602272034,
"train/unweighted/reward": 0.09476357698440552,
"train/unweighted/value": 0.11448501795530319,
"train/unweighted/action": 0.6661775708198547,
"test/unweighted/latent_dynamics": 0.028428947553038597,
"test/unweighted/reward": 0.09076973795890808,
"test/unweighted/value": 0.050183434039354324,
"test/unweighted/action": 0.04577108100056648,
"eval/latent_rollout_error/h1": 0.01649195305071771,
"eval/latent_rollout_error/h2": 0.02295673405751586,
"eval/latent_rollout_error/h3": 0.029069016920402646,
"eval/latent_rollout_error/h4": 0.034896362805739045,
"eval/latent_rollout_error/h5": 0.03929050685837865,
"eval/latent_rollout_error_mean": 0.028540914738550784,
"eval/latent_variance/encoder": 0.3801327235996723,
"eval/latent_variance/predicted": 0.3579341322183609,
"eval/reward_r2": 0.8451192732026092,
"eval/reward_explained_variance": 0.845189836195351,
"eval/reward_pearson_r": 0.9197788819037257,
"eval/value_r2": 0.9305456669299486,
"eval/value_explained_variance": 0.9381005530969181,
"eval/value_pearson_r": 0.970501224975795,
"eval/bc_action_mse": 0.11969463255469778,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.72265625,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 0
},
{
"step": 85000,
"steps_per_second": 2.191051559261465,
"throughput/samples_per_s": 560.909199170935,
"lr": 0.00010096110781887546,
"grad_norm": 2.664278527867794,
"dataloader_wait_frac": 0.01972621496386623,
"gpu_util": 12.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.2923389673233032,
"train/latent_dynamics": 0.03426206484436989,
"train/reward": 0.09400884062051773,
"train/value": 0.11071474850177765,
"train/action": 1.0533535480499268,
"test/loss": 0.3499971330165863,
"test/latent_dynamics": 0.029449978843331337,
"test/reward": 0.09152733534574509,
"test/value": 0.04927626624703407,
"test/action": 0.17974364757537842,
"test/dataloader_wait_frac": 0.06768066026471253,
"train/unweighted/latent_dynamics": 0.03426206484436989,
"train/unweighted/reward": 0.09400884062051773,
"train/unweighted/value": 0.11071474850177765,
"train/unweighted/action": 0.2633383870124817,
"test/unweighted/latent_dynamics": 0.029449978843331337,
"test/unweighted/reward": 0.09152733534574509,
"test/unweighted/value": 0.04927626624703407,
"test/unweighted/action": 0.044935911893844604,
"eval/latent_rollout_error/h1": 0.017256082966923714,
"eval/latent_rollout_error/h2": 0.02419969066977501,
"eval/latent_rollout_error/h3": 0.029760430799797177,
"eval/latent_rollout_error/h4": 0.03685018629767001,
"eval/latent_rollout_error/h5": 0.041485327295958996,
"eval/latent_rollout_error_mean": 0.02991034360602498,
"eval/latent_variance/encoder": 0.3935634419322014,
"eval/latent_variance/predicted": 0.3752981536090374,
"eval/reward_r2": 0.8555056676006516,
"eval/reward_explained_variance": 0.8578352471332622,
"eval/reward_pearson_r": 0.9264707654358145,
"eval/value_r2": 0.9153592203993111,
"eval/value_explained_variance": 0.9153896076849279,
"eval/value_pearson_r": 0.9645543510214282,
"eval/bc_action_mse": 0.11925048275634284,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.66015625,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
},
{
"step": 87500,
"steps_per_second": 2.2855638775837877,
"throughput/samples_per_s": 585.1043526614496,
"lr": 0.00010024095536209643,
"grad_norm": 3.9284848890066146,
"dataloader_wait_frac": 0.014968870037864667,
"gpu_util": 0.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.6484307050704956,
"train/latent_dynamics": 0.03258352354168892,
"train/reward": 0.09275206923484802,
"train/value": 0.13881859183311462,
"train/action": 1.3842756748199463,
"test/loss": 0.351699560880661,
"test/latent_dynamics": 0.02748098410665989,
"test/reward": 0.08842066675424576,
"test/value": 0.04794136807322502,
"test/action": 0.187856525182724,
"test/dataloader_wait_frac": 0.061164046657752824,
"train/unweighted/latent_dynamics": 0.03258352354168892,
"train/unweighted/reward": 0.09275206923484802,
"train/unweighted/value": 0.13881859183311462,
"train/unweighted/action": 0.3460689187049866,
"test/unweighted/latent_dynamics": 0.02748098410665989,
"test/unweighted/reward": 0.08842066675424576,
"test/unweighted/value": 0.04794136807322502,
"test/unweighted/action": 0.046964131295681,
"eval/latent_rollout_error/h1": 0.015983542893081903,
"eval/latent_rollout_error/h2": 0.02256822888739407,
"eval/latent_rollout_error/h3": 0.02805278543382883,
"eval/latent_rollout_error/h4": 0.03399595757946372,
"eval/latent_rollout_error/h5": 0.0383128160610795,
"eval/latent_rollout_error_mean": 0.027782666170969604,
"eval/latent_variance/encoder": 0.37536946311593056,
"eval/latent_variance/predicted": 0.3522566817700863,
"eval/reward_r2": 0.8542284460554775,
"eval/reward_explained_variance": 0.8542324616235485,
"eval/reward_pearson_r": 0.9244794870134933,
"eval/value_r2": 0.9435963573705607,
"eval/value_explained_variance": 0.9441889662994097,
"eval/value_pearson_r": 0.9723895464029698,
"eval/bc_action_mse": 0.11862212250780478,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.7578125,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
},
{
"step": 90000,
"steps_per_second": 2.264137356582644,
"throughput/samples_per_s": 579.6191632851569,
"lr": 9.999999747378752e-05,
"grad_norm": 2.907674429702759,
"dataloader_wait_frac": 0.014950468752680034,
"gpu_util": 97.0,
"gpu_mem_used_frac": 0.7556966295580704,
"train/loss": 1.6041066646575928,
"train/latent_dynamics": 0.034288667142391205,
"train/reward": 0.091888926923275,
"train/value": 0.1268676519393921,
"train/action": 1.3510606288909912,
"test/loss": 0.36793431639671326,
"test/latent_dynamics": 0.027841078117489815,
"test/reward": 0.08893612772226334,
"test/value": 0.05607955902814865,
"test/action": 0.19507770240306854,
"test/dataloader_wait_frac": 0.07222307166565173,
"train/unweighted/latent_dynamics": 0.034288667142391205,
"train/unweighted/reward": 0.091888926923275,
"train/unweighted/value": 0.1268676519393921,
"train/unweighted/action": 0.3377651572227478,
"test/unweighted/latent_dynamics": 0.027841078117489815,
"test/unweighted/reward": 0.08893612772226334,
"test/unweighted/value": 0.05607955902814865,
"test/unweighted/action": 0.048769425600767136,
"eval/latent_rollout_error/h1": 0.016440856154076755,
"eval/latent_rollout_error/h2": 0.02284725825302303,
"eval/latent_rollout_error/h3": 0.028287908528000116,
"eval/latent_rollout_error/h4": 0.03440041467547417,
"eval/latent_rollout_error/h5": 0.03848161967471242,
"eval/latent_rollout_error_mean": 0.028091611457057297,
"eval/latent_variance/encoder": 0.36949001252651215,
"eval/latent_variance/predicted": 0.3481830880045891,
"eval/reward_r2": 0.8640634588769904,
"eval/reward_explained_variance": 0.8640658966140121,
"eval/reward_pearson_r": 0.9299749404804377,
"eval/value_r2": 0.9040185561929274,
"eval/value_explained_variance": 0.904381994157503,
"eval/value_pearson_r": 0.9510478076222231,
"eval/bc_action_mse": 0.11875594078199576,
"eval/num_batches": 8.0,
"eval/value_auc_success": 0.734375,
"eval/value_auc_num_episodes": 32.0,
"eval/value_auc_success_fraction": 0.5,
"eval/value_auc_holdout_episodewise": 0.0,
"epoch": 1
}
]
}