| { |
| "final_step": 90000, |
| "final": { |
| "steps_per_second": 2.264137356582644, |
| "throughput/samples_per_s": 579.6191632851569, |
| "lr": 9.999999747378752e-05, |
| "grad_norm": 2.907674429702759, |
| "dataloader_wait_frac": 0.014950468752680034, |
| "gpu_util": 97.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 1.6041066646575928, |
| "train/latent_dynamics": 0.034288667142391205, |
| "train/reward": 0.091888926923275, |
| "train/value": 0.1268676519393921, |
| "train/action": 1.3510606288909912, |
| "test/loss": 0.36793431639671326, |
| "test/latent_dynamics": 0.027841078117489815, |
| "test/reward": 0.08893612772226334, |
| "test/value": 0.05607955902814865, |
| "test/action": 0.19507770240306854, |
| "test/dataloader_wait_frac": 0.07222307166565173, |
| "train/unweighted/latent_dynamics": 0.034288667142391205, |
| "train/unweighted/reward": 0.091888926923275, |
| "train/unweighted/value": 0.1268676519393921, |
| "train/unweighted/action": 0.3377651572227478, |
| "test/unweighted/latent_dynamics": 0.027841078117489815, |
| "test/unweighted/reward": 0.08893612772226334, |
| "test/unweighted/value": 0.05607955902814865, |
| "test/unweighted/action": 0.048769425600767136, |
| "eval/latent_rollout_error/h1": 0.016440856154076755, |
| "eval/latent_rollout_error/h2": 0.02284725825302303, |
| "eval/latent_rollout_error/h3": 0.028287908528000116, |
| "eval/latent_rollout_error/h4": 0.03440041467547417, |
| "eval/latent_rollout_error/h5": 0.03848161967471242, |
| "eval/latent_rollout_error_mean": 0.028091611457057297, |
| "eval/latent_variance/encoder": 0.36949001252651215, |
| "eval/latent_variance/predicted": 0.3481830880045891, |
| "eval/reward_r2": 0.8640634588769904, |
| "eval/reward_explained_variance": 0.8640658966140121, |
| "eval/reward_pearson_r": 0.9299749404804377, |
| "eval/value_r2": 0.9040185561929274, |
| "eval/value_explained_variance": 0.904381994157503, |
| "eval/value_pearson_r": 0.9510478076222231, |
| "eval/bc_action_mse": 0.11875594078199576, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.734375, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 1 |
| }, |
| "history": [ |
| { |
| "step": 77500, |
| "steps_per_second": 2.223805761615172, |
| "throughput/samples_per_s": 569.294274973484, |
| "lr": 0.00010590485180728137, |
| "grad_norm": 2.959945218408108, |
| "dataloader_wait_frac": 0.014640432691202972, |
| "gpu_util": 10.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 1.8115915060043335, |
| "train/latent_dynamics": 0.03509516268968582, |
| "train/reward": 0.09630102664232254, |
| "train/value": 0.11673177033662796, |
| "train/action": 1.563463568687439, |
| "test/loss": 0.3625366985797882, |
| "test/latent_dynamics": 0.03166506066918373, |
| "test/reward": 0.09030120074748993, |
| "test/value": 0.04829816520214081, |
| "test/action": 0.19227223098278046, |
| "test/dataloader_wait_frac": 0.09258119643627996, |
| "train/unweighted/latent_dynamics": 0.03509516268968582, |
| "train/unweighted/reward": 0.09630102664232254, |
| "train/unweighted/value": 0.11673177033662796, |
| "train/unweighted/action": 0.39086589217185974, |
| "test/unweighted/latent_dynamics": 0.03166506066918373, |
| "test/unweighted/reward": 0.09030120074748993, |
| "test/unweighted/value": 0.04829816520214081, |
| "test/unweighted/action": 0.048068057745695114, |
| "eval/latent_rollout_error/h1": 0.01902947691269219, |
| "eval/latent_rollout_error/h2": 0.02590755606070161, |
| "eval/latent_rollout_error/h3": 0.03208049386739731, |
| "eval/latent_rollout_error/h4": 0.03829987347126007, |
| "eval/latent_rollout_error/h5": 0.04329092847183347, |
| "eval/latent_rollout_error_mean": 0.03172166575677693, |
| "eval/latent_variance/encoder": 0.4032224379479885, |
| "eval/latent_variance/predicted": 0.3734528236091137, |
| "eval/reward_r2": 0.8657696363367613, |
| "eval/reward_explained_variance": 0.8659159601879088, |
| "eval/reward_pearson_r": 0.9307447939651985, |
| "eval/value_r2": 0.952680986841906, |
| "eval/value_explained_variance": 0.9537749228122561, |
| "eval/value_pearson_r": 0.9769653645368003, |
| "eval/bc_action_mse": 0.11979678725108049, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.7265625, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 0 |
| }, |
| { |
| "step": 80000, |
| "steps_per_second": 2.1858953369386933, |
| "throughput/samples_per_s": 559.5892062563055, |
| "lr": 0.00010380676394561306, |
| "grad_norm": 3.2097072541236877, |
| "dataloader_wait_frac": 0.014587272505527778, |
| "gpu_util": 2.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 1.997807264328003, |
| "train/latent_dynamics": 0.03491310775279999, |
| "train/reward": 0.09499596059322357, |
| "train/value": 0.11520768702030182, |
| "train/action": 1.752692699432373, |
| "test/loss": 0.3552946448326111, |
| "test/latent_dynamics": 0.02962455525994301, |
| "test/reward": 0.0906500443816185, |
| "test/value": 0.04775635525584221, |
| "test/action": 0.18726356327533722, |
| "test/dataloader_wait_frac": 0.0860506894259314, |
| "train/unweighted/latent_dynamics": 0.03491310775279999, |
| "train/unweighted/reward": 0.09499596059322357, |
| "train/unweighted/value": 0.11520768702030182, |
| "train/unweighted/action": 0.43817317485809326, |
| "test/unweighted/latent_dynamics": 0.02962455525994301, |
| "test/unweighted/reward": 0.0906500443816185, |
| "test/unweighted/value": 0.04775635525584221, |
| "test/unweighted/action": 0.046815890818834305, |
| "eval/latent_rollout_error/h1": 0.01721197832375765, |
| "eval/latent_rollout_error/h2": 0.02369445562362671, |
| "eval/latent_rollout_error/h3": 0.029701126739382744, |
| "eval/latent_rollout_error/h4": 0.03565819235518575, |
| "eval/latent_rollout_error/h5": 0.040975292678922415, |
| "eval/latent_rollout_error_mean": 0.029448209144175053, |
| "eval/latent_variance/encoder": 0.3933471292257309, |
| "eval/latent_variance/predicted": 0.36553169414401054, |
| "eval/reward_r2": 0.8562007289002663, |
| "eval/reward_explained_variance": 0.8562415056168066, |
| "eval/reward_pearson_r": 0.9254635251792452, |
| "eval/value_r2": 0.9272054893510393, |
| "eval/value_explained_variance": 0.9277184746148723, |
| "eval/value_pearson_r": 0.9664026867583859, |
| "eval/bc_action_mse": 0.12010589994723948, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.67578125, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 0 |
| }, |
| { |
| "step": 82500, |
| "steps_per_second": 2.2369057112938946, |
| "throughput/samples_per_s": 572.647862091237, |
| "lr": 0.00010215354996034876, |
| "grad_norm": 2.6193276660084726, |
| "dataloader_wait_frac": 0.014656386422210654, |
| "gpu_util": 100.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 2.909078598022461, |
| "train/latent_dynamics": 0.035124197602272034, |
| "train/reward": 0.09476357698440552, |
| "train/value": 0.11448501795530319, |
| "train/action": 2.664710283279419, |
| "test/loss": 0.35246652364730835, |
| "test/latent_dynamics": 0.028428947553038597, |
| "test/reward": 0.09076973795890808, |
| "test/value": 0.050183434039354324, |
| "test/action": 0.18308432400226593, |
| "test/dataloader_wait_frac": 0.07403307832759255, |
| "train/unweighted/latent_dynamics": 0.035124197602272034, |
| "train/unweighted/reward": 0.09476357698440552, |
| "train/unweighted/value": 0.11448501795530319, |
| "train/unweighted/action": 0.6661775708198547, |
| "test/unweighted/latent_dynamics": 0.028428947553038597, |
| "test/unweighted/reward": 0.09076973795890808, |
| "test/unweighted/value": 0.050183434039354324, |
| "test/unweighted/action": 0.04577108100056648, |
| "eval/latent_rollout_error/h1": 0.01649195305071771, |
| "eval/latent_rollout_error/h2": 0.02295673405751586, |
| "eval/latent_rollout_error/h3": 0.029069016920402646, |
| "eval/latent_rollout_error/h4": 0.034896362805739045, |
| "eval/latent_rollout_error/h5": 0.03929050685837865, |
| "eval/latent_rollout_error_mean": 0.028540914738550784, |
| "eval/latent_variance/encoder": 0.3801327235996723, |
| "eval/latent_variance/predicted": 0.3579341322183609, |
| "eval/reward_r2": 0.8451192732026092, |
| "eval/reward_explained_variance": 0.845189836195351, |
| "eval/reward_pearson_r": 0.9197788819037257, |
| "eval/value_r2": 0.9305456669299486, |
| "eval/value_explained_variance": 0.9381005530969181, |
| "eval/value_pearson_r": 0.970501224975795, |
| "eval/bc_action_mse": 0.11969463255469778, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.72265625, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 0 |
| }, |
| { |
| "step": 85000, |
| "steps_per_second": 2.191051559261465, |
| "throughput/samples_per_s": 560.909199170935, |
| "lr": 0.00010096110781887546, |
| "grad_norm": 2.664278527867794, |
| "dataloader_wait_frac": 0.01972621496386623, |
| "gpu_util": 12.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 1.2923389673233032, |
| "train/latent_dynamics": 0.03426206484436989, |
| "train/reward": 0.09400884062051773, |
| "train/value": 0.11071474850177765, |
| "train/action": 1.0533535480499268, |
| "test/loss": 0.3499971330165863, |
| "test/latent_dynamics": 0.029449978843331337, |
| "test/reward": 0.09152733534574509, |
| "test/value": 0.04927626624703407, |
| "test/action": 0.17974364757537842, |
| "test/dataloader_wait_frac": 0.06768066026471253, |
| "train/unweighted/latent_dynamics": 0.03426206484436989, |
| "train/unweighted/reward": 0.09400884062051773, |
| "train/unweighted/value": 0.11071474850177765, |
| "train/unweighted/action": 0.2633383870124817, |
| "test/unweighted/latent_dynamics": 0.029449978843331337, |
| "test/unweighted/reward": 0.09152733534574509, |
| "test/unweighted/value": 0.04927626624703407, |
| "test/unweighted/action": 0.044935911893844604, |
| "eval/latent_rollout_error/h1": 0.017256082966923714, |
| "eval/latent_rollout_error/h2": 0.02419969066977501, |
| "eval/latent_rollout_error/h3": 0.029760430799797177, |
| "eval/latent_rollout_error/h4": 0.03685018629767001, |
| "eval/latent_rollout_error/h5": 0.041485327295958996, |
| "eval/latent_rollout_error_mean": 0.02991034360602498, |
| "eval/latent_variance/encoder": 0.3935634419322014, |
| "eval/latent_variance/predicted": 0.3752981536090374, |
| "eval/reward_r2": 0.8555056676006516, |
| "eval/reward_explained_variance": 0.8578352471332622, |
| "eval/reward_pearson_r": 0.9264707654358145, |
| "eval/value_r2": 0.9153592203993111, |
| "eval/value_explained_variance": 0.9153896076849279, |
| "eval/value_pearson_r": 0.9645543510214282, |
| "eval/bc_action_mse": 0.11925048275634284, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.66015625, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 1 |
| }, |
| { |
| "step": 87500, |
| "steps_per_second": 2.2855638775837877, |
| "throughput/samples_per_s": 585.1043526614496, |
| "lr": 0.00010024095536209643, |
| "grad_norm": 3.9284848890066146, |
| "dataloader_wait_frac": 0.014968870037864667, |
| "gpu_util": 0.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 1.6484307050704956, |
| "train/latent_dynamics": 0.03258352354168892, |
| "train/reward": 0.09275206923484802, |
| "train/value": 0.13881859183311462, |
| "train/action": 1.3842756748199463, |
| "test/loss": 0.351699560880661, |
| "test/latent_dynamics": 0.02748098410665989, |
| "test/reward": 0.08842066675424576, |
| "test/value": 0.04794136807322502, |
| "test/action": 0.187856525182724, |
| "test/dataloader_wait_frac": 0.061164046657752824, |
| "train/unweighted/latent_dynamics": 0.03258352354168892, |
| "train/unweighted/reward": 0.09275206923484802, |
| "train/unweighted/value": 0.13881859183311462, |
| "train/unweighted/action": 0.3460689187049866, |
| "test/unweighted/latent_dynamics": 0.02748098410665989, |
| "test/unweighted/reward": 0.08842066675424576, |
| "test/unweighted/value": 0.04794136807322502, |
| "test/unweighted/action": 0.046964131295681, |
| "eval/latent_rollout_error/h1": 0.015983542893081903, |
| "eval/latent_rollout_error/h2": 0.02256822888739407, |
| "eval/latent_rollout_error/h3": 0.02805278543382883, |
| "eval/latent_rollout_error/h4": 0.03399595757946372, |
| "eval/latent_rollout_error/h5": 0.0383128160610795, |
| "eval/latent_rollout_error_mean": 0.027782666170969604, |
| "eval/latent_variance/encoder": 0.37536946311593056, |
| "eval/latent_variance/predicted": 0.3522566817700863, |
| "eval/reward_r2": 0.8542284460554775, |
| "eval/reward_explained_variance": 0.8542324616235485, |
| "eval/reward_pearson_r": 0.9244794870134933, |
| "eval/value_r2": 0.9435963573705607, |
| "eval/value_explained_variance": 0.9441889662994097, |
| "eval/value_pearson_r": 0.9723895464029698, |
| "eval/bc_action_mse": 0.11862212250780478, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.7578125, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 1 |
| }, |
| { |
| "step": 90000, |
| "steps_per_second": 2.264137356582644, |
| "throughput/samples_per_s": 579.6191632851569, |
| "lr": 9.999999747378752e-05, |
| "grad_norm": 2.907674429702759, |
| "dataloader_wait_frac": 0.014950468752680034, |
| "gpu_util": 97.0, |
| "gpu_mem_used_frac": 0.7556966295580704, |
| "train/loss": 1.6041066646575928, |
| "train/latent_dynamics": 0.034288667142391205, |
| "train/reward": 0.091888926923275, |
| "train/value": 0.1268676519393921, |
| "train/action": 1.3510606288909912, |
| "test/loss": 0.36793431639671326, |
| "test/latent_dynamics": 0.027841078117489815, |
| "test/reward": 0.08893612772226334, |
| "test/value": 0.05607955902814865, |
| "test/action": 0.19507770240306854, |
| "test/dataloader_wait_frac": 0.07222307166565173, |
| "train/unweighted/latent_dynamics": 0.034288667142391205, |
| "train/unweighted/reward": 0.091888926923275, |
| "train/unweighted/value": 0.1268676519393921, |
| "train/unweighted/action": 0.3377651572227478, |
| "test/unweighted/latent_dynamics": 0.027841078117489815, |
| "test/unweighted/reward": 0.08893612772226334, |
| "test/unweighted/value": 0.05607955902814865, |
| "test/unweighted/action": 0.048769425600767136, |
| "eval/latent_rollout_error/h1": 0.016440856154076755, |
| "eval/latent_rollout_error/h2": 0.02284725825302303, |
| "eval/latent_rollout_error/h3": 0.028287908528000116, |
| "eval/latent_rollout_error/h4": 0.03440041467547417, |
| "eval/latent_rollout_error/h5": 0.03848161967471242, |
| "eval/latent_rollout_error_mean": 0.028091611457057297, |
| "eval/latent_variance/encoder": 0.36949001252651215, |
| "eval/latent_variance/predicted": 0.3481830880045891, |
| "eval/reward_r2": 0.8640634588769904, |
| "eval/reward_explained_variance": 0.8640658966140121, |
| "eval/reward_pearson_r": 0.9299749404804377, |
| "eval/value_r2": 0.9040185561929274, |
| "eval/value_explained_variance": 0.904381994157503, |
| "eval/value_pearson_r": 0.9510478076222231, |
| "eval/bc_action_mse": 0.11875594078199576, |
| "eval/num_batches": 8.0, |
| "eval/value_auc_success": 0.734375, |
| "eval/value_auc_num_episodes": 32.0, |
| "eval/value_auc_success_fraction": 0.5, |
| "eval/value_auc_holdout_episodewise": 0.0, |
| "epoch": 1 |
| } |
| ] |
| } |