{ "final_step": 90000, "final": { "steps_per_second": 2.264137356582644, "throughput/samples_per_s": 579.6191632851569, "lr": 9.999999747378752e-05, "grad_norm": 2.907674429702759, "dataloader_wait_frac": 0.014950468752680034, "gpu_util": 97.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 1.6041066646575928, "train/latent_dynamics": 0.034288667142391205, "train/reward": 0.091888926923275, "train/value": 0.1268676519393921, "train/action": 1.3510606288909912, "test/loss": 0.36793431639671326, "test/latent_dynamics": 0.027841078117489815, "test/reward": 0.08893612772226334, "test/value": 0.05607955902814865, "test/action": 0.19507770240306854, "test/dataloader_wait_frac": 0.07222307166565173, "train/unweighted/latent_dynamics": 0.034288667142391205, "train/unweighted/reward": 0.091888926923275, "train/unweighted/value": 0.1268676519393921, "train/unweighted/action": 0.3377651572227478, "test/unweighted/latent_dynamics": 0.027841078117489815, "test/unweighted/reward": 0.08893612772226334, "test/unweighted/value": 0.05607955902814865, "test/unweighted/action": 0.048769425600767136, "eval/latent_rollout_error/h1": 0.016440856154076755, "eval/latent_rollout_error/h2": 0.02284725825302303, "eval/latent_rollout_error/h3": 0.028287908528000116, "eval/latent_rollout_error/h4": 0.03440041467547417, "eval/latent_rollout_error/h5": 0.03848161967471242, "eval/latent_rollout_error_mean": 0.028091611457057297, "eval/latent_variance/encoder": 0.36949001252651215, "eval/latent_variance/predicted": 0.3481830880045891, "eval/reward_r2": 0.8640634588769904, "eval/reward_explained_variance": 0.8640658966140121, "eval/reward_pearson_r": 0.9299749404804377, "eval/value_r2": 0.9040185561929274, "eval/value_explained_variance": 0.904381994157503, "eval/value_pearson_r": 0.9510478076222231, "eval/bc_action_mse": 0.11875594078199576, "eval/num_batches": 8.0, "eval/value_auc_success": 0.734375, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 1 }, "history": [ { "step": 77500, "steps_per_second": 2.223805761615172, "throughput/samples_per_s": 569.294274973484, "lr": 0.00010590485180728137, "grad_norm": 2.959945218408108, "dataloader_wait_frac": 0.014640432691202972, "gpu_util": 10.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 1.8115915060043335, "train/latent_dynamics": 0.03509516268968582, "train/reward": 0.09630102664232254, "train/value": 0.11673177033662796, "train/action": 1.563463568687439, "test/loss": 0.3625366985797882, "test/latent_dynamics": 0.03166506066918373, "test/reward": 0.09030120074748993, "test/value": 0.04829816520214081, "test/action": 0.19227223098278046, "test/dataloader_wait_frac": 0.09258119643627996, "train/unweighted/latent_dynamics": 0.03509516268968582, "train/unweighted/reward": 0.09630102664232254, "train/unweighted/value": 0.11673177033662796, "train/unweighted/action": 0.39086589217185974, "test/unweighted/latent_dynamics": 0.03166506066918373, "test/unweighted/reward": 0.09030120074748993, "test/unweighted/value": 0.04829816520214081, "test/unweighted/action": 0.048068057745695114, "eval/latent_rollout_error/h1": 0.01902947691269219, "eval/latent_rollout_error/h2": 0.02590755606070161, "eval/latent_rollout_error/h3": 0.03208049386739731, "eval/latent_rollout_error/h4": 0.03829987347126007, "eval/latent_rollout_error/h5": 0.04329092847183347, "eval/latent_rollout_error_mean": 0.03172166575677693, "eval/latent_variance/encoder": 0.4032224379479885, "eval/latent_variance/predicted": 0.3734528236091137, "eval/reward_r2": 0.8657696363367613, "eval/reward_explained_variance": 0.8659159601879088, "eval/reward_pearson_r": 0.9307447939651985, "eval/value_r2": 0.952680986841906, "eval/value_explained_variance": 0.9537749228122561, "eval/value_pearson_r": 0.9769653645368003, "eval/bc_action_mse": 0.11979678725108049, "eval/num_batches": 8.0, "eval/value_auc_success": 0.7265625, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 0 }, { "step": 80000, "steps_per_second": 2.1858953369386933, "throughput/samples_per_s": 559.5892062563055, "lr": 0.00010380676394561306, "grad_norm": 3.2097072541236877, "dataloader_wait_frac": 0.014587272505527778, "gpu_util": 2.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 1.997807264328003, "train/latent_dynamics": 0.03491310775279999, "train/reward": 0.09499596059322357, "train/value": 0.11520768702030182, "train/action": 1.752692699432373, "test/loss": 0.3552946448326111, "test/latent_dynamics": 0.02962455525994301, "test/reward": 0.0906500443816185, "test/value": 0.04775635525584221, "test/action": 0.18726356327533722, "test/dataloader_wait_frac": 0.0860506894259314, "train/unweighted/latent_dynamics": 0.03491310775279999, "train/unweighted/reward": 0.09499596059322357, "train/unweighted/value": 0.11520768702030182, "train/unweighted/action": 0.43817317485809326, "test/unweighted/latent_dynamics": 0.02962455525994301, "test/unweighted/reward": 0.0906500443816185, "test/unweighted/value": 0.04775635525584221, "test/unweighted/action": 0.046815890818834305, "eval/latent_rollout_error/h1": 0.01721197832375765, "eval/latent_rollout_error/h2": 0.02369445562362671, "eval/latent_rollout_error/h3": 0.029701126739382744, "eval/latent_rollout_error/h4": 0.03565819235518575, "eval/latent_rollout_error/h5": 0.040975292678922415, "eval/latent_rollout_error_mean": 0.029448209144175053, "eval/latent_variance/encoder": 0.3933471292257309, "eval/latent_variance/predicted": 0.36553169414401054, "eval/reward_r2": 0.8562007289002663, "eval/reward_explained_variance": 0.8562415056168066, "eval/reward_pearson_r": 0.9254635251792452, "eval/value_r2": 0.9272054893510393, "eval/value_explained_variance": 0.9277184746148723, "eval/value_pearson_r": 0.9664026867583859, "eval/bc_action_mse": 0.12010589994723948, "eval/num_batches": 8.0, "eval/value_auc_success": 0.67578125, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 0 }, { "step": 82500, "steps_per_second": 2.2369057112938946, "throughput/samples_per_s": 572.647862091237, "lr": 0.00010215354996034876, "grad_norm": 2.6193276660084726, "dataloader_wait_frac": 0.014656386422210654, "gpu_util": 100.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 2.909078598022461, "train/latent_dynamics": 0.035124197602272034, "train/reward": 0.09476357698440552, "train/value": 0.11448501795530319, "train/action": 2.664710283279419, "test/loss": 0.35246652364730835, "test/latent_dynamics": 0.028428947553038597, "test/reward": 0.09076973795890808, "test/value": 0.050183434039354324, "test/action": 0.18308432400226593, "test/dataloader_wait_frac": 0.07403307832759255, "train/unweighted/latent_dynamics": 0.035124197602272034, "train/unweighted/reward": 0.09476357698440552, "train/unweighted/value": 0.11448501795530319, "train/unweighted/action": 0.6661775708198547, "test/unweighted/latent_dynamics": 0.028428947553038597, "test/unweighted/reward": 0.09076973795890808, "test/unweighted/value": 0.050183434039354324, "test/unweighted/action": 0.04577108100056648, "eval/latent_rollout_error/h1": 0.01649195305071771, "eval/latent_rollout_error/h2": 0.02295673405751586, "eval/latent_rollout_error/h3": 0.029069016920402646, "eval/latent_rollout_error/h4": 0.034896362805739045, "eval/latent_rollout_error/h5": 0.03929050685837865, "eval/latent_rollout_error_mean": 0.028540914738550784, "eval/latent_variance/encoder": 0.3801327235996723, "eval/latent_variance/predicted": 0.3579341322183609, "eval/reward_r2": 0.8451192732026092, "eval/reward_explained_variance": 0.845189836195351, "eval/reward_pearson_r": 0.9197788819037257, "eval/value_r2": 0.9305456669299486, "eval/value_explained_variance": 0.9381005530969181, "eval/value_pearson_r": 0.970501224975795, "eval/bc_action_mse": 0.11969463255469778, "eval/num_batches": 8.0, "eval/value_auc_success": 0.72265625, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 0 }, { "step": 85000, "steps_per_second": 2.191051559261465, "throughput/samples_per_s": 560.909199170935, "lr": 0.00010096110781887546, "grad_norm": 2.664278527867794, "dataloader_wait_frac": 0.01972621496386623, "gpu_util": 12.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 1.2923389673233032, "train/latent_dynamics": 0.03426206484436989, "train/reward": 0.09400884062051773, "train/value": 0.11071474850177765, "train/action": 1.0533535480499268, "test/loss": 0.3499971330165863, "test/latent_dynamics": 0.029449978843331337, "test/reward": 0.09152733534574509, "test/value": 0.04927626624703407, "test/action": 0.17974364757537842, "test/dataloader_wait_frac": 0.06768066026471253, "train/unweighted/latent_dynamics": 0.03426206484436989, "train/unweighted/reward": 0.09400884062051773, "train/unweighted/value": 0.11071474850177765, "train/unweighted/action": 0.2633383870124817, "test/unweighted/latent_dynamics": 0.029449978843331337, "test/unweighted/reward": 0.09152733534574509, "test/unweighted/value": 0.04927626624703407, "test/unweighted/action": 0.044935911893844604, "eval/latent_rollout_error/h1": 0.017256082966923714, "eval/latent_rollout_error/h2": 0.02419969066977501, "eval/latent_rollout_error/h3": 0.029760430799797177, "eval/latent_rollout_error/h4": 0.03685018629767001, "eval/latent_rollout_error/h5": 0.041485327295958996, "eval/latent_rollout_error_mean": 0.02991034360602498, "eval/latent_variance/encoder": 0.3935634419322014, "eval/latent_variance/predicted": 0.3752981536090374, "eval/reward_r2": 0.8555056676006516, "eval/reward_explained_variance": 0.8578352471332622, "eval/reward_pearson_r": 0.9264707654358145, "eval/value_r2": 0.9153592203993111, "eval/value_explained_variance": 0.9153896076849279, "eval/value_pearson_r": 0.9645543510214282, "eval/bc_action_mse": 0.11925048275634284, "eval/num_batches": 8.0, "eval/value_auc_success": 0.66015625, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 1 }, { "step": 87500, "steps_per_second": 2.2855638775837877, "throughput/samples_per_s": 585.1043526614496, "lr": 0.00010024095536209643, "grad_norm": 3.9284848890066146, "dataloader_wait_frac": 0.014968870037864667, "gpu_util": 0.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 1.6484307050704956, "train/latent_dynamics": 0.03258352354168892, "train/reward": 0.09275206923484802, "train/value": 0.13881859183311462, "train/action": 1.3842756748199463, "test/loss": 0.351699560880661, "test/latent_dynamics": 0.02748098410665989, "test/reward": 0.08842066675424576, "test/value": 0.04794136807322502, "test/action": 0.187856525182724, "test/dataloader_wait_frac": 0.061164046657752824, "train/unweighted/latent_dynamics": 0.03258352354168892, "train/unweighted/reward": 0.09275206923484802, "train/unweighted/value": 0.13881859183311462, "train/unweighted/action": 0.3460689187049866, "test/unweighted/latent_dynamics": 0.02748098410665989, "test/unweighted/reward": 0.08842066675424576, "test/unweighted/value": 0.04794136807322502, "test/unweighted/action": 0.046964131295681, "eval/latent_rollout_error/h1": 0.015983542893081903, "eval/latent_rollout_error/h2": 0.02256822888739407, "eval/latent_rollout_error/h3": 0.02805278543382883, "eval/latent_rollout_error/h4": 0.03399595757946372, "eval/latent_rollout_error/h5": 0.0383128160610795, "eval/latent_rollout_error_mean": 0.027782666170969604, "eval/latent_variance/encoder": 0.37536946311593056, "eval/latent_variance/predicted": 0.3522566817700863, "eval/reward_r2": 0.8542284460554775, "eval/reward_explained_variance": 0.8542324616235485, "eval/reward_pearson_r": 0.9244794870134933, "eval/value_r2": 0.9435963573705607, "eval/value_explained_variance": 0.9441889662994097, "eval/value_pearson_r": 0.9723895464029698, "eval/bc_action_mse": 0.11862212250780478, "eval/num_batches": 8.0, "eval/value_auc_success": 0.7578125, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 1 }, { "step": 90000, "steps_per_second": 2.264137356582644, "throughput/samples_per_s": 579.6191632851569, "lr": 9.999999747378752e-05, "grad_norm": 2.907674429702759, "dataloader_wait_frac": 0.014950468752680034, "gpu_util": 97.0, "gpu_mem_used_frac": 0.7556966295580704, "train/loss": 1.6041066646575928, "train/latent_dynamics": 0.034288667142391205, "train/reward": 0.091888926923275, "train/value": 0.1268676519393921, "train/action": 1.3510606288909912, "test/loss": 0.36793431639671326, "test/latent_dynamics": 0.027841078117489815, "test/reward": 0.08893612772226334, "test/value": 0.05607955902814865, "test/action": 0.19507770240306854, "test/dataloader_wait_frac": 0.07222307166565173, "train/unweighted/latent_dynamics": 0.034288667142391205, "train/unweighted/reward": 0.091888926923275, "train/unweighted/value": 0.1268676519393921, "train/unweighted/action": 0.3377651572227478, "test/unweighted/latent_dynamics": 0.027841078117489815, "test/unweighted/reward": 0.08893612772226334, "test/unweighted/value": 0.05607955902814865, "test/unweighted/action": 0.048769425600767136, "eval/latent_rollout_error/h1": 0.016440856154076755, "eval/latent_rollout_error/h2": 0.02284725825302303, "eval/latent_rollout_error/h3": 0.028287908528000116, "eval/latent_rollout_error/h4": 0.03440041467547417, "eval/latent_rollout_error/h5": 0.03848161967471242, "eval/latent_rollout_error_mean": 0.028091611457057297, "eval/latent_variance/encoder": 0.36949001252651215, "eval/latent_variance/predicted": 0.3481830880045891, "eval/reward_r2": 0.8640634588769904, "eval/reward_explained_variance": 0.8640658966140121, "eval/reward_pearson_r": 0.9299749404804377, "eval/value_r2": 0.9040185561929274, "eval/value_explained_variance": 0.904381994157503, "eval/value_pearson_r": 0.9510478076222231, "eval/bc_action_mse": 0.11875594078199576, "eval/num_batches": 8.0, "eval/value_auc_success": 0.734375, "eval/value_auc_num_episodes": 32.0, "eval/value_auc_success_fraction": 0.5, "eval/value_auc_holdout_episodewise": 0.0, "epoch": 1 } ] }