File size: 15,211 Bytes
1c5b1f4
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
{
 "final_step": 90000,
 "final": {
  "steps_per_second": 2.264137356582644,
  "throughput/samples_per_s": 579.6191632851569,
  "lr": 9.999999747378752e-05,
  "grad_norm": 2.907674429702759,
  "dataloader_wait_frac": 0.014950468752680034,
  "gpu_util": 97.0,
  "gpu_mem_used_frac": 0.7556966295580704,
  "train/loss": 1.6041066646575928,
  "train/latent_dynamics": 0.034288667142391205,
  "train/reward": 0.091888926923275,
  "train/value": 0.1268676519393921,
  "train/action": 1.3510606288909912,
  "test/loss": 0.36793431639671326,
  "test/latent_dynamics": 0.027841078117489815,
  "test/reward": 0.08893612772226334,
  "test/value": 0.05607955902814865,
  "test/action": 0.19507770240306854,
  "test/dataloader_wait_frac": 0.07222307166565173,
  "train/unweighted/latent_dynamics": 0.034288667142391205,
  "train/unweighted/reward": 0.091888926923275,
  "train/unweighted/value": 0.1268676519393921,
  "train/unweighted/action": 0.3377651572227478,
  "test/unweighted/latent_dynamics": 0.027841078117489815,
  "test/unweighted/reward": 0.08893612772226334,
  "test/unweighted/value": 0.05607955902814865,
  "test/unweighted/action": 0.048769425600767136,
  "eval/latent_rollout_error/h1": 0.016440856154076755,
  "eval/latent_rollout_error/h2": 0.02284725825302303,
  "eval/latent_rollout_error/h3": 0.028287908528000116,
  "eval/latent_rollout_error/h4": 0.03440041467547417,
  "eval/latent_rollout_error/h5": 0.03848161967471242,
  "eval/latent_rollout_error_mean": 0.028091611457057297,
  "eval/latent_variance/encoder": 0.36949001252651215,
  "eval/latent_variance/predicted": 0.3481830880045891,
  "eval/reward_r2": 0.8640634588769904,
  "eval/reward_explained_variance": 0.8640658966140121,
  "eval/reward_pearson_r": 0.9299749404804377,
  "eval/value_r2": 0.9040185561929274,
  "eval/value_explained_variance": 0.904381994157503,
  "eval/value_pearson_r": 0.9510478076222231,
  "eval/bc_action_mse": 0.11875594078199576,
  "eval/num_batches": 8.0,
  "eval/value_auc_success": 0.734375,
  "eval/value_auc_num_episodes": 32.0,
  "eval/value_auc_success_fraction": 0.5,
  "eval/value_auc_holdout_episodewise": 0.0,
  "epoch": 1
 },
 "history": [
  {
   "step": 77500,
   "steps_per_second": 2.223805761615172,
   "throughput/samples_per_s": 569.294274973484,
   "lr": 0.00010590485180728137,
   "grad_norm": 2.959945218408108,
   "dataloader_wait_frac": 0.014640432691202972,
   "gpu_util": 10.0,
   "gpu_mem_used_frac": 0.7556966295580704,
   "train/loss": 1.8115915060043335,
   "train/latent_dynamics": 0.03509516268968582,
   "train/reward": 0.09630102664232254,
   "train/value": 0.11673177033662796,
   "train/action": 1.563463568687439,
   "test/loss": 0.3625366985797882,
   "test/latent_dynamics": 0.03166506066918373,
   "test/reward": 0.09030120074748993,
   "test/value": 0.04829816520214081,
   "test/action": 0.19227223098278046,
   "test/dataloader_wait_frac": 0.09258119643627996,
   "train/unweighted/latent_dynamics": 0.03509516268968582,
   "train/unweighted/reward": 0.09630102664232254,
   "train/unweighted/value": 0.11673177033662796,
   "train/unweighted/action": 0.39086589217185974,
   "test/unweighted/latent_dynamics": 0.03166506066918373,
   "test/unweighted/reward": 0.09030120074748993,
   "test/unweighted/value": 0.04829816520214081,
   "test/unweighted/action": 0.048068057745695114,
   "eval/latent_rollout_error/h1": 0.01902947691269219,
   "eval/latent_rollout_error/h2": 0.02590755606070161,
   "eval/latent_rollout_error/h3": 0.03208049386739731,
   "eval/latent_rollout_error/h4": 0.03829987347126007,
   "eval/latent_rollout_error/h5": 0.04329092847183347,
   "eval/latent_rollout_error_mean": 0.03172166575677693,
   "eval/latent_variance/encoder": 0.4032224379479885,
   "eval/latent_variance/predicted": 0.3734528236091137,
   "eval/reward_r2": 0.8657696363367613,
   "eval/reward_explained_variance": 0.8659159601879088,
   "eval/reward_pearson_r": 0.9307447939651985,
   "eval/value_r2": 0.952680986841906,
   "eval/value_explained_variance": 0.9537749228122561,
   "eval/value_pearson_r": 0.9769653645368003,
   "eval/bc_action_mse": 0.11979678725108049,
   "eval/num_batches": 8.0,
   "eval/value_auc_success": 0.7265625,
   "eval/value_auc_num_episodes": 32.0,
   "eval/value_auc_success_fraction": 0.5,
   "eval/value_auc_holdout_episodewise": 0.0,
   "epoch": 0
  },
  {
   "step": 80000,
   "steps_per_second": 2.1858953369386933,
   "throughput/samples_per_s": 559.5892062563055,
   "lr": 0.00010380676394561306,
   "grad_norm": 3.2097072541236877,
   "dataloader_wait_frac": 0.014587272505527778,
   "gpu_util": 2.0,
   "gpu_mem_used_frac": 0.7556966295580704,
   "train/loss": 1.997807264328003,
   "train/latent_dynamics": 0.03491310775279999,
   "train/reward": 0.09499596059322357,
   "train/value": 0.11520768702030182,
   "train/action": 1.752692699432373,
   "test/loss": 0.3552946448326111,
   "test/latent_dynamics": 0.02962455525994301,
   "test/reward": 0.0906500443816185,
   "test/value": 0.04775635525584221,
   "test/action": 0.18726356327533722,
   "test/dataloader_wait_frac": 0.0860506894259314,
   "train/unweighted/latent_dynamics": 0.03491310775279999,
   "train/unweighted/reward": 0.09499596059322357,
   "train/unweighted/value": 0.11520768702030182,
   "train/unweighted/action": 0.43817317485809326,
   "test/unweighted/latent_dynamics": 0.02962455525994301,
   "test/unweighted/reward": 0.0906500443816185,
   "test/unweighted/value": 0.04775635525584221,
   "test/unweighted/action": 0.046815890818834305,
   "eval/latent_rollout_error/h1": 0.01721197832375765,
   "eval/latent_rollout_error/h2": 0.02369445562362671,
   "eval/latent_rollout_error/h3": 0.029701126739382744,
   "eval/latent_rollout_error/h4": 0.03565819235518575,
   "eval/latent_rollout_error/h5": 0.040975292678922415,
   "eval/latent_rollout_error_mean": 0.029448209144175053,
   "eval/latent_variance/encoder": 0.3933471292257309,
   "eval/latent_variance/predicted": 0.36553169414401054,
   "eval/reward_r2": 0.8562007289002663,
   "eval/reward_explained_variance": 0.8562415056168066,
   "eval/reward_pearson_r": 0.9254635251792452,
   "eval/value_r2": 0.9272054893510393,
   "eval/value_explained_variance": 0.9277184746148723,
   "eval/value_pearson_r": 0.9664026867583859,
   "eval/bc_action_mse": 0.12010589994723948,
   "eval/num_batches": 8.0,
   "eval/value_auc_success": 0.67578125,
   "eval/value_auc_num_episodes": 32.0,
   "eval/value_auc_success_fraction": 0.5,
   "eval/value_auc_holdout_episodewise": 0.0,
   "epoch": 0
  },
  {
   "step": 82500,
   "steps_per_second": 2.2369057112938946,
   "throughput/samples_per_s": 572.647862091237,
   "lr": 0.00010215354996034876,
   "grad_norm": 2.6193276660084726,
   "dataloader_wait_frac": 0.014656386422210654,
   "gpu_util": 100.0,
   "gpu_mem_used_frac": 0.7556966295580704,
   "train/loss": 2.909078598022461,
   "train/latent_dynamics": 0.035124197602272034,
   "train/reward": 0.09476357698440552,
   "train/value": 0.11448501795530319,
   "train/action": 2.664710283279419,
   "test/loss": 0.35246652364730835,
   "test/latent_dynamics": 0.028428947553038597,
   "test/reward": 0.09076973795890808,
   "test/value": 0.050183434039354324,
   "test/action": 0.18308432400226593,
   "test/dataloader_wait_frac": 0.07403307832759255,
   "train/unweighted/latent_dynamics": 0.035124197602272034,
   "train/unweighted/reward": 0.09476357698440552,
   "train/unweighted/value": 0.11448501795530319,
   "train/unweighted/action": 0.6661775708198547,
   "test/unweighted/latent_dynamics": 0.028428947553038597,
   "test/unweighted/reward": 0.09076973795890808,
   "test/unweighted/value": 0.050183434039354324,
   "test/unweighted/action": 0.04577108100056648,
   "eval/latent_rollout_error/h1": 0.01649195305071771,
   "eval/latent_rollout_error/h2": 0.02295673405751586,
   "eval/latent_rollout_error/h3": 0.029069016920402646,
   "eval/latent_rollout_error/h4": 0.034896362805739045,
   "eval/latent_rollout_error/h5": 0.03929050685837865,
   "eval/latent_rollout_error_mean": 0.028540914738550784,
   "eval/latent_variance/encoder": 0.3801327235996723,
   "eval/latent_variance/predicted": 0.3579341322183609,
   "eval/reward_r2": 0.8451192732026092,
   "eval/reward_explained_variance": 0.845189836195351,
   "eval/reward_pearson_r": 0.9197788819037257,
   "eval/value_r2": 0.9305456669299486,
   "eval/value_explained_variance": 0.9381005530969181,
   "eval/value_pearson_r": 0.970501224975795,
   "eval/bc_action_mse": 0.11969463255469778,
   "eval/num_batches": 8.0,
   "eval/value_auc_success": 0.72265625,
   "eval/value_auc_num_episodes": 32.0,
   "eval/value_auc_success_fraction": 0.5,
   "eval/value_auc_holdout_episodewise": 0.0,
   "epoch": 0
  },
  {
   "step": 85000,
   "steps_per_second": 2.191051559261465,
   "throughput/samples_per_s": 560.909199170935,
   "lr": 0.00010096110781887546,
   "grad_norm": 2.664278527867794,
   "dataloader_wait_frac": 0.01972621496386623,
   "gpu_util": 12.0,
   "gpu_mem_used_frac": 0.7556966295580704,
   "train/loss": 1.2923389673233032,
   "train/latent_dynamics": 0.03426206484436989,
   "train/reward": 0.09400884062051773,
   "train/value": 0.11071474850177765,
   "train/action": 1.0533535480499268,
   "test/loss": 0.3499971330165863,
   "test/latent_dynamics": 0.029449978843331337,
   "test/reward": 0.09152733534574509,
   "test/value": 0.04927626624703407,
   "test/action": 0.17974364757537842,
   "test/dataloader_wait_frac": 0.06768066026471253,
   "train/unweighted/latent_dynamics": 0.03426206484436989,
   "train/unweighted/reward": 0.09400884062051773,
   "train/unweighted/value": 0.11071474850177765,
   "train/unweighted/action": 0.2633383870124817,
   "test/unweighted/latent_dynamics": 0.029449978843331337,
   "test/unweighted/reward": 0.09152733534574509,
   "test/unweighted/value": 0.04927626624703407,
   "test/unweighted/action": 0.044935911893844604,
   "eval/latent_rollout_error/h1": 0.017256082966923714,
   "eval/latent_rollout_error/h2": 0.02419969066977501,
   "eval/latent_rollout_error/h3": 0.029760430799797177,
   "eval/latent_rollout_error/h4": 0.03685018629767001,
   "eval/latent_rollout_error/h5": 0.041485327295958996,
   "eval/latent_rollout_error_mean": 0.02991034360602498,
   "eval/latent_variance/encoder": 0.3935634419322014,
   "eval/latent_variance/predicted": 0.3752981536090374,
   "eval/reward_r2": 0.8555056676006516,
   "eval/reward_explained_variance": 0.8578352471332622,
   "eval/reward_pearson_r": 0.9264707654358145,
   "eval/value_r2": 0.9153592203993111,
   "eval/value_explained_variance": 0.9153896076849279,
   "eval/value_pearson_r": 0.9645543510214282,
   "eval/bc_action_mse": 0.11925048275634284,
   "eval/num_batches": 8.0,
   "eval/value_auc_success": 0.66015625,
   "eval/value_auc_num_episodes": 32.0,
   "eval/value_auc_success_fraction": 0.5,
   "eval/value_auc_holdout_episodewise": 0.0,
   "epoch": 1
  },
  {
   "step": 87500,
   "steps_per_second": 2.2855638775837877,
   "throughput/samples_per_s": 585.1043526614496,
   "lr": 0.00010024095536209643,
   "grad_norm": 3.9284848890066146,
   "dataloader_wait_frac": 0.014968870037864667,
   "gpu_util": 0.0,
   "gpu_mem_used_frac": 0.7556966295580704,
   "train/loss": 1.6484307050704956,
   "train/latent_dynamics": 0.03258352354168892,
   "train/reward": 0.09275206923484802,
   "train/value": 0.13881859183311462,
   "train/action": 1.3842756748199463,
   "test/loss": 0.351699560880661,
   "test/latent_dynamics": 0.02748098410665989,
   "test/reward": 0.08842066675424576,
   "test/value": 0.04794136807322502,
   "test/action": 0.187856525182724,
   "test/dataloader_wait_frac": 0.061164046657752824,
   "train/unweighted/latent_dynamics": 0.03258352354168892,
   "train/unweighted/reward": 0.09275206923484802,
   "train/unweighted/value": 0.13881859183311462,
   "train/unweighted/action": 0.3460689187049866,
   "test/unweighted/latent_dynamics": 0.02748098410665989,
   "test/unweighted/reward": 0.08842066675424576,
   "test/unweighted/value": 0.04794136807322502,
   "test/unweighted/action": 0.046964131295681,
   "eval/latent_rollout_error/h1": 0.015983542893081903,
   "eval/latent_rollout_error/h2": 0.02256822888739407,
   "eval/latent_rollout_error/h3": 0.02805278543382883,
   "eval/latent_rollout_error/h4": 0.03399595757946372,
   "eval/latent_rollout_error/h5": 0.0383128160610795,
   "eval/latent_rollout_error_mean": 0.027782666170969604,
   "eval/latent_variance/encoder": 0.37536946311593056,
   "eval/latent_variance/predicted": 0.3522566817700863,
   "eval/reward_r2": 0.8542284460554775,
   "eval/reward_explained_variance": 0.8542324616235485,
   "eval/reward_pearson_r": 0.9244794870134933,
   "eval/value_r2": 0.9435963573705607,
   "eval/value_explained_variance": 0.9441889662994097,
   "eval/value_pearson_r": 0.9723895464029698,
   "eval/bc_action_mse": 0.11862212250780478,
   "eval/num_batches": 8.0,
   "eval/value_auc_success": 0.7578125,
   "eval/value_auc_num_episodes": 32.0,
   "eval/value_auc_success_fraction": 0.5,
   "eval/value_auc_holdout_episodewise": 0.0,
   "epoch": 1
  },
  {
   "step": 90000,
   "steps_per_second": 2.264137356582644,
   "throughput/samples_per_s": 579.6191632851569,
   "lr": 9.999999747378752e-05,
   "grad_norm": 2.907674429702759,
   "dataloader_wait_frac": 0.014950468752680034,
   "gpu_util": 97.0,
   "gpu_mem_used_frac": 0.7556966295580704,
   "train/loss": 1.6041066646575928,
   "train/latent_dynamics": 0.034288667142391205,
   "train/reward": 0.091888926923275,
   "train/value": 0.1268676519393921,
   "train/action": 1.3510606288909912,
   "test/loss": 0.36793431639671326,
   "test/latent_dynamics": 0.027841078117489815,
   "test/reward": 0.08893612772226334,
   "test/value": 0.05607955902814865,
   "test/action": 0.19507770240306854,
   "test/dataloader_wait_frac": 0.07222307166565173,
   "train/unweighted/latent_dynamics": 0.034288667142391205,
   "train/unweighted/reward": 0.091888926923275,
   "train/unweighted/value": 0.1268676519393921,
   "train/unweighted/action": 0.3377651572227478,
   "test/unweighted/latent_dynamics": 0.027841078117489815,
   "test/unweighted/reward": 0.08893612772226334,
   "test/unweighted/value": 0.05607955902814865,
   "test/unweighted/action": 0.048769425600767136,
   "eval/latent_rollout_error/h1": 0.016440856154076755,
   "eval/latent_rollout_error/h2": 0.02284725825302303,
   "eval/latent_rollout_error/h3": 0.028287908528000116,
   "eval/latent_rollout_error/h4": 0.03440041467547417,
   "eval/latent_rollout_error/h5": 0.03848161967471242,
   "eval/latent_rollout_error_mean": 0.028091611457057297,
   "eval/latent_variance/encoder": 0.36949001252651215,
   "eval/latent_variance/predicted": 0.3481830880045891,
   "eval/reward_r2": 0.8640634588769904,
   "eval/reward_explained_variance": 0.8640658966140121,
   "eval/reward_pearson_r": 0.9299749404804377,
   "eval/value_r2": 0.9040185561929274,
   "eval/value_explained_variance": 0.904381994157503,
   "eval/value_pearson_r": 0.9510478076222231,
   "eval/bc_action_mse": 0.11875594078199576,
   "eval/num_batches": 8.0,
   "eval/value_auc_success": 0.734375,
   "eval/value_auc_num_episodes": 32.0,
   "eval/value_auc_success_fraction": 0.5,
   "eval/value_auc_holdout_episodewise": 0.0,
   "epoch": 1
  }
 ]
}