[ { "episode": 0, "reward": -4117.106074270732, "length": 50.0, "curriculum_workspace": 2.0, "curriculum_tolerance": 1.0 }, { "episode": 1, "reward": -4019.12128505361, "length": 50.0, "curriculum_workspace": 2.032, "curriculum_tolerance": 0.9964, "policy_loss": 622.3520736694336, "value_loss": 2572531.1875, "entropy": 10.570202509562174 }, { "episode": 2, "reward": -4394.865559441144, "length": 51.0, "curriculum_workspace": 2.064, "curriculum_tolerance": 0.9928, "policy_loss": 14.566550572713217, "value_loss": 2151228.0, "entropy": 10.952080726623535 }, { "episode": 3, "reward": -3323.885949789756, "length": 51.0, "curriculum_workspace": 2.096, "curriculum_tolerance": 0.9892, "policy_loss": 17.67809995015462, "value_loss": 1829146.2083333333, "entropy": 10.703398068745932 }, { "episode": 4, "reward": -1371.6076234851791, "length": 52.0, "curriculum_workspace": 2.128, "curriculum_tolerance": 0.9856, "policy_loss": 23.171199162801106, "value_loss": 2108416.0416666665, "entropy": 10.893921852111816 }, { "episode": 5, "reward": -2990.053538943499, "length": 53.0, "curriculum_workspace": 2.16, "curriculum_tolerance": 0.982, "policy_loss": 35.66572380065918, "value_loss": 2114751.2916666665, "entropy": 10.788981437683105 }, { "episode": 6, "reward": -2674.839804156554, "length": 53.0, "curriculum_workspace": 2.192, "curriculum_tolerance": 0.9784, "policy_loss": 44.39890797932943, "value_loss": 2036071.25, "entropy": 10.80025863647461 }, { "episode": 7, "reward": -4651.07461919707, "length": 54.0, "curriculum_workspace": 2.224, "curriculum_tolerance": 0.9748, "policy_loss": 39.96443303426107, "value_loss": 2158826.625, "entropy": 10.968170483907064 }, { "episode": 8, "reward": -4467.484574136011, "length": 54.0, "curriculum_workspace": 2.2560000000000002, "curriculum_tolerance": 0.9712, "policy_loss": 26.5602970123291, "value_loss": 1640928.0, "entropy": 11.055835405985514 }, { "episode": 9, "reward": -4823.719373494976, "length": 55.0, "curriculum_workspace": 2.288, "curriculum_tolerance": 0.9676, "policy_loss": 18.048124313354492, "value_loss": 2375369.4166666665, "entropy": 11.101380666097006 }, { "episode": 10, "reward": -1923.4369389589249, "length": 56.0, "curriculum_workspace": 2.32, "curriculum_tolerance": 0.964, "policy_loss": 14.790959040323893, "value_loss": 1835558.3333333333, "entropy": 11.058162371317545 }, { "episode": 11, "reward": -1484.6377772607584, "length": 56.0, "curriculum_workspace": 2.352, "curriculum_tolerance": 0.9604, "policy_loss": 13.82265822092692, "value_loss": 2059071.75, "entropy": 11.060895601908365 }, { "episode": 12, "reward": -3500.6315790371855, "length": 57.0, "curriculum_workspace": 2.384, "curriculum_tolerance": 0.9568, "policy_loss": 13.319823265075684, "value_loss": 2112584.625, "entropy": 11.42590618133545 }, { "episode": 13, "reward": -4982.834369741242, "length": 57.0, "curriculum_workspace": 2.416, "curriculum_tolerance": 0.9532, "policy_loss": 13.116266250610352, "value_loss": 1860672.75, "entropy": 12.066414833068848 }, { "episode": 14, "reward": -2058.2394866598056, "length": 58.0, "curriculum_workspace": 2.448, "curriculum_tolerance": 0.9496, "policy_loss": 13.031009991963705, "value_loss": 2165116.1666666665, "entropy": 12.93746821085612 }, { "episode": 15, "reward": -4977.607776830717, "length": 59.0, "curriculum_workspace": 2.48, "curriculum_tolerance": 0.946, "policy_loss": 13.213780085245768, "value_loss": 2002223.9166666667, "entropy": 13.819189071655273 }, { "episode": 16, "reward": -3859.9774600218493, "length": 59.0, "curriculum_workspace": 2.512, "curriculum_tolerance": 0.9424, "policy_loss": 13.350354194641113, "value_loss": 1832578.2916666667, "entropy": 14.376607577006022 }, { "episode": 17, "reward": -1627.6385071755694, "length": 60.0, "curriculum_workspace": 2.544, "curriculum_tolerance": 0.9388, "policy_loss": 13.431756019592285, "value_loss": 1617376.3333333333, "entropy": 14.540836016337076 }, { "episode": 18, "reward": -4149.944166288463, "length": 60.0, "curriculum_workspace": 2.576, "curriculum_tolerance": 0.9352, "policy_loss": 13.467912038167318, "value_loss": 1981814.4166666667, "entropy": 14.324907938639322 }, { "episode": 19, "reward": -5131.686962639794, "length": 61.0, "curriculum_workspace": 2.608, "curriculum_tolerance": 0.9316, "policy_loss": 13.326446851094564, "value_loss": 1915032.2916666667, "entropy": 13.877846717834473 }, { "episode": 20, "reward": -5228.075066189372, "length": 62.0, "curriculum_workspace": 2.64, "curriculum_tolerance": 0.9279999999999999, "policy_loss": 13.375265757242838, "value_loss": 2112962.6666666665, "entropy": 13.361644744873047 }, { "episode": 21, "reward": -5186.329137771654, "length": 62.0, "curriculum_workspace": 2.672, "curriculum_tolerance": 0.9244, "policy_loss": 13.818631807963053, "value_loss": 2113175.875, "entropy": 13.105459849039713 }, { "episode": 22, "reward": -4057.782614067842, "length": 63.0, "curriculum_workspace": 2.7039999999999997, "curriculum_tolerance": 0.9208000000000001, "policy_loss": 13.76739756266276, "value_loss": 2045289.0833333333, "entropy": 13.31519349416097 }, { "episode": 23, "reward": -4834.530011717787, "length": 63.0, "curriculum_workspace": 2.7359999999999998, "curriculum_tolerance": 0.9172, "policy_loss": 13.784981409708658, "value_loss": 1915178.9166666667, "entropy": 13.730597813924154 }, { "episode": 24, "reward": -3705.748301970469, "length": 64.0, "curriculum_workspace": 2.768, "curriculum_tolerance": 0.9136, "policy_loss": 14.00051212310791, "value_loss": 1903344.875, "entropy": 13.990816434224447 }, { "episode": 25, "reward": -5161.172102921899, "length": 65.0, "curriculum_workspace": 2.8, "curriculum_tolerance": 0.91, "policy_loss": 14.05345090230306, "value_loss": 2276532.3333333335, "entropy": 13.964613914489746 }, { "episode": 26, "reward": -3577.1441104754713, "length": 65.0, "curriculum_workspace": 2.832, "curriculum_tolerance": 0.9064, "policy_loss": 14.074357350667318, "value_loss": 1869222.5, "entropy": 13.688777287801107 }, { "episode": 27, "reward": -3782.84499566091, "length": 66.0, "curriculum_workspace": 2.864, "curriculum_tolerance": 0.9028, "policy_loss": 14.263980865478516, "value_loss": 2033995.5833333333, "entropy": 13.331088383992514 }, { "episode": 28, "reward": -5083.709728782213, "length": 66.0, "curriculum_workspace": 2.896, "curriculum_tolerance": 0.8992, "policy_loss": 14.407584508260092, "value_loss": 1587029.625, "entropy": 13.100332260131836 }, { "episode": 29, "reward": -6013.648801080463, "length": 67.0, "curriculum_workspace": 2.928, "curriculum_tolerance": 0.8956, "policy_loss": 14.627202669779459, "value_loss": 1742995.6666666667, "entropy": 13.188586870829264 }, { "episode": 30, "reward": -4239.0001420298895, "length": 68.0, "curriculum_workspace": 2.96, "curriculum_tolerance": 0.892, "policy_loss": 14.833614031473795, "value_loss": 1826684.2916666667, "entropy": 13.385094006856283 }, { "episode": 31, "reward": -4409.100572156202, "length": 68.0, "curriculum_workspace": 2.992, "curriculum_tolerance": 0.8884, "policy_loss": 14.945093154907227, "value_loss": 1562933.0, "entropy": 13.490048090616861 }, { "episode": 32, "reward": -3356.641185420492, "length": 69.0, "curriculum_workspace": 3.024, "curriculum_tolerance": 0.8848, "policy_loss": 14.982863108317057, "value_loss": 1835477.25, "entropy": 13.370009740193685 }, { "episode": 33, "reward": -3986.904896779282, "length": 69.0, "curriculum_workspace": 3.056, "curriculum_tolerance": 0.8812, "policy_loss": 15.273401896158854, "value_loss": 1439701.4166666667, "entropy": 13.198060353597006 }, { "episode": 34, "reward": -5312.22716664324, "length": 70.0, "curriculum_workspace": 3.088, "curriculum_tolerance": 0.8775999999999999, "policy_loss": 15.424799919128418, "value_loss": 1434203.2083333333, "entropy": 13.200188318888346 }, { "episode": 35, "reward": -6367.123222509682, "length": 71.0, "curriculum_workspace": 3.12, "curriculum_tolerance": 0.874, "policy_loss": 15.523966789245605, "value_loss": 1611426.9583333333, "entropy": 13.17090098063151 }, { "episode": 36, "reward": -3722.3854661972437, "length": 71.0, "curriculum_workspace": 3.152, "curriculum_tolerance": 0.8704000000000001, "policy_loss": 15.664861043294271, "value_loss": 1258489.2708333333, "entropy": 13.123793601989746 }, { "episode": 37, "reward": -5995.377595287716, "length": 72.0, "curriculum_workspace": 3.184, "curriculum_tolerance": 0.8668, "policy_loss": 15.935842196146647, "value_loss": 1838711.8333333333, "entropy": 13.184882481892904 }, { "episode": 38, "reward": -5378.967535211291, "length": 72.0, "curriculum_workspace": 3.216, "curriculum_tolerance": 0.8632, "policy_loss": 16.148719787597656, "value_loss": 1345982.7083333333, "entropy": 13.360455830891928 }, { "episode": 39, "reward": -6093.868606661191, "length": 73.0, "curriculum_workspace": 3.248, "curriculum_tolerance": 0.8596, "policy_loss": 16.233165105183918, "value_loss": 1257234.625, "entropy": 13.434273719787598 }, { "episode": 40, "reward": -6064.6288814716445, "length": 74.0, "curriculum_workspace": 3.2800000000000002, "curriculum_tolerance": 0.856, "policy_loss": 16.413060506184895, "value_loss": 1189908.5833333333, "entropy": 13.33445962270101 }, { "episode": 41, "reward": -5977.5052540340685, "length": 74.0, "curriculum_workspace": 3.3120000000000003, "curriculum_tolerance": 0.8524, "policy_loss": 16.411815643310547, "value_loss": 1765572.25, "entropy": 13.32754135131836 }, { "episode": 42, "reward": -5023.37425454401, "length": 75.0, "curriculum_workspace": 3.3440000000000003, "curriculum_tolerance": 0.8488, "policy_loss": 16.58466084798177, "value_loss": 1764871.875, "entropy": 13.210077921549479 }, { "episode": 43, "reward": -4485.519327776879, "length": 75.0, "curriculum_workspace": 3.376, "curriculum_tolerance": 0.8452, "policy_loss": 16.889702479044598, "value_loss": 1481838.0416666667, "entropy": 13.155010541280111 }, { "episode": 44, "reward": -5829.447719411327, "length": 76.0, "curriculum_workspace": 3.408, "curriculum_tolerance": 0.8416, "policy_loss": 16.830699284871418, "value_loss": 1200839.125, "entropy": 13.277695655822754 }, { "episode": 45, "reward": -3817.8684198857645, "length": 77.0, "curriculum_workspace": 3.44, "curriculum_tolerance": 0.838, "policy_loss": 17.062369028727215, "value_loss": 1179923.625, "entropy": 13.127998034159342 }, { "episode": 46, "reward": -4911.160951885778, "length": 77.0, "curriculum_workspace": 3.472, "curriculum_tolerance": 0.8344, "policy_loss": 17.37917963663737, "value_loss": 1451180.5833333333, "entropy": 12.96893056233724 }, { "episode": 47, "reward": -5950.035294946636, "length": 78.0, "curriculum_workspace": 3.504, "curriculum_tolerance": 0.8308, "policy_loss": 17.585961023966473, "value_loss": 1121931.5208333333, "entropy": 13.135512987772623 }, { "episode": 48, "reward": -3238.837607449335, "length": 78.0, "curriculum_workspace": 3.536, "curriculum_tolerance": 0.8271999999999999, "policy_loss": 17.703017552693684, "value_loss": 987417.9583333334, "entropy": 13.413006782531738 }, { "episode": 49, "reward": -2798.3747808645585, "length": 79.0, "curriculum_workspace": 3.568, "curriculum_tolerance": 0.8236, "policy_loss": 17.936787923177082, "value_loss": 1280633.3333333333, "entropy": 13.242624918619791 }, { "episode": 50, "reward": -7072.326660121866, "length": 80.0, "curriculum_workspace": 3.6, "curriculum_tolerance": 0.82, "policy_loss": 18.204940795898438, "value_loss": 1209743.6875, "entropy": 13.124441146850586 }, { "episode": 51, "reward": -6741.980706600847, "length": 80.0, "curriculum_workspace": 3.6319999999999997, "curriculum_tolerance": 0.8164, "policy_loss": 18.491525014241535, "value_loss": 1162674.7291666667, "entropy": 13.718675295511881 }, { "episode": 52, "reward": -5947.681020919423, "length": 81.0, "curriculum_workspace": 3.6639999999999997, "curriculum_tolerance": 0.8128, "policy_loss": 18.72053400675456, "value_loss": 1099385.0833333333, "entropy": 13.551950454711914 }, { "episode": 53, "reward": -6465.06947989624, "length": 81.0, "curriculum_workspace": 3.6959999999999997, "curriculum_tolerance": 0.8092, "policy_loss": 18.95237922668457, "value_loss": 1051834.0416666667, "entropy": 13.281392415364584 }, { "episode": 54, "reward": -5043.096543840526, "length": 82.0, "curriculum_workspace": 3.7279999999999998, "curriculum_tolerance": 0.8056, "policy_loss": 19.06976381937663, "value_loss": 661422.71875, "entropy": 13.68356450398763 }, { "episode": 55, "reward": -3703.934553518295, "length": 83.0, "curriculum_workspace": 3.76, "curriculum_tolerance": 0.802, "policy_loss": 19.282599131266277, "value_loss": 943620.5833333334, "entropy": 13.604517618815104 }, { "episode": 56, "reward": -6821.8447050707055, "length": 83.0, "curriculum_workspace": 3.792, "curriculum_tolerance": 0.7984, "policy_loss": 19.329707463582356, "value_loss": 1042977.7083333334, "entropy": 13.349701881408691 }, { "episode": 57, "reward": -5400.922056119247, "length": 84.0, "curriculum_workspace": 3.824, "curriculum_tolerance": 0.7948, "policy_loss": 19.504372278849285, "value_loss": 764966.25, "entropy": 13.603109995524088 }, { "episode": 58, "reward": -3875.5526876033327, "length": 84.0, "curriculum_workspace": 3.856, "curriculum_tolerance": 0.7912, "policy_loss": 19.897963841756184, "value_loss": 852760.1041666666, "entropy": 13.718326886494955 } ]