ianshank's picture
Initial ZeroG-RL training dashboard with sample data
267359d verified
Raw
History Blame Contribute Delete
16 kB
[
{
"episode": 0,
"reward": -4117.106074270732,
"length": 50.0,
"curriculum_workspace": 2.0,
"curriculum_tolerance": 1.0
},
{
"episode": 1,
"reward": -4019.12128505361,
"length": 50.0,
"curriculum_workspace": 2.032,
"curriculum_tolerance": 0.9964,
"policy_loss": 622.3520736694336,
"value_loss": 2572531.1875,
"entropy": 10.570202509562174
},
{
"episode": 2,
"reward": -4394.865559441144,
"length": 51.0,
"curriculum_workspace": 2.064,
"curriculum_tolerance": 0.9928,
"policy_loss": 14.566550572713217,
"value_loss": 2151228.0,
"entropy": 10.952080726623535
},
{
"episode": 3,
"reward": -3323.885949789756,
"length": 51.0,
"curriculum_workspace": 2.096,
"curriculum_tolerance": 0.9892,
"policy_loss": 17.67809995015462,
"value_loss": 1829146.2083333333,
"entropy": 10.703398068745932
},
{
"episode": 4,
"reward": -1371.6076234851791,
"length": 52.0,
"curriculum_workspace": 2.128,
"curriculum_tolerance": 0.9856,
"policy_loss": 23.171199162801106,
"value_loss": 2108416.0416666665,
"entropy": 10.893921852111816
},
{
"episode": 5,
"reward": -2990.053538943499,
"length": 53.0,
"curriculum_workspace": 2.16,
"curriculum_tolerance": 0.982,
"policy_loss": 35.66572380065918,
"value_loss": 2114751.2916666665,
"entropy": 10.788981437683105
},
{
"episode": 6,
"reward": -2674.839804156554,
"length": 53.0,
"curriculum_workspace": 2.192,
"curriculum_tolerance": 0.9784,
"policy_loss": 44.39890797932943,
"value_loss": 2036071.25,
"entropy": 10.80025863647461
},
{
"episode": 7,
"reward": -4651.07461919707,
"length": 54.0,
"curriculum_workspace": 2.224,
"curriculum_tolerance": 0.9748,
"policy_loss": 39.96443303426107,
"value_loss": 2158826.625,
"entropy": 10.968170483907064
},
{
"episode": 8,
"reward": -4467.484574136011,
"length": 54.0,
"curriculum_workspace": 2.2560000000000002,
"curriculum_tolerance": 0.9712,
"policy_loss": 26.5602970123291,
"value_loss": 1640928.0,
"entropy": 11.055835405985514
},
{
"episode": 9,
"reward": -4823.719373494976,
"length": 55.0,
"curriculum_workspace": 2.288,
"curriculum_tolerance": 0.9676,
"policy_loss": 18.048124313354492,
"value_loss": 2375369.4166666665,
"entropy": 11.101380666097006
},
{
"episode": 10,
"reward": -1923.4369389589249,
"length": 56.0,
"curriculum_workspace": 2.32,
"curriculum_tolerance": 0.964,
"policy_loss": 14.790959040323893,
"value_loss": 1835558.3333333333,
"entropy": 11.058162371317545
},
{
"episode": 11,
"reward": -1484.6377772607584,
"length": 56.0,
"curriculum_workspace": 2.352,
"curriculum_tolerance": 0.9604,
"policy_loss": 13.82265822092692,
"value_loss": 2059071.75,
"entropy": 11.060895601908365
},
{
"episode": 12,
"reward": -3500.6315790371855,
"length": 57.0,
"curriculum_workspace": 2.384,
"curriculum_tolerance": 0.9568,
"policy_loss": 13.319823265075684,
"value_loss": 2112584.625,
"entropy": 11.42590618133545
},
{
"episode": 13,
"reward": -4982.834369741242,
"length": 57.0,
"curriculum_workspace": 2.416,
"curriculum_tolerance": 0.9532,
"policy_loss": 13.116266250610352,
"value_loss": 1860672.75,
"entropy": 12.066414833068848
},
{
"episode": 14,
"reward": -2058.2394866598056,
"length": 58.0,
"curriculum_workspace": 2.448,
"curriculum_tolerance": 0.9496,
"policy_loss": 13.031009991963705,
"value_loss": 2165116.1666666665,
"entropy": 12.93746821085612
},
{
"episode": 15,
"reward": -4977.607776830717,
"length": 59.0,
"curriculum_workspace": 2.48,
"curriculum_tolerance": 0.946,
"policy_loss": 13.213780085245768,
"value_loss": 2002223.9166666667,
"entropy": 13.819189071655273
},
{
"episode": 16,
"reward": -3859.9774600218493,
"length": 59.0,
"curriculum_workspace": 2.512,
"curriculum_tolerance": 0.9424,
"policy_loss": 13.350354194641113,
"value_loss": 1832578.2916666667,
"entropy": 14.376607577006022
},
{
"episode": 17,
"reward": -1627.6385071755694,
"length": 60.0,
"curriculum_workspace": 2.544,
"curriculum_tolerance": 0.9388,
"policy_loss": 13.431756019592285,
"value_loss": 1617376.3333333333,
"entropy": 14.540836016337076
},
{
"episode": 18,
"reward": -4149.944166288463,
"length": 60.0,
"curriculum_workspace": 2.576,
"curriculum_tolerance": 0.9352,
"policy_loss": 13.467912038167318,
"value_loss": 1981814.4166666667,
"entropy": 14.324907938639322
},
{
"episode": 19,
"reward": -5131.686962639794,
"length": 61.0,
"curriculum_workspace": 2.608,
"curriculum_tolerance": 0.9316,
"policy_loss": 13.326446851094564,
"value_loss": 1915032.2916666667,
"entropy": 13.877846717834473
},
{
"episode": 20,
"reward": -5228.075066189372,
"length": 62.0,
"curriculum_workspace": 2.64,
"curriculum_tolerance": 0.9279999999999999,
"policy_loss": 13.375265757242838,
"value_loss": 2112962.6666666665,
"entropy": 13.361644744873047
},
{
"episode": 21,
"reward": -5186.329137771654,
"length": 62.0,
"curriculum_workspace": 2.672,
"curriculum_tolerance": 0.9244,
"policy_loss": 13.818631807963053,
"value_loss": 2113175.875,
"entropy": 13.105459849039713
},
{
"episode": 22,
"reward": -4057.782614067842,
"length": 63.0,
"curriculum_workspace": 2.7039999999999997,
"curriculum_tolerance": 0.9208000000000001,
"policy_loss": 13.76739756266276,
"value_loss": 2045289.0833333333,
"entropy": 13.31519349416097
},
{
"episode": 23,
"reward": -4834.530011717787,
"length": 63.0,
"curriculum_workspace": 2.7359999999999998,
"curriculum_tolerance": 0.9172,
"policy_loss": 13.784981409708658,
"value_loss": 1915178.9166666667,
"entropy": 13.730597813924154
},
{
"episode": 24,
"reward": -3705.748301970469,
"length": 64.0,
"curriculum_workspace": 2.768,
"curriculum_tolerance": 0.9136,
"policy_loss": 14.00051212310791,
"value_loss": 1903344.875,
"entropy": 13.990816434224447
},
{
"episode": 25,
"reward": -5161.172102921899,
"length": 65.0,
"curriculum_workspace": 2.8,
"curriculum_tolerance": 0.91,
"policy_loss": 14.05345090230306,
"value_loss": 2276532.3333333335,
"entropy": 13.964613914489746
},
{
"episode": 26,
"reward": -3577.1441104754713,
"length": 65.0,
"curriculum_workspace": 2.832,
"curriculum_tolerance": 0.9064,
"policy_loss": 14.074357350667318,
"value_loss": 1869222.5,
"entropy": 13.688777287801107
},
{
"episode": 27,
"reward": -3782.84499566091,
"length": 66.0,
"curriculum_workspace": 2.864,
"curriculum_tolerance": 0.9028,
"policy_loss": 14.263980865478516,
"value_loss": 2033995.5833333333,
"entropy": 13.331088383992514
},
{
"episode": 28,
"reward": -5083.709728782213,
"length": 66.0,
"curriculum_workspace": 2.896,
"curriculum_tolerance": 0.8992,
"policy_loss": 14.407584508260092,
"value_loss": 1587029.625,
"entropy": 13.100332260131836
},
{
"episode": 29,
"reward": -6013.648801080463,
"length": 67.0,
"curriculum_workspace": 2.928,
"curriculum_tolerance": 0.8956,
"policy_loss": 14.627202669779459,
"value_loss": 1742995.6666666667,
"entropy": 13.188586870829264
},
{
"episode": 30,
"reward": -4239.0001420298895,
"length": 68.0,
"curriculum_workspace": 2.96,
"curriculum_tolerance": 0.892,
"policy_loss": 14.833614031473795,
"value_loss": 1826684.2916666667,
"entropy": 13.385094006856283
},
{
"episode": 31,
"reward": -4409.100572156202,
"length": 68.0,
"curriculum_workspace": 2.992,
"curriculum_tolerance": 0.8884,
"policy_loss": 14.945093154907227,
"value_loss": 1562933.0,
"entropy": 13.490048090616861
},
{
"episode": 32,
"reward": -3356.641185420492,
"length": 69.0,
"curriculum_workspace": 3.024,
"curriculum_tolerance": 0.8848,
"policy_loss": 14.982863108317057,
"value_loss": 1835477.25,
"entropy": 13.370009740193685
},
{
"episode": 33,
"reward": -3986.904896779282,
"length": 69.0,
"curriculum_workspace": 3.056,
"curriculum_tolerance": 0.8812,
"policy_loss": 15.273401896158854,
"value_loss": 1439701.4166666667,
"entropy": 13.198060353597006
},
{
"episode": 34,
"reward": -5312.22716664324,
"length": 70.0,
"curriculum_workspace": 3.088,
"curriculum_tolerance": 0.8775999999999999,
"policy_loss": 15.424799919128418,
"value_loss": 1434203.2083333333,
"entropy": 13.200188318888346
},
{
"episode": 35,
"reward": -6367.123222509682,
"length": 71.0,
"curriculum_workspace": 3.12,
"curriculum_tolerance": 0.874,
"policy_loss": 15.523966789245605,
"value_loss": 1611426.9583333333,
"entropy": 13.17090098063151
},
{
"episode": 36,
"reward": -3722.3854661972437,
"length": 71.0,
"curriculum_workspace": 3.152,
"curriculum_tolerance": 0.8704000000000001,
"policy_loss": 15.664861043294271,
"value_loss": 1258489.2708333333,
"entropy": 13.123793601989746
},
{
"episode": 37,
"reward": -5995.377595287716,
"length": 72.0,
"curriculum_workspace": 3.184,
"curriculum_tolerance": 0.8668,
"policy_loss": 15.935842196146647,
"value_loss": 1838711.8333333333,
"entropy": 13.184882481892904
},
{
"episode": 38,
"reward": -5378.967535211291,
"length": 72.0,
"curriculum_workspace": 3.216,
"curriculum_tolerance": 0.8632,
"policy_loss": 16.148719787597656,
"value_loss": 1345982.7083333333,
"entropy": 13.360455830891928
},
{
"episode": 39,
"reward": -6093.868606661191,
"length": 73.0,
"curriculum_workspace": 3.248,
"curriculum_tolerance": 0.8596,
"policy_loss": 16.233165105183918,
"value_loss": 1257234.625,
"entropy": 13.434273719787598
},
{
"episode": 40,
"reward": -6064.6288814716445,
"length": 74.0,
"curriculum_workspace": 3.2800000000000002,
"curriculum_tolerance": 0.856,
"policy_loss": 16.413060506184895,
"value_loss": 1189908.5833333333,
"entropy": 13.33445962270101
},
{
"episode": 41,
"reward": -5977.5052540340685,
"length": 74.0,
"curriculum_workspace": 3.3120000000000003,
"curriculum_tolerance": 0.8524,
"policy_loss": 16.411815643310547,
"value_loss": 1765572.25,
"entropy": 13.32754135131836
},
{
"episode": 42,
"reward": -5023.37425454401,
"length": 75.0,
"curriculum_workspace": 3.3440000000000003,
"curriculum_tolerance": 0.8488,
"policy_loss": 16.58466084798177,
"value_loss": 1764871.875,
"entropy": 13.210077921549479
},
{
"episode": 43,
"reward": -4485.519327776879,
"length": 75.0,
"curriculum_workspace": 3.376,
"curriculum_tolerance": 0.8452,
"policy_loss": 16.889702479044598,
"value_loss": 1481838.0416666667,
"entropy": 13.155010541280111
},
{
"episode": 44,
"reward": -5829.447719411327,
"length": 76.0,
"curriculum_workspace": 3.408,
"curriculum_tolerance": 0.8416,
"policy_loss": 16.830699284871418,
"value_loss": 1200839.125,
"entropy": 13.277695655822754
},
{
"episode": 45,
"reward": -3817.8684198857645,
"length": 77.0,
"curriculum_workspace": 3.44,
"curriculum_tolerance": 0.838,
"policy_loss": 17.062369028727215,
"value_loss": 1179923.625,
"entropy": 13.127998034159342
},
{
"episode": 46,
"reward": -4911.160951885778,
"length": 77.0,
"curriculum_workspace": 3.472,
"curriculum_tolerance": 0.8344,
"policy_loss": 17.37917963663737,
"value_loss": 1451180.5833333333,
"entropy": 12.96893056233724
},
{
"episode": 47,
"reward": -5950.035294946636,
"length": 78.0,
"curriculum_workspace": 3.504,
"curriculum_tolerance": 0.8308,
"policy_loss": 17.585961023966473,
"value_loss": 1121931.5208333333,
"entropy": 13.135512987772623
},
{
"episode": 48,
"reward": -3238.837607449335,
"length": 78.0,
"curriculum_workspace": 3.536,
"curriculum_tolerance": 0.8271999999999999,
"policy_loss": 17.703017552693684,
"value_loss": 987417.9583333334,
"entropy": 13.413006782531738
},
{
"episode": 49,
"reward": -2798.3747808645585,
"length": 79.0,
"curriculum_workspace": 3.568,
"curriculum_tolerance": 0.8236,
"policy_loss": 17.936787923177082,
"value_loss": 1280633.3333333333,
"entropy": 13.242624918619791
},
{
"episode": 50,
"reward": -7072.326660121866,
"length": 80.0,
"curriculum_workspace": 3.6,
"curriculum_tolerance": 0.82,
"policy_loss": 18.204940795898438,
"value_loss": 1209743.6875,
"entropy": 13.124441146850586
},
{
"episode": 51,
"reward": -6741.980706600847,
"length": 80.0,
"curriculum_workspace": 3.6319999999999997,
"curriculum_tolerance": 0.8164,
"policy_loss": 18.491525014241535,
"value_loss": 1162674.7291666667,
"entropy": 13.718675295511881
},
{
"episode": 52,
"reward": -5947.681020919423,
"length": 81.0,
"curriculum_workspace": 3.6639999999999997,
"curriculum_tolerance": 0.8128,
"policy_loss": 18.72053400675456,
"value_loss": 1099385.0833333333,
"entropy": 13.551950454711914
},
{
"episode": 53,
"reward": -6465.06947989624,
"length": 81.0,
"curriculum_workspace": 3.6959999999999997,
"curriculum_tolerance": 0.8092,
"policy_loss": 18.95237922668457,
"value_loss": 1051834.0416666667,
"entropy": 13.281392415364584
},
{
"episode": 54,
"reward": -5043.096543840526,
"length": 82.0,
"curriculum_workspace": 3.7279999999999998,
"curriculum_tolerance": 0.8056,
"policy_loss": 19.06976381937663,
"value_loss": 661422.71875,
"entropy": 13.68356450398763
},
{
"episode": 55,
"reward": -3703.934553518295,
"length": 83.0,
"curriculum_workspace": 3.76,
"curriculum_tolerance": 0.802,
"policy_loss": 19.282599131266277,
"value_loss": 943620.5833333334,
"entropy": 13.604517618815104
},
{
"episode": 56,
"reward": -6821.8447050707055,
"length": 83.0,
"curriculum_workspace": 3.792,
"curriculum_tolerance": 0.7984,
"policy_loss": 19.329707463582356,
"value_loss": 1042977.7083333334,
"entropy": 13.349701881408691
},
{
"episode": 57,
"reward": -5400.922056119247,
"length": 84.0,
"curriculum_workspace": 3.824,
"curriculum_tolerance": 0.7948,
"policy_loss": 19.504372278849285,
"value_loss": 764966.25,
"entropy": 13.603109995524088
},
{
"episode": 58,
"reward": -3875.5526876033327,
"length": 84.0,
"curriculum_workspace": 3.856,
"curriculum_tolerance": 0.7912,
"policy_loss": 19.897963841756184,
"value_loss": 852760.1041666666,
"entropy": 13.718326886494955
}
]