LLM-continual-learning / trace /seq /order2 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order2
d37e0d7 verified
Raw
History Blame Contribute Delete
59.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.968152866242038,
"eval_steps": 500,
"global_step": 234,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 8.287943840026855,
"learning_rate": 0.0,
"loss": 2.1051,
"mean_token_accuracy": 0.6576112508773804,
"num_tokens": 7722.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 8.355767250061035,
"learning_rate": 2.5e-05,
"loss": 2.0935,
"mean_token_accuracy": 0.662928581237793,
"num_tokens": 15318.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 5.267609119415283,
"learning_rate": 5e-05,
"loss": 1.823,
"mean_token_accuracy": 0.6904586851596832,
"num_tokens": 23143.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 4.595154762268066,
"learning_rate": 7.500000000000001e-05,
"loss": 1.3159,
"mean_token_accuracy": 0.7333050668239594,
"num_tokens": 30786.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 1.5862985849380493,
"learning_rate": 0.0001,
"loss": 1.0104,
"mean_token_accuracy": 0.7833340167999268,
"num_tokens": 38345.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 0.8021528124809265,
"learning_rate": 0.000125,
"loss": 0.8478,
"mean_token_accuracy": 0.8248030543327332,
"num_tokens": 45956.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 0.5970975756645203,
"learning_rate": 0.00015000000000000001,
"loss": 0.7815,
"mean_token_accuracy": 0.8295383155345917,
"num_tokens": 53562.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 1.414368987083435,
"learning_rate": 0.000175,
"loss": 0.7247,
"mean_token_accuracy": 0.8384078443050385,
"num_tokens": 60929.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 0.9989311099052429,
"learning_rate": 0.0002,
"loss": 0.74,
"mean_token_accuracy": 0.8326991200447083,
"num_tokens": 68327.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 0.4296531081199646,
"learning_rate": 0.00019999033847063811,
"loss": 0.7706,
"mean_token_accuracy": 0.8299016058444977,
"num_tokens": 75754.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 0.4344661831855774,
"learning_rate": 0.00019996135574945544,
"loss": 0.7121,
"mean_token_accuracy": 0.8349876701831818,
"num_tokens": 83217.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.3851865530014038,
"learning_rate": 0.00019991305743680013,
"loss": 0.747,
"mean_token_accuracy": 0.830773264169693,
"num_tokens": 90805.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.3876875042915344,
"learning_rate": 0.0001998454528653836,
"loss": 0.7502,
"mean_token_accuracy": 0.8285396993160248,
"num_tokens": 98404.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.4084186553955078,
"learning_rate": 0.00019975855509847686,
"loss": 0.7135,
"mean_token_accuracy": 0.83475062251091,
"num_tokens": 106081.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.3862064480781555,
"learning_rate": 0.00019965238092738643,
"loss": 0.777,
"mean_token_accuracy": 0.8248996436595917,
"num_tokens": 113617.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.4174270033836365,
"learning_rate": 0.00019952695086820975,
"loss": 0.7301,
"mean_token_accuracy": 0.8283782601356506,
"num_tokens": 121314.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.3616231381893158,
"learning_rate": 0.0001993822891578708,
"loss": 0.7061,
"mean_token_accuracy": 0.8416012227535248,
"num_tokens": 128659.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.38920992612838745,
"learning_rate": 0.0001992184237494368,
"loss": 0.7001,
"mean_token_accuracy": 0.835535317659378,
"num_tokens": 136314.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.3504973351955414,
"learning_rate": 0.0001990353863067169,
"loss": 0.7106,
"mean_token_accuracy": 0.8328219652175903,
"num_tokens": 144182.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.34746506810188293,
"learning_rate": 0.0001988332121981436,
"loss": 0.7584,
"mean_token_accuracy": 0.8270872235298157,
"num_tokens": 152095.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.3385103642940521,
"learning_rate": 0.00019861194048993863,
"loss": 0.6867,
"mean_token_accuracy": 0.8429812490940094,
"num_tokens": 159463.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.3274126946926117,
"learning_rate": 0.0001983716139385641,
"loss": 0.6727,
"mean_token_accuracy": 0.8409291505813599,
"num_tokens": 166878.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.33483415842056274,
"learning_rate": 0.0001981122789824607,
"loss": 0.656,
"mean_token_accuracy": 0.8487405478954315,
"num_tokens": 174314.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.3158458173274994,
"learning_rate": 0.00019783398573307428,
"loss": 0.7133,
"mean_token_accuracy": 0.8301410675048828,
"num_tokens": 181966.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.3395407199859619,
"learning_rate": 0.00019753678796517282,
"loss": 0.7214,
"mean_token_accuracy": 0.8315837681293488,
"num_tokens": 189637.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.3301332890987396,
"learning_rate": 0.00019722074310645553,
"loss": 0.65,
"mean_token_accuracy": 0.8509158194065094,
"num_tokens": 196866.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.40064746141433716,
"learning_rate": 0.00019688591222645607,
"loss": 0.6879,
"mean_token_accuracy": 0.8388471305370331,
"num_tokens": 204527.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.36539191007614136,
"learning_rate": 0.000196532360024742,
"loss": 0.7129,
"mean_token_accuracy": 0.8327633142471313,
"num_tokens": 212217.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.32001280784606934,
"learning_rate": 0.0001961601548184129,
"loss": 0.6097,
"mean_token_accuracy": 0.8550100326538086,
"num_tokens": 219611.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.3553815484046936,
"learning_rate": 0.00019576936852889936,
"loss": 0.664,
"mean_token_accuracy": 0.8454612195491791,
"num_tokens": 227201.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.37485066056251526,
"learning_rate": 0.00019536007666806556,
"loss": 0.6167,
"mean_token_accuracy": 0.8543617725372314,
"num_tokens": 234596.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.43772801756858826,
"learning_rate": 0.0001949323583236181,
"loss": 0.6297,
"mean_token_accuracy": 0.848662257194519,
"num_tokens": 242008.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.4182124137878418,
"learning_rate": 0.0001944862961438239,
"loss": 0.6675,
"mean_token_accuracy": 0.8380049467086792,
"num_tokens": 249776.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.3301289975643158,
"learning_rate": 0.00019402197632153992,
"loss": 0.6575,
"mean_token_accuracy": 0.8471685945987701,
"num_tokens": 257319.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.35300567746162415,
"learning_rate": 0.00019353948857755803,
"loss": 0.5979,
"mean_token_accuracy": 0.8560113310813904,
"num_tokens": 264828.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.3664567768573761,
"learning_rate": 0.00019303892614326836,
"loss": 0.5948,
"mean_token_accuracy": 0.8638049066066742,
"num_tokens": 272172.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.3352532386779785,
"learning_rate": 0.00019252038574264405,
"loss": 0.6585,
"mean_token_accuracy": 0.844391405582428,
"num_tokens": 279813.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.4468683898448944,
"learning_rate": 0.00019198396757355118,
"loss": 0.6146,
"mean_token_accuracy": 0.8511447310447693,
"num_tokens": 287537.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.3902146518230438,
"learning_rate": 0.00019142977528838762,
"loss": 0.5993,
"mean_token_accuracy": 0.8533865213394165,
"num_tokens": 295085.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.3714890778064728,
"learning_rate": 0.00019085791597405404,
"loss": 0.6601,
"mean_token_accuracy": 0.8435452580451965,
"num_tokens": 302853.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.35523873567581177,
"learning_rate": 0.00019026850013126157,
"loss": 0.6153,
"mean_token_accuracy": 0.8525647222995758,
"num_tokens": 310507.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.35029295086860657,
"learning_rate": 0.00018966164165317966,
"loss": 0.5312,
"mean_token_accuracy": 0.8702357113361359,
"num_tokens": 317912.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.38241031765937805,
"learning_rate": 0.00018903745780342839,
"loss": 0.6103,
"mean_token_accuracy": 0.855758547782898,
"num_tokens": 325400.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.4096700847148895,
"learning_rate": 0.0001883960691934196,
"loss": 0.5746,
"mean_token_accuracy": 0.8615990579128265,
"num_tokens": 333086.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.37658724188804626,
"learning_rate": 0.00018773759975905098,
"loss": 0.5288,
"mean_token_accuracy": 0.8693232238292694,
"num_tokens": 340578.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.43547865748405457,
"learning_rate": 0.00018706217673675811,
"loss": 0.6485,
"mean_token_accuracy": 0.8440962433815002,
"num_tokens": 348586.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.4606596827507019,
"learning_rate": 0.0001863699306389282,
"loss": 0.5552,
"mean_token_accuracy": 0.8659605085849762,
"num_tokens": 356174.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.4326448142528534,
"learning_rate": 0.00018566099522868119,
"loss": 0.5145,
"mean_token_accuracy": 0.8702480494976044,
"num_tokens": 363805.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.4241434633731842,
"learning_rate": 0.00018493550749402278,
"loss": 0.6031,
"mean_token_accuracy": 0.8582789897918701,
"num_tokens": 371462.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.4271712005138397,
"learning_rate": 0.00018419360762137395,
"loss": 0.5618,
"mean_token_accuracy": 0.8646855652332306,
"num_tokens": 379019.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.40694111585617065,
"learning_rate": 0.00018343543896848273,
"loss": 0.5195,
"mean_token_accuracy": 0.8710185289382935,
"num_tokens": 386380.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.40776747465133667,
"learning_rate": 0.00018266114803672318,
"loss": 0.5566,
"mean_token_accuracy": 0.8674687147140503,
"num_tokens": 393867.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.4121972620487213,
"learning_rate": 0.00018187088444278674,
"loss": 0.5482,
"mean_token_accuracy": 0.8711592853069305,
"num_tokens": 401609.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.40399909019470215,
"learning_rate": 0.00018106480088977172,
"loss": 0.5687,
"mean_token_accuracy": 0.8622486889362335,
"num_tokens": 409264.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.41347479820251465,
"learning_rate": 0.00018024305313767646,
"loss": 0.5048,
"mean_token_accuracy": 0.8774301111698151,
"num_tokens": 416527.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.44538500905036926,
"learning_rate": 0.00017940579997330165,
"loss": 0.4789,
"mean_token_accuracy": 0.8834721446037292,
"num_tokens": 424091.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.5161186456680298,
"learning_rate": 0.00017855320317956784,
"loss": 0.5374,
"mean_token_accuracy": 0.867156058549881,
"num_tokens": 431859.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.4894382953643799,
"learning_rate": 0.00017768542750425426,
"loss": 0.5479,
"mean_token_accuracy": 0.8681759834289551,
"num_tokens": 439429.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.4625523090362549,
"learning_rate": 0.0001768026406281642,
"loss": 0.587,
"mean_token_accuracy": 0.8580531179904938,
"num_tokens": 447417.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.4163782000541687,
"learning_rate": 0.00017590501313272415,
"loss": 0.5592,
"mean_token_accuracy": 0.868916928768158,
"num_tokens": 455053.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.4515700042247772,
"learning_rate": 0.00017499271846702213,
"loss": 0.4692,
"mean_token_accuracy": 0.8839752674102783,
"num_tokens": 462553.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.48304829001426697,
"learning_rate": 0.00017406593291429217,
"loss": 0.4951,
"mean_token_accuracy": 0.8761360943317413,
"num_tokens": 470057.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.4670911729335785,
"learning_rate": 0.00017312483555785086,
"loss": 0.4412,
"mean_token_accuracy": 0.8923192024230957,
"num_tokens": 477410.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.4475160241127014,
"learning_rate": 0.00017216960824649303,
"loss": 0.4687,
"mean_token_accuracy": 0.8837877810001373,
"num_tokens": 485000.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.4836560785770416,
"learning_rate": 0.00017120043555935298,
"loss": 0.4642,
"mean_token_accuracy": 0.886978417634964,
"num_tokens": 492576.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.5065037608146667,
"learning_rate": 0.0001702175047702382,
"loss": 0.5121,
"mean_token_accuracy": 0.8710624575614929,
"num_tokens": 500413.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.4843185245990753,
"learning_rate": 0.00016922100581144228,
"loss": 0.5384,
"mean_token_accuracy": 0.8697362542152405,
"num_tokens": 508117.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.5202386379241943,
"learning_rate": 0.00016821113123704424,
"loss": 0.4639,
"mean_token_accuracy": 0.8836866319179535,
"num_tokens": 515746.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.4895678460597992,
"learning_rate": 0.00016718807618570106,
"loss": 0.4422,
"mean_token_accuracy": 0.8906868398189545,
"num_tokens": 523013.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.5349318981170654,
"learning_rate": 0.00016615203834294119,
"loss": 0.4428,
"mean_token_accuracy": 0.8886107206344604,
"num_tokens": 530452.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.48844024538993835,
"learning_rate": 0.00016510321790296525,
"loss": 0.4153,
"mean_token_accuracy": 0.8925909399986267,
"num_tokens": 537855.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.5755529999732971,
"learning_rate": 0.00016404181752996289,
"loss": 0.4864,
"mean_token_accuracy": 0.8765636086463928,
"num_tokens": 545421.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.45479002594947815,
"learning_rate": 0.00016296804231895142,
"loss": 0.3651,
"mean_token_accuracy": 0.9048753976821899,
"num_tokens": 552909.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.49108317494392395,
"learning_rate": 0.00016188209975614542,
"loss": 0.45,
"mean_token_accuracy": 0.8858565986156464,
"num_tokens": 560702.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.46213510632514954,
"learning_rate": 0.00016078419967886402,
"loss": 0.3958,
"mean_token_accuracy": 0.9005838930606842,
"num_tokens": 568245.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.5798938870429993,
"learning_rate": 0.00015967455423498387,
"loss": 0.3912,
"mean_token_accuracy": 0.9034214019775391,
"num_tokens": 575857.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.5185940861701965,
"learning_rate": 0.00015855337784194577,
"loss": 0.3628,
"mean_token_accuracy": 0.9065321683883667,
"num_tokens": 583441.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.5182363390922546,
"learning_rate": 0.00015742088714532247,
"loss": 0.4174,
"mean_token_accuracy": 0.8943608999252319,
"num_tokens": 591106.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.5182363390922546,
"learning_rate": 0.00015627730097695638,
"loss": 0.4455,
"mean_token_accuracy": 0.8872870206832886,
"num_tokens": 594953.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.823184072971344,
"learning_rate": 0.00015512284031267437,
"loss": 0.2927,
"mean_token_accuracy": 0.9254479706287384,
"num_tokens": 602519.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.4461751878261566,
"learning_rate": 0.00015395772822958845,
"loss": 0.2936,
"mean_token_accuracy": 0.9253770411014557,
"num_tokens": 610085.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.5058058500289917,
"learning_rate": 0.00015278218986299074,
"loss": 0.235,
"mean_token_accuracy": 0.9344533979892731,
"num_tokens": 617710.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.6525824069976807,
"learning_rate": 0.0001515964523628501,
"loss": 0.2901,
"mean_token_accuracy": 0.9262363314628601,
"num_tokens": 625223.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.6204919815063477,
"learning_rate": 0.00015040074484992,
"loss": 0.2371,
"mean_token_accuracy": 0.9375110268592834,
"num_tokens": 632672.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.4697447419166565,
"learning_rate": 0.00014919529837146528,
"loss": 0.2389,
"mean_token_accuracy": 0.9337205290794373,
"num_tokens": 640267.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.5069385170936584,
"learning_rate": 0.00014798034585661695,
"loss": 0.2394,
"mean_token_accuracy": 0.9344863593578339,
"num_tokens": 647855.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.512169599533081,
"learning_rate": 0.0001467561220713628,
"loss": 0.3004,
"mean_token_accuracy": 0.9232901930809021,
"num_tokens": 655347.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.5167611837387085,
"learning_rate": 0.0001455228635731839,
"loss": 0.261,
"mean_token_accuracy": 0.9302393794059753,
"num_tokens": 662908.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.43430718779563904,
"learning_rate": 0.00014428080866534396,
"loss": 0.2426,
"mean_token_accuracy": 0.9376973807811737,
"num_tokens": 670227.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.44046974182128906,
"learning_rate": 0.00014303019735084226,
"loss": 0.2484,
"mean_token_accuracy": 0.9353660345077515,
"num_tokens": 677733.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.5374375581741333,
"learning_rate": 0.00014177127128603745,
"loss": 0.2681,
"mean_token_accuracy": 0.9323221743106842,
"num_tokens": 685450.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.507544219493866,
"learning_rate": 0.0001405042737339524,
"loss": 0.2522,
"mean_token_accuracy": 0.9334528148174286,
"num_tokens": 693379.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.5681467056274414,
"learning_rate": 0.0001392294495172681,
"loss": 0.2381,
"mean_token_accuracy": 0.9384985864162445,
"num_tokens": 701006.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.5037748217582703,
"learning_rate": 0.00013794704497101655,
"loss": 0.248,
"mean_token_accuracy": 0.9311998784542084,
"num_tokens": 708222.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.4543361961841583,
"learning_rate": 0.0001366573078949813,
"loss": 0.2709,
"mean_token_accuracy": 0.927354484796524,
"num_tokens": 715815.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.47324758768081665,
"learning_rate": 0.00013536048750581494,
"loss": 0.2349,
"mean_token_accuracy": 0.941594272851944,
"num_tokens": 723177.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.4437101185321808,
"learning_rate": 0.00013405683438888282,
"loss": 0.2264,
"mean_token_accuracy": 0.9379465878009796,
"num_tokens": 730685.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.3893497884273529,
"learning_rate": 0.00013274660044984224,
"loss": 0.2139,
"mean_token_accuracy": 0.9428676962852478,
"num_tokens": 738399.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.47590160369873047,
"learning_rate": 0.00013143003886596669,
"loss": 0.2622,
"mean_token_accuracy": 0.9279411733150482,
"num_tokens": 746096.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.5140976309776306,
"learning_rate": 0.0001301074040372242,
"loss": 0.2063,
"mean_token_accuracy": 0.9456835091114044,
"num_tokens": 753562.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.438860148191452,
"learning_rate": 0.00012877895153711935,
"loss": 0.2382,
"mean_token_accuracy": 0.9374182820320129,
"num_tokens": 761282.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.6094561815261841,
"learning_rate": 0.0001274449380633089,
"loss": 0.2339,
"mean_token_accuracy": 0.9405188262462616,
"num_tokens": 768815.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.5217446088790894,
"learning_rate": 0.00012610562138799978,
"loss": 0.2705,
"mean_token_accuracy": 0.9315881133079529,
"num_tokens": 776490.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.5095704197883606,
"learning_rate": 0.00012476126030813963,
"loss": 0.2185,
"mean_token_accuracy": 0.9398861229419708,
"num_tokens": 784055.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.5053628087043762,
"learning_rate": 0.0001234121145954094,
"loss": 0.2421,
"mean_token_accuracy": 0.9382818043231964,
"num_tokens": 791644.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.43147337436676025,
"learning_rate": 0.0001220584449460274,
"loss": 0.207,
"mean_token_accuracy": 0.9434195756912231,
"num_tokens": 799207.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.40620630979537964,
"learning_rate": 0.00012070051293037492,
"loss": 0.2302,
"mean_token_accuracy": 0.9408184885978699,
"num_tokens": 806854.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.4834441542625427,
"learning_rate": 0.00011933858094245281,
"loss": 0.2031,
"mean_token_accuracy": 0.9470761716365814,
"num_tokens": 814335.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.45893028378486633,
"learning_rate": 0.00011797291214917881,
"loss": 0.2137,
"mean_token_accuracy": 0.9417379796504974,
"num_tokens": 822129.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.5153368711471558,
"learning_rate": 0.00011660377043953588,
"loss": 0.2402,
"mean_token_accuracy": 0.938307374715805,
"num_tokens": 830009.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.4056824743747711,
"learning_rate": 0.0001152314203735805,
"loss": 0.2025,
"mean_token_accuracy": 0.9457784295082092,
"num_tokens": 837339.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.4811604619026184,
"learning_rate": 0.0001138561271313219,
"loss": 0.2136,
"mean_token_accuracy": 0.9439316689968109,
"num_tokens": 844962.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.4947657585144043,
"learning_rate": 0.00011247815646148087,
"loss": 0.228,
"mean_token_accuracy": 0.9374533593654633,
"num_tokens": 852442.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.4831300973892212,
"learning_rate": 0.00011109777463013915,
"loss": 0.1971,
"mean_token_accuracy": 0.950575202703476,
"num_tokens": 859705.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.4768920838832855,
"learning_rate": 0.0001097152483692886,
"loss": 0.2014,
"mean_token_accuracy": 0.9461125135421753,
"num_tokens": 867320.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.4603787362575531,
"learning_rate": 0.00010833084482529048,
"loss": 0.2343,
"mean_token_accuracy": 0.9413523375988007,
"num_tokens": 874840.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.4399753510951996,
"learning_rate": 0.00010694483150725458,
"loss": 0.2075,
"mean_token_accuracy": 0.948328822851181,
"num_tokens": 882451.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.483257919549942,
"learning_rate": 0.00010555747623534831,
"loss": 0.1985,
"mean_token_accuracy": 0.9503215551376343,
"num_tokens": 890101.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.45524635910987854,
"learning_rate": 0.00010416904708904548,
"loss": 0.1954,
"mean_token_accuracy": 0.9504112601280212,
"num_tokens": 897607.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.44008612632751465,
"learning_rate": 0.00010277981235532541,
"loss": 0.212,
"mean_token_accuracy": 0.9436098635196686,
"num_tokens": 905191.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.46399325132369995,
"learning_rate": 0.00010139004047683151,
"loss": 0.1785,
"mean_token_accuracy": 0.9537560045719147,
"num_tokens": 912523.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.4352799654006958,
"learning_rate": 0.0001,
"loss": 0.2154,
"mean_token_accuracy": 0.9456183016300201,
"num_tokens": 920273.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.4239864945411682,
"learning_rate": 9.860995952316851e-05,
"loss": 0.1709,
"mean_token_accuracy": 0.9573950469493866,
"num_tokens": 927864.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.5215359926223755,
"learning_rate": 9.722018764467461e-05,
"loss": 0.1979,
"mean_token_accuracy": 0.9506862163543701,
"num_tokens": 935454.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.5375974178314209,
"learning_rate": 9.583095291095453e-05,
"loss": 0.2106,
"mean_token_accuracy": 0.9438005685806274,
"num_tokens": 943211.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.47071683406829834,
"learning_rate": 9.444252376465171e-05,
"loss": 0.188,
"mean_token_accuracy": 0.9508571922779083,
"num_tokens": 950616.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.4657401442527771,
"learning_rate": 9.305516849274541e-05,
"loss": 0.1689,
"mean_token_accuracy": 0.9533426463603973,
"num_tokens": 958183.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.3836834132671356,
"learning_rate": 9.166915517470953e-05,
"loss": 0.1871,
"mean_token_accuracy": 0.9511479735374451,
"num_tokens": 965678.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.46731242537498474,
"learning_rate": 9.028475163071141e-05,
"loss": 0.175,
"mean_token_accuracy": 0.9512114226818085,
"num_tokens": 973262.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.4541298747062683,
"learning_rate": 8.890222536986085e-05,
"loss": 0.216,
"mean_token_accuracy": 0.9441925585269928,
"num_tokens": 980887.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.3771320581436157,
"learning_rate": 8.752184353851916e-05,
"loss": 0.1853,
"mean_token_accuracy": 0.952815979719162,
"num_tokens": 988463.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.4476616382598877,
"learning_rate": 8.614387286867814e-05,
"loss": 0.1831,
"mean_token_accuracy": 0.9529510140419006,
"num_tokens": 996025.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.3788629174232483,
"learning_rate": 8.47685796264195e-05,
"loss": 0.194,
"mean_token_accuracy": 0.953939825296402,
"num_tokens": 1003816.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.4536489248275757,
"learning_rate": 8.339622956046417e-05,
"loss": 0.1445,
"mean_token_accuracy": 0.9615342020988464,
"num_tokens": 1011351.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.41908058524131775,
"learning_rate": 8.202708785082121e-05,
"loss": 0.1623,
"mean_token_accuracy": 0.9565115869045258,
"num_tokens": 1018759.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.475737988948822,
"learning_rate": 8.066141905754723e-05,
"loss": 0.1725,
"mean_token_accuracy": 0.9567776024341583,
"num_tokens": 1026286.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.349752813577652,
"learning_rate": 7.929948706962508e-05,
"loss": 0.1255,
"mean_token_accuracy": 0.9658943712711334,
"num_tokens": 1033770.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.39415788650512695,
"learning_rate": 7.794155505397261e-05,
"loss": 0.1577,
"mean_token_accuracy": 0.9558201730251312,
"num_tokens": 1041659.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.41134774684906006,
"learning_rate": 7.658788540459062e-05,
"loss": 0.2085,
"mean_token_accuracy": 0.948514312505722,
"num_tokens": 1049150.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.5479893088340759,
"learning_rate": 7.523873969186039e-05,
"loss": 0.1663,
"mean_token_accuracy": 0.9547719359397888,
"num_tokens": 1056784.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.36870864033699036,
"learning_rate": 7.389437861200024e-05,
"loss": 0.1485,
"mean_token_accuracy": 0.9612145721912384,
"num_tokens": 1064184.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.39722350239753723,
"learning_rate": 7.25550619366911e-05,
"loss": 0.1559,
"mean_token_accuracy": 0.9604078829288483,
"num_tokens": 1072029.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.40050435066223145,
"learning_rate": 7.122104846288064e-05,
"loss": 0.1384,
"mean_token_accuracy": 0.962491363286972,
"num_tokens": 1079591.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.391933411359787,
"learning_rate": 6.989259596277582e-05,
"loss": 0.1792,
"mean_token_accuracy": 0.9526192545890808,
"num_tokens": 1087338.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.456823468208313,
"learning_rate": 6.85699611340333e-05,
"loss": 0.1416,
"mean_token_accuracy": 0.9639541804790497,
"num_tokens": 1094894.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.3839541971683502,
"learning_rate": 6.725339955015777e-05,
"loss": 0.1389,
"mean_token_accuracy": 0.9645723104476929,
"num_tokens": 1102210.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.33357852697372437,
"learning_rate": 6.594316561111724e-05,
"loss": 0.1557,
"mean_token_accuracy": 0.96068075299263,
"num_tokens": 1109738.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.4593367874622345,
"learning_rate": 6.46395124941851e-05,
"loss": 0.1708,
"mean_token_accuracy": 0.9570999145507812,
"num_tokens": 1117265.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.36817261576652527,
"learning_rate": 6.334269210501875e-05,
"loss": 0.1372,
"mean_token_accuracy": 0.9625333249568939,
"num_tokens": 1124990.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.3801482617855072,
"learning_rate": 6.205295502898348e-05,
"loss": 0.121,
"mean_token_accuracy": 0.966850757598877,
"num_tokens": 1132869.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.34184518456459045,
"learning_rate": 6.0770550482731924e-05,
"loss": 0.1642,
"mean_token_accuracy": 0.9570443630218506,
"num_tokens": 1140785.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.4241127669811249,
"learning_rate": 5.9495726266047605e-05,
"loss": 0.1556,
"mean_token_accuracy": 0.9617596864700317,
"num_tokens": 1148603.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.3778759837150574,
"learning_rate": 5.8228728713962543e-05,
"loss": 0.114,
"mean_token_accuracy": 0.9691117703914642,
"num_tokens": 1156149.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.4415481686592102,
"learning_rate": 5.696980264915777e-05,
"loss": 0.1381,
"mean_token_accuracy": 0.9639294743537903,
"num_tokens": 1163656.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.3667774796485901,
"learning_rate": 5.571919133465605e-05,
"loss": 0.1433,
"mean_token_accuracy": 0.9641910791397095,
"num_tokens": 1171141.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.36915281414985657,
"learning_rate": 5.447713642681612e-05,
"loss": 0.1358,
"mean_token_accuracy": 0.9650273025035858,
"num_tokens": 1178660.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.33127549290657043,
"learning_rate": 5.324387792863719e-05,
"loss": 0.1873,
"mean_token_accuracy": 0.955519050359726,
"num_tokens": 1186058.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.5781312584877014,
"learning_rate": 5.201965414338308e-05,
"loss": 0.0995,
"mean_token_accuracy": 0.9694300293922424,
"num_tokens": 1189950.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.22299824655056,
"learning_rate": 5.080470162853472e-05,
"loss": 0.0994,
"mean_token_accuracy": 0.9725558459758759,
"num_tokens": 1197547.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.20428019762039185,
"learning_rate": 4.959925515008002e-05,
"loss": 0.0981,
"mean_token_accuracy": 0.9740569591522217,
"num_tokens": 1205124.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.31417369842529297,
"learning_rate": 4.840354763714991e-05,
"loss": 0.1128,
"mean_token_accuracy": 0.9698708951473236,
"num_tokens": 1212386.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.2941860258579254,
"learning_rate": 4.7217810137009274e-05,
"loss": 0.1198,
"mean_token_accuracy": 0.9675701260566711,
"num_tokens": 1219879.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.22774440050125122,
"learning_rate": 4.604227177041156e-05,
"loss": 0.0893,
"mean_token_accuracy": 0.9721206724643707,
"num_tokens": 1227344.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.20990870893001556,
"learning_rate": 4.487715968732568e-05,
"loss": 0.0897,
"mean_token_accuracy": 0.9736597836017609,
"num_tokens": 1234928.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.23693329095840454,
"learning_rate": 4.372269902304363e-05,
"loss": 0.1029,
"mean_token_accuracy": 0.9717570245265961,
"num_tokens": 1242719.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.2804213762283325,
"learning_rate": 4.257911285467754e-05,
"loss": 0.1026,
"mean_token_accuracy": 0.9732820093631744,
"num_tokens": 1250304.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.28864407539367676,
"learning_rate": 4.144662215805426e-05,
"loss": 0.1022,
"mean_token_accuracy": 0.9715860486030579,
"num_tokens": 1258105.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.3053213059902191,
"learning_rate": 4.0325445765016145e-05,
"loss": 0.0995,
"mean_token_accuracy": 0.9712505340576172,
"num_tokens": 1265853.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.3355003893375397,
"learning_rate": 3.921580032113602e-05,
"loss": 0.1006,
"mean_token_accuracy": 0.9709268808364868,
"num_tokens": 1273220.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.3259344696998596,
"learning_rate": 3.8117900243854595e-05,
"loss": 0.1025,
"mean_token_accuracy": 0.969818502664566,
"num_tokens": 1280636.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.25363364815711975,
"learning_rate": 3.7031957681048604e-05,
"loss": 0.0899,
"mean_token_accuracy": 0.973079264163971,
"num_tokens": 1288501.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.33290988206863403,
"learning_rate": 3.595818247003713e-05,
"loss": 0.1036,
"mean_token_accuracy": 0.9701544344425201,
"num_tokens": 1296181.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.23419451713562012,
"learning_rate": 3.489678209703475e-05,
"loss": 0.0922,
"mean_token_accuracy": 0.9737686514854431,
"num_tokens": 1303725.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.25606822967529297,
"learning_rate": 3.3847961657058845e-05,
"loss": 0.093,
"mean_token_accuracy": 0.9733033776283264,
"num_tokens": 1311315.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.2730248272418976,
"learning_rate": 3.281192381429894e-05,
"loss": 0.0945,
"mean_token_accuracy": 0.9713809788227081,
"num_tokens": 1318647.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.25905486941337585,
"learning_rate": 3.178886876295578e-05,
"loss": 0.094,
"mean_token_accuracy": 0.9720935225486755,
"num_tokens": 1326203.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.21770048141479492,
"learning_rate": 3.077899418855772e-05,
"loss": 0.095,
"mean_token_accuracy": 0.972693145275116,
"num_tokens": 1333736.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.21615815162658691,
"learning_rate": 2.9782495229761808e-05,
"loss": 0.0959,
"mean_token_accuracy": 0.9725539982318878,
"num_tokens": 1341160.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.29113566875457764,
"learning_rate": 2.879956444064703e-05,
"loss": 0.1089,
"mean_token_accuracy": 0.9702370762825012,
"num_tokens": 1348750.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.298750102519989,
"learning_rate": 2.783039175350699e-05,
"loss": 0.1037,
"mean_token_accuracy": 0.9692679643630981,
"num_tokens": 1356569.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.2231506109237671,
"learning_rate": 2.6875164442149147e-05,
"loss": 0.0955,
"mean_token_accuracy": 0.9708955585956573,
"num_tokens": 1364056.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.2941678762435913,
"learning_rate": 2.5934067085707834e-05,
"loss": 0.0996,
"mean_token_accuracy": 0.9709564447402954,
"num_tokens": 1371659.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.1835247129201889,
"learning_rate": 2.500728153297788e-05,
"loss": 0.0942,
"mean_token_accuracy": 0.9725345969200134,
"num_tokens": 1379147.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.28575223684310913,
"learning_rate": 2.409498686727587e-05,
"loss": 0.091,
"mean_token_accuracy": 0.9733802676200867,
"num_tokens": 1386765.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.2463427037000656,
"learning_rate": 2.3197359371835802e-05,
"loss": 0.086,
"mean_token_accuracy": 0.9742932319641113,
"num_tokens": 1394618.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.1932964026927948,
"learning_rate": 2.2314572495745746e-05,
"loss": 0.093,
"mean_token_accuracy": 0.9733997285366058,
"num_tokens": 1402323.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.31327489018440247,
"learning_rate": 2.1446796820432167e-05,
"loss": 0.099,
"mean_token_accuracy": 0.9692893028259277,
"num_tokens": 1409811.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.2381305992603302,
"learning_rate": 2.0594200026698363e-05,
"loss": 0.0944,
"mean_token_accuracy": 0.9724844992160797,
"num_tokens": 1417360.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.2520155906677246,
"learning_rate": 1.9756946862323535e-05,
"loss": 0.096,
"mean_token_accuracy": 0.9740960896015167,
"num_tokens": 1425115.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.183822900056839,
"learning_rate": 1.8935199110228275e-05,
"loss": 0.0911,
"mean_token_accuracy": 0.9735857248306274,
"num_tokens": 1432795.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.20515495538711548,
"learning_rate": 1.8129115557213262e-05,
"loss": 0.0936,
"mean_token_accuracy": 0.9743000864982605,
"num_tokens": 1440406.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.34444665908813477,
"learning_rate": 1.7338851963276825e-05,
"loss": 0.0932,
"mean_token_accuracy": 0.9733559787273407,
"num_tokens": 1447979.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.19695109128952026,
"learning_rate": 1.656456103151728e-05,
"loss": 0.0941,
"mean_token_accuracy": 0.9739238917827606,
"num_tokens": 1455491.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.21720701456069946,
"learning_rate": 1.580639237862608e-05,
"loss": 0.0928,
"mean_token_accuracy": 0.9730100631713867,
"num_tokens": 1463007.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.21964755654335022,
"learning_rate": 1.5064492505977234e-05,
"loss": 0.0892,
"mean_token_accuracy": 0.9735862016677856,
"num_tokens": 1470901.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.1945929080247879,
"learning_rate": 1.433900477131882e-05,
"loss": 0.0889,
"mean_token_accuracy": 0.9738577008247375,
"num_tokens": 1478538.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.2573101818561554,
"learning_rate": 1.363006936107183e-05,
"loss": 0.1038,
"mean_token_accuracy": 0.9701802432537079,
"num_tokens": 1486088.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.1948987990617752,
"learning_rate": 1.29378232632419e-05,
"loss": 0.0892,
"mean_token_accuracy": 0.9724543392658234,
"num_tokens": 1493703.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.2603251338005066,
"learning_rate": 1.2262400240949023e-05,
"loss": 0.1021,
"mean_token_accuracy": 0.9714818596839905,
"num_tokens": 1501201.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.23355098068714142,
"learning_rate": 1.1603930806580444e-05,
"loss": 0.0918,
"mean_token_accuracy": 0.9732993841171265,
"num_tokens": 1508923.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.26143762469291687,
"learning_rate": 1.0962542196571634e-05,
"loss": 0.0978,
"mean_token_accuracy": 0.9724924564361572,
"num_tokens": 1516403.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.19722925126552582,
"learning_rate": 1.0338358346820353e-05,
"loss": 0.0881,
"mean_token_accuracy": 0.9745533466339111,
"num_tokens": 1524170.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.24879567325115204,
"learning_rate": 9.731499868738447e-06,
"loss": 0.1024,
"mean_token_accuracy": 0.9704383015632629,
"num_tokens": 1531711.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.18551646173000336,
"learning_rate": 9.142084025945984e-06,
"loss": 0.0887,
"mean_token_accuracy": 0.9731804728507996,
"num_tokens": 1539309.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.19061441719532013,
"learning_rate": 8.570224711612385e-06,
"loss": 0.0906,
"mean_token_accuracy": 0.9726877510547638,
"num_tokens": 1546875.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.22261416912078857,
"learning_rate": 8.016032426448817e-06,
"loss": 0.0918,
"mean_token_accuracy": 0.9743273258209229,
"num_tokens": 1554385.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.23906444013118744,
"learning_rate": 7.479614257355971e-06,
"loss": 0.0954,
"mean_token_accuracy": 0.9728935956954956,
"num_tokens": 1562049.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.2492460012435913,
"learning_rate": 6.961073856731648e-06,
"loss": 0.096,
"mean_token_accuracy": 0.9732304513454437,
"num_tokens": 1569434.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.278803288936615,
"learning_rate": 6.460511422441984e-06,
"loss": 0.0969,
"mean_token_accuracy": 0.9719431698322296,
"num_tokens": 1576927.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.24254080653190613,
"learning_rate": 5.978023678460099e-06,
"loss": 0.1048,
"mean_token_accuracy": 0.9709457159042358,
"num_tokens": 1584531.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.21079742908477783,
"learning_rate": 5.5137038561761115e-06,
"loss": 0.0892,
"mean_token_accuracy": 0.9735644161701202,
"num_tokens": 1591932.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.25342243909835815,
"learning_rate": 5.067641676381918e-06,
"loss": 0.0972,
"mean_token_accuracy": 0.972582995891571,
"num_tokens": 1599678.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.1848929524421692,
"learning_rate": 4.639923331934471e-06,
"loss": 0.0904,
"mean_token_accuracy": 0.97327721118927,
"num_tokens": 1607234.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.21844594180583954,
"learning_rate": 4.230631471100655e-06,
"loss": 0.098,
"mean_token_accuracy": 0.9728173017501831,
"num_tokens": 1614910.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.29655906558036804,
"learning_rate": 3.839845181587098e-06,
"loss": 0.1011,
"mean_token_accuracy": 0.9714401960372925,
"num_tokens": 1622358.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.19944727420806885,
"learning_rate": 3.467639975257997e-06,
"loss": 0.0913,
"mean_token_accuracy": 0.9719055891036987,
"num_tokens": 1629753.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.21076829731464386,
"learning_rate": 3.1140877735439387e-06,
"loss": 0.0894,
"mean_token_accuracy": 0.97262904047966,
"num_tokens": 1637347.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.2960074245929718,
"learning_rate": 2.7792568935444796e-06,
"loss": 0.0913,
"mean_token_accuracy": 0.9721934199333191,
"num_tokens": 1644999.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.185651496052742,
"learning_rate": 2.4632120348272003e-06,
"loss": 0.0888,
"mean_token_accuracy": 0.9723814725875854,
"num_tokens": 1652451.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.22099068760871887,
"learning_rate": 2.166014266925731e-06,
"loss": 0.0892,
"mean_token_accuracy": 0.9731795489788055,
"num_tokens": 1660101.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.2245907336473465,
"learning_rate": 1.88772101753929e-06,
"loss": 0.0939,
"mean_token_accuracy": 0.9741968810558319,
"num_tokens": 1667978.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.2256772518157959,
"learning_rate": 1.6283860614358936e-06,
"loss": 0.0914,
"mean_token_accuracy": 0.9728004634380341,
"num_tokens": 1675469.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.19644984602928162,
"learning_rate": 1.3880595100613792e-06,
"loss": 0.0927,
"mean_token_accuracy": 0.9726226031780243,
"num_tokens": 1682842.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.22729112207889557,
"learning_rate": 1.1667878018564171e-06,
"loss": 0.0903,
"mean_token_accuracy": 0.9728392660617828,
"num_tokens": 1690491.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.21743939816951752,
"learning_rate": 9.64613693283123e-07,
"loss": 0.0956,
"mean_token_accuracy": 0.9711977541446686,
"num_tokens": 1697950.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.23131786286830902,
"learning_rate": 7.815762505632096e-07,
"loss": 0.0908,
"mean_token_accuracy": 0.972371518611908,
"num_tokens": 1705398.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.19186514616012573,
"learning_rate": 6.177108421292266e-07,
"loss": 0.0896,
"mean_token_accuracy": 0.9753928780555725,
"num_tokens": 1712737.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.15185010433197021,
"learning_rate": 4.7304913179025965e-07,
"loss": 0.0849,
"mean_token_accuracy": 0.9748527407646179,
"num_tokens": 1720472.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.1807604730129242,
"learning_rate": 3.4761907261356976e-07,
"loss": 0.0887,
"mean_token_accuracy": 0.9729354083538055,
"num_tokens": 1727956.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.23020492494106293,
"learning_rate": 2.414449015231357e-07,
"loss": 0.0956,
"mean_token_accuracy": 0.9716013371944427,
"num_tokens": 1735520.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.3724834620952606,
"learning_rate": 1.545471346164007e-07,
"loss": 0.1087,
"mean_token_accuracy": 0.9690882861614227,
"num_tokens": 1743213.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.3106917142868042,
"learning_rate": 8.694256319987659e-08,
"loss": 0.0969,
"mean_token_accuracy": 0.9719716310501099,
"num_tokens": 1750982.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.19371703267097473,
"learning_rate": 3.8644250544594975e-08,
"loss": 0.0889,
"mean_token_accuracy": 0.972972184419632,
"num_tokens": 1758448.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.29524293541908264,
"learning_rate": 9.661529361892907e-09,
"loss": 0.0987,
"mean_token_accuracy": 0.9689370095729828,
"num_tokens": 1766023.0,
"step": 234
},
{
"epoch": 2.968152866242038,
"step": 234,
"total_flos": 1.0230160156105114e+17,
"train_loss": 0.3221458565985036,
"train_runtime": 403.0093,
"train_samples_per_second": 37.22,
"train_steps_per_second": 0.581
}
],
"logging_steps": 1.0,
"max_steps": 234,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.0230160156105114e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}