Instructions to use anhdai312/MathDeepSeek with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use anhdai312/MathDeepSeek with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("anhdai312/MathDeepSeek", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use anhdai312/MathDeepSeek with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for anhdai312/MathDeepSeek to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="anhdai312/MathDeepSeek", max_seq_length=2048, )
| { | |
| "best_global_step": 360, | |
| "best_metric": 0.7657684087753296, | |
| "best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-360", | |
| "epoch": 2.946395563770795, | |
| "eval_steps": 10, | |
| "global_step": 400, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0073937153419593345, | |
| "grad_norm": 1.8413621187210083, | |
| "learning_rate": 0.0, | |
| "loss": 3.3830344676971436, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.014787430683918669, | |
| "grad_norm": 2.0386335849761963, | |
| "learning_rate": 1e-05, | |
| "loss": 3.3935506343841553, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.022181146025878003, | |
| "grad_norm": 1.3186163902282715, | |
| "learning_rate": 2e-05, | |
| "loss": 2.732372999191284, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.029574861367837338, | |
| "grad_norm": 0.8585255146026611, | |
| "learning_rate": 3e-05, | |
| "loss": 1.7911560535430908, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.036968576709796676, | |
| "grad_norm": 2.3140437602996826, | |
| "learning_rate": 4e-05, | |
| "loss": 3.907397508621216, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.04436229205175601, | |
| "grad_norm": 1.8938422203063965, | |
| "learning_rate": 5e-05, | |
| "loss": 3.279386281967163, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.051756007393715345, | |
| "grad_norm": 1.4730970859527588, | |
| "learning_rate": 4.987593052109181e-05, | |
| "loss": 2.3899412155151367, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.059149722735674676, | |
| "grad_norm": 2.0717520713806152, | |
| "learning_rate": 4.9751861042183624e-05, | |
| "loss": 2.698546886444092, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.066543438077634, | |
| "grad_norm": 2.2532644271850586, | |
| "learning_rate": 4.962779156327544e-05, | |
| "loss": 2.6992990970611572, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.07393715341959335, | |
| "grad_norm": 0.9512649178504944, | |
| "learning_rate": 4.950372208436725e-05, | |
| "loss": 1.5360665321350098, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.07393715341959335, | |
| "eval_loss": 2.1426639556884766, | |
| "eval_runtime": 15.4966, | |
| "eval_samples_per_second": 3.227, | |
| "eval_steps_per_second": 0.839, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.08133086876155268, | |
| "grad_norm": 2.03887939453125, | |
| "learning_rate": 4.937965260545906e-05, | |
| "loss": 2.421833038330078, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.08872458410351201, | |
| "grad_norm": 0.5944672226905823, | |
| "learning_rate": 4.9255583126550866e-05, | |
| "loss": 0.9898832440376282, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.09611829944547134, | |
| "grad_norm": 2.314751148223877, | |
| "learning_rate": 4.9131513647642677e-05, | |
| "loss": 2.684413433074951, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.10351201478743069, | |
| "grad_norm": 3.032388687133789, | |
| "learning_rate": 4.9007444168734494e-05, | |
| "loss": 2.4992518424987793, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.11090573012939002, | |
| "grad_norm": 0.7512603998184204, | |
| "learning_rate": 4.8883374689826305e-05, | |
| "loss": 1.5652904510498047, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.11829944547134935, | |
| "grad_norm": 2.1483168601989746, | |
| "learning_rate": 4.8759305210918115e-05, | |
| "loss": 2.0766830444335938, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.1256931608133087, | |
| "grad_norm": 2.4940130710601807, | |
| "learning_rate": 4.8635235732009926e-05, | |
| "loss": 2.14599609375, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.133086876155268, | |
| "grad_norm": 2.58516788482666, | |
| "learning_rate": 4.851116625310174e-05, | |
| "loss": 2.678130865097046, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.14048059149722736, | |
| "grad_norm": 2.1474788188934326, | |
| "learning_rate": 4.8387096774193554e-05, | |
| "loss": 2.2763166427612305, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.1478743068391867, | |
| "grad_norm": 1.9327515363693237, | |
| "learning_rate": 4.8263027295285364e-05, | |
| "loss": 2.2559866905212402, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.1478743068391867, | |
| "eval_loss": 1.6021771430969238, | |
| "eval_runtime": 14.2984, | |
| "eval_samples_per_second": 3.497, | |
| "eval_steps_per_second": 0.909, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.15526802218114602, | |
| "grad_norm": 2.2944412231445312, | |
| "learning_rate": 4.8138957816377175e-05, | |
| "loss": 1.956355333328247, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.16266173752310537, | |
| "grad_norm": 2.040257453918457, | |
| "learning_rate": 4.8014888337468986e-05, | |
| "loss": 1.9789292812347412, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.17005545286506468, | |
| "grad_norm": 1.0300790071487427, | |
| "learning_rate": 4.7890818858560796e-05, | |
| "loss": 1.229586124420166, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.17744916820702403, | |
| "grad_norm": 1.9188776016235352, | |
| "learning_rate": 4.776674937965261e-05, | |
| "loss": 2.252568006515503, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.18484288354898337, | |
| "grad_norm": 0.6468012928962708, | |
| "learning_rate": 4.764267990074442e-05, | |
| "loss": 0.6744526028633118, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.1922365988909427, | |
| "grad_norm": 2.002753257751465, | |
| "learning_rate": 4.751861042183623e-05, | |
| "loss": 1.6015210151672363, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.19963031423290203, | |
| "grad_norm": 2.264155864715576, | |
| "learning_rate": 4.739454094292804e-05, | |
| "loss": 1.9130383729934692, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.20702402957486138, | |
| "grad_norm": 2.164496421813965, | |
| "learning_rate": 4.7270471464019856e-05, | |
| "loss": 1.3355481624603271, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.2144177449168207, | |
| "grad_norm": 0.9778668880462646, | |
| "learning_rate": 4.7146401985111667e-05, | |
| "loss": 1.042914867401123, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.22181146025878004, | |
| "grad_norm": 2.4416842460632324, | |
| "learning_rate": 4.702233250620348e-05, | |
| "loss": 1.7163786888122559, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.22181146025878004, | |
| "eval_loss": 1.4117671251296997, | |
| "eval_runtime": 14.7244, | |
| "eval_samples_per_second": 3.396, | |
| "eval_steps_per_second": 0.883, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.22920517560073936, | |
| "grad_norm": 2.560103416442871, | |
| "learning_rate": 4.689826302729529e-05, | |
| "loss": 1.7177424430847168, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.2365988909426987, | |
| "grad_norm": 2.265031576156616, | |
| "learning_rate": 4.67741935483871e-05, | |
| "loss": 1.6933493614196777, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.24399260628465805, | |
| "grad_norm": 1.3352007865905762, | |
| "learning_rate": 4.665012406947891e-05, | |
| "loss": 1.289770483970642, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.2513863216266174, | |
| "grad_norm": 2.739408016204834, | |
| "learning_rate": 4.652605459057072e-05, | |
| "loss": 1.892009973526001, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.2587800369685767, | |
| "grad_norm": 0.848355770111084, | |
| "learning_rate": 4.640198511166253e-05, | |
| "loss": 0.7992806434631348, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.266173752310536, | |
| "grad_norm": 1.8914474248886108, | |
| "learning_rate": 4.627791563275434e-05, | |
| "loss": 1.014716386795044, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.2735674676524954, | |
| "grad_norm": 1.8833729028701782, | |
| "learning_rate": 4.615384615384616e-05, | |
| "loss": 1.8454999923706055, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.2809611829944547, | |
| "grad_norm": 1.0575491189956665, | |
| "learning_rate": 4.602977667493797e-05, | |
| "loss": 0.7487808465957642, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.28835489833641403, | |
| "grad_norm": 1.340802550315857, | |
| "learning_rate": 4.590570719602978e-05, | |
| "loss": 1.2484363317489624, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.2957486136783734, | |
| "grad_norm": 2.2050182819366455, | |
| "learning_rate": 4.578163771712159e-05, | |
| "loss": 1.4082988500595093, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.2957486136783734, | |
| "eval_loss": 1.2930712699890137, | |
| "eval_runtime": 14.6012, | |
| "eval_samples_per_second": 3.424, | |
| "eval_steps_per_second": 0.89, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.3031423290203327, | |
| "grad_norm": 1.9534828662872314, | |
| "learning_rate": 4.56575682382134e-05, | |
| "loss": 1.0940786600112915, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.31053604436229204, | |
| "grad_norm": 2.391226053237915, | |
| "learning_rate": 4.553349875930522e-05, | |
| "loss": 1.151236891746521, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.3179297597042514, | |
| "grad_norm": 2.316863536834717, | |
| "learning_rate": 4.540942928039703e-05, | |
| "loss": 1.2963817119598389, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.32532347504621073, | |
| "grad_norm": 0.9008046984672546, | |
| "learning_rate": 4.528535980148884e-05, | |
| "loss": 0.6621055006980896, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.33271719038817005, | |
| "grad_norm": 1.6869522333145142, | |
| "learning_rate": 4.516129032258064e-05, | |
| "loss": 1.0466387271881104, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.34011090573012936, | |
| "grad_norm": 2.317460536956787, | |
| "learning_rate": 4.5037220843672454e-05, | |
| "loss": 1.386788249015808, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.34750462107208874, | |
| "grad_norm": 1.1141090393066406, | |
| "learning_rate": 4.491315136476427e-05, | |
| "loss": 1.6268982887268066, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.35489833641404805, | |
| "grad_norm": 2.659907341003418, | |
| "learning_rate": 4.478908188585608e-05, | |
| "loss": 1.7704683542251587, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.36229205175600737, | |
| "grad_norm": 1.2273647785186768, | |
| "learning_rate": 4.466501240694789e-05, | |
| "loss": 0.8123348951339722, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.36968576709796674, | |
| "grad_norm": 1.389702320098877, | |
| "learning_rate": 4.45409429280397e-05, | |
| "loss": 1.4599602222442627, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.36968576709796674, | |
| "eval_loss": 1.2116776704788208, | |
| "eval_runtime": 14.659, | |
| "eval_samples_per_second": 3.411, | |
| "eval_steps_per_second": 0.887, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.37707948243992606, | |
| "grad_norm": 2.522132635116577, | |
| "learning_rate": 4.441687344913151e-05, | |
| "loss": 1.606776237487793, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.3844731977818854, | |
| "grad_norm": 2.7198681831359863, | |
| "learning_rate": 4.429280397022333e-05, | |
| "loss": 1.5745301246643066, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.39186691312384475, | |
| "grad_norm": 2.941790819168091, | |
| "learning_rate": 4.416873449131514e-05, | |
| "loss": 1.1630932092666626, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.39926062846580407, | |
| "grad_norm": 2.5087671279907227, | |
| "learning_rate": 4.404466501240695e-05, | |
| "loss": 1.0615822076797485, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.4066543438077634, | |
| "grad_norm": 2.8571765422821045, | |
| "learning_rate": 4.392059553349876e-05, | |
| "loss": 1.4195711612701416, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.41404805914972276, | |
| "grad_norm": 2.0848593711853027, | |
| "learning_rate": 4.379652605459057e-05, | |
| "loss": 1.430311679840088, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.4214417744916821, | |
| "grad_norm": 2.469207286834717, | |
| "learning_rate": 4.3672456575682384e-05, | |
| "loss": 1.1654510498046875, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.4288354898336414, | |
| "grad_norm": 2.1722354888916016, | |
| "learning_rate": 4.3548387096774194e-05, | |
| "loss": 1.0921519994735718, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.43622920517560076, | |
| "grad_norm": 1.956921100616455, | |
| "learning_rate": 4.3424317617866005e-05, | |
| "loss": 1.6206697225570679, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.4436229205175601, | |
| "grad_norm": 2.6034843921661377, | |
| "learning_rate": 4.3300248138957816e-05, | |
| "loss": 1.1840237379074097, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.4436229205175601, | |
| "eval_loss": 1.1138910055160522, | |
| "eval_runtime": 14.7491, | |
| "eval_samples_per_second": 3.39, | |
| "eval_steps_per_second": 0.881, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.4510166358595194, | |
| "grad_norm": 3.262052297592163, | |
| "learning_rate": 4.317617866004963e-05, | |
| "loss": 1.0644543170928955, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.4584103512014787, | |
| "grad_norm": 2.89835262298584, | |
| "learning_rate": 4.3052109181141444e-05, | |
| "loss": 1.783827543258667, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.4658040665434381, | |
| "grad_norm": 2.8248863220214844, | |
| "learning_rate": 4.2928039702233254e-05, | |
| "loss": 1.4520047903060913, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.4731977818853974, | |
| "grad_norm": 2.2947335243225098, | |
| "learning_rate": 4.2803970223325065e-05, | |
| "loss": 1.1205673217773438, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.4805914972273567, | |
| "grad_norm": 2.2984018325805664, | |
| "learning_rate": 4.2679900744416875e-05, | |
| "loss": 0.9593680500984192, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.4879852125693161, | |
| "grad_norm": 3.3136825561523438, | |
| "learning_rate": 4.2555831265508686e-05, | |
| "loss": 1.685524344444275, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.4953789279112754, | |
| "grad_norm": 2.308732509613037, | |
| "learning_rate": 4.2431761786600497e-05, | |
| "loss": 1.4158852100372314, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.5027726432532348, | |
| "grad_norm": 2.764207363128662, | |
| "learning_rate": 4.230769230769231e-05, | |
| "loss": 1.1706503629684448, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.5101663585951941, | |
| "grad_norm": 2.7320327758789062, | |
| "learning_rate": 4.218362282878412e-05, | |
| "loss": 0.978042721748352, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.5175600739371534, | |
| "grad_norm": 2.549668550491333, | |
| "learning_rate": 4.205955334987593e-05, | |
| "loss": 1.1643197536468506, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.5175600739371534, | |
| "eval_loss": 1.0553016662597656, | |
| "eval_runtime": 14.6825, | |
| "eval_samples_per_second": 3.405, | |
| "eval_steps_per_second": 0.885, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.5249537892791127, | |
| "grad_norm": 3.1705875396728516, | |
| "learning_rate": 4.1935483870967746e-05, | |
| "loss": 1.828012228012085, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.532347504621072, | |
| "grad_norm": 3.109196424484253, | |
| "learning_rate": 4.1811414392059556e-05, | |
| "loss": 0.7359082698822021, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.5397412199630314, | |
| "grad_norm": 1.8801664113998413, | |
| "learning_rate": 4.168734491315137e-05, | |
| "loss": 1.0972692966461182, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.5471349353049908, | |
| "grad_norm": 2.4713597297668457, | |
| "learning_rate": 4.156327543424318e-05, | |
| "loss": 0.8450818061828613, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.5545286506469501, | |
| "grad_norm": 2.952817440032959, | |
| "learning_rate": 4.1439205955334995e-05, | |
| "loss": 1.0884149074554443, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.5619223659889094, | |
| "grad_norm": 2.8595173358917236, | |
| "learning_rate": 4.1315136476426805e-05, | |
| "loss": 1.139454960823059, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.5693160813308688, | |
| "grad_norm": 3.3091001510620117, | |
| "learning_rate": 4.119106699751861e-05, | |
| "loss": 1.3391754627227783, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.5767097966728281, | |
| "grad_norm": 3.2456319332122803, | |
| "learning_rate": 4.106699751861042e-05, | |
| "loss": 1.3041037321090698, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.5841035120147874, | |
| "grad_norm": 2.745225667953491, | |
| "learning_rate": 4.094292803970223e-05, | |
| "loss": 1.4664080142974854, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.5914972273567468, | |
| "grad_norm": 3.86385178565979, | |
| "learning_rate": 4.081885856079405e-05, | |
| "loss": 1.0991761684417725, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.5914972273567468, | |
| "eval_loss": 1.024406909942627, | |
| "eval_runtime": 14.6773, | |
| "eval_samples_per_second": 3.407, | |
| "eval_steps_per_second": 0.886, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.5988909426987061, | |
| "grad_norm": 3.2133798599243164, | |
| "learning_rate": 4.069478908188586e-05, | |
| "loss": 1.482096791267395, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.6062846580406654, | |
| "grad_norm": 2.4578635692596436, | |
| "learning_rate": 4.057071960297767e-05, | |
| "loss": 0.95296311378479, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.6136783733826248, | |
| "grad_norm": 3.0704939365386963, | |
| "learning_rate": 4.044665012406948e-05, | |
| "loss": 1.4384511709213257, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.6210720887245841, | |
| "grad_norm": 3.1470870971679688, | |
| "learning_rate": 4.032258064516129e-05, | |
| "loss": 0.8680386543273926, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.6284658040665434, | |
| "grad_norm": 2.6569035053253174, | |
| "learning_rate": 4.019851116625311e-05, | |
| "loss": 1.0536919832229614, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.6358595194085028, | |
| "grad_norm": 2.6955459117889404, | |
| "learning_rate": 4.007444168734492e-05, | |
| "loss": 1.2974836826324463, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.6432532347504621, | |
| "grad_norm": 2.881974458694458, | |
| "learning_rate": 3.995037220843673e-05, | |
| "loss": 0.9090498089790344, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.6506469500924215, | |
| "grad_norm": 2.85056209564209, | |
| "learning_rate": 3.982630272952854e-05, | |
| "loss": 1.142749547958374, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.6580406654343808, | |
| "grad_norm": 2.879006862640381, | |
| "learning_rate": 3.970223325062035e-05, | |
| "loss": 0.8405839204788208, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.6654343807763401, | |
| "grad_norm": 3.156893253326416, | |
| "learning_rate": 3.957816377171216e-05, | |
| "loss": 0.8235164880752563, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.6654343807763401, | |
| "eval_loss": 0.9943150877952576, | |
| "eval_runtime": 14.7351, | |
| "eval_samples_per_second": 3.393, | |
| "eval_steps_per_second": 0.882, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.6728280961182994, | |
| "grad_norm": 2.9643747806549072, | |
| "learning_rate": 3.945409429280397e-05, | |
| "loss": 1.1688953638076782, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.6802218114602587, | |
| "grad_norm": 2.8159196376800537, | |
| "learning_rate": 3.933002481389578e-05, | |
| "loss": 1.1848558187484741, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.6876155268022182, | |
| "grad_norm": 3.1563498973846436, | |
| "learning_rate": 3.920595533498759e-05, | |
| "loss": 1.133997917175293, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.6950092421441775, | |
| "grad_norm": 2.359210252761841, | |
| "learning_rate": 3.908188585607941e-05, | |
| "loss": 0.8476818799972534, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.7024029574861368, | |
| "grad_norm": 3.1568336486816406, | |
| "learning_rate": 3.895781637717122e-05, | |
| "loss": 0.8584047555923462, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.7097966728280961, | |
| "grad_norm": 3.0946948528289795, | |
| "learning_rate": 3.883374689826303e-05, | |
| "loss": 0.8942509889602661, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.7171903881700554, | |
| "grad_norm": 2.688983201980591, | |
| "learning_rate": 3.870967741935484e-05, | |
| "loss": 0.9744483232498169, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.7245841035120147, | |
| "grad_norm": 3.7019851207733154, | |
| "learning_rate": 3.858560794044665e-05, | |
| "loss": 1.0812692642211914, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.7319778188539742, | |
| "grad_norm": 3.413264274597168, | |
| "learning_rate": 3.846153846153846e-05, | |
| "loss": 1.2246288061141968, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.7393715341959335, | |
| "grad_norm": 3.1463723182678223, | |
| "learning_rate": 3.8337468982630273e-05, | |
| "loss": 0.9551287889480591, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.7393715341959335, | |
| "eval_loss": 0.9603383541107178, | |
| "eval_runtime": 14.5967, | |
| "eval_samples_per_second": 3.425, | |
| "eval_steps_per_second": 0.891, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.7467652495378928, | |
| "grad_norm": 3.331590414047241, | |
| "learning_rate": 3.8213399503722084e-05, | |
| "loss": 1.0125172138214111, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.7541589648798521, | |
| "grad_norm": 1.8756176233291626, | |
| "learning_rate": 3.8089330024813895e-05, | |
| "loss": 1.4402893781661987, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.7615526802218114, | |
| "grad_norm": 2.8599133491516113, | |
| "learning_rate": 3.7965260545905705e-05, | |
| "loss": 0.9122072458267212, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.7689463955637708, | |
| "grad_norm": 2.963188648223877, | |
| "learning_rate": 3.784119106699752e-05, | |
| "loss": 0.9114301204681396, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.7763401109057301, | |
| "grad_norm": 3.2771401405334473, | |
| "learning_rate": 3.771712158808933e-05, | |
| "loss": 0.9420968890190125, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.7837338262476895, | |
| "grad_norm": 1.1317050457000732, | |
| "learning_rate": 3.7593052109181144e-05, | |
| "loss": 0.5487204790115356, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.7911275415896488, | |
| "grad_norm": 1.592030644416809, | |
| "learning_rate": 3.7468982630272954e-05, | |
| "loss": 0.6232097744941711, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.7985212569316081, | |
| "grad_norm": 2.3476905822753906, | |
| "learning_rate": 3.734491315136477e-05, | |
| "loss": 1.3079752922058105, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.8059149722735675, | |
| "grad_norm": 3.5496175289154053, | |
| "learning_rate": 3.7220843672456576e-05, | |
| "loss": 1.1627793312072754, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.8133086876155268, | |
| "grad_norm": 2.3397562503814697, | |
| "learning_rate": 3.7096774193548386e-05, | |
| "loss": 1.2222082614898682, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.8133086876155268, | |
| "eval_loss": 0.9296000599861145, | |
| "eval_runtime": 14.6623, | |
| "eval_samples_per_second": 3.41, | |
| "eval_steps_per_second": 0.887, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.8207024029574861, | |
| "grad_norm": 3.8196728229522705, | |
| "learning_rate": 3.69727047146402e-05, | |
| "loss": 1.4748249053955078, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.8280961182994455, | |
| "grad_norm": 3.2699241638183594, | |
| "learning_rate": 3.684863523573201e-05, | |
| "loss": 1.1485276222229004, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.8354898336414048, | |
| "grad_norm": 3.5778534412384033, | |
| "learning_rate": 3.6724565756823825e-05, | |
| "loss": 1.1845570802688599, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.8428835489833642, | |
| "grad_norm": 3.3727245330810547, | |
| "learning_rate": 3.6600496277915635e-05, | |
| "loss": 0.8769504427909851, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.8502772643253235, | |
| "grad_norm": 3.280014753341675, | |
| "learning_rate": 3.6476426799007446e-05, | |
| "loss": 1.2621396780014038, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.8576709796672828, | |
| "grad_norm": 3.677361488342285, | |
| "learning_rate": 3.635235732009926e-05, | |
| "loss": 1.1793429851531982, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.8650646950092421, | |
| "grad_norm": 2.788851261138916, | |
| "learning_rate": 3.622828784119107e-05, | |
| "loss": 1.0340873003005981, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.8724584103512015, | |
| "grad_norm": 2.7919020652770996, | |
| "learning_rate": 3.6104218362282885e-05, | |
| "loss": 1.1847516298294067, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.8798521256931608, | |
| "grad_norm": 1.7291911840438843, | |
| "learning_rate": 3.5980148883374695e-05, | |
| "loss": 0.8953083157539368, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.8872458410351202, | |
| "grad_norm": 3.1404361724853516, | |
| "learning_rate": 3.5856079404466506e-05, | |
| "loss": 1.0396440029144287, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.8872458410351202, | |
| "eval_loss": 0.9078614711761475, | |
| "eval_runtime": 14.7987, | |
| "eval_samples_per_second": 3.379, | |
| "eval_steps_per_second": 0.878, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.8946395563770795, | |
| "grad_norm": 1.7119001150131226, | |
| "learning_rate": 3.573200992555831e-05, | |
| "loss": 0.7708945274353027, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.9020332717190388, | |
| "grad_norm": 2.804116725921631, | |
| "learning_rate": 3.560794044665012e-05, | |
| "loss": 1.2879009246826172, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.9094269870609981, | |
| "grad_norm": 3.6296403408050537, | |
| "learning_rate": 3.548387096774194e-05, | |
| "loss": 1.2780061960220337, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.9168207024029574, | |
| "grad_norm": 4.171301364898682, | |
| "learning_rate": 3.535980148883375e-05, | |
| "loss": 1.2573845386505127, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.9242144177449169, | |
| "grad_norm": 1.6946974992752075, | |
| "learning_rate": 3.523573200992556e-05, | |
| "loss": 1.5690746307373047, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.9316081330868762, | |
| "grad_norm": 1.9035532474517822, | |
| "learning_rate": 3.511166253101737e-05, | |
| "loss": 0.6932345628738403, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.9390018484288355, | |
| "grad_norm": 1.6593624353408813, | |
| "learning_rate": 3.498759305210919e-05, | |
| "loss": 0.5941351056098938, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.9463955637707948, | |
| "grad_norm": 2.5471839904785156, | |
| "learning_rate": 3.4863523573201e-05, | |
| "loss": 0.4706844687461853, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.9537892791127541, | |
| "grad_norm": 1.5462491512298584, | |
| "learning_rate": 3.473945409429281e-05, | |
| "loss": 1.3614616394042969, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.9611829944547134, | |
| "grad_norm": 2.8795769214630127, | |
| "learning_rate": 3.461538461538462e-05, | |
| "loss": 1.2096058130264282, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.9611829944547134, | |
| "eval_loss": 0.8965096473693848, | |
| "eval_runtime": 14.6807, | |
| "eval_samples_per_second": 3.406, | |
| "eval_steps_per_second": 0.886, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.9685767097966729, | |
| "grad_norm": 1.1051534414291382, | |
| "learning_rate": 3.449131513647643e-05, | |
| "loss": 0.4035143256187439, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.9759704251386322, | |
| "grad_norm": 3.4675469398498535, | |
| "learning_rate": 3.436724565756824e-05, | |
| "loss": 0.61115962266922, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.9833641404805915, | |
| "grad_norm": 3.4992542266845703, | |
| "learning_rate": 3.424317617866005e-05, | |
| "loss": 1.0233020782470703, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.9907578558225508, | |
| "grad_norm": 2.9477298259735107, | |
| "learning_rate": 3.411910669975186e-05, | |
| "loss": 1.1910691261291504, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.9981515711645101, | |
| "grad_norm": 3.404331684112549, | |
| "learning_rate": 3.399503722084367e-05, | |
| "loss": 0.8914271593093872, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 7.629513740539551, | |
| "learning_rate": 3.387096774193548e-05, | |
| "loss": 0.7269555330276489, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 1.0073937153419594, | |
| "grad_norm": 3.7028565406799316, | |
| "learning_rate": 3.37468982630273e-05, | |
| "loss": 1.024603247642517, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 1.0147874306839186, | |
| "grad_norm": 3.0595295429229736, | |
| "learning_rate": 3.362282878411911e-05, | |
| "loss": 1.0184353590011597, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 1.022181146025878, | |
| "grad_norm": 1.5020614862442017, | |
| "learning_rate": 3.349875930521092e-05, | |
| "loss": 0.5547934770584106, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 1.0295748613678373, | |
| "grad_norm": 2.5641324520111084, | |
| "learning_rate": 3.337468982630273e-05, | |
| "loss": 0.8376579284667969, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.0295748613678373, | |
| "eval_loss": 0.8667128682136536, | |
| "eval_runtime": 14.7254, | |
| "eval_samples_per_second": 3.396, | |
| "eval_steps_per_second": 0.883, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.0369685767097967, | |
| "grad_norm": 2.9328815937042236, | |
| "learning_rate": 3.325062034739454e-05, | |
| "loss": 0.6763349175453186, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 1.044362292051756, | |
| "grad_norm": 2.459362506866455, | |
| "learning_rate": 3.312655086848635e-05, | |
| "loss": 0.9117762446403503, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 1.0517560073937153, | |
| "grad_norm": 2.7116122245788574, | |
| "learning_rate": 3.300248138957816e-05, | |
| "loss": 0.5921486616134644, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 1.0591497227356748, | |
| "grad_norm": 2.9720282554626465, | |
| "learning_rate": 3.2878411910669974e-05, | |
| "loss": 0.607153058052063, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 1.066543438077634, | |
| "grad_norm": 2.249736785888672, | |
| "learning_rate": 3.2754342431761784e-05, | |
| "loss": 0.8126924633979797, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 1.0739371534195934, | |
| "grad_norm": 2.706214427947998, | |
| "learning_rate": 3.26302729528536e-05, | |
| "loss": 0.6490439772605896, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 1.0813308687615526, | |
| "grad_norm": 3.738187074661255, | |
| "learning_rate": 3.250620347394541e-05, | |
| "loss": 0.819773256778717, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 1.088724584103512, | |
| "grad_norm": 3.121695041656494, | |
| "learning_rate": 3.238213399503722e-05, | |
| "loss": 0.6183997392654419, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 1.0961182994454712, | |
| "grad_norm": 4.132612228393555, | |
| "learning_rate": 3.2258064516129034e-05, | |
| "loss": 0.767497181892395, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 1.1035120147874307, | |
| "grad_norm": 2.0239458084106445, | |
| "learning_rate": 3.2133995037220844e-05, | |
| "loss": 1.0948212146759033, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.1035120147874307, | |
| "eval_loss": 0.8530704975128174, | |
| "eval_runtime": 14.7071, | |
| "eval_samples_per_second": 3.4, | |
| "eval_steps_per_second": 0.884, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.11090573012939, | |
| "grad_norm": 3.3580844402313232, | |
| "learning_rate": 3.200992555831266e-05, | |
| "loss": 0.5469967126846313, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 1.1182994454713493, | |
| "grad_norm": 2.974302053451538, | |
| "learning_rate": 3.188585607940447e-05, | |
| "loss": 0.47518885135650635, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 1.1256931608133087, | |
| "grad_norm": 3.033684492111206, | |
| "learning_rate": 3.176178660049628e-05, | |
| "loss": 0.7291224002838135, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 1.133086876155268, | |
| "grad_norm": 3.733419418334961, | |
| "learning_rate": 3.1637717121588087e-05, | |
| "loss": 0.7658367156982422, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 1.1404805914972274, | |
| "grad_norm": 3.2456040382385254, | |
| "learning_rate": 3.15136476426799e-05, | |
| "loss": 0.8450358510017395, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 1.1478743068391868, | |
| "grad_norm": 3.432668924331665, | |
| "learning_rate": 3.1389578163771715e-05, | |
| "loss": 0.6418715715408325, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 1.155268022181146, | |
| "grad_norm": 2.9463069438934326, | |
| "learning_rate": 3.1265508684863525e-05, | |
| "loss": 1.3750693798065186, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 1.1626617375231054, | |
| "grad_norm": 3.7486484050750732, | |
| "learning_rate": 3.1141439205955336e-05, | |
| "loss": 0.7545527815818787, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 1.1700554528650646, | |
| "grad_norm": 1.1400007009506226, | |
| "learning_rate": 3.1017369727047146e-05, | |
| "loss": 0.4953806400299072, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 1.177449168207024, | |
| "grad_norm": 1.9228570461273193, | |
| "learning_rate": 3.089330024813896e-05, | |
| "loss": 0.5013564825057983, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.177449168207024, | |
| "eval_loss": 0.8432470560073853, | |
| "eval_runtime": 14.7161, | |
| "eval_samples_per_second": 3.398, | |
| "eval_steps_per_second": 0.883, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.1848428835489835, | |
| "grad_norm": 2.0466220378875732, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "loss": 0.8158243298530579, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 1.1922365988909427, | |
| "grad_norm": 3.307772636413574, | |
| "learning_rate": 3.0645161290322585e-05, | |
| "loss": 0.7138271927833557, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 1.1996303142329021, | |
| "grad_norm": 1.4036277532577515, | |
| "learning_rate": 3.0521091811414396e-05, | |
| "loss": 0.391914963722229, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 1.2070240295748613, | |
| "grad_norm": 4.2623610496521, | |
| "learning_rate": 3.0397022332506203e-05, | |
| "loss": 1.1953831911087036, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 1.2144177449168208, | |
| "grad_norm": 1.5940158367156982, | |
| "learning_rate": 3.027295285359802e-05, | |
| "loss": 0.5775357484817505, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 1.22181146025878, | |
| "grad_norm": 2.010906219482422, | |
| "learning_rate": 3.014888337468983e-05, | |
| "loss": 0.9656795859336853, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 1.2292051756007394, | |
| "grad_norm": 3.457470178604126, | |
| "learning_rate": 3.0024813895781638e-05, | |
| "loss": 0.6407822966575623, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 1.2365988909426986, | |
| "grad_norm": 3.8961503505706787, | |
| "learning_rate": 2.990074441687345e-05, | |
| "loss": 0.6025644540786743, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 1.243992606284658, | |
| "grad_norm": 1.594923496246338, | |
| "learning_rate": 2.977667493796526e-05, | |
| "loss": 0.5624638199806213, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 1.2513863216266174, | |
| "grad_norm": 1.737376093864441, | |
| "learning_rate": 2.9652605459057077e-05, | |
| "loss": 1.1991184949874878, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.2513863216266174, | |
| "eval_loss": 0.8280792236328125, | |
| "eval_runtime": 14.5811, | |
| "eval_samples_per_second": 3.429, | |
| "eval_steps_per_second": 0.892, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.2587800369685767, | |
| "grad_norm": 3.161806583404541, | |
| "learning_rate": 2.9528535980148887e-05, | |
| "loss": 0.5611181259155273, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 1.266173752310536, | |
| "grad_norm": 3.9646661281585693, | |
| "learning_rate": 2.9404466501240698e-05, | |
| "loss": 0.9791576862335205, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 1.2735674676524953, | |
| "grad_norm": 2.939876079559326, | |
| "learning_rate": 2.9280397022332505e-05, | |
| "loss": 0.6126688718795776, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 1.2809611829944547, | |
| "grad_norm": 3.9292585849761963, | |
| "learning_rate": 2.9156327543424316e-05, | |
| "loss": 0.8683090209960938, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 1.2883548983364141, | |
| "grad_norm": 1.8785326480865479, | |
| "learning_rate": 2.9032258064516133e-05, | |
| "loss": 0.46358799934387207, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.2957486136783734, | |
| "grad_norm": 3.62471079826355, | |
| "learning_rate": 2.8908188585607944e-05, | |
| "loss": 0.764897346496582, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 1.3031423290203328, | |
| "grad_norm": 3.8324623107910156, | |
| "learning_rate": 2.8784119106699754e-05, | |
| "loss": 0.6231205463409424, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 1.310536044362292, | |
| "grad_norm": 2.560826539993286, | |
| "learning_rate": 2.8660049627791565e-05, | |
| "loss": 0.4221123456954956, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 1.3179297597042514, | |
| "grad_norm": 4.285940647125244, | |
| "learning_rate": 2.8535980148883372e-05, | |
| "loss": 0.9465740919113159, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 1.3253234750462108, | |
| "grad_norm": 1.7949848175048828, | |
| "learning_rate": 2.841191066997519e-05, | |
| "loss": 0.680899977684021, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.3253234750462108, | |
| "eval_loss": 0.8194607496261597, | |
| "eval_runtime": 14.8751, | |
| "eval_samples_per_second": 3.361, | |
| "eval_steps_per_second": 0.874, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.33271719038817, | |
| "grad_norm": 2.0182719230651855, | |
| "learning_rate": 2.8287841191067e-05, | |
| "loss": 0.613226592540741, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 1.3401109057301293, | |
| "grad_norm": 4.6714887619018555, | |
| "learning_rate": 2.816377171215881e-05, | |
| "loss": 0.8670039176940918, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 1.3475046210720887, | |
| "grad_norm": 4.056960582733154, | |
| "learning_rate": 2.803970223325062e-05, | |
| "loss": 0.7967749834060669, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 1.354898336414048, | |
| "grad_norm": 4.206955909729004, | |
| "learning_rate": 2.7915632754342435e-05, | |
| "loss": 1.0874457359313965, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 1.3622920517560073, | |
| "grad_norm": 3.817035436630249, | |
| "learning_rate": 2.7791563275434246e-05, | |
| "loss": 0.95674729347229, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 1.3696857670979667, | |
| "grad_norm": 3.6514406204223633, | |
| "learning_rate": 2.7667493796526056e-05, | |
| "loss": 0.555774450302124, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 1.377079482439926, | |
| "grad_norm": 3.7338063716888428, | |
| "learning_rate": 2.7543424317617867e-05, | |
| "loss": 0.5461658835411072, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 1.3844731977818854, | |
| "grad_norm": 3.01973295211792, | |
| "learning_rate": 2.7419354838709678e-05, | |
| "loss": 0.9282134771347046, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 1.3918669131238448, | |
| "grad_norm": 3.5295522212982178, | |
| "learning_rate": 2.729528535980149e-05, | |
| "loss": 0.8109346628189087, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 1.399260628465804, | |
| "grad_norm": 3.73514461517334, | |
| "learning_rate": 2.7171215880893302e-05, | |
| "loss": 0.6853020787239075, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.399260628465804, | |
| "eval_loss": 0.8215422630310059, | |
| "eval_runtime": 14.5513, | |
| "eval_samples_per_second": 3.436, | |
| "eval_steps_per_second": 0.893, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.4066543438077634, | |
| "grad_norm": 2.7374188899993896, | |
| "learning_rate": 2.7047146401985113e-05, | |
| "loss": 1.0195677280426025, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 1.4140480591497226, | |
| "grad_norm": 4.187663555145264, | |
| "learning_rate": 2.6923076923076923e-05, | |
| "loss": 1.0480753183364868, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 1.421441774491682, | |
| "grad_norm": 3.276689052581787, | |
| "learning_rate": 2.6799007444168734e-05, | |
| "loss": 0.5181576013565063, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 1.4288354898336415, | |
| "grad_norm": 3.5883798599243164, | |
| "learning_rate": 2.6674937965260548e-05, | |
| "loss": 0.7783234119415283, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 1.4362292051756007, | |
| "grad_norm": 1.0365864038467407, | |
| "learning_rate": 2.655086848635236e-05, | |
| "loss": 0.7230033874511719, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 1.4436229205175601, | |
| "grad_norm": 3.209699869155884, | |
| "learning_rate": 2.642679900744417e-05, | |
| "loss": 0.725004255771637, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 1.4510166358595193, | |
| "grad_norm": 2.7974090576171875, | |
| "learning_rate": 2.630272952853598e-05, | |
| "loss": 0.8251001238822937, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 1.4584103512014788, | |
| "grad_norm": 4.012574195861816, | |
| "learning_rate": 2.617866004962779e-05, | |
| "loss": 0.7500607371330261, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 1.4658040665434382, | |
| "grad_norm": 3.2767927646636963, | |
| "learning_rate": 2.6054590570719604e-05, | |
| "loss": 0.5972156524658203, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 1.4731977818853974, | |
| "grad_norm": 3.665105104446411, | |
| "learning_rate": 2.5930521091811415e-05, | |
| "loss": 0.42983272671699524, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.4731977818853974, | |
| "eval_loss": 0.8120042681694031, | |
| "eval_runtime": 14.6672, | |
| "eval_samples_per_second": 3.409, | |
| "eval_steps_per_second": 0.886, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.4805914972273566, | |
| "grad_norm": 4.322039604187012, | |
| "learning_rate": 2.5806451612903226e-05, | |
| "loss": 0.8239177465438843, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 1.487985212569316, | |
| "grad_norm": 3.681670904159546, | |
| "learning_rate": 2.5682382133995036e-05, | |
| "loss": 0.46425601840019226, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 1.4953789279112755, | |
| "grad_norm": 3.829942226409912, | |
| "learning_rate": 2.5558312655086853e-05, | |
| "loss": 0.5882385969161987, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 1.502772643253235, | |
| "grad_norm": 3.8684608936309814, | |
| "learning_rate": 2.5434243176178664e-05, | |
| "loss": 0.8204436302185059, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 1.510166358595194, | |
| "grad_norm": 4.183191776275635, | |
| "learning_rate": 2.531017369727047e-05, | |
| "loss": 1.1439590454101562, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 1.5175600739371533, | |
| "grad_norm": 3.61912202835083, | |
| "learning_rate": 2.5186104218362282e-05, | |
| "loss": 0.7177018523216248, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 1.5249537892791127, | |
| "grad_norm": 3.1439766883850098, | |
| "learning_rate": 2.5062034739454093e-05, | |
| "loss": 1.0978827476501465, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 1.5323475046210722, | |
| "grad_norm": 1.9132380485534668, | |
| "learning_rate": 2.4937965260545906e-05, | |
| "loss": 0.6175467371940613, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 1.5397412199630314, | |
| "grad_norm": 1.373880386352539, | |
| "learning_rate": 2.481389578163772e-05, | |
| "loss": 0.22940072417259216, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 1.5471349353049908, | |
| "grad_norm": 3.687744379043579, | |
| "learning_rate": 2.468982630272953e-05, | |
| "loss": 0.3838157653808594, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.5471349353049908, | |
| "eval_loss": 0.8064006567001343, | |
| "eval_runtime": 14.6872, | |
| "eval_samples_per_second": 3.404, | |
| "eval_steps_per_second": 0.885, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.55452865064695, | |
| "grad_norm": 2.725609302520752, | |
| "learning_rate": 2.4565756823821338e-05, | |
| "loss": 0.3925488293170929, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 1.5619223659889094, | |
| "grad_norm": 4.170878887176514, | |
| "learning_rate": 2.4441687344913152e-05, | |
| "loss": 0.9177101254463196, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 1.5693160813308689, | |
| "grad_norm": 3.54719877243042, | |
| "learning_rate": 2.4317617866004963e-05, | |
| "loss": 0.3834892213344574, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 1.576709796672828, | |
| "grad_norm": 3.7506401538848877, | |
| "learning_rate": 2.4193548387096777e-05, | |
| "loss": 0.782739520072937, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 1.5841035120147873, | |
| "grad_norm": 1.567891240119934, | |
| "learning_rate": 2.4069478908188587e-05, | |
| "loss": 0.47440165281295776, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 1.5914972273567467, | |
| "grad_norm": 4.019551753997803, | |
| "learning_rate": 2.3945409429280398e-05, | |
| "loss": 0.7724896669387817, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 1.5988909426987061, | |
| "grad_norm": 3.265582323074341, | |
| "learning_rate": 2.382133995037221e-05, | |
| "loss": 0.585466742515564, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 1.6062846580406656, | |
| "grad_norm": 3.6960299015045166, | |
| "learning_rate": 2.369727047146402e-05, | |
| "loss": 0.683808445930481, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 1.6136783733826248, | |
| "grad_norm": 4.092567443847656, | |
| "learning_rate": 2.3573200992555833e-05, | |
| "loss": 0.8049482703208923, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 1.621072088724584, | |
| "grad_norm": 3.318016290664673, | |
| "learning_rate": 2.3449131513647644e-05, | |
| "loss": 0.5561220645904541, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.621072088724584, | |
| "eval_loss": 0.8024477362632751, | |
| "eval_runtime": 14.5996, | |
| "eval_samples_per_second": 3.425, | |
| "eval_steps_per_second": 0.89, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.6284658040665434, | |
| "grad_norm": 5.157983779907227, | |
| "learning_rate": 2.3325062034739454e-05, | |
| "loss": 0.919698178768158, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 1.6358595194085028, | |
| "grad_norm": 3.365602970123291, | |
| "learning_rate": 2.3200992555831265e-05, | |
| "loss": 0.7725900411605835, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 1.6432532347504623, | |
| "grad_norm": 3.9181325435638428, | |
| "learning_rate": 2.307692307692308e-05, | |
| "loss": 0.535124659538269, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 1.6506469500924215, | |
| "grad_norm": 3.7963433265686035, | |
| "learning_rate": 2.295285359801489e-05, | |
| "loss": 0.9627186059951782, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 1.6580406654343807, | |
| "grad_norm": 3.6968164443969727, | |
| "learning_rate": 2.28287841191067e-05, | |
| "loss": 0.8556936979293823, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.66543438077634, | |
| "grad_norm": 4.4114861488342285, | |
| "learning_rate": 2.2704714640198514e-05, | |
| "loss": 0.8419898748397827, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 1.6728280961182995, | |
| "grad_norm": 3.3653135299682617, | |
| "learning_rate": 2.258064516129032e-05, | |
| "loss": 0.4375629127025604, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 1.6802218114602587, | |
| "grad_norm": 2.5058343410491943, | |
| "learning_rate": 2.2456575682382135e-05, | |
| "loss": 0.5678821206092834, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 1.6876155268022182, | |
| "grad_norm": 3.3000216484069824, | |
| "learning_rate": 2.2332506203473946e-05, | |
| "loss": 0.9510512948036194, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 1.6950092421441774, | |
| "grad_norm": 4.843665599822998, | |
| "learning_rate": 2.2208436724565757e-05, | |
| "loss": 1.1221953630447388, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.6950092421441774, | |
| "eval_loss": 0.7935811877250671, | |
| "eval_runtime": 14.7786, | |
| "eval_samples_per_second": 3.383, | |
| "eval_steps_per_second": 0.88, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.7024029574861368, | |
| "grad_norm": 2.4911141395568848, | |
| "learning_rate": 2.208436724565757e-05, | |
| "loss": 1.419028878211975, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 1.7097966728280962, | |
| "grad_norm": 1.9304749965667725, | |
| "learning_rate": 2.196029776674938e-05, | |
| "loss": 0.5840872526168823, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 1.7171903881700554, | |
| "grad_norm": 1.9608324766159058, | |
| "learning_rate": 2.1836228287841192e-05, | |
| "loss": 1.2491809129714966, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 1.7245841035120146, | |
| "grad_norm": 4.504591464996338, | |
| "learning_rate": 2.1712158808933002e-05, | |
| "loss": 0.7342857718467712, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 1.731977818853974, | |
| "grad_norm": 3.7661826610565186, | |
| "learning_rate": 2.1588089330024816e-05, | |
| "loss": 0.5309323072433472, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.7393715341959335, | |
| "grad_norm": 3.5521440505981445, | |
| "learning_rate": 2.1464019851116627e-05, | |
| "loss": 0.4989915192127228, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 1.746765249537893, | |
| "grad_norm": 3.6262974739074707, | |
| "learning_rate": 2.1339950372208438e-05, | |
| "loss": 0.5839136242866516, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 1.7541589648798521, | |
| "grad_norm": 3.896362543106079, | |
| "learning_rate": 2.1215880893300248e-05, | |
| "loss": 1.0018640756607056, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 1.7615526802218113, | |
| "grad_norm": 3.742424249649048, | |
| "learning_rate": 2.109181141439206e-05, | |
| "loss": 0.5923015475273132, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 1.7689463955637708, | |
| "grad_norm": 4.05252742767334, | |
| "learning_rate": 2.0967741935483873e-05, | |
| "loss": 1.1995235681533813, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.7689463955637708, | |
| "eval_loss": 0.7851760983467102, | |
| "eval_runtime": 14.6763, | |
| "eval_samples_per_second": 3.407, | |
| "eval_steps_per_second": 0.886, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.7763401109057302, | |
| "grad_norm": 3.0683846473693848, | |
| "learning_rate": 2.0843672456575683e-05, | |
| "loss": 0.923507809638977, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 1.7837338262476896, | |
| "grad_norm": 4.6438374519348145, | |
| "learning_rate": 2.0719602977667497e-05, | |
| "loss": 0.8670483231544495, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 1.7911275415896488, | |
| "grad_norm": 4.422187328338623, | |
| "learning_rate": 2.0595533498759305e-05, | |
| "loss": 0.7011516094207764, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 1.798521256931608, | |
| "grad_norm": 4.1537675857543945, | |
| "learning_rate": 2.0471464019851115e-05, | |
| "loss": 1.2851660251617432, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 1.8059149722735675, | |
| "grad_norm": 3.753478527069092, | |
| "learning_rate": 2.034739454094293e-05, | |
| "loss": 0.6607624292373657, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 1.8133086876155269, | |
| "grad_norm": 3.5585222244262695, | |
| "learning_rate": 2.022332506203474e-05, | |
| "loss": 0.46847808361053467, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 1.820702402957486, | |
| "grad_norm": 3.6007564067840576, | |
| "learning_rate": 2.0099255583126554e-05, | |
| "loss": 0.5693677663803101, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 1.8280961182994455, | |
| "grad_norm": 3.056473970413208, | |
| "learning_rate": 1.9975186104218364e-05, | |
| "loss": 0.27784496545791626, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 1.8354898336414047, | |
| "grad_norm": 3.8631675243377686, | |
| "learning_rate": 1.9851116625310175e-05, | |
| "loss": 0.6002547144889832, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 1.8428835489833642, | |
| "grad_norm": 4.168581962585449, | |
| "learning_rate": 1.9727047146401986e-05, | |
| "loss": 1.1656219959259033, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.8428835489833642, | |
| "eval_loss": 0.7865164279937744, | |
| "eval_runtime": 14.7045, | |
| "eval_samples_per_second": 3.4, | |
| "eval_steps_per_second": 0.884, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.8502772643253236, | |
| "grad_norm": 3.506394386291504, | |
| "learning_rate": 1.9602977667493796e-05, | |
| "loss": 0.759330153465271, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 1.8576709796672828, | |
| "grad_norm": 4.319957256317139, | |
| "learning_rate": 1.947890818858561e-05, | |
| "loss": 0.9550069570541382, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 1.865064695009242, | |
| "grad_norm": 4.66499662399292, | |
| "learning_rate": 1.935483870967742e-05, | |
| "loss": 0.7672110199928284, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 1.8724584103512014, | |
| "grad_norm": 3.980341672897339, | |
| "learning_rate": 1.923076923076923e-05, | |
| "loss": 1.0426957607269287, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 1.8798521256931608, | |
| "grad_norm": 2.3597588539123535, | |
| "learning_rate": 1.9106699751861042e-05, | |
| "loss": 0.5822687745094299, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 1.8872458410351203, | |
| "grad_norm": 3.7864487171173096, | |
| "learning_rate": 1.8982630272952853e-05, | |
| "loss": 0.6077347993850708, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 1.8946395563770795, | |
| "grad_norm": 2.9949333667755127, | |
| "learning_rate": 1.8858560794044667e-05, | |
| "loss": 0.5098516345024109, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 1.9020332717190387, | |
| "grad_norm": 1.3919459581375122, | |
| "learning_rate": 1.8734491315136477e-05, | |
| "loss": 0.40490952134132385, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 1.9094269870609981, | |
| "grad_norm": 3.4704983234405518, | |
| "learning_rate": 1.8610421836228288e-05, | |
| "loss": 0.4017954468727112, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 1.9168207024029575, | |
| "grad_norm": 3.2767493724823, | |
| "learning_rate": 1.84863523573201e-05, | |
| "loss": 0.4063960611820221, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.9168207024029575, | |
| "eval_loss": 0.7780888080596924, | |
| "eval_runtime": 14.5949, | |
| "eval_samples_per_second": 3.426, | |
| "eval_steps_per_second": 0.891, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.924214417744917, | |
| "grad_norm": 3.6285297870635986, | |
| "learning_rate": 1.8362282878411912e-05, | |
| "loss": 0.6483629941940308, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 1.9316081330868762, | |
| "grad_norm": 3.957628011703491, | |
| "learning_rate": 1.8238213399503723e-05, | |
| "loss": 0.6059281826019287, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 1.9390018484288354, | |
| "grad_norm": 3.794084072113037, | |
| "learning_rate": 1.8114143920595534e-05, | |
| "loss": 1.0474138259887695, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 1.9463955637707948, | |
| "grad_norm": 4.161247253417969, | |
| "learning_rate": 1.7990074441687348e-05, | |
| "loss": 0.7336093187332153, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 1.9537892791127542, | |
| "grad_norm": 2.166621446609497, | |
| "learning_rate": 1.7866004962779155e-05, | |
| "loss": 0.9245311617851257, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 1.9611829944547134, | |
| "grad_norm": 1.8056215047836304, | |
| "learning_rate": 1.774193548387097e-05, | |
| "loss": 0.4297409653663635, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 1.9685767097966729, | |
| "grad_norm": 2.4709436893463135, | |
| "learning_rate": 1.761786600496278e-05, | |
| "loss": 0.6437153220176697, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 1.975970425138632, | |
| "grad_norm": 4.184484481811523, | |
| "learning_rate": 1.7493796526054593e-05, | |
| "loss": 0.6798198223114014, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 1.9833641404805915, | |
| "grad_norm": 3.1639716625213623, | |
| "learning_rate": 1.7369727047146404e-05, | |
| "loss": 0.44798582792282104, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 1.990757855822551, | |
| "grad_norm": 4.66642951965332, | |
| "learning_rate": 1.7245657568238215e-05, | |
| "loss": 0.7636345028877258, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.990757855822551, | |
| "eval_loss": 0.7736530900001526, | |
| "eval_runtime": 14.6752, | |
| "eval_samples_per_second": 3.407, | |
| "eval_steps_per_second": 0.886, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.9981515711645101, | |
| "grad_norm": 4.238684177398682, | |
| "learning_rate": 1.7121588089330025e-05, | |
| "loss": 0.6888635158538818, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 6.728516101837158, | |
| "learning_rate": 1.6997518610421836e-05, | |
| "loss": 0.7793468832969666, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 2.0073937153419594, | |
| "grad_norm": 1.4594340324401855, | |
| "learning_rate": 1.687344913151365e-05, | |
| "loss": 0.4310983717441559, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 2.014787430683919, | |
| "grad_norm": 1.4875929355621338, | |
| "learning_rate": 1.674937965260546e-05, | |
| "loss": 0.8607257604598999, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 2.022181146025878, | |
| "grad_norm": 2.3744559288024902, | |
| "learning_rate": 1.662531017369727e-05, | |
| "loss": 0.5578240156173706, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 2.0295748613678373, | |
| "grad_norm": 3.0702226161956787, | |
| "learning_rate": 1.650124069478908e-05, | |
| "loss": 0.6157624125480652, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 2.0369685767097967, | |
| "grad_norm": 3.3733112812042236, | |
| "learning_rate": 1.6377171215880892e-05, | |
| "loss": 0.37903928756713867, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 2.044362292051756, | |
| "grad_norm": 1.7422901391983032, | |
| "learning_rate": 1.6253101736972706e-05, | |
| "loss": 0.46220725774765015, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 2.0517560073937156, | |
| "grad_norm": 2.0484213829040527, | |
| "learning_rate": 1.6129032258064517e-05, | |
| "loss": 0.7493972182273865, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 2.0591497227356745, | |
| "grad_norm": 2.9543616771698, | |
| "learning_rate": 1.600496277915633e-05, | |
| "loss": 0.4740079641342163, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.0591497227356745, | |
| "eval_loss": 0.774247407913208, | |
| "eval_runtime": 14.7788, | |
| "eval_samples_per_second": 3.383, | |
| "eval_steps_per_second": 0.88, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.066543438077634, | |
| "grad_norm": 4.02524995803833, | |
| "learning_rate": 1.588089330024814e-05, | |
| "loss": 0.4648398756980896, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 2.0739371534195934, | |
| "grad_norm": 3.726748466491699, | |
| "learning_rate": 1.575682382133995e-05, | |
| "loss": 0.4465940296649933, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 2.081330868761553, | |
| "grad_norm": 3.6973981857299805, | |
| "learning_rate": 1.5632754342431763e-05, | |
| "loss": 1.1393554210662842, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 2.088724584103512, | |
| "grad_norm": 2.837871789932251, | |
| "learning_rate": 1.5508684863523573e-05, | |
| "loss": 0.6313468217849731, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 2.0961182994454712, | |
| "grad_norm": 2.803872585296631, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "loss": 0.42370834946632385, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 2.1035120147874307, | |
| "grad_norm": 2.8776919841766357, | |
| "learning_rate": 1.5260545905707198e-05, | |
| "loss": 0.5538661479949951, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 2.11090573012939, | |
| "grad_norm": 3.7334094047546387, | |
| "learning_rate": 1.513647642679901e-05, | |
| "loss": 0.5879999399185181, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 2.1182994454713495, | |
| "grad_norm": 1.8186419010162354, | |
| "learning_rate": 1.5012406947890819e-05, | |
| "loss": 1.026726484298706, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 2.1256931608133085, | |
| "grad_norm": 3.8631510734558105, | |
| "learning_rate": 1.488833746898263e-05, | |
| "loss": 0.6525065302848816, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 2.133086876155268, | |
| "grad_norm": 3.008190155029297, | |
| "learning_rate": 1.4764267990074444e-05, | |
| "loss": 0.6006858944892883, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 2.133086876155268, | |
| "eval_loss": 0.7701458930969238, | |
| "eval_runtime": 14.5805, | |
| "eval_samples_per_second": 3.429, | |
| "eval_steps_per_second": 0.892, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 2.1404805914972274, | |
| "grad_norm": 3.7055914402008057, | |
| "learning_rate": 1.4640198511166252e-05, | |
| "loss": 0.5744045376777649, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 2.147874306839187, | |
| "grad_norm": 3.3834142684936523, | |
| "learning_rate": 1.4516129032258066e-05, | |
| "loss": 0.5752605199813843, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 2.155268022181146, | |
| "grad_norm": 2.1001501083374023, | |
| "learning_rate": 1.4392059553349877e-05, | |
| "loss": 0.3292985260486603, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 2.162661737523105, | |
| "grad_norm": 2.7614121437072754, | |
| "learning_rate": 1.4267990074441686e-05, | |
| "loss": 0.4825969934463501, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 2.1700554528650646, | |
| "grad_norm": 1.8585422039031982, | |
| "learning_rate": 1.41439205955335e-05, | |
| "loss": 0.3931984007358551, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 2.177449168207024, | |
| "grad_norm": 3.197474479675293, | |
| "learning_rate": 1.401985111662531e-05, | |
| "loss": 0.4858049154281616, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 2.1848428835489835, | |
| "grad_norm": 3.774609327316284, | |
| "learning_rate": 1.3895781637717123e-05, | |
| "loss": 0.5701273083686829, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 2.1922365988909425, | |
| "grad_norm": 3.7056381702423096, | |
| "learning_rate": 1.3771712158808933e-05, | |
| "loss": 0.35671544075012207, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 2.199630314232902, | |
| "grad_norm": 3.762648344039917, | |
| "learning_rate": 1.3647642679900746e-05, | |
| "loss": 0.38978254795074463, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 2.2070240295748613, | |
| "grad_norm": 2.4346160888671875, | |
| "learning_rate": 1.3523573200992556e-05, | |
| "loss": 0.3817184865474701, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.2070240295748613, | |
| "eval_loss": 0.771511971950531, | |
| "eval_runtime": 14.7091, | |
| "eval_samples_per_second": 3.399, | |
| "eval_steps_per_second": 0.884, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.2144177449168208, | |
| "grad_norm": 3.8731868267059326, | |
| "learning_rate": 1.3399503722084367e-05, | |
| "loss": 0.49884963035583496, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 2.22181146025878, | |
| "grad_norm": 2.4828414916992188, | |
| "learning_rate": 1.327543424317618e-05, | |
| "loss": 0.15124742686748505, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 2.229205175600739, | |
| "grad_norm": 4.272462368011475, | |
| "learning_rate": 1.315136476426799e-05, | |
| "loss": 0.47460150718688965, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 2.2365988909426986, | |
| "grad_norm": 4.066652774810791, | |
| "learning_rate": 1.3027295285359802e-05, | |
| "loss": 0.6313046813011169, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 2.243992606284658, | |
| "grad_norm": 3.1820685863494873, | |
| "learning_rate": 1.2903225806451613e-05, | |
| "loss": 0.39370083808898926, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 2.2513863216266174, | |
| "grad_norm": 3.9971110820770264, | |
| "learning_rate": 1.2779156327543427e-05, | |
| "loss": 0.5994598865509033, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 2.258780036968577, | |
| "grad_norm": 0.996334969997406, | |
| "learning_rate": 1.2655086848635236e-05, | |
| "loss": 0.32513830065727234, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 2.266173752310536, | |
| "grad_norm": 4.294183254241943, | |
| "learning_rate": 1.2531017369727046e-05, | |
| "loss": 0.6398261785507202, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 2.2735674676524953, | |
| "grad_norm": 3.178579092025757, | |
| "learning_rate": 1.240694789081886e-05, | |
| "loss": 0.3428504467010498, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 2.2809611829944547, | |
| "grad_norm": 2.2119312286376953, | |
| "learning_rate": 1.2282878411910669e-05, | |
| "loss": 0.46374407410621643, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 2.2809611829944547, | |
| "eval_loss": 0.7703814506530762, | |
| "eval_runtime": 14.7466, | |
| "eval_samples_per_second": 3.391, | |
| "eval_steps_per_second": 0.882, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 2.288354898336414, | |
| "grad_norm": 3.7887892723083496, | |
| "learning_rate": 1.2158808933002481e-05, | |
| "loss": 0.5297147035598755, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 2.2957486136783736, | |
| "grad_norm": 1.7170554399490356, | |
| "learning_rate": 1.2034739454094294e-05, | |
| "loss": 0.32796400785446167, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 2.3031423290203326, | |
| "grad_norm": 1.6616400480270386, | |
| "learning_rate": 1.1910669975186104e-05, | |
| "loss": 0.4169609546661377, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 2.310536044362292, | |
| "grad_norm": 4.250360012054443, | |
| "learning_rate": 1.1786600496277917e-05, | |
| "loss": 0.5692564845085144, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 2.3179297597042514, | |
| "grad_norm": 3.9190673828125, | |
| "learning_rate": 1.1662531017369727e-05, | |
| "loss": 0.2902570962905884, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 2.325323475046211, | |
| "grad_norm": 3.265540599822998, | |
| "learning_rate": 1.153846153846154e-05, | |
| "loss": 0.22921332716941833, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 2.33271719038817, | |
| "grad_norm": 3.34489369392395, | |
| "learning_rate": 1.141439205955335e-05, | |
| "loss": 0.3899090886116028, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 2.3401109057301293, | |
| "grad_norm": 2.0498178005218506, | |
| "learning_rate": 1.129032258064516e-05, | |
| "loss": 0.45650577545166016, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 2.3475046210720887, | |
| "grad_norm": 4.382551670074463, | |
| "learning_rate": 1.1166253101736973e-05, | |
| "loss": 0.6734753847122192, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 2.354898336414048, | |
| "grad_norm": 4.091598987579346, | |
| "learning_rate": 1.1042183622828785e-05, | |
| "loss": 0.608093798160553, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.354898336414048, | |
| "eval_loss": 0.7693940997123718, | |
| "eval_runtime": 14.6834, | |
| "eval_samples_per_second": 3.405, | |
| "eval_steps_per_second": 0.885, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.3622920517560075, | |
| "grad_norm": 4.082503318786621, | |
| "learning_rate": 1.0918114143920596e-05, | |
| "loss": 0.43649721145629883, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 2.369685767097967, | |
| "grad_norm": 3.7380568981170654, | |
| "learning_rate": 1.0794044665012408e-05, | |
| "loss": 0.4303453862667084, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 2.377079482439926, | |
| "grad_norm": 3.448054313659668, | |
| "learning_rate": 1.0669975186104219e-05, | |
| "loss": 0.9947173595428467, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 2.3844731977818854, | |
| "grad_norm": 3.79837703704834, | |
| "learning_rate": 1.054590570719603e-05, | |
| "loss": 0.4145554304122925, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 2.391866913123845, | |
| "grad_norm": 3.390570640563965, | |
| "learning_rate": 1.0421836228287842e-05, | |
| "loss": 1.0003561973571777, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 2.3992606284658042, | |
| "grad_norm": 4.022547245025635, | |
| "learning_rate": 1.0297766749379652e-05, | |
| "loss": 0.37200576066970825, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 2.406654343807763, | |
| "grad_norm": 3.9541947841644287, | |
| "learning_rate": 1.0173697270471465e-05, | |
| "loss": 0.617558479309082, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 2.4140480591497226, | |
| "grad_norm": 2.225595235824585, | |
| "learning_rate": 1.0049627791563277e-05, | |
| "loss": 0.4966333508491516, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 2.421441774491682, | |
| "grad_norm": 4.891867637634277, | |
| "learning_rate": 9.925558312655088e-06, | |
| "loss": 0.44887012243270874, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 2.4288354898336415, | |
| "grad_norm": 1.9620754718780518, | |
| "learning_rate": 9.801488833746898e-06, | |
| "loss": 0.27701541781425476, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 2.4288354898336415, | |
| "eval_loss": 0.768280029296875, | |
| "eval_runtime": 14.6898, | |
| "eval_samples_per_second": 3.404, | |
| "eval_steps_per_second": 0.885, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 2.436229205175601, | |
| "grad_norm": 4.712418079376221, | |
| "learning_rate": 9.67741935483871e-06, | |
| "loss": 0.6389679908752441, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 2.44362292051756, | |
| "grad_norm": 1.852449893951416, | |
| "learning_rate": 9.553349875930521e-06, | |
| "loss": 1.1038583517074585, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 2.4510166358595193, | |
| "grad_norm": 4.138819694519043, | |
| "learning_rate": 9.429280397022333e-06, | |
| "loss": 0.43939751386642456, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 2.4584103512014788, | |
| "grad_norm": 2.835935354232788, | |
| "learning_rate": 9.305210918114144e-06, | |
| "loss": 0.41257309913635254, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 2.465804066543438, | |
| "grad_norm": 2.160979986190796, | |
| "learning_rate": 9.181141439205956e-06, | |
| "loss": 0.39569902420043945, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 2.473197781885397, | |
| "grad_norm": 3.6228151321411133, | |
| "learning_rate": 9.057071960297767e-06, | |
| "loss": 0.5179893970489502, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 2.4805914972273566, | |
| "grad_norm": 3.591714382171631, | |
| "learning_rate": 8.933002481389577e-06, | |
| "loss": 0.4214794933795929, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 2.487985212569316, | |
| "grad_norm": 3.018785238265991, | |
| "learning_rate": 8.80893300248139e-06, | |
| "loss": 0.5895953178405762, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 2.4953789279112755, | |
| "grad_norm": 3.907846689224243, | |
| "learning_rate": 8.684863523573202e-06, | |
| "loss": 0.5587291717529297, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 2.502772643253235, | |
| "grad_norm": 3.9467413425445557, | |
| "learning_rate": 8.560794044665013e-06, | |
| "loss": 0.4495808482170105, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 2.502772643253235, | |
| "eval_loss": 0.7679100036621094, | |
| "eval_runtime": 14.7533, | |
| "eval_samples_per_second": 3.389, | |
| "eval_steps_per_second": 0.881, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 2.5101663585951943, | |
| "grad_norm": 3.962733507156372, | |
| "learning_rate": 8.436724565756825e-06, | |
| "loss": 0.3088897466659546, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 2.5175600739371533, | |
| "grad_norm": 4.829586505889893, | |
| "learning_rate": 8.312655086848635e-06, | |
| "loss": 0.4583315849304199, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 2.5249537892791127, | |
| "grad_norm": 2.465217113494873, | |
| "learning_rate": 8.188585607940446e-06, | |
| "loss": 0.5734530687332153, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 2.532347504621072, | |
| "grad_norm": 1.578626275062561, | |
| "learning_rate": 8.064516129032258e-06, | |
| "loss": 0.29778629541397095, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 2.539741219963031, | |
| "grad_norm": 3.794196605682373, | |
| "learning_rate": 7.94044665012407e-06, | |
| "loss": 0.514739990234375, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 2.5471349353049906, | |
| "grad_norm": 4.320169448852539, | |
| "learning_rate": 7.816377171215881e-06, | |
| "loss": 0.36768847703933716, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 2.55452865064695, | |
| "grad_norm": 3.7134804725646973, | |
| "learning_rate": 7.692307692307694e-06, | |
| "loss": 0.32225626707077026, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 2.5619223659889094, | |
| "grad_norm": 3.2205772399902344, | |
| "learning_rate": 7.568238213399505e-06, | |
| "loss": 0.45840057730674744, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 2.569316081330869, | |
| "grad_norm": 5.132753372192383, | |
| "learning_rate": 7.444168734491315e-06, | |
| "loss": 0.6190608739852905, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 2.5767097966728283, | |
| "grad_norm": 2.7665748596191406, | |
| "learning_rate": 7.320099255583126e-06, | |
| "loss": 0.2809644937515259, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.5767097966728283, | |
| "eval_loss": 0.7658350467681885, | |
| "eval_runtime": 14.6579, | |
| "eval_samples_per_second": 3.411, | |
| "eval_steps_per_second": 0.887, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.5841035120147873, | |
| "grad_norm": 4.205397605895996, | |
| "learning_rate": 7.1960297766749385e-06, | |
| "loss": 0.30544620752334595, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 2.5914972273567467, | |
| "grad_norm": 2.3894495964050293, | |
| "learning_rate": 7.07196029776675e-06, | |
| "loss": 0.310545414686203, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 2.598890942698706, | |
| "grad_norm": 3.995877981185913, | |
| "learning_rate": 6.9478908188585614e-06, | |
| "loss": 0.5483052730560303, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 2.6062846580406656, | |
| "grad_norm": 3.834993362426758, | |
| "learning_rate": 6.823821339950373e-06, | |
| "loss": 0.8772858381271362, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 2.6136783733826245, | |
| "grad_norm": 4.7651777267456055, | |
| "learning_rate": 6.6997518610421835e-06, | |
| "loss": 0.4968230128288269, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 2.621072088724584, | |
| "grad_norm": 4.165541648864746, | |
| "learning_rate": 6.575682382133995e-06, | |
| "loss": 0.5299187898635864, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 2.6284658040665434, | |
| "grad_norm": 5.075289726257324, | |
| "learning_rate": 6.451612903225806e-06, | |
| "loss": 0.4870533049106598, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 2.635859519408503, | |
| "grad_norm": 4.575265884399414, | |
| "learning_rate": 6.327543424317618e-06, | |
| "loss": 0.8198877573013306, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 2.6432532347504623, | |
| "grad_norm": 4.340782165527344, | |
| "learning_rate": 6.20347394540943e-06, | |
| "loss": 0.3996822237968445, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 2.6506469500924217, | |
| "grad_norm": 4.009160995483398, | |
| "learning_rate": 6.079404466501241e-06, | |
| "loss": 0.40964275598526, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.6506469500924217, | |
| "eval_loss": 0.7657684087753296, | |
| "eval_runtime": 14.717, | |
| "eval_samples_per_second": 3.397, | |
| "eval_steps_per_second": 0.883, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.6580406654343807, | |
| "grad_norm": 3.997911214828491, | |
| "learning_rate": 5.955334987593052e-06, | |
| "loss": 0.3987128734588623, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 2.66543438077634, | |
| "grad_norm": 3.6921792030334473, | |
| "learning_rate": 5.831265508684864e-06, | |
| "loss": 0.4136401116847992, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 2.6728280961182995, | |
| "grad_norm": 4.61245059967041, | |
| "learning_rate": 5.707196029776675e-06, | |
| "loss": 0.4332594573497772, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 2.6802218114602585, | |
| "grad_norm": 3.801255702972412, | |
| "learning_rate": 5.5831265508684865e-06, | |
| "loss": 0.4616243243217468, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 2.687615526802218, | |
| "grad_norm": 3.358360767364502, | |
| "learning_rate": 5.459057071960298e-06, | |
| "loss": 0.29757314920425415, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 2.6950092421441774, | |
| "grad_norm": 3.087639331817627, | |
| "learning_rate": 5.334987593052109e-06, | |
| "loss": 0.32710200548171997, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 2.702402957486137, | |
| "grad_norm": 4.153397083282471, | |
| "learning_rate": 5.210918114143921e-06, | |
| "loss": 0.3512117564678192, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 2.709796672828096, | |
| "grad_norm": 4.165513038635254, | |
| "learning_rate": 5.086848635235732e-06, | |
| "loss": 0.8789117932319641, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 2.7171903881700556, | |
| "grad_norm": 4.394218921661377, | |
| "learning_rate": 4.962779156327544e-06, | |
| "loss": 0.5227751135826111, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 2.7245841035120146, | |
| "grad_norm": 4.3006110191345215, | |
| "learning_rate": 4.838709677419355e-06, | |
| "loss": 0.6214644312858582, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 2.7245841035120146, | |
| "eval_loss": 0.7669808268547058, | |
| "eval_runtime": 14.7732, | |
| "eval_samples_per_second": 3.385, | |
| "eval_steps_per_second": 0.88, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 2.731977818853974, | |
| "grad_norm": 4.888645172119141, | |
| "learning_rate": 4.714640198511167e-06, | |
| "loss": 0.8665144443511963, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 2.7393715341959335, | |
| "grad_norm": 3.778118371963501, | |
| "learning_rate": 4.590570719602978e-06, | |
| "loss": 0.33991459012031555, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 2.746765249537893, | |
| "grad_norm": 2.7993180751800537, | |
| "learning_rate": 4.466501240694789e-06, | |
| "loss": 0.6993688344955444, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 2.754158964879852, | |
| "grad_norm": 4.365177154541016, | |
| "learning_rate": 4.342431761786601e-06, | |
| "loss": 0.3615218997001648, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 2.7615526802218113, | |
| "grad_norm": 3.846773862838745, | |
| "learning_rate": 4.2183622828784124e-06, | |
| "loss": 0.39533162117004395, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 2.7689463955637708, | |
| "grad_norm": 4.7195725440979, | |
| "learning_rate": 4.094292803970223e-06, | |
| "loss": 0.7132782340049744, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 2.77634011090573, | |
| "grad_norm": 5.103621482849121, | |
| "learning_rate": 3.970223325062035e-06, | |
| "loss": 0.7199317812919617, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 2.7837338262476896, | |
| "grad_norm": 1.6189250946044922, | |
| "learning_rate": 3.846153846153847e-06, | |
| "loss": 0.6657246947288513, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 2.791127541589649, | |
| "grad_norm": 1.8573932647705078, | |
| "learning_rate": 3.7220843672456574e-06, | |
| "loss": 0.5098580718040466, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 2.798521256931608, | |
| "grad_norm": 4.506024360656738, | |
| "learning_rate": 3.5980148883374693e-06, | |
| "loss": 0.6152743697166443, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 2.798521256931608, | |
| "eval_loss": 0.7685391306877136, | |
| "eval_runtime": 14.6745, | |
| "eval_samples_per_second": 3.407, | |
| "eval_steps_per_second": 0.886, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 2.8059149722735675, | |
| "grad_norm": 3.2825143337249756, | |
| "learning_rate": 3.4739454094292807e-06, | |
| "loss": 0.44237416982650757, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 2.813308687615527, | |
| "grad_norm": 4.352462291717529, | |
| "learning_rate": 3.3498759305210917e-06, | |
| "loss": 0.6616033315658569, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 2.820702402957486, | |
| "grad_norm": 2.646233081817627, | |
| "learning_rate": 3.225806451612903e-06, | |
| "loss": 1.343247890472412, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 2.8280961182994453, | |
| "grad_norm": 4.7132368087768555, | |
| "learning_rate": 3.101736972704715e-06, | |
| "loss": 0.5540533661842346, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 2.8354898336414047, | |
| "grad_norm": 4.393060684204102, | |
| "learning_rate": 2.977667493796526e-06, | |
| "loss": 0.3722197711467743, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 2.842883548983364, | |
| "grad_norm": 3.9295449256896973, | |
| "learning_rate": 2.8535980148883375e-06, | |
| "loss": 0.4926016926765442, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 2.8502772643253236, | |
| "grad_norm": 4.140054225921631, | |
| "learning_rate": 2.729528535980149e-06, | |
| "loss": 0.671159565448761, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 2.857670979667283, | |
| "grad_norm": 1.8080183267593384, | |
| "learning_rate": 2.6054590570719604e-06, | |
| "loss": 0.30225613713264465, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 2.865064695009242, | |
| "grad_norm": 3.795689582824707, | |
| "learning_rate": 2.481389578163772e-06, | |
| "loss": 0.30790403485298157, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 2.8724584103512014, | |
| "grad_norm": 3.827852725982666, | |
| "learning_rate": 2.3573200992555833e-06, | |
| "loss": 0.38701093196868896, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.8724584103512014, | |
| "eval_loss": 0.7680988907814026, | |
| "eval_runtime": 14.7048, | |
| "eval_samples_per_second": 3.4, | |
| "eval_steps_per_second": 0.884, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.879852125693161, | |
| "grad_norm": 4.782068729400635, | |
| "learning_rate": 2.2332506203473944e-06, | |
| "loss": 0.3287886083126068, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 2.8872458410351203, | |
| "grad_norm": 3.9645960330963135, | |
| "learning_rate": 2.1091811414392062e-06, | |
| "loss": 0.3570128381252289, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 2.8946395563770793, | |
| "grad_norm": 1.9487789869308472, | |
| "learning_rate": 1.9851116625310177e-06, | |
| "loss": 0.36440327763557434, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 2.9020332717190387, | |
| "grad_norm": 4.191056728363037, | |
| "learning_rate": 1.8610421836228287e-06, | |
| "loss": 0.4157246947288513, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 2.909426987060998, | |
| "grad_norm": 3.8392462730407715, | |
| "learning_rate": 1.7369727047146404e-06, | |
| "loss": 0.4623328447341919, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 2.9168207024029575, | |
| "grad_norm": 5.019207000732422, | |
| "learning_rate": 1.6129032258064516e-06, | |
| "loss": 0.8991196155548096, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 2.924214417744917, | |
| "grad_norm": 4.490087509155273, | |
| "learning_rate": 1.488833746898263e-06, | |
| "loss": 0.548180103302002, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 2.9316081330868764, | |
| "grad_norm": 5.643899440765381, | |
| "learning_rate": 1.3647642679900745e-06, | |
| "loss": 0.7324087619781494, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 2.9390018484288354, | |
| "grad_norm": 4.432566165924072, | |
| "learning_rate": 1.240694789081886e-06, | |
| "loss": 0.32455164194107056, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 2.946395563770795, | |
| "grad_norm": 4.33750581741333, | |
| "learning_rate": 1.1166253101736972e-06, | |
| "loss": 0.4725751280784607, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.946395563770795, | |
| "eval_loss": 0.7677021622657776, | |
| "eval_runtime": 14.6144, | |
| "eval_samples_per_second": 3.421, | |
| "eval_steps_per_second": 0.89, | |
| "step": 400 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 408, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 10, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.2864504986317824e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |