Instructions to use anhdai312/MathDeepSeek2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use anhdai312/MathDeepSeek2 with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("anhdai312/MathDeepSeek2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use anhdai312/MathDeepSeek2 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek2 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for anhdai312/MathDeepSeek2 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for anhdai312/MathDeepSeek2 to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="anhdai312/MathDeepSeek2", max_seq_length=2048, )
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_global_step": 408, | |
| "best_metric": 0.6750363707542419, | |
| "best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-408", | |
| "epoch": 3.0, | |
| "eval_steps": 10, | |
| "global_step": 408, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0073937153419593345, | |
| "grad_norm": 1.7587594985961914, | |
| "learning_rate": 0.0, | |
| "loss": 2.691019296646118, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.014787430683918669, | |
| "grad_norm": 1.930446982383728, | |
| "learning_rate": 1e-05, | |
| "loss": 2.75667667388916, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.022181146025878003, | |
| "grad_norm": 1.953555703163147, | |
| "learning_rate": 2e-05, | |
| "loss": 3.7232160568237305, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.029574861367837338, | |
| "grad_norm": 1.4509127140045166, | |
| "learning_rate": 3e-05, | |
| "loss": 2.9131853580474854, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.036968576709796676, | |
| "grad_norm": 2.036184310913086, | |
| "learning_rate": 4e-05, | |
| "loss": 3.0811572074890137, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.04436229205175601, | |
| "grad_norm": 1.7680681943893433, | |
| "learning_rate": 5e-05, | |
| "loss": 2.68190598487854, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.051756007393715345, | |
| "grad_norm": 2.4544951915740967, | |
| "learning_rate": 4.987593052109181e-05, | |
| "loss": 3.960662364959717, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.059149722735674676, | |
| "grad_norm": 1.7252415418624878, | |
| "learning_rate": 4.9751861042183624e-05, | |
| "loss": 2.195984125137329, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.066543438077634, | |
| "grad_norm": 1.9524086713790894, | |
| "learning_rate": 4.962779156327544e-05, | |
| "loss": 2.1853127479553223, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.07393715341959335, | |
| "grad_norm": 2.1538190841674805, | |
| "learning_rate": 4.950372208436725e-05, | |
| "loss": 2.8134853839874268, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.07393715341959335, | |
| "eval_loss": 2.3912832736968994, | |
| "eval_runtime": 11.6038, | |
| "eval_samples_per_second": 4.309, | |
| "eval_steps_per_second": 1.12, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.08133086876155268, | |
| "grad_norm": 1.9469140768051147, | |
| "learning_rate": 4.937965260545906e-05, | |
| "loss": 2.1433486938476562, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.08872458410351201, | |
| "grad_norm": 2.3120369911193848, | |
| "learning_rate": 4.9255583126550866e-05, | |
| "loss": 2.385965347290039, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.09611829944547134, | |
| "grad_norm": 2.2094929218292236, | |
| "learning_rate": 4.9131513647642677e-05, | |
| "loss": 2.4737462997436523, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.10351201478743069, | |
| "grad_norm": 2.6324586868286133, | |
| "learning_rate": 4.9007444168734494e-05, | |
| "loss": 2.3202741146087646, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.11090573012939002, | |
| "grad_norm": 2.2847135066986084, | |
| "learning_rate": 4.8883374689826305e-05, | |
| "loss": 2.369445323944092, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.11829944547134935, | |
| "grad_norm": 2.079944133758545, | |
| "learning_rate": 4.8759305210918115e-05, | |
| "loss": 2.015984058380127, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.1256931608133087, | |
| "grad_norm": 2.3084442615509033, | |
| "learning_rate": 4.8635235732009926e-05, | |
| "loss": 2.0963761806488037, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.133086876155268, | |
| "grad_norm": 2.5707437992095947, | |
| "learning_rate": 4.851116625310174e-05, | |
| "loss": 2.4691004753112793, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.14048059149722736, | |
| "grad_norm": 2.2389156818389893, | |
| "learning_rate": 4.8387096774193554e-05, | |
| "loss": 2.1746907234191895, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.1478743068391867, | |
| "grad_norm": 2.1317756175994873, | |
| "learning_rate": 4.8263027295285364e-05, | |
| "loss": 2.1674509048461914, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.1478743068391867, | |
| "eval_loss": 1.91414213180542, | |
| "eval_runtime": 12.5864, | |
| "eval_samples_per_second": 3.973, | |
| "eval_steps_per_second": 1.033, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.15526802218114602, | |
| "grad_norm": 2.428013563156128, | |
| "learning_rate": 4.8138957816377175e-05, | |
| "loss": 1.9142755270004272, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.16266173752310537, | |
| "grad_norm": 2.3884992599487305, | |
| "learning_rate": 4.8014888337468986e-05, | |
| "loss": 2.2496678829193115, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.17005545286506468, | |
| "grad_norm": 1.786407232284546, | |
| "learning_rate": 4.7890818858560796e-05, | |
| "loss": 1.8403816223144531, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.17744916820702403, | |
| "grad_norm": 2.4553239345550537, | |
| "learning_rate": 4.776674937965261e-05, | |
| "loss": 2.4630396366119385, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.18484288354898337, | |
| "grad_norm": 2.4950063228607178, | |
| "learning_rate": 4.764267990074442e-05, | |
| "loss": 1.4519834518432617, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.1922365988909427, | |
| "grad_norm": 2.243168354034424, | |
| "learning_rate": 4.751861042183623e-05, | |
| "loss": 1.7111647129058838, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.19963031423290203, | |
| "grad_norm": 2.569514274597168, | |
| "learning_rate": 4.739454094292804e-05, | |
| "loss": 1.9534958600997925, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.20702402957486138, | |
| "grad_norm": 2.2852730751037598, | |
| "learning_rate": 4.7270471464019856e-05, | |
| "loss": 1.4022412300109863, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.2144177449168207, | |
| "grad_norm": 2.4911389350891113, | |
| "learning_rate": 4.7146401985111667e-05, | |
| "loss": 1.627483606338501, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.22181146025878004, | |
| "grad_norm": 2.8639137744903564, | |
| "learning_rate": 4.702233250620348e-05, | |
| "loss": 1.8156955242156982, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.22181146025878004, | |
| "eval_loss": 1.637284755706787, | |
| "eval_runtime": 12.06, | |
| "eval_samples_per_second": 4.146, | |
| "eval_steps_per_second": 1.078, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.22920517560073936, | |
| "grad_norm": 2.854050397872925, | |
| "learning_rate": 4.689826302729529e-05, | |
| "loss": 1.8234474658966064, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.2365988909426987, | |
| "grad_norm": 2.51224684715271, | |
| "learning_rate": 4.67741935483871e-05, | |
| "loss": 1.630173683166504, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.24399260628465805, | |
| "grad_norm": 2.530003786087036, | |
| "learning_rate": 4.665012406947891e-05, | |
| "loss": 2.195810317993164, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.2513863216266174, | |
| "grad_norm": 2.8960745334625244, | |
| "learning_rate": 4.652605459057072e-05, | |
| "loss": 2.0083396434783936, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.2587800369685767, | |
| "grad_norm": 2.9172658920288086, | |
| "learning_rate": 4.640198511166253e-05, | |
| "loss": 1.4498248100280762, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.266173752310536, | |
| "grad_norm": 2.2400825023651123, | |
| "learning_rate": 4.627791563275434e-05, | |
| "loss": 1.1269171237945557, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.2735674676524954, | |
| "grad_norm": 2.538266181945801, | |
| "learning_rate": 4.615384615384616e-05, | |
| "loss": 1.8185009956359863, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.2809611829944547, | |
| "grad_norm": 2.3526978492736816, | |
| "learning_rate": 4.602977667493797e-05, | |
| "loss": 1.0682374238967896, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.28835489833641403, | |
| "grad_norm": 2.8807811737060547, | |
| "learning_rate": 4.590570719602978e-05, | |
| "loss": 2.21337890625, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.2957486136783734, | |
| "grad_norm": 2.7879021167755127, | |
| "learning_rate": 4.578163771712159e-05, | |
| "loss": 1.689092755317688, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.2957486136783734, | |
| "eval_loss": 1.4498449563980103, | |
| "eval_runtime": 12.5884, | |
| "eval_samples_per_second": 3.972, | |
| "eval_steps_per_second": 1.033, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.3031423290203327, | |
| "grad_norm": 2.432206392288208, | |
| "learning_rate": 4.56575682382134e-05, | |
| "loss": 1.2275516986846924, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.31053604436229204, | |
| "grad_norm": 3.0099549293518066, | |
| "learning_rate": 4.553349875930522e-05, | |
| "loss": 1.185080647468567, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.3179297597042514, | |
| "grad_norm": 2.7897891998291016, | |
| "learning_rate": 4.540942928039703e-05, | |
| "loss": 1.3819549083709717, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.32532347504621073, | |
| "grad_norm": 2.8821756839752197, | |
| "learning_rate": 4.528535980148884e-05, | |
| "loss": 1.3627997636795044, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.33271719038817005, | |
| "grad_norm": 3.9456920623779297, | |
| "learning_rate": 4.516129032258064e-05, | |
| "loss": 1.792586326599121, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.34011090573012936, | |
| "grad_norm": 2.7059478759765625, | |
| "learning_rate": 4.5037220843672454e-05, | |
| "loss": 1.4585685729980469, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.34750462107208874, | |
| "grad_norm": 3.4259610176086426, | |
| "learning_rate": 4.491315136476427e-05, | |
| "loss": 2.1591320037841797, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.35489833641404805, | |
| "grad_norm": 3.6107091903686523, | |
| "learning_rate": 4.478908188585608e-05, | |
| "loss": 1.9699089527130127, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.36229205175600737, | |
| "grad_norm": 2.445187568664551, | |
| "learning_rate": 4.466501240694789e-05, | |
| "loss": 1.0851035118103027, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.36968576709796674, | |
| "grad_norm": 3.2657907009124756, | |
| "learning_rate": 4.45409429280397e-05, | |
| "loss": 1.8776271343231201, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.36968576709796674, | |
| "eval_loss": 1.2967743873596191, | |
| "eval_runtime": 12.5267, | |
| "eval_samples_per_second": 3.991, | |
| "eval_steps_per_second": 1.038, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.37707948243992606, | |
| "grad_norm": 3.1562914848327637, | |
| "learning_rate": 4.441687344913151e-05, | |
| "loss": 1.5886495113372803, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.3844731977818854, | |
| "grad_norm": 3.7622435092926025, | |
| "learning_rate": 4.429280397022333e-05, | |
| "loss": 1.5878514051437378, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.39186691312384475, | |
| "grad_norm": 3.235161066055298, | |
| "learning_rate": 4.416873449131514e-05, | |
| "loss": 1.307330846786499, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.39926062846580407, | |
| "grad_norm": 3.034426212310791, | |
| "learning_rate": 4.404466501240695e-05, | |
| "loss": 1.0698113441467285, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.4066543438077634, | |
| "grad_norm": 3.166105270385742, | |
| "learning_rate": 4.392059553349876e-05, | |
| "loss": 1.3888237476348877, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.41404805914972276, | |
| "grad_norm": 3.379401922225952, | |
| "learning_rate": 4.379652605459057e-05, | |
| "loss": 1.4811557531356812, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.4214417744916821, | |
| "grad_norm": 2.8660521507263184, | |
| "learning_rate": 4.3672456575682384e-05, | |
| "loss": 1.2131584882736206, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.4288354898336414, | |
| "grad_norm": 2.932765245437622, | |
| "learning_rate": 4.3548387096774194e-05, | |
| "loss": 1.1394425630569458, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.43622920517560076, | |
| "grad_norm": 3.085935354232788, | |
| "learning_rate": 4.3424317617866005e-05, | |
| "loss": 1.2639648914337158, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.4436229205175601, | |
| "grad_norm": 2.835193157196045, | |
| "learning_rate": 4.3300248138957816e-05, | |
| "loss": 1.256007194519043, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.4436229205175601, | |
| "eval_loss": 1.171344518661499, | |
| "eval_runtime": 12.3887, | |
| "eval_samples_per_second": 4.036, | |
| "eval_steps_per_second": 1.049, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.4510166358595194, | |
| "grad_norm": 4.220600128173828, | |
| "learning_rate": 4.317617866004963e-05, | |
| "loss": 1.1558457612991333, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.4584103512014787, | |
| "grad_norm": 3.2328484058380127, | |
| "learning_rate": 4.3052109181141444e-05, | |
| "loss": 1.7892142534255981, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.4658040665434381, | |
| "grad_norm": 3.1310110092163086, | |
| "learning_rate": 4.2928039702233254e-05, | |
| "loss": 1.5464088916778564, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.4731977818853974, | |
| "grad_norm": 2.7544875144958496, | |
| "learning_rate": 4.2803970223325065e-05, | |
| "loss": 1.1755099296569824, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.4805914972273567, | |
| "grad_norm": 2.8833136558532715, | |
| "learning_rate": 4.2679900744416875e-05, | |
| "loss": 1.0351439714431763, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.4879852125693161, | |
| "grad_norm": 3.911613702774048, | |
| "learning_rate": 4.2555831265508686e-05, | |
| "loss": 1.674350619316101, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.4953789279112754, | |
| "grad_norm": 3.5602052211761475, | |
| "learning_rate": 4.2431761786600497e-05, | |
| "loss": 1.8415451049804688, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.5027726432532348, | |
| "grad_norm": 3.243236541748047, | |
| "learning_rate": 4.230769230769231e-05, | |
| "loss": 0.9139584302902222, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.5101663585951941, | |
| "grad_norm": 3.178295135498047, | |
| "learning_rate": 4.218362282878412e-05, | |
| "loss": 1.0007776021957397, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.5175600739371534, | |
| "grad_norm": 2.949404001235962, | |
| "learning_rate": 4.205955334987593e-05, | |
| "loss": 1.2593410015106201, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.5175600739371534, | |
| "eval_loss": 1.0979946851730347, | |
| "eval_runtime": 12.5239, | |
| "eval_samples_per_second": 3.992, | |
| "eval_steps_per_second": 1.038, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.5249537892791127, | |
| "grad_norm": 3.8847079277038574, | |
| "learning_rate": 4.1935483870967746e-05, | |
| "loss": 2.036594867706299, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.532347504621072, | |
| "grad_norm": 3.068953514099121, | |
| "learning_rate": 4.1811414392059556e-05, | |
| "loss": 0.6717187166213989, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.5397412199630314, | |
| "grad_norm": 3.2837107181549072, | |
| "learning_rate": 4.168734491315137e-05, | |
| "loss": 1.2511982917785645, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.5471349353049908, | |
| "grad_norm": 2.77791690826416, | |
| "learning_rate": 4.156327543424318e-05, | |
| "loss": 0.8615735769271851, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.5545286506469501, | |
| "grad_norm": 3.068490743637085, | |
| "learning_rate": 4.1439205955334995e-05, | |
| "loss": 1.0339652299880981, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.5619223659889094, | |
| "grad_norm": 2.979583263397217, | |
| "learning_rate": 4.1315136476426805e-05, | |
| "loss": 1.1108063459396362, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.5693160813308688, | |
| "grad_norm": 3.9051339626312256, | |
| "learning_rate": 4.119106699751861e-05, | |
| "loss": 1.4168835878372192, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.5767097966728281, | |
| "grad_norm": 3.7126312255859375, | |
| "learning_rate": 4.106699751861042e-05, | |
| "loss": 1.3734055757522583, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.5841035120147874, | |
| "grad_norm": 3.31662654876709, | |
| "learning_rate": 4.094292803970223e-05, | |
| "loss": 1.2524129152297974, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.5914972273567468, | |
| "grad_norm": 4.711428642272949, | |
| "learning_rate": 4.081885856079405e-05, | |
| "loss": 1.236316442489624, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.5914972273567468, | |
| "eval_loss": 1.0435348749160767, | |
| "eval_runtime": 12.3458, | |
| "eval_samples_per_second": 4.05, | |
| "eval_steps_per_second": 1.053, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.5988909426987061, | |
| "grad_norm": 4.0361762046813965, | |
| "learning_rate": 4.069478908188586e-05, | |
| "loss": 1.4246442317962646, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.6062846580406654, | |
| "grad_norm": 2.8361904621124268, | |
| "learning_rate": 4.057071960297767e-05, | |
| "loss": 0.9345840811729431, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.6136783733826248, | |
| "grad_norm": 3.7095162868499756, | |
| "learning_rate": 4.044665012406948e-05, | |
| "loss": 1.5689283609390259, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.6210720887245841, | |
| "grad_norm": 3.5047953128814697, | |
| "learning_rate": 4.032258064516129e-05, | |
| "loss": 0.8759887218475342, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.6284658040665434, | |
| "grad_norm": 3.5987155437469482, | |
| "learning_rate": 4.019851116625311e-05, | |
| "loss": 1.1171759366989136, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.6358595194085028, | |
| "grad_norm": 3.731731414794922, | |
| "learning_rate": 4.007444168734492e-05, | |
| "loss": 1.6270053386688232, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.6432532347504621, | |
| "grad_norm": 3.573490858078003, | |
| "learning_rate": 3.995037220843673e-05, | |
| "loss": 1.056086540222168, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.6506469500924215, | |
| "grad_norm": 3.3525490760803223, | |
| "learning_rate": 3.982630272952854e-05, | |
| "loss": 1.1946213245391846, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.6580406654343808, | |
| "grad_norm": 3.7373411655426025, | |
| "learning_rate": 3.970223325062035e-05, | |
| "loss": 0.8827130794525146, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.6654343807763401, | |
| "grad_norm": 4.0084710121154785, | |
| "learning_rate": 3.957816377171216e-05, | |
| "loss": 0.9339371919631958, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.6654343807763401, | |
| "eval_loss": 1.0062669515609741, | |
| "eval_runtime": 12.5195, | |
| "eval_samples_per_second": 3.994, | |
| "eval_steps_per_second": 1.038, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.6728280961182994, | |
| "grad_norm": 3.986560583114624, | |
| "learning_rate": 3.945409429280397e-05, | |
| "loss": 1.4415428638458252, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.6802218114602587, | |
| "grad_norm": 4.451272964477539, | |
| "learning_rate": 3.933002481389578e-05, | |
| "loss": 1.0824394226074219, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.6876155268022182, | |
| "grad_norm": 3.693286180496216, | |
| "learning_rate": 3.920595533498759e-05, | |
| "loss": 1.1940369606018066, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.6950092421441775, | |
| "grad_norm": 2.855053424835205, | |
| "learning_rate": 3.908188585607941e-05, | |
| "loss": 0.9173199534416199, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.7024029574861368, | |
| "grad_norm": 4.027679443359375, | |
| "learning_rate": 3.895781637717122e-05, | |
| "loss": 0.9497783184051514, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.7097966728280961, | |
| "grad_norm": 3.9087977409362793, | |
| "learning_rate": 3.883374689826303e-05, | |
| "loss": 1.0188655853271484, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.7171903881700554, | |
| "grad_norm": 3.241875171661377, | |
| "learning_rate": 3.870967741935484e-05, | |
| "loss": 0.8885791301727295, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.7245841035120147, | |
| "grad_norm": 4.185547351837158, | |
| "learning_rate": 3.858560794044665e-05, | |
| "loss": 1.2772949934005737, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.7319778188539742, | |
| "grad_norm": 4.142065048217773, | |
| "learning_rate": 3.846153846153846e-05, | |
| "loss": 1.2576420307159424, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.7393715341959335, | |
| "grad_norm": 3.615719795227051, | |
| "learning_rate": 3.8337468982630273e-05, | |
| "loss": 1.0819486379623413, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.7393715341959335, | |
| "eval_loss": 0.9623194932937622, | |
| "eval_runtime": 12.381, | |
| "eval_samples_per_second": 4.038, | |
| "eval_steps_per_second": 1.05, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.7467652495378928, | |
| "grad_norm": 4.190881729125977, | |
| "learning_rate": 3.8213399503722084e-05, | |
| "loss": 1.2672250270843506, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.7541589648798521, | |
| "grad_norm": 3.193317174911499, | |
| "learning_rate": 3.8089330024813895e-05, | |
| "loss": 0.5870144963264465, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.7615526802218114, | |
| "grad_norm": 3.363736867904663, | |
| "learning_rate": 3.7965260545905705e-05, | |
| "loss": 0.9823516011238098, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.7689463955637708, | |
| "grad_norm": 3.5238037109375, | |
| "learning_rate": 3.784119106699752e-05, | |
| "loss": 1.0627766847610474, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.7763401109057301, | |
| "grad_norm": 3.9384078979492188, | |
| "learning_rate": 3.771712158808933e-05, | |
| "loss": 0.9595991969108582, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.7837338262476895, | |
| "grad_norm": 2.542327642440796, | |
| "learning_rate": 3.7593052109181144e-05, | |
| "loss": 0.4437144696712494, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.7911275415896488, | |
| "grad_norm": 3.4414448738098145, | |
| "learning_rate": 3.7468982630272954e-05, | |
| "loss": 0.9118318557739258, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.7985212569316081, | |
| "grad_norm": 4.058464527130127, | |
| "learning_rate": 3.734491315136477e-05, | |
| "loss": 1.0451924800872803, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.8059149722735675, | |
| "grad_norm": 4.525938987731934, | |
| "learning_rate": 3.7220843672456576e-05, | |
| "loss": 1.365138053894043, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.8133086876155268, | |
| "grad_norm": 4.43060302734375, | |
| "learning_rate": 3.7096774193548386e-05, | |
| "loss": 1.3941904306411743, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.8133086876155268, | |
| "eval_loss": 0.9057048559188843, | |
| "eval_runtime": 12.4702, | |
| "eval_samples_per_second": 4.01, | |
| "eval_steps_per_second": 1.042, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.8207024029574861, | |
| "grad_norm": 4.437230110168457, | |
| "learning_rate": 3.69727047146402e-05, | |
| "loss": 1.5756592750549316, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.8280961182994455, | |
| "grad_norm": 4.131067752838135, | |
| "learning_rate": 3.684863523573201e-05, | |
| "loss": 1.2377750873565674, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.8354898336414048, | |
| "grad_norm": 4.641602516174316, | |
| "learning_rate": 3.6724565756823825e-05, | |
| "loss": 1.4081263542175293, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.8428835489833642, | |
| "grad_norm": 4.326359272003174, | |
| "learning_rate": 3.6600496277915635e-05, | |
| "loss": 0.9341489672660828, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.8502772643253235, | |
| "grad_norm": 2.9741251468658447, | |
| "learning_rate": 3.6476426799007446e-05, | |
| "loss": 0.866841197013855, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.8576709796672828, | |
| "grad_norm": 4.513277053833008, | |
| "learning_rate": 3.635235732009926e-05, | |
| "loss": 1.2367680072784424, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.8650646950092421, | |
| "grad_norm": 3.476611852645874, | |
| "learning_rate": 3.622828784119107e-05, | |
| "loss": 1.1124229431152344, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.8724584103512015, | |
| "grad_norm": 3.6457555294036865, | |
| "learning_rate": 3.6104218362282885e-05, | |
| "loss": 0.9956739544868469, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.8798521256931608, | |
| "grad_norm": 3.688424825668335, | |
| "learning_rate": 3.5980148883374695e-05, | |
| "loss": 1.0528156757354736, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.8872458410351202, | |
| "grad_norm": 3.346254348754883, | |
| "learning_rate": 3.5856079404466506e-05, | |
| "loss": 0.7025595903396606, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.8872458410351202, | |
| "eval_loss": 0.8716071844100952, | |
| "eval_runtime": 12.4971, | |
| "eval_samples_per_second": 4.001, | |
| "eval_steps_per_second": 1.04, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.8946395563770795, | |
| "grad_norm": 4.01053524017334, | |
| "learning_rate": 3.573200992555831e-05, | |
| "loss": 1.2084448337554932, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.9020332717190388, | |
| "grad_norm": 4.092630386352539, | |
| "learning_rate": 3.560794044665012e-05, | |
| "loss": 0.9433890581130981, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.9094269870609981, | |
| "grad_norm": 4.795446872711182, | |
| "learning_rate": 3.548387096774194e-05, | |
| "loss": 1.5043132305145264, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.9168207024029574, | |
| "grad_norm": 5.034322261810303, | |
| "learning_rate": 3.535980148883375e-05, | |
| "loss": 1.2913501262664795, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.9242144177449169, | |
| "grad_norm": 2.9654548168182373, | |
| "learning_rate": 3.523573200992556e-05, | |
| "loss": 0.7111821174621582, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.9316081330868762, | |
| "grad_norm": 3.7520949840545654, | |
| "learning_rate": 3.511166253101737e-05, | |
| "loss": 1.012024164199829, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.9390018484288355, | |
| "grad_norm": 3.2195515632629395, | |
| "learning_rate": 3.498759305210919e-05, | |
| "loss": 0.7502498626708984, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.9463955637707948, | |
| "grad_norm": 2.7303340435028076, | |
| "learning_rate": 3.4863523573201e-05, | |
| "loss": 0.4674774408340454, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.9537892791127541, | |
| "grad_norm": 4.547392845153809, | |
| "learning_rate": 3.473945409429281e-05, | |
| "loss": 1.1602028608322144, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.9611829944547134, | |
| "grad_norm": 3.680309772491455, | |
| "learning_rate": 3.461538461538462e-05, | |
| "loss": 0.9905465841293335, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.9611829944547134, | |
| "eval_loss": 0.8414432406425476, | |
| "eval_runtime": 12.5233, | |
| "eval_samples_per_second": 3.993, | |
| "eval_steps_per_second": 1.038, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.9685767097966729, | |
| "grad_norm": 3.0262203216552734, | |
| "learning_rate": 3.449131513647643e-05, | |
| "loss": 0.5491358041763306, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.9759704251386322, | |
| "grad_norm": 3.6449105739593506, | |
| "learning_rate": 3.436724565756824e-05, | |
| "loss": 0.6083657741546631, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.9833641404805915, | |
| "grad_norm": 3.8271355628967285, | |
| "learning_rate": 3.424317617866005e-05, | |
| "loss": 0.8229025602340698, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.9907578558225508, | |
| "grad_norm": 4.178423881530762, | |
| "learning_rate": 3.411910669975186e-05, | |
| "loss": 0.9378503561019897, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.9981515711645101, | |
| "grad_norm": 4.2185516357421875, | |
| "learning_rate": 3.399503722084367e-05, | |
| "loss": 1.0079054832458496, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 7.801852703094482, | |
| "learning_rate": 3.387096774193548e-05, | |
| "loss": 0.695327877998352, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 1.0073937153419594, | |
| "grad_norm": 4.088887691497803, | |
| "learning_rate": 3.37468982630273e-05, | |
| "loss": 0.9851850867271423, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 1.0147874306839186, | |
| "grad_norm": 3.9392666816711426, | |
| "learning_rate": 3.362282878411911e-05, | |
| "loss": 1.0859596729278564, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 1.022181146025878, | |
| "grad_norm": 2.7098422050476074, | |
| "learning_rate": 3.349875930521092e-05, | |
| "loss": 0.6913776397705078, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 1.0295748613678373, | |
| "grad_norm": 3.724003314971924, | |
| "learning_rate": 3.337468982630273e-05, | |
| "loss": 0.9150189161300659, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.0295748613678373, | |
| "eval_loss": 0.8158807158470154, | |
| "eval_runtime": 12.4581, | |
| "eval_samples_per_second": 4.013, | |
| "eval_steps_per_second": 1.043, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.0369685767097967, | |
| "grad_norm": 3.8593032360076904, | |
| "learning_rate": 3.325062034739454e-05, | |
| "loss": 0.763762354850769, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 1.044362292051756, | |
| "grad_norm": 2.0002894401550293, | |
| "learning_rate": 3.312655086848635e-05, | |
| "loss": 0.19527605175971985, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 1.0517560073937153, | |
| "grad_norm": 3.253109931945801, | |
| "learning_rate": 3.300248138957816e-05, | |
| "loss": 0.6456115245819092, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 1.0591497227356748, | |
| "grad_norm": 3.54606556892395, | |
| "learning_rate": 3.2878411910669974e-05, | |
| "loss": 0.6633723974227905, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 1.066543438077634, | |
| "grad_norm": 3.267594575881958, | |
| "learning_rate": 3.2754342431761784e-05, | |
| "loss": 0.5955727696418762, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 1.0739371534195934, | |
| "grad_norm": 2.721489429473877, | |
| "learning_rate": 3.26302729528536e-05, | |
| "loss": 0.4804825186729431, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 1.0813308687615526, | |
| "grad_norm": 4.136324882507324, | |
| "learning_rate": 3.250620347394541e-05, | |
| "loss": 0.8072193264961243, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 1.088724584103512, | |
| "grad_norm": 4.00969934463501, | |
| "learning_rate": 3.238213399503722e-05, | |
| "loss": 0.6894694566726685, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 1.0961182994454712, | |
| "grad_norm": 4.594008445739746, | |
| "learning_rate": 3.2258064516129034e-05, | |
| "loss": 0.8274256587028503, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 1.1035120147874307, | |
| "grad_norm": 4.16753625869751, | |
| "learning_rate": 3.2133995037220844e-05, | |
| "loss": 0.9284324645996094, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.1035120147874307, | |
| "eval_loss": 0.7907436490058899, | |
| "eval_runtime": 12.5252, | |
| "eval_samples_per_second": 3.992, | |
| "eval_steps_per_second": 1.038, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.11090573012939, | |
| "grad_norm": 4.045674800872803, | |
| "learning_rate": 3.200992555831266e-05, | |
| "loss": 0.5929744243621826, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 1.1182994454713493, | |
| "grad_norm": 3.518078565597534, | |
| "learning_rate": 3.188585607940447e-05, | |
| "loss": 0.5093523263931274, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 1.1256931608133087, | |
| "grad_norm": 3.477130174636841, | |
| "learning_rate": 3.176178660049628e-05, | |
| "loss": 0.7743373513221741, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 1.133086876155268, | |
| "grad_norm": 3.28774356842041, | |
| "learning_rate": 3.1637717121588087e-05, | |
| "loss": 0.6708226799964905, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 1.1404805914972274, | |
| "grad_norm": 3.7155025005340576, | |
| "learning_rate": 3.15136476426799e-05, | |
| "loss": 0.8554853796958923, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 1.1478743068391868, | |
| "grad_norm": 3.8972744941711426, | |
| "learning_rate": 3.1389578163771715e-05, | |
| "loss": 0.6046540141105652, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 1.155268022181146, | |
| "grad_norm": 3.0317745208740234, | |
| "learning_rate": 3.1265508684863525e-05, | |
| "loss": 0.4163368046283722, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 1.1626617375231054, | |
| "grad_norm": 4.095373630523682, | |
| "learning_rate": 3.1141439205955336e-05, | |
| "loss": 0.7496839761734009, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 1.1700554528650646, | |
| "grad_norm": 3.626768112182617, | |
| "learning_rate": 3.1017369727047146e-05, | |
| "loss": 0.661150336265564, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 1.177449168207024, | |
| "grad_norm": 4.329172611236572, | |
| "learning_rate": 3.089330024813896e-05, | |
| "loss": 0.7081620693206787, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.177449168207024, | |
| "eval_loss": 0.7687544822692871, | |
| "eval_runtime": 12.4056, | |
| "eval_samples_per_second": 4.03, | |
| "eval_steps_per_second": 1.048, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.1848428835489835, | |
| "grad_norm": 3.254220485687256, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "loss": 0.5945311784744263, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 1.1922365988909427, | |
| "grad_norm": 3.851109266281128, | |
| "learning_rate": 3.0645161290322585e-05, | |
| "loss": 0.8574079871177673, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 1.1996303142329021, | |
| "grad_norm": 4.224574089050293, | |
| "learning_rate": 3.0521091811414396e-05, | |
| "loss": 0.9319736957550049, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 1.2070240295748613, | |
| "grad_norm": 4.972801208496094, | |
| "learning_rate": 3.0397022332506203e-05, | |
| "loss": 1.2526912689208984, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 1.2144177449168208, | |
| "grad_norm": 3.001422643661499, | |
| "learning_rate": 3.027295285359802e-05, | |
| "loss": 0.6652424335479736, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 1.22181146025878, | |
| "grad_norm": 4.232393741607666, | |
| "learning_rate": 3.014888337468983e-05, | |
| "loss": 0.7774908542633057, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 1.2292051756007394, | |
| "grad_norm": 3.8872828483581543, | |
| "learning_rate": 3.0024813895781638e-05, | |
| "loss": 0.6157264709472656, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 1.2365988909426986, | |
| "grad_norm": 4.408735275268555, | |
| "learning_rate": 2.990074441687345e-05, | |
| "loss": 0.6650868654251099, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 1.243992606284658, | |
| "grad_norm": 3.140364646911621, | |
| "learning_rate": 2.977667493796526e-05, | |
| "loss": 0.36262229084968567, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 1.2513863216266174, | |
| "grad_norm": 3.9706201553344727, | |
| "learning_rate": 2.9652605459057077e-05, | |
| "loss": 0.5755283832550049, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.2513863216266174, | |
| "eval_loss": 0.7536106705665588, | |
| "eval_runtime": 12.506, | |
| "eval_samples_per_second": 3.998, | |
| "eval_steps_per_second": 1.039, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.2587800369685767, | |
| "grad_norm": 3.590471029281616, | |
| "learning_rate": 2.9528535980148887e-05, | |
| "loss": 0.5963804125785828, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 1.266173752310536, | |
| "grad_norm": 4.341546535491943, | |
| "learning_rate": 2.9404466501240698e-05, | |
| "loss": 0.8772169947624207, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 1.2735674676524953, | |
| "grad_norm": 3.2243599891662598, | |
| "learning_rate": 2.9280397022332505e-05, | |
| "loss": 0.6366092562675476, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 1.2809611829944547, | |
| "grad_norm": 4.367596626281738, | |
| "learning_rate": 2.9156327543424316e-05, | |
| "loss": 0.9016575813293457, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 1.2883548983364141, | |
| "grad_norm": 4.07682466506958, | |
| "learning_rate": 2.9032258064516133e-05, | |
| "loss": 0.5885382890701294, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.2957486136783734, | |
| "grad_norm": 4.982141017913818, | |
| "learning_rate": 2.8908188585607944e-05, | |
| "loss": 0.8368382453918457, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 1.3031423290203328, | |
| "grad_norm": 4.268311977386475, | |
| "learning_rate": 2.8784119106699754e-05, | |
| "loss": 0.6095747947692871, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 1.310536044362292, | |
| "grad_norm": 3.039452314376831, | |
| "learning_rate": 2.8660049627791565e-05, | |
| "loss": 0.43989288806915283, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 1.3179297597042514, | |
| "grad_norm": 5.515888690948486, | |
| "learning_rate": 2.8535980148883372e-05, | |
| "loss": 1.043910026550293, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 1.3253234750462108, | |
| "grad_norm": 3.7631590366363525, | |
| "learning_rate": 2.841191066997519e-05, | |
| "loss": 0.5932552814483643, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.3253234750462108, | |
| "eval_loss": 0.7392276525497437, | |
| "eval_runtime": 12.5696, | |
| "eval_samples_per_second": 3.978, | |
| "eval_steps_per_second": 1.034, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.33271719038817, | |
| "grad_norm": 3.9628963470458984, | |
| "learning_rate": 2.8287841191067e-05, | |
| "loss": 0.5854453444480896, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 1.3401109057301293, | |
| "grad_norm": 4.974862098693848, | |
| "learning_rate": 2.816377171215881e-05, | |
| "loss": 0.8424703478813171, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 1.3475046210720887, | |
| "grad_norm": 4.7892069816589355, | |
| "learning_rate": 2.803970223325062e-05, | |
| "loss": 0.8794567584991455, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 1.354898336414048, | |
| "grad_norm": 4.94668436050415, | |
| "learning_rate": 2.7915632754342435e-05, | |
| "loss": 1.1411162614822388, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 1.3622920517560073, | |
| "grad_norm": 5.014815807342529, | |
| "learning_rate": 2.7791563275434246e-05, | |
| "loss": 1.0451624393463135, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 1.3696857670979667, | |
| "grad_norm": 4.067875862121582, | |
| "learning_rate": 2.7667493796526056e-05, | |
| "loss": 0.5183364748954773, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 1.377079482439926, | |
| "grad_norm": 4.259342670440674, | |
| "learning_rate": 2.7543424317617867e-05, | |
| "loss": 0.5706149935722351, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 1.3844731977818854, | |
| "grad_norm": 4.0488104820251465, | |
| "learning_rate": 2.7419354838709678e-05, | |
| "loss": 0.606059193611145, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 1.3918669131238448, | |
| "grad_norm": 4.461766242980957, | |
| "learning_rate": 2.729528535980149e-05, | |
| "loss": 0.861075222492218, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 1.399260628465804, | |
| "grad_norm": 4.1285295486450195, | |
| "learning_rate": 2.7171215880893302e-05, | |
| "loss": 0.6729316711425781, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.399260628465804, | |
| "eval_loss": 0.7324373722076416, | |
| "eval_runtime": 12.4604, | |
| "eval_samples_per_second": 4.013, | |
| "eval_steps_per_second": 1.043, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.4066543438077634, | |
| "grad_norm": 4.628056049346924, | |
| "learning_rate": 2.7047146401985113e-05, | |
| "loss": 0.5330791473388672, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 1.4140480591497226, | |
| "grad_norm": 4.561936855316162, | |
| "learning_rate": 2.6923076923076923e-05, | |
| "loss": 1.0062705278396606, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 1.421441774491682, | |
| "grad_norm": 3.802652359008789, | |
| "learning_rate": 2.6799007444168734e-05, | |
| "loss": 0.5224090814590454, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 1.4288354898336415, | |
| "grad_norm": 3.884530782699585, | |
| "learning_rate": 2.6674937965260548e-05, | |
| "loss": 0.7373669147491455, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 1.4362292051756007, | |
| "grad_norm": 2.499845504760742, | |
| "learning_rate": 2.655086848635236e-05, | |
| "loss": 0.14097268879413605, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 1.4436229205175601, | |
| "grad_norm": 3.8135945796966553, | |
| "learning_rate": 2.642679900744417e-05, | |
| "loss": 0.4497666656970978, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 1.4510166358595193, | |
| "grad_norm": 4.8832268714904785, | |
| "learning_rate": 2.630272952853598e-05, | |
| "loss": 1.0067732334136963, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 1.4584103512014788, | |
| "grad_norm": 4.868736267089844, | |
| "learning_rate": 2.617866004962779e-05, | |
| "loss": 0.7973582744598389, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 1.4658040665434382, | |
| "grad_norm": 3.969160556793213, | |
| "learning_rate": 2.6054590570719604e-05, | |
| "loss": 0.642175018787384, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 1.4731977818853974, | |
| "grad_norm": 4.04058837890625, | |
| "learning_rate": 2.5930521091811415e-05, | |
| "loss": 0.4151504635810852, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.4731977818853974, | |
| "eval_loss": 0.7266122698783875, | |
| "eval_runtime": 12.4172, | |
| "eval_samples_per_second": 4.027, | |
| "eval_steps_per_second": 1.047, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.4805914972273566, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.5806451612903226e-05, | |
| "loss": 0.9558417797088623, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 1.487985212569316, | |
| "grad_norm": 4.036558151245117, | |
| "learning_rate": 2.5806451612903226e-05, | |
| "loss": 0.633673369884491, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 1.4953789279112755, | |
| "grad_norm": 4.391520023345947, | |
| "learning_rate": 2.5682382133995036e-05, | |
| "loss": 0.6117820143699646, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 1.502772643253235, | |
| "grad_norm": 4.382378578186035, | |
| "learning_rate": 2.5558312655086853e-05, | |
| "loss": 0.7942304611206055, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 1.510166358595194, | |
| "grad_norm": 4.690098762512207, | |
| "learning_rate": 2.5434243176178664e-05, | |
| "loss": 1.1411387920379639, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 1.5175600739371533, | |
| "grad_norm": 3.7537717819213867, | |
| "learning_rate": 2.531017369727047e-05, | |
| "loss": 0.6303231716156006, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 1.5249537892791127, | |
| "grad_norm": 3.366995096206665, | |
| "learning_rate": 2.5186104218362282e-05, | |
| "loss": 0.3322565257549286, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 1.5323475046210722, | |
| "grad_norm": 3.7209525108337402, | |
| "learning_rate": 2.5062034739454093e-05, | |
| "loss": 0.39026719331741333, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 1.5397412199630314, | |
| "grad_norm": 3.066854953765869, | |
| "learning_rate": 2.4937965260545906e-05, | |
| "loss": 0.24430927634239197, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 1.5471349353049908, | |
| "grad_norm": 4.770087242126465, | |
| "learning_rate": 2.481389578163772e-05, | |
| "loss": 0.5006218552589417, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.5471349353049908, | |
| "eval_loss": 0.7169432044029236, | |
| "eval_runtime": 12.4867, | |
| "eval_samples_per_second": 4.004, | |
| "eval_steps_per_second": 1.041, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.55452865064695, | |
| "grad_norm": 2.8433492183685303, | |
| "learning_rate": 2.468982630272953e-05, | |
| "loss": 0.31588056683540344, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 1.5619223659889094, | |
| "grad_norm": 4.780882358551025, | |
| "learning_rate": 2.4565756823821338e-05, | |
| "loss": 0.9557748436927795, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 1.5693160813308689, | |
| "grad_norm": 3.854046583175659, | |
| "learning_rate": 2.4441687344913152e-05, | |
| "loss": 0.4003015160560608, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 1.576709796672828, | |
| "grad_norm": 4.2938666343688965, | |
| "learning_rate": 2.4317617866004963e-05, | |
| "loss": 0.6644906997680664, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 1.5841035120147873, | |
| "grad_norm": 4.548666000366211, | |
| "learning_rate": 2.4193548387096777e-05, | |
| "loss": 0.6904682517051697, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 1.5914972273567467, | |
| "grad_norm": 4.770917892456055, | |
| "learning_rate": 2.4069478908188587e-05, | |
| "loss": 0.837977945804596, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 1.5988909426987061, | |
| "grad_norm": 3.6060478687286377, | |
| "learning_rate": 2.3945409429280398e-05, | |
| "loss": 0.5721973776817322, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 1.6062846580406656, | |
| "grad_norm": 4.638070106506348, | |
| "learning_rate": 2.382133995037221e-05, | |
| "loss": 0.7397695183753967, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 1.6136783733826248, | |
| "grad_norm": 4.492130279541016, | |
| "learning_rate": 2.369727047146402e-05, | |
| "loss": 0.8275012969970703, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 1.621072088724584, | |
| "grad_norm": 2.734531879425049, | |
| "learning_rate": 2.3573200992555833e-05, | |
| "loss": 0.17226025462150574, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.621072088724584, | |
| "eval_loss": 0.7117969989776611, | |
| "eval_runtime": 12.5391, | |
| "eval_samples_per_second": 3.988, | |
| "eval_steps_per_second": 1.037, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.6284658040665434, | |
| "grad_norm": 5.867221832275391, | |
| "learning_rate": 2.3449131513647644e-05, | |
| "loss": 0.9325424432754517, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 1.6358595194085028, | |
| "grad_norm": 4.813448429107666, | |
| "learning_rate": 2.3325062034739454e-05, | |
| "loss": 1.0752629041671753, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 1.6432532347504623, | |
| "grad_norm": 4.7057647705078125, | |
| "learning_rate": 2.3200992555831265e-05, | |
| "loss": 0.5686098337173462, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 1.6506469500924215, | |
| "grad_norm": 4.052099704742432, | |
| "learning_rate": 2.307692307692308e-05, | |
| "loss": 0.6606102585792542, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 1.6580406654343807, | |
| "grad_norm": 3.486253261566162, | |
| "learning_rate": 2.295285359801489e-05, | |
| "loss": 0.6913259029388428, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.66543438077634, | |
| "grad_norm": 4.941483974456787, | |
| "learning_rate": 2.28287841191067e-05, | |
| "loss": 0.88069748878479, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 1.6728280961182995, | |
| "grad_norm": 3.968275785446167, | |
| "learning_rate": 2.2704714640198514e-05, | |
| "loss": 0.46321308612823486, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 1.6802218114602587, | |
| "grad_norm": 3.1694424152374268, | |
| "learning_rate": 2.258064516129032e-05, | |
| "loss": 0.387752503156662, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 1.6876155268022182, | |
| "grad_norm": 2.896517515182495, | |
| "learning_rate": 2.2456575682382135e-05, | |
| "loss": 0.19096603989601135, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 1.6950092421441774, | |
| "grad_norm": 5.64996337890625, | |
| "learning_rate": 2.2332506203473946e-05, | |
| "loss": 1.1302458047866821, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.6950092421441774, | |
| "eval_loss": 0.7003970146179199, | |
| "eval_runtime": 12.3627, | |
| "eval_samples_per_second": 4.044, | |
| "eval_steps_per_second": 1.052, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.7024029574861368, | |
| "grad_norm": 4.2490105628967285, | |
| "learning_rate": 2.2208436724565757e-05, | |
| "loss": 0.3965778350830078, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 1.7097966728280962, | |
| "grad_norm": 4.177857875823975, | |
| "learning_rate": 2.208436724565757e-05, | |
| "loss": 0.7732095122337341, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 1.7171903881700554, | |
| "grad_norm": 4.114255905151367, | |
| "learning_rate": 2.196029776674938e-05, | |
| "loss": 0.6610587239265442, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 1.7245841035120146, | |
| "grad_norm": 4.6579790115356445, | |
| "learning_rate": 2.1836228287841192e-05, | |
| "loss": 0.6404513120651245, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 1.731977818853974, | |
| "grad_norm": 4.545577526092529, | |
| "learning_rate": 2.1712158808933002e-05, | |
| "loss": 0.563823938369751, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.7393715341959335, | |
| "grad_norm": 3.8521006107330322, | |
| "learning_rate": 2.1588089330024816e-05, | |
| "loss": 0.46250104904174805, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 1.746765249537893, | |
| "grad_norm": 4.345403671264648, | |
| "learning_rate": 2.1464019851116627e-05, | |
| "loss": 0.572223961353302, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 1.7541589648798521, | |
| "grad_norm": 4.653343677520752, | |
| "learning_rate": 2.1339950372208438e-05, | |
| "loss": 0.916043221950531, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 1.7615526802218113, | |
| "grad_norm": 4.250296115875244, | |
| "learning_rate": 2.1215880893300248e-05, | |
| "loss": 0.5865936875343323, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 1.7689463955637708, | |
| "grad_norm": 5.195578575134277, | |
| "learning_rate": 2.109181141439206e-05, | |
| "loss": 1.2301476001739502, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.7689463955637708, | |
| "eval_loss": 0.6921948790550232, | |
| "eval_runtime": 12.4796, | |
| "eval_samples_per_second": 4.007, | |
| "eval_steps_per_second": 1.042, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.7763401109057302, | |
| "grad_norm": 2.8348636627197266, | |
| "learning_rate": 2.0967741935483873e-05, | |
| "loss": 0.26018866896629333, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 1.7837338262476896, | |
| "grad_norm": 5.202093124389648, | |
| "learning_rate": 2.0843672456575683e-05, | |
| "loss": 0.7929123044013977, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 1.7911275415896488, | |
| "grad_norm": 5.220610618591309, | |
| "learning_rate": 2.0719602977667497e-05, | |
| "loss": 0.6777660846710205, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 1.798521256931608, | |
| "grad_norm": 4.286166667938232, | |
| "learning_rate": 2.0595533498759305e-05, | |
| "loss": 0.6516886353492737, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 1.8059149722735675, | |
| "grad_norm": 4.031196594238281, | |
| "learning_rate": 2.0471464019851115e-05, | |
| "loss": 0.5112631916999817, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 1.8133086876155269, | |
| "grad_norm": 4.3230485916137695, | |
| "learning_rate": 2.034739454094293e-05, | |
| "loss": 0.3475070297718048, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 1.820702402957486, | |
| "grad_norm": 3.3923592567443848, | |
| "learning_rate": 2.022332506203474e-05, | |
| "loss": 0.4742909371852875, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 1.8280961182994455, | |
| "grad_norm": 3.982393264770508, | |
| "learning_rate": 2.0099255583126554e-05, | |
| "loss": 0.31971654295921326, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 1.8354898336414047, | |
| "grad_norm": 4.76895809173584, | |
| "learning_rate": 1.9975186104218364e-05, | |
| "loss": 0.6392852663993835, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 1.8428835489833642, | |
| "grad_norm": 3.412508010864258, | |
| "learning_rate": 1.9851116625310175e-05, | |
| "loss": 0.3292834758758545, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.8428835489833642, | |
| "eval_loss": 0.6914193034172058, | |
| "eval_runtime": 12.3365, | |
| "eval_samples_per_second": 4.053, | |
| "eval_steps_per_second": 1.054, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.8502772643253236, | |
| "grad_norm": 4.11257791519165, | |
| "learning_rate": 1.9727047146401986e-05, | |
| "loss": 0.7835528254508972, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 1.8576709796672828, | |
| "grad_norm": 5.388609886169434, | |
| "learning_rate": 1.9602977667493796e-05, | |
| "loss": 1.027623176574707, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 1.865064695009242, | |
| "grad_norm": 5.567387104034424, | |
| "learning_rate": 1.947890818858561e-05, | |
| "loss": 0.7551397681236267, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 1.8724584103512014, | |
| "grad_norm": 5.3149847984313965, | |
| "learning_rate": 1.935483870967742e-05, | |
| "loss": 1.1124372482299805, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 1.8798521256931608, | |
| "grad_norm": 4.300573348999023, | |
| "learning_rate": 1.923076923076923e-05, | |
| "loss": 0.7125287055969238, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 1.8872458410351203, | |
| "grad_norm": 4.081615924835205, | |
| "learning_rate": 1.9106699751861042e-05, | |
| "loss": 0.5935063362121582, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 1.8946395563770795, | |
| "grad_norm": 2.4937996864318848, | |
| "learning_rate": 1.8982630272952853e-05, | |
| "loss": 0.2382672131061554, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 1.9020332717190387, | |
| "grad_norm": 3.744213819503784, | |
| "learning_rate": 1.8858560794044667e-05, | |
| "loss": 0.5946758985519409, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 1.9094269870609981, | |
| "grad_norm": 3.3455610275268555, | |
| "learning_rate": 1.8734491315136477e-05, | |
| "loss": 0.3634100556373596, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 1.9168207024029575, | |
| "grad_norm": 3.925421714782715, | |
| "learning_rate": 1.8610421836228288e-05, | |
| "loss": 0.4476943016052246, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.9168207024029575, | |
| "eval_loss": 0.6890667676925659, | |
| "eval_runtime": 12.5388, | |
| "eval_samples_per_second": 3.988, | |
| "eval_steps_per_second": 1.037, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.924214417744917, | |
| "grad_norm": 4.225397109985352, | |
| "learning_rate": 1.84863523573201e-05, | |
| "loss": 0.6327498555183411, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 1.9316081330868762, | |
| "grad_norm": 5.073101043701172, | |
| "learning_rate": 1.8362282878411912e-05, | |
| "loss": 0.6480901837348938, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 1.9390018484288354, | |
| "grad_norm": 5.898105144500732, | |
| "learning_rate": 1.8238213399503723e-05, | |
| "loss": 0.8572679758071899, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 1.9463955637707948, | |
| "grad_norm": 5.332759380340576, | |
| "learning_rate": 1.8114143920595534e-05, | |
| "loss": 0.7909560203552246, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 1.9537892791127542, | |
| "grad_norm": 3.7612059116363525, | |
| "learning_rate": 1.7990074441687348e-05, | |
| "loss": 0.46339747309684753, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 1.9611829944547134, | |
| "grad_norm": 3.9361913204193115, | |
| "learning_rate": 1.7866004962779155e-05, | |
| "loss": 0.28523582220077515, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 1.9685767097966729, | |
| "grad_norm": 3.6171579360961914, | |
| "learning_rate": 1.774193548387097e-05, | |
| "loss": 0.5036706924438477, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 1.975970425138632, | |
| "grad_norm": 4.578619003295898, | |
| "learning_rate": 1.761786600496278e-05, | |
| "loss": 0.5884866714477539, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 1.9833641404805915, | |
| "grad_norm": 3.30562162399292, | |
| "learning_rate": 1.7493796526054593e-05, | |
| "loss": 0.27540749311447144, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 1.990757855822551, | |
| "grad_norm": 5.476099491119385, | |
| "learning_rate": 1.7369727047146404e-05, | |
| "loss": 0.6743600368499756, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.990757855822551, | |
| "eval_loss": 0.6857466101646423, | |
| "eval_runtime": 12.4606, | |
| "eval_samples_per_second": 4.013, | |
| "eval_steps_per_second": 1.043, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.9981515711645101, | |
| "grad_norm": 5.06631326675415, | |
| "learning_rate": 1.7245657568238215e-05, | |
| "loss": 0.6917240023612976, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 10.330102920532227, | |
| "learning_rate": 1.7121588089330025e-05, | |
| "loss": 0.9991450905799866, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 2.0073937153419594, | |
| "grad_norm": 3.6291868686676025, | |
| "learning_rate": 1.6997518610421836e-05, | |
| "loss": 0.5753036737442017, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 2.014787430683919, | |
| "grad_norm": 3.012753963470459, | |
| "learning_rate": 1.687344913151365e-05, | |
| "loss": 0.39315706491470337, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 2.022181146025878, | |
| "grad_norm": 2.8621585369110107, | |
| "learning_rate": 1.674937965260546e-05, | |
| "loss": 0.21679037809371948, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 2.0295748613678373, | |
| "grad_norm": 3.5421297550201416, | |
| "learning_rate": 1.662531017369727e-05, | |
| "loss": 0.3504061996936798, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 2.0369685767097967, | |
| "grad_norm": 4.237403869628906, | |
| "learning_rate": 1.650124069478908e-05, | |
| "loss": 0.3911523222923279, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 2.044362292051756, | |
| "grad_norm": 3.58307147026062, | |
| "learning_rate": 1.6377171215880892e-05, | |
| "loss": 0.2892913818359375, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 2.0517560073937156, | |
| "grad_norm": 3.5432863235473633, | |
| "learning_rate": 1.6253101736972706e-05, | |
| "loss": 0.28674107789993286, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 2.0591497227356745, | |
| "grad_norm": 3.829465389251709, | |
| "learning_rate": 1.6129032258064517e-05, | |
| "loss": 0.5085712671279907, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.0591497227356745, | |
| "eval_loss": 0.6785848736763, | |
| "eval_runtime": 12.4959, | |
| "eval_samples_per_second": 4.001, | |
| "eval_steps_per_second": 1.04, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.066543438077634, | |
| "grad_norm": 4.736692428588867, | |
| "learning_rate": 1.600496277915633e-05, | |
| "loss": 0.45895498991012573, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 2.0739371534195934, | |
| "grad_norm": 3.5632877349853516, | |
| "learning_rate": 1.588089330024814e-05, | |
| "loss": 0.404934823513031, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 2.081330868761553, | |
| "grad_norm": 2.9595789909362793, | |
| "learning_rate": 1.575682382133995e-05, | |
| "loss": 0.24088506400585175, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 2.088724584103512, | |
| "grad_norm": 3.6839349269866943, | |
| "learning_rate": 1.5632754342431763e-05, | |
| "loss": 0.3658759891986847, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 2.0961182994454712, | |
| "grad_norm": 4.99697208404541, | |
| "learning_rate": 1.5508684863523573e-05, | |
| "loss": 0.6948235034942627, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 2.1035120147874307, | |
| "grad_norm": 4.195018291473389, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "loss": 0.37375789880752563, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 2.11090573012939, | |
| "grad_norm": 3.6975293159484863, | |
| "learning_rate": 1.5260545905707198e-05, | |
| "loss": 0.4121526777744293, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 2.1182994454713495, | |
| "grad_norm": 2.941937208175659, | |
| "learning_rate": 1.513647642679901e-05, | |
| "loss": 0.27218982577323914, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 2.1256931608133085, | |
| "grad_norm": 4.575267791748047, | |
| "learning_rate": 1.5012406947890819e-05, | |
| "loss": 0.6285619735717773, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 2.133086876155268, | |
| "grad_norm": 3.1897130012512207, | |
| "learning_rate": 1.488833746898263e-05, | |
| "loss": 0.2965329587459564, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 2.133086876155268, | |
| "eval_loss": 0.677734375, | |
| "eval_runtime": 12.5014, | |
| "eval_samples_per_second": 4.0, | |
| "eval_steps_per_second": 1.04, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 2.1404805914972274, | |
| "grad_norm": 4.293984889984131, | |
| "learning_rate": 1.4764267990074444e-05, | |
| "loss": 0.5726566314697266, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 2.147874306839187, | |
| "grad_norm": 3.8995208740234375, | |
| "learning_rate": 1.4640198511166252e-05, | |
| "loss": 0.5817862749099731, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 2.155268022181146, | |
| "grad_norm": 3.5895419120788574, | |
| "learning_rate": 1.4516129032258066e-05, | |
| "loss": 0.35040074586868286, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 2.162661737523105, | |
| "grad_norm": 2.880908966064453, | |
| "learning_rate": 1.4392059553349877e-05, | |
| "loss": 0.2075611799955368, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 2.1700554528650646, | |
| "grad_norm": 2.844344139099121, | |
| "learning_rate": 1.4267990074441686e-05, | |
| "loss": 0.16030986607074738, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 2.177449168207024, | |
| "grad_norm": 3.2597815990448, | |
| "learning_rate": 1.41439205955335e-05, | |
| "loss": 0.4147431254386902, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 2.1848428835489835, | |
| "grad_norm": 3.9886868000030518, | |
| "learning_rate": 1.401985111662531e-05, | |
| "loss": 0.5274520516395569, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 2.1922365988909425, | |
| "grad_norm": 4.478377819061279, | |
| "learning_rate": 1.3895781637717123e-05, | |
| "loss": 0.41934865713119507, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 2.199630314232902, | |
| "grad_norm": 4.394498348236084, | |
| "learning_rate": 1.3771712158808933e-05, | |
| "loss": 0.42625561356544495, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 2.2070240295748613, | |
| "grad_norm": 3.080974578857422, | |
| "learning_rate": 1.3647642679900746e-05, | |
| "loss": 0.3000877797603607, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.2070240295748613, | |
| "eval_loss": 0.6803019046783447, | |
| "eval_runtime": 12.5007, | |
| "eval_samples_per_second": 4.0, | |
| "eval_steps_per_second": 1.04, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.2144177449168208, | |
| "grad_norm": 4.009698867797852, | |
| "learning_rate": 1.3523573200992556e-05, | |
| "loss": 0.43977871537208557, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 2.22181146025878, | |
| "grad_norm": 2.766298294067383, | |
| "learning_rate": 1.3399503722084367e-05, | |
| "loss": 0.17407231032848358, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 2.229205175600739, | |
| "grad_norm": 5.193652629852295, | |
| "learning_rate": 1.327543424317618e-05, | |
| "loss": 0.40429675579071045, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 2.2365988909426986, | |
| "grad_norm": 4.609817981719971, | |
| "learning_rate": 1.315136476426799e-05, | |
| "loss": 0.6340703964233398, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 2.243992606284658, | |
| "grad_norm": 3.17801570892334, | |
| "learning_rate": 1.3027295285359802e-05, | |
| "loss": 0.3360348343849182, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 2.2513863216266174, | |
| "grad_norm": 4.517796993255615, | |
| "learning_rate": 1.2903225806451613e-05, | |
| "loss": 0.6079537272453308, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 2.258780036968577, | |
| "grad_norm": 4.179698944091797, | |
| "learning_rate": 1.2779156327543427e-05, | |
| "loss": 0.4164172410964966, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 2.266173752310536, | |
| "grad_norm": 4.557032108306885, | |
| "learning_rate": 1.2655086848635236e-05, | |
| "loss": 0.5597180128097534, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 2.2735674676524953, | |
| "grad_norm": 3.3242549896240234, | |
| "learning_rate": 1.2531017369727046e-05, | |
| "loss": 0.2977086901664734, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 2.2809611829944547, | |
| "grad_norm": 4.459362983703613, | |
| "learning_rate": 1.240694789081886e-05, | |
| "loss": 0.46301090717315674, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 2.2809611829944547, | |
| "eval_loss": 0.6781811714172363, | |
| "eval_runtime": 12.543, | |
| "eval_samples_per_second": 3.986, | |
| "eval_steps_per_second": 1.036, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 2.288354898336414, | |
| "grad_norm": 4.992742538452148, | |
| "learning_rate": 1.2282878411910669e-05, | |
| "loss": 0.46335217356681824, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 2.2957486136783736, | |
| "grad_norm": 3.204737424850464, | |
| "learning_rate": 1.2158808933002481e-05, | |
| "loss": 0.2609277367591858, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 2.3031423290203326, | |
| "grad_norm": 2.343017339706421, | |
| "learning_rate": 1.2034739454094294e-05, | |
| "loss": 0.09263511747121811, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 2.310536044362292, | |
| "grad_norm": 4.5192108154296875, | |
| "learning_rate": 1.1910669975186104e-05, | |
| "loss": 0.4888758957386017, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 2.3179297597042514, | |
| "grad_norm": 4.179697513580322, | |
| "learning_rate": 1.1786600496277917e-05, | |
| "loss": 0.2793925702571869, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 2.325323475046211, | |
| "grad_norm": 3.240756034851074, | |
| "learning_rate": 1.1662531017369727e-05, | |
| "loss": 0.18993309140205383, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 2.33271719038817, | |
| "grad_norm": 3.8120131492614746, | |
| "learning_rate": 1.153846153846154e-05, | |
| "loss": 0.400962233543396, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 2.3401109057301293, | |
| "grad_norm": 3.7298102378845215, | |
| "learning_rate": 1.141439205955335e-05, | |
| "loss": 0.46058881282806396, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 2.3475046210720887, | |
| "grad_norm": 4.015145778656006, | |
| "learning_rate": 1.129032258064516e-05, | |
| "loss": 0.408356249332428, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 2.354898336414048, | |
| "grad_norm": 4.480742454528809, | |
| "learning_rate": 1.1166253101736973e-05, | |
| "loss": 0.5604572296142578, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.354898336414048, | |
| "eval_loss": 0.6816579699516296, | |
| "eval_runtime": 12.3582, | |
| "eval_samples_per_second": 4.046, | |
| "eval_steps_per_second": 1.052, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.3622920517560075, | |
| "grad_norm": 4.857553482055664, | |
| "learning_rate": 1.1042183622828785e-05, | |
| "loss": 0.40513134002685547, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 2.369685767097967, | |
| "grad_norm": 4.126130104064941, | |
| "learning_rate": 1.0918114143920596e-05, | |
| "loss": 0.40128400921821594, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 2.377079482439926, | |
| "grad_norm": 4.141418933868408, | |
| "learning_rate": 1.0794044665012408e-05, | |
| "loss": 0.29924750328063965, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 2.3844731977818854, | |
| "grad_norm": 4.493786811828613, | |
| "learning_rate": 1.0669975186104219e-05, | |
| "loss": 0.4414414167404175, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 2.391866913123845, | |
| "grad_norm": 3.504249095916748, | |
| "learning_rate": 1.054590570719603e-05, | |
| "loss": 0.21310807764530182, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 2.3992606284658042, | |
| "grad_norm": 4.698243618011475, | |
| "learning_rate": 1.0421836228287842e-05, | |
| "loss": 0.3865514397621155, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 2.406654343807763, | |
| "grad_norm": 4.5291361808776855, | |
| "learning_rate": 1.0297766749379652e-05, | |
| "loss": 0.507878303527832, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 2.4140480591497226, | |
| "grad_norm": 4.491507530212402, | |
| "learning_rate": 1.0173697270471465e-05, | |
| "loss": 0.5876278877258301, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 2.421441774491682, | |
| "grad_norm": 4.440368175506592, | |
| "learning_rate": 1.0049627791563277e-05, | |
| "loss": 0.3370438814163208, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 2.4288354898336415, | |
| "grad_norm": 4.03184700012207, | |
| "learning_rate": 9.925558312655088e-06, | |
| "loss": 0.3488239645957947, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 2.4288354898336415, | |
| "eval_loss": 0.6855019927024841, | |
| "eval_runtime": 12.5549, | |
| "eval_samples_per_second": 3.983, | |
| "eval_steps_per_second": 1.035, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 2.436229205175601, | |
| "grad_norm": 5.132557392120361, | |
| "learning_rate": 9.801488833746898e-06, | |
| "loss": 0.5963175892829895, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 2.44362292051756, | |
| "grad_norm": 3.78555965423584, | |
| "learning_rate": 9.67741935483871e-06, | |
| "loss": 0.258226603269577, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 2.4510166358595193, | |
| "grad_norm": 4.775308132171631, | |
| "learning_rate": 9.553349875930521e-06, | |
| "loss": 0.43731528520584106, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 2.4584103512014788, | |
| "grad_norm": 3.104215621948242, | |
| "learning_rate": 9.429280397022333e-06, | |
| "loss": 0.37882596254348755, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 2.465804066543438, | |
| "grad_norm": 3.798936128616333, | |
| "learning_rate": 9.305210918114144e-06, | |
| "loss": 0.4152655601501465, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 2.473197781885397, | |
| "grad_norm": 3.886282444000244, | |
| "learning_rate": 9.181141439205956e-06, | |
| "loss": 0.45343902707099915, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 2.4805914972273566, | |
| "grad_norm": 3.8217668533325195, | |
| "learning_rate": 9.057071960297767e-06, | |
| "loss": 0.3023824095726013, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 2.487985212569316, | |
| "grad_norm": 4.341695308685303, | |
| "learning_rate": 8.933002481389577e-06, | |
| "loss": 0.31776532530784607, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 2.4953789279112755, | |
| "grad_norm": 4.166908264160156, | |
| "learning_rate": 8.80893300248139e-06, | |
| "loss": 0.4596524238586426, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 2.502772643253235, | |
| "grad_norm": 4.498860836029053, | |
| "learning_rate": 8.684863523573202e-06, | |
| "loss": 0.42993947863578796, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 2.502772643253235, | |
| "eval_loss": 0.6849582195281982, | |
| "eval_runtime": 12.4343, | |
| "eval_samples_per_second": 4.021, | |
| "eval_steps_per_second": 1.045, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 2.5101663585951943, | |
| "grad_norm": 4.697827339172363, | |
| "learning_rate": 8.560794044665013e-06, | |
| "loss": 0.30538150668144226, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 2.5175600739371533, | |
| "grad_norm": 5.051844596862793, | |
| "learning_rate": 8.436724565756825e-06, | |
| "loss": 0.424445241689682, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 2.5249537892791127, | |
| "grad_norm": 4.363079071044922, | |
| "learning_rate": 8.312655086848635e-06, | |
| "loss": 0.3895280361175537, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 2.532347504621072, | |
| "grad_norm": 3.4225594997406006, | |
| "learning_rate": 8.188585607940446e-06, | |
| "loss": 0.24427245557308197, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 2.539741219963031, | |
| "grad_norm": 4.501352787017822, | |
| "learning_rate": 8.064516129032258e-06, | |
| "loss": 0.5370553135871887, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 2.5471349353049906, | |
| "grad_norm": 4.623712539672852, | |
| "learning_rate": 7.94044665012407e-06, | |
| "loss": 0.36334437131881714, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 2.55452865064695, | |
| "grad_norm": 4.001847743988037, | |
| "learning_rate": 7.816377171215881e-06, | |
| "loss": 0.3196173310279846, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 2.5619223659889094, | |
| "grad_norm": 4.033841609954834, | |
| "learning_rate": 7.692307692307694e-06, | |
| "loss": 0.2993355691432953, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 2.569316081330869, | |
| "grad_norm": 5.598950386047363, | |
| "learning_rate": 7.568238213399505e-06, | |
| "loss": 0.5544854402542114, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 2.5767097966728283, | |
| "grad_norm": 3.0546700954437256, | |
| "learning_rate": 7.444168734491315e-06, | |
| "loss": 0.2565973699092865, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.5767097966728283, | |
| "eval_loss": 0.6780612468719482, | |
| "eval_runtime": 12.5593, | |
| "eval_samples_per_second": 3.981, | |
| "eval_steps_per_second": 1.035, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.5841035120147873, | |
| "grad_norm": 5.245316028594971, | |
| "learning_rate": 7.320099255583126e-06, | |
| "loss": 0.3251678943634033, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 2.5914972273567467, | |
| "grad_norm": 3.5428197383880615, | |
| "learning_rate": 7.1960297766749385e-06, | |
| "loss": 0.2545225918292999, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 2.598890942698706, | |
| "grad_norm": 3.804682493209839, | |
| "learning_rate": 7.07196029776675e-06, | |
| "loss": 0.47154200077056885, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 2.6062846580406656, | |
| "grad_norm": 4.04072904586792, | |
| "learning_rate": 6.9478908188585614e-06, | |
| "loss": 0.35344043374061584, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 2.6136783733826245, | |
| "grad_norm": 5.472744464874268, | |
| "learning_rate": 6.823821339950373e-06, | |
| "loss": 0.4716290831565857, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 2.621072088724584, | |
| "grad_norm": 5.119224548339844, | |
| "learning_rate": 6.6997518610421835e-06, | |
| "loss": 0.5888644456863403, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 2.6284658040665434, | |
| "grad_norm": 5.897572994232178, | |
| "learning_rate": 6.575682382133995e-06, | |
| "loss": 0.5343536138534546, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 2.635859519408503, | |
| "grad_norm": 5.354091167449951, | |
| "learning_rate": 6.451612903225806e-06, | |
| "loss": 0.8592066764831543, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 2.6432532347504623, | |
| "grad_norm": 4.489461898803711, | |
| "learning_rate": 6.327543424317618e-06, | |
| "loss": 0.33109182119369507, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 2.6506469500924217, | |
| "grad_norm": 4.269669532775879, | |
| "learning_rate": 6.20347394540943e-06, | |
| "loss": 0.32698845863342285, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.6506469500924217, | |
| "eval_loss": 0.6756904125213623, | |
| "eval_runtime": 12.4205, | |
| "eval_samples_per_second": 4.026, | |
| "eval_steps_per_second": 1.047, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.6580406654343807, | |
| "grad_norm": 2.9795918464660645, | |
| "learning_rate": 6.079404466501241e-06, | |
| "loss": 0.16840402781963348, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 2.66543438077634, | |
| "grad_norm": 4.061313629150391, | |
| "learning_rate": 5.955334987593052e-06, | |
| "loss": 0.3083171546459198, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 2.6728280961182995, | |
| "grad_norm": 4.778440475463867, | |
| "learning_rate": 5.831265508684864e-06, | |
| "loss": 0.34697240591049194, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 2.6802218114602585, | |
| "grad_norm": 4.378132343292236, | |
| "learning_rate": 5.707196029776675e-06, | |
| "loss": 0.4491539001464844, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 2.687615526802218, | |
| "grad_norm": 3.488309860229492, | |
| "learning_rate": 5.5831265508684865e-06, | |
| "loss": 0.2493092566728592, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 2.6950092421441774, | |
| "grad_norm": 2.665125846862793, | |
| "learning_rate": 5.459057071960298e-06, | |
| "loss": 0.14598557353019714, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 2.702402957486137, | |
| "grad_norm": 4.287075519561768, | |
| "learning_rate": 5.334987593052109e-06, | |
| "loss": 0.33190983533859253, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 2.709796672828096, | |
| "grad_norm": 4.174441337585449, | |
| "learning_rate": 5.210918114143921e-06, | |
| "loss": 0.38076817989349365, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 2.7171903881700556, | |
| "grad_norm": 4.562845706939697, | |
| "learning_rate": 5.086848635235732e-06, | |
| "loss": 0.385815292596817, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 2.7245841035120146, | |
| "grad_norm": 4.855499267578125, | |
| "learning_rate": 4.962779156327544e-06, | |
| "loss": 0.6614516973495483, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 2.7245841035120146, | |
| "eval_loss": 0.675829291343689, | |
| "eval_runtime": 12.5697, | |
| "eval_samples_per_second": 3.978, | |
| "eval_steps_per_second": 1.034, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 2.731977818853974, | |
| "grad_norm": 5.454403400421143, | |
| "learning_rate": 4.838709677419355e-06, | |
| "loss": 0.8207973837852478, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 2.7393715341959335, | |
| "grad_norm": 4.332508563995361, | |
| "learning_rate": 4.714640198511167e-06, | |
| "loss": 0.3006463646888733, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 2.746765249537893, | |
| "grad_norm": 3.909074544906616, | |
| "learning_rate": 4.590570719602978e-06, | |
| "loss": 0.28956088423728943, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 2.754158964879852, | |
| "grad_norm": 5.085633754730225, | |
| "learning_rate": 4.466501240694789e-06, | |
| "loss": 0.35135942697525024, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 2.7615526802218113, | |
| "grad_norm": 4.4873809814453125, | |
| "learning_rate": 4.342431761786601e-06, | |
| "loss": 0.4216098487377167, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 2.7689463955637708, | |
| "grad_norm": 4.101310729980469, | |
| "learning_rate": 4.2183622828784124e-06, | |
| "loss": 0.2831707298755646, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 2.77634011090573, | |
| "grad_norm": 6.565721035003662, | |
| "learning_rate": 4.094292803970223e-06, | |
| "loss": 0.8177705407142639, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 2.7837338262476896, | |
| "grad_norm": 4.548885345458984, | |
| "learning_rate": 3.970223325062035e-06, | |
| "loss": 0.5057659149169922, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 2.791127541589649, | |
| "grad_norm": 4.665341377258301, | |
| "learning_rate": 3.846153846153847e-06, | |
| "loss": 0.33335670828819275, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 2.798521256931608, | |
| "grad_norm": 4.832557201385498, | |
| "learning_rate": 3.7220843672456574e-06, | |
| "loss": 0.548736572265625, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 2.798521256931608, | |
| "eval_loss": 0.6768398880958557, | |
| "eval_runtime": 12.3489, | |
| "eval_samples_per_second": 4.049, | |
| "eval_steps_per_second": 1.053, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 2.8059149722735675, | |
| "grad_norm": 2.661865472793579, | |
| "learning_rate": 3.5980148883374693e-06, | |
| "loss": 0.10511849820613861, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 2.813308687615527, | |
| "grad_norm": 5.309775352478027, | |
| "learning_rate": 3.4739454094292807e-06, | |
| "loss": 0.6201926469802856, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 2.820702402957486, | |
| "grad_norm": 4.453733921051025, | |
| "learning_rate": 3.3498759305210917e-06, | |
| "loss": 0.3460041880607605, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 2.8280961182994453, | |
| "grad_norm": 4.914036750793457, | |
| "learning_rate": 3.225806451612903e-06, | |
| "loss": 0.48873624205589294, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 2.8354898336414047, | |
| "grad_norm": 4.469694137573242, | |
| "learning_rate": 3.101736972704715e-06, | |
| "loss": 0.3550401031970978, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 2.842883548983364, | |
| "grad_norm": 4.101950168609619, | |
| "learning_rate": 2.977667493796526e-06, | |
| "loss": 0.36257147789001465, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 2.8502772643253236, | |
| "grad_norm": 4.840570449829102, | |
| "learning_rate": 2.8535980148883375e-06, | |
| "loss": 0.5777380466461182, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 2.857670979667283, | |
| "grad_norm": 3.147803783416748, | |
| "learning_rate": 2.729528535980149e-06, | |
| "loss": 0.320244163274765, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 2.865064695009242, | |
| "grad_norm": 4.090023994445801, | |
| "learning_rate": 2.6054590570719604e-06, | |
| "loss": 0.2959524989128113, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 2.8724584103512014, | |
| "grad_norm": 4.499933242797852, | |
| "learning_rate": 2.481389578163772e-06, | |
| "loss": 0.3996496796607971, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.8724584103512014, | |
| "eval_loss": 0.6760193705558777, | |
| "eval_runtime": 12.5645, | |
| "eval_samples_per_second": 3.979, | |
| "eval_steps_per_second": 1.035, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.879852125693161, | |
| "grad_norm": 4.907258033752441, | |
| "learning_rate": 2.3573200992555833e-06, | |
| "loss": 0.30245816707611084, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 2.8872458410351203, | |
| "grad_norm": 4.042727947235107, | |
| "learning_rate": 2.2332506203473944e-06, | |
| "loss": 0.3344458341598511, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 2.8946395563770793, | |
| "grad_norm": 4.045156002044678, | |
| "learning_rate": 2.1091811414392062e-06, | |
| "loss": 0.17773765325546265, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 2.9020332717190387, | |
| "grad_norm": 4.525294303894043, | |
| "learning_rate": 1.9851116625310177e-06, | |
| "loss": 0.3942530155181885, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 2.909426987060998, | |
| "grad_norm": 4.726840019226074, | |
| "learning_rate": 1.8610421836228287e-06, | |
| "loss": 0.4639776349067688, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 2.9168207024029575, | |
| "grad_norm": 6.167337417602539, | |
| "learning_rate": 1.7369727047146404e-06, | |
| "loss": 0.873107373714447, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 2.924214417744917, | |
| "grad_norm": 4.44651460647583, | |
| "learning_rate": 1.6129032258064516e-06, | |
| "loss": 0.4783494472503662, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 2.9316081330868764, | |
| "grad_norm": 5.8177289962768555, | |
| "learning_rate": 1.488833746898263e-06, | |
| "loss": 0.566139280796051, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 2.9390018484288354, | |
| "grad_norm": 4.559521675109863, | |
| "learning_rate": 1.3647642679900745e-06, | |
| "loss": 0.2975980043411255, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 2.946395563770795, | |
| "grad_norm": 4.534932613372803, | |
| "learning_rate": 1.240694789081886e-06, | |
| "loss": 0.42307165265083313, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.946395563770795, | |
| "eval_loss": 0.6753122210502625, | |
| "eval_runtime": 12.473, | |
| "eval_samples_per_second": 4.009, | |
| "eval_steps_per_second": 1.042, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.9537892791127542, | |
| "grad_norm": 4.688410758972168, | |
| "learning_rate": 1.1166253101736972e-06, | |
| "loss": 0.31728246808052063, | |
| "step": 401 | |
| }, | |
| { | |
| "epoch": 2.9611829944547132, | |
| "grad_norm": 3.6959214210510254, | |
| "learning_rate": 9.925558312655088e-07, | |
| "loss": 0.296553373336792, | |
| "step": 402 | |
| }, | |
| { | |
| "epoch": 2.9685767097966727, | |
| "grad_norm": 4.490988254547119, | |
| "learning_rate": 8.684863523573202e-07, | |
| "loss": 0.41596537828445435, | |
| "step": 403 | |
| }, | |
| { | |
| "epoch": 2.975970425138632, | |
| "grad_norm": 5.713006019592285, | |
| "learning_rate": 7.444168734491315e-07, | |
| "loss": 0.5145145654678345, | |
| "step": 404 | |
| }, | |
| { | |
| "epoch": 2.9833641404805915, | |
| "grad_norm": 4.68435001373291, | |
| "learning_rate": 6.20347394540943e-07, | |
| "loss": 0.47570955753326416, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 2.990757855822551, | |
| "grad_norm": 3.961190938949585, | |
| "learning_rate": 4.962779156327544e-07, | |
| "loss": 0.4042632579803467, | |
| "step": 406 | |
| }, | |
| { | |
| "epoch": 2.9981515711645104, | |
| "grad_norm": 5.057858467102051, | |
| "learning_rate": 3.7220843672456576e-07, | |
| "loss": 0.4465891718864441, | |
| "step": 407 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 8.670039176940918, | |
| "learning_rate": 2.481389578163772e-07, | |
| "loss": 0.4737997353076935, | |
| "step": 408 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.6750363707542419, | |
| "eval_runtime": 12.4809, | |
| "eval_samples_per_second": 4.006, | |
| "eval_steps_per_second": 1.042, | |
| "step": 408 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 408, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 10, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.1448379908790272e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |