Update training logs at step 500
Browse files- training_logs.jsonl +22 -0
training_logs.jsonl
ADDED
|
@@ -0,0 +1,22 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"step": 1, "epoch": 0.0006309148264984228, "time": "2026-07-08 22:01:06", "logs": {"loss": 0.6932622194290161, "grad_norm": 2.571892738342285, "learning_rate": 0.0, "epoch": 0.0006309148264984228}}
|
| 2 |
+
{"step": 25, "epoch": 0.015772870662460567, "time": "2026-07-08 22:01:25", "logs": {"loss": 0.7295282681783041, "grad_norm": 2.436145544052124, "learning_rate": 7.570977917981073e-07, "epoch": 0.015772870662460567}}
|
| 3 |
+
{"step": 50, "epoch": 0.031545741324921134, "time": "2026-07-08 22:01:45", "logs": {"loss": 0.7090779113769531, "grad_norm": 5.32429838180542, "learning_rate": 1.545741324921136e-06, "epoch": 0.031545741324921134}}
|
| 4 |
+
{"step": 75, "epoch": 0.0473186119873817, "time": "2026-07-08 22:02:06", "logs": {"loss": 0.6694438171386718, "grad_norm": 5.425052165985107, "learning_rate": 2.3343848580441643e-06, "epoch": 0.0473186119873817}}
|
| 5 |
+
{"step": 100, "epoch": 0.06309148264984227, "time": "2026-07-08 22:02:28", "logs": {"loss": 0.6196812057495117, "grad_norm": 5.74971866607666, "learning_rate": 3.1230283911671926e-06, "epoch": 0.06309148264984227}}
|
| 6 |
+
{"step": 125, "epoch": 0.07886435331230283, "time": "2026-07-08 22:02:50", "logs": {"loss": 0.43090095520019533, "grad_norm": 4.759191989898682, "learning_rate": 3.911671924290221e-06, "epoch": 0.07886435331230283}}
|
| 7 |
+
{"step": 150, "epoch": 0.0946372239747634, "time": "2026-07-08 22:03:13", "logs": {"loss": 0.29434648513793943, "grad_norm": 5.838165283203125, "learning_rate": 4.70031545741325e-06, "epoch": 0.0946372239747634}}
|
| 8 |
+
{"step": 175, "epoch": 0.11041009463722397, "time": "2026-07-08 22:03:36", "logs": {"loss": 0.1876709747314453, "grad_norm": 6.797428131103516, "learning_rate": 5.4889589905362786e-06, "epoch": 0.11041009463722397}}
|
| 9 |
+
{"step": 200, "epoch": 0.12618296529968454, "time": "2026-07-08 22:03:59", "logs": {"loss": 0.20350841522216798, "grad_norm": 3.7547245025634766, "learning_rate": 6.2776025236593065e-06, "epoch": 0.12618296529968454}}
|
| 10 |
+
{"step": 225, "epoch": 0.14195583596214512, "time": "2026-07-08 22:04:22", "logs": {"loss": 0.1446442985534668, "grad_norm": 11.165263175964355, "learning_rate": 7.066246056782335e-06, "epoch": 0.14195583596214512}}
|
| 11 |
+
{"step": 250, "epoch": 0.15772870662460567, "time": "2026-07-08 22:04:45", "logs": {"loss": 0.17608392715454102, "grad_norm": 4.109164237976074, "learning_rate": 7.854889589905364e-06, "epoch": 0.15772870662460567}}
|
| 12 |
+
{"step": 275, "epoch": 0.17350157728706625, "time": "2026-07-08 22:05:08", "logs": {"loss": 0.08311139106750488, "grad_norm": 0.37571197748184204, "learning_rate": 8.643533123028391e-06, "epoch": 0.17350157728706625}}
|
| 13 |
+
{"step": 300, "epoch": 0.1892744479495268, "time": "2026-07-08 22:05:31", "logs": {"loss": 0.10653317451477051, "grad_norm": 0.21334795653820038, "learning_rate": 9.43217665615142e-06, "epoch": 0.1892744479495268}}
|
| 14 |
+
{"step": 325, "epoch": 0.20504731861198738, "time": "2026-07-08 22:05:54", "logs": {"loss": 0.12078428268432617, "grad_norm": 0.21560309827327728, "learning_rate": 1.022082018927445e-05, "epoch": 0.20504731861198738}}
|
| 15 |
+
{"step": 350, "epoch": 0.22082018927444794, "time": "2026-07-08 22:06:17", "logs": {"loss": 0.10522660255432129, "grad_norm": 0.07722581177949905, "learning_rate": 1.1009463722397478e-05, "epoch": 0.22082018927444794}}
|
| 16 |
+
{"step": 375, "epoch": 0.23659305993690852, "time": "2026-07-08 22:06:39", "logs": {"loss": 0.10268622398376465, "grad_norm": 13.963035583496094, "learning_rate": 1.1798107255520506e-05, "epoch": 0.23659305993690852}}
|
| 17 |
+
{"step": 400, "epoch": 0.25236593059936907, "time": "2026-07-08 22:07:02", "logs": {"loss": 0.1168508243560791, "grad_norm": 1.7228655815124512, "learning_rate": 1.2586750788643533e-05, "epoch": 0.25236593059936907}}
|
| 18 |
+
{"step": 425, "epoch": 0.26813880126182965, "time": "2026-07-08 22:07:25", "logs": {"loss": 0.1246561050415039, "grad_norm": 4.807567596435547, "learning_rate": 1.3375394321766562e-05, "epoch": 0.26813880126182965}}
|
| 19 |
+
{"step": 450, "epoch": 0.28391167192429023, "time": "2026-07-08 22:07:47", "logs": {"loss": 0.06862223625183106, "grad_norm": 0.10336830466985703, "learning_rate": 1.4164037854889591e-05, "epoch": 0.28391167192429023}}
|
| 20 |
+
{"step": 475, "epoch": 0.2996845425867508, "time": "2026-07-08 22:08:10", "logs": {"loss": 0.10785533905029297, "grad_norm": 0.18726640939712524, "learning_rate": 1.495268138801262e-05, "epoch": 0.2996845425867508}}
|
| 21 |
+
{"step": 500, "epoch": 0.31545741324921134, "time": "2026-07-08 22:08:33", "logs": {"loss": 0.08045989990234376, "grad_norm": 7.849733829498291, "learning_rate": 1.574132492113565e-05, "epoch": 0.31545741324921134}}
|
| 22 |
+
{"step": 500, "epoch": 0.31545741324921134, "time": "2026-07-08 22:09:29", "logs": {"eval_loss": 0.11268972605466843, "eval_accuracy": 0.9766561514195583, "eval_precision": 0.9654959950708565, "eval_recall": 0.9886435331230284, "eval_f1": 0.976932668329177, "eval_runtime": 56.1856, "eval_samples_per_second": 56.42, "eval_steps_per_second": 3.542, "epoch": 0.31545741324921134}}
|