w-ahmad commited on
Commit
4553dad
·
verified ·
1 Parent(s): 1ecec1b

Auto upload zain 2026-08-18T15:44:15.901384 (part 2)

Browse files
zain/Activation/out/mlp-gelu-9L_run/training_log.jsonl CHANGED
@@ -147,3 +147,20 @@
147
  {"step": 1080, "epoch": 0.03640040444893832, "timestamp": 1787067813.9590166, "loss": 3.581328582763672, "grad_norm": 1.3203125, "learning_rate": 0.0003, "train/total_time_seconds": 23.430609609931707, "train/time_per_step_avg": 0.020997195057570934, "train/epoch_time_elapsed": 130.1217622421682, "train/estimated_remaining_minutes": 0.513448543921343}
148
  {"step": 1100, "epoch": 0.03707448601280755, "timestamp": 1787067814.880627, "loss": 3.575098419189453, "grad_norm": 1.421875, "learning_rate": 0.0003, "train/total_time_seconds": 23.85159657523036, "train/time_per_step_avg": 0.021093439385294913, "train/epoch_time_elapsed": 131.04336904361844, "train/estimated_remaining_minutes": 0.5059429576564016}
149
  {"step": 1100, "epoch": 0.03707448601280755, "timestamp": 1787067822.8128498, "eval_loss": 3.58323335647583, "eval_runtime": 7.9304, "eval_samples_per_second": 1201.32, "eval_steps_per_second": 1.261, "train/total_time_seconds": 23.85159657523036, "train/time_per_step_avg": 0.021093439385294913, "train/epoch_time_elapsed": 138.97559468075633, "train/estimated_remaining_minutes": 0.5059429576564016}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
147
  {"step": 1080, "epoch": 0.03640040444893832, "timestamp": 1787067813.9590166, "loss": 3.581328582763672, "grad_norm": 1.3203125, "learning_rate": 0.0003, "train/total_time_seconds": 23.430609609931707, "train/time_per_step_avg": 0.020997195057570934, "train/epoch_time_elapsed": 130.1217622421682, "train/estimated_remaining_minutes": 0.513448543921343}
148
  {"step": 1100, "epoch": 0.03707448601280755, "timestamp": 1787067814.880627, "loss": 3.575098419189453, "grad_norm": 1.421875, "learning_rate": 0.0003, "train/total_time_seconds": 23.85159657523036, "train/time_per_step_avg": 0.021093439385294913, "train/epoch_time_elapsed": 131.04336904361844, "train/estimated_remaining_minutes": 0.5059429576564016}
149
  {"step": 1100, "epoch": 0.03707448601280755, "timestamp": 1787067822.8128498, "eval_loss": 3.58323335647583, "eval_runtime": 7.9304, "eval_samples_per_second": 1201.32, "eval_steps_per_second": 1.261, "train/total_time_seconds": 23.85159657523036, "train/time_per_step_avg": 0.021093439385294913, "train/epoch_time_elapsed": 138.97559468075633, "train/estimated_remaining_minutes": 0.5059429576564016}
150
+ {"step": 1120, "epoch": 0.03774856757667678, "timestamp": 1787067823.7356358, "loss": 3.576860046386719, "grad_norm": 1.203125, "learning_rate": 0.0003, "train/total_time_seconds": 24.246112272143364, "train/time_per_step_avg": 0.02068075641989708, "train/epoch_time_elapsed": 139.8983819708228, "train/estimated_remaining_minutes": 0.497911234160087}
151
+ {"step": 1140, "epoch": 0.03842264914054601, "timestamp": 1787067824.651654, "loss": 3.551131820678711, "grad_norm": 1.3046875, "learning_rate": 0.0003, "train/total_time_seconds": 24.64831342548132, "train/time_per_step_avg": 0.02050654012709856, "train/epoch_time_elapsed": 140.81440006569028, "train/estimated_remaining_minutes": 0.49008342483413153}
152
+ {"step": 1160, "epoch": 0.03909673070441524, "timestamp": 1787067825.6557994, "loss": 3.549495315551758, "grad_norm": 1.3125, "learning_rate": 0.0003, "train/total_time_seconds": 25.11421512067318, "train/time_per_step_avg": 0.02099115502089262, "train/epoch_time_elapsed": 141.8185441158712, "train/estimated_remaining_minutes": 0.48352080835778827}
153
+ {"step": 1180, "epoch": 0.03977081226828446, "timestamp": 1787067826.703538, "loss": 3.5650367736816406, "grad_norm": 1.2734375, "learning_rate": 0.0003, "train/total_time_seconds": 25.628276962786913, "train/time_per_step_avg": 0.021976673528552055, "train/epoch_time_elapsed": 142.86628357321024, "train/estimated_remaining_minutes": 0.47781533320450176}
154
+ {"step": 1200, "epoch": 0.04044489383215369, "timestamp": 1787067827.7146764, "loss": 3.5327903747558596, "grad_norm": 1.3359375, "learning_rate": 0.0003, "train/total_time_seconds": 26.12070846185088, "train/time_per_step_avg": 0.022691118866205215, "train/epoch_time_elapsed": 143.87742221727967, "train/estimated_remaining_minutes": 0.4716239027834187}
155
+ {"step": 1200, "epoch": 0.04044489383215369, "timestamp": 1787067835.551021, "eval_loss": 3.5364842414855957, "eval_runtime": 7.8349, "eval_samples_per_second": 1215.972, "eval_steps_per_second": 1.276, "train/total_time_seconds": 26.12070846185088, "train/time_per_step_avg": 0.022691118866205215, "train/epoch_time_elapsed": 151.71376561373472, "train/estimated_remaining_minutes": 0.4716239027834187}
156
+ {"step": 1220, "epoch": 0.04111897539602292, "timestamp": 1787067836.4856834, "loss": 3.5040164947509767, "grad_norm": 1.3125, "learning_rate": 0.0003, "train/total_time_seconds": 26.53010554611683, "train/time_per_step_avg": 0.02283993273973465, "train/epoch_time_elapsed": 152.64842871576548, "train/estimated_remaining_minutes": 0.4639144139211686}
157
+ {"step": 1240, "epoch": 0.04179305695989215, "timestamp": 1787067837.3813841, "loss": 3.521894836425781, "grad_norm": 1.359375, "learning_rate": 0.0003, "train/total_time_seconds": 26.93879707157612, "train/time_per_step_avg": 0.02290483646094799, "train/epoch_time_elapsed": 153.544130474329, "train/estimated_remaining_minutes": 0.4562215633089504}
158
+ {"step": 1260, "epoch": 0.042467138523761376, "timestamp": 1787067838.277116, "loss": 3.5320816040039062, "grad_norm": 1.3828125, "learning_rate": 0.0003, "train/total_time_seconds": 27.348903592675924, "train/time_per_step_avg": 0.02234688472002745, "train/epoch_time_elapsed": 154.4398616477847, "train/estimated_remaining_minutes": 0.44857990019732996}
159
+ {"step": 1280, "epoch": 0.043141220087630605, "timestamp": 1787067839.1746852, "loss": 3.5089996337890623, "grad_norm": 1.25, "learning_rate": 0.0003, "train/total_time_seconds": 27.760600492358208, "train/time_per_step_avg": 0.021323235295712947, "train/epoch_time_elapsed": 155.33743096515536, "train/estimated_remaining_minutes": 0.44098870573798193}
160
+ {"step": 1300, "epoch": 0.043815301651499834, "timestamp": 1787067840.0717094, "loss": 3.500400161743164, "grad_norm": 1.2734375, "learning_rate": 0.0003, "train/total_time_seconds": 28.17085425183177, "train/time_per_step_avg": 0.020501457899808884, "train/epoch_time_elapsed": 156.2344555556774, "train/estimated_remaining_minutes": 0.4333977577204888}
161
+ {"step": 1300, "epoch": 0.043815301651499834, "timestamp": 1787067848.0262697, "eval_loss": 3.4943602085113525, "eval_runtime": 7.9531, "eval_samples_per_second": 1197.894, "eval_steps_per_second": 1.257, "train/total_time_seconds": 28.17085425183177, "train/time_per_step_avg": 0.020501457899808884, "train/epoch_time_elapsed": 164.1890142671764, "train/estimated_remaining_minutes": 0.4333977577204888}
162
+ {"step": 1320, "epoch": 0.044489383215369056, "timestamp": 1787067848.9607685, "loss": 3.467268371582031, "grad_norm": 1.3046875, "learning_rate": 0.0003, "train/total_time_seconds": 28.582970276474953, "train/time_per_step_avg": 0.020528647303581237, "train/epoch_time_elapsed": 165.12351417914033, "train/estimated_remaining_minutes": 0.4258573854323288}
163
+ {"step": 1340, "epoch": 0.045163464779238285, "timestamp": 1787067849.8674655, "loss": 3.4918872833251955, "grad_norm": 1.34375, "learning_rate": 0.0003, "train/total_time_seconds": 28.997342467308044, "train/time_per_step_avg": 0.02058545395731926, "train/epoch_time_elapsed": 166.03021077811718, "train/estimated_remaining_minutes": 0.418369617687529}
164
+ {"step": 1360, "epoch": 0.045837546343107514, "timestamp": 1787067850.763746, "loss": 3.4714279174804688, "grad_norm": 1.1328125, "learning_rate": 0.0003, "train/total_time_seconds": 29.408032950013876, "train/time_per_step_avg": 0.020591293573379518, "train/epoch_time_elapsed": 166.92649219557643, "train/estimated_remaining_minutes": 0.41084751915460566}
165
+ {"step": 1380, "epoch": 0.046511627906976744, "timestamp": 1787067851.6658502, "loss": 3.4670150756835936, "grad_norm": 1.1875, "learning_rate": 0.0003, "train/total_time_seconds": 29.822390381246805, "train/time_per_step_avg": 0.020617898888885974, "train/epoch_time_elapsed": 167.82859598100185, "train/estimated_remaining_minutes": 0.40339465249995676}
166
+ {"step": 1400, "epoch": 0.04718570947084597, "timestamp": 1787067852.5606885, "loss": 3.44476203918457, "grad_norm": 1.4453125, "learning_rate": 0.0003, "train/total_time_seconds": 30.23169444128871, "train/time_per_step_avg": 0.020608401894569396, "train/epoch_time_elapsed": 168.72343412786722, "train/estimated_remaining_minutes": 0.39589123673116167}