PRATYUSH-BHARDWAJ commited on
Commit
e8fada7
·
verified ·
1 Parent(s): 54c3f07

SFT checkpoint step 24

Browse files
checkpoints/checkpoint-24/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:63e5deaea9432e094c15bb64c92fa81cbba3041810db39c721e22096a1702974
3
  size 204500912
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0b606145073d15bc2135946e05c944e20860deae934882b9fdb438337056243b
3
  size 204500912
checkpoints/checkpoint-24/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5c539f10386e07d23265746ae848f134e6801e7ac62cbc5fecdea9f06b09838e
3
  size 620569547
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:250ec5c90b9926f38ce2814a51bf1b25af5843cfba9eb35ac72d18a21b221940
3
  size 620569547
checkpoints/checkpoint-24/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6c8c484b6aeff8e48e491091e15944fd74e10a109ea0ef357d241072f6e7ea4a
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e67c4c81374c6f521df75510e2ff9132038e90aa5d6f4327585ee498a7c32acf
3
  size 1383
checkpoints/checkpoint-24/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cf03b2543d3b9777aee09aeaefb82e4e594fbd8d33431ba55fbfdf92efaf789a
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0688e184f56eee18176185f2f1a5a43c3abd2e7e0e3b23afd81829a9a6999304
3
  size 1465
checkpoints/checkpoint-24/time_state.json CHANGED
@@ -1 +1 @@
1
- {"consumed_seconds": 263.88233065605164, "global_step": 24}
 
1
+ {"consumed_seconds": 277.82182002067566, "global_step": 24}
checkpoints/checkpoint-24/trainer_state.json CHANGED
@@ -17,15 +17,15 @@
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
- "train_runtime": 44.9864,
21
- "train_tokens_per_second": 33.21
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
  "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
- "eval_runtime": 28.6663,
28
- "eval_samples_per_second": 1.047,
29
  "eval_steps_per_second": 0.279,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
@@ -34,71 +34,71 @@
34
  "epoch": 0.1391304347826087,
35
  "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
- "eval_runtime": 3.5559,
38
- "eval_samples_per_second": 8.437,
39
- "eval_steps_per_second": 2.25,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
- "grad_norm": 28.138591766357422,
46
  "learning_rate": 0.0,
47
  "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
- "train_runtime": 145.0656,
52
- "train_tokens_per_second": 76.827
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
- "eval_loss": 1.795594573020935,
57
  "eval_num_tokens": 13293.0,
58
- "eval_runtime": 3.5484,
59
- "eval_samples_per_second": 8.455,
60
- "eval_steps_per_second": 2.255,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
- "eval_loss": 0.5860968232154846,
67
  "eval_num_tokens": 17742.0,
68
- "eval_runtime": 3.4658,
69
- "eval_samples_per_second": 8.656,
70
- "eval_steps_per_second": 2.308,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
- "grad_norm": 7.353201389312744,
77
- "learning_rate": 0.0001442909649383465,
78
- "loss": 0.8008382797241211,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
- "train_runtime": 227.664,
83
- "train_tokens_per_second": 89.008
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
- "eval_loss": 0.39688172936439514,
88
  "eval_num_tokens": 20264.0,
89
- "eval_runtime": 3.494,
90
- "eval_samples_per_second": 8.586,
91
- "eval_steps_per_second": 2.29,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
- "eval_loss": 0.5452550053596497,
98
  "eval_num_tokens": 24990.0,
99
- "eval_runtime": 3.5856,
100
- "eval_samples_per_second": 8.367,
101
- "eval_steps_per_second": 2.231,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  }
 
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
+ "train_runtime": 42.4619,
21
+ "train_tokens_per_second": 35.185
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
  "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
+ "eval_runtime": 28.7144,
28
+ "eval_samples_per_second": 1.045,
29
  "eval_steps_per_second": 0.279,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
 
34
  "epoch": 0.1391304347826087,
35
  "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
+ "eval_runtime": 3.4006,
38
+ "eval_samples_per_second": 8.822,
39
+ "eval_steps_per_second": 2.353,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
+ "grad_norm": 28.1390438079834,
46
  "learning_rate": 0.0,
47
  "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
+ "train_runtime": 146.4448,
52
+ "train_tokens_per_second": 76.104
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
+ "eval_loss": 1.7850792407989502,
57
  "eval_num_tokens": 13293.0,
58
+ "eval_runtime": 3.4816,
59
+ "eval_samples_per_second": 8.617,
60
+ "eval_steps_per_second": 2.298,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
+ "eval_loss": 0.5965744256973267,
67
  "eval_num_tokens": 17742.0,
68
+ "eval_runtime": 3.4391,
69
+ "eval_samples_per_second": 8.723,
70
+ "eval_steps_per_second": 2.326,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
+ "grad_norm": 6.518080711364746,
77
+ "learning_rate": 0.0001425726650926814,
78
+ "loss": 0.7919160842895507,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
+ "train_runtime": 241.9804,
83
+ "train_tokens_per_second": 83.742
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
+ "eval_loss": 0.6307523250579834,
88
  "eval_num_tokens": 20264.0,
89
+ "eval_runtime": 3.512,
90
+ "eval_samples_per_second": 8.542,
91
+ "eval_steps_per_second": 2.278,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
+ "eval_loss": 0.3135659396648407,
98
  "eval_num_tokens": 24990.0,
99
+ "eval_runtime": 3.4341,
100
+ "eval_samples_per_second": 8.736,
101
+ "eval_steps_per_second": 2.33,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  }