sravanthib commited on
Commit
fe888d4
·
verified ·
1 Parent(s): e2779a1

Training completed

Browse files
Files changed (3) hide show
  1. all_results.json +5 -5
  2. train_results.json +5 -5
  3. trainer_state.json +13 -13
all_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
  "epoch": 0.0547945205479452,
3
- "total_flos": 8.348676830055629e+16,
4
- "train_loss": 2.75271688302358,
5
- "train_runtime": 423.9764,
6
- "train_samples_per_second": 11.321,
7
- "train_steps_per_second": 0.071
8
  }
 
1
  {
2
  "epoch": 0.0547945205479452,
3
+ "total_flos": 1.6697353660111258e+17,
4
+ "train_loss": 2.030022064844767,
5
+ "train_runtime": 481.4543,
6
+ "train_samples_per_second": 9.97,
7
+ "train_steps_per_second": 0.062
8
  }
train_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
  "epoch": 0.0547945205479452,
3
- "total_flos": 8.348676830055629e+16,
4
- "train_loss": 2.75271688302358,
5
- "train_runtime": 423.9764,
6
- "train_samples_per_second": 11.321,
7
- "train_steps_per_second": 0.071
8
  }
 
1
  {
2
  "epoch": 0.0547945205479452,
3
+ "total_flos": 1.6697353660111258e+17,
4
+ "train_loss": 2.030022064844767,
5
+ "train_runtime": 481.4543,
6
+ "train_samples_per_second": 9.97,
7
+ "train_steps_per_second": 0.062
8
  }
trainer_state.json CHANGED
@@ -10,40 +10,40 @@
10
  "log_history": [
11
  {
12
  "epoch": 0.0182648401826484,
13
- "grad_norm": 2.923218011856079,
14
  "learning_rate": 0.0001,
15
- "loss": 6.0475,
16
  "step": 10
17
  },
18
  {
19
  "epoch": 0.0365296803652968,
20
- "grad_norm": 5.51038122177124,
21
  "learning_rate": 0.0001,
22
- "loss": 1.929,
23
  "step": 20
24
  },
25
  {
26
  "epoch": 0.0547945205479452,
27
- "grad_norm": 0.20810189843177795,
28
  "learning_rate": 0.0001,
29
- "loss": 0.2817,
30
  "step": 30
31
  },
32
  {
33
  "epoch": 0.0547945205479452,
34
  "step": 30,
35
- "total_flos": 8.348676830055629e+16,
36
- "train_loss": 2.75271688302358,
37
- "train_runtime": 423.9764,
38
- "train_samples_per_second": 11.321,
39
- "train_steps_per_second": 0.071
40
  }
41
  ],
42
  "logging_steps": 10,
43
  "max_steps": 30,
44
  "num_input_tokens_seen": 0,
45
  "num_train_epochs": 1,
46
- "save_steps": 10,
47
  "stateful_callbacks": {
48
  "TrainerControl": {
49
  "args": {
@@ -56,7 +56,7 @@
56
  "attributes": {}
57
  }
58
  },
59
- "total_flos": 8.348676830055629e+16,
60
  "train_batch_size": 2,
61
  "trial_name": null,
62
  "trial_params": null
 
10
  "log_history": [
11
  {
12
  "epoch": 0.0182648401826484,
13
+ "grad_norm": 1.4427909851074219,
14
  "learning_rate": 0.0001,
15
+ "loss": 4.6764,
16
  "step": 10
17
  },
18
  {
19
  "epoch": 0.0365296803652968,
20
+ "grad_norm": 4.036961555480957,
21
  "learning_rate": 0.0001,
22
+ "loss": 1.0438,
23
  "step": 20
24
  },
25
  {
26
  "epoch": 0.0547945205479452,
27
+ "grad_norm": 0.26397082209587097,
28
  "learning_rate": 0.0001,
29
+ "loss": 0.3698,
30
  "step": 30
31
  },
32
  {
33
  "epoch": 0.0547945205479452,
34
  "step": 30,
35
+ "total_flos": 1.6697353660111258e+17,
36
+ "train_loss": 2.030022064844767,
37
+ "train_runtime": 481.4543,
38
+ "train_samples_per_second": 9.97,
39
+ "train_steps_per_second": 0.062
40
  }
41
  ],
42
  "logging_steps": 10,
43
  "max_steps": 30,
44
  "num_input_tokens_seen": 0,
45
  "num_train_epochs": 1,
46
+ "save_steps": 30,
47
  "stateful_callbacks": {
48
  "TrainerControl": {
49
  "args": {
 
56
  "attributes": {}
57
  }
58
  },
59
+ "total_flos": 1.6697353660111258e+17,
60
  "train_batch_size": 2,
61
  "trial_name": null,
62
  "trial_params": null