heavyhelium commited on
Commit
41fe0e8
·
verified ·
1 Parent(s): 31c4ee6

Training in progress, epoch 1, checkpoint

Browse files
checkpoint-93/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b8382937490df6137c1fd1d38ba0f2b1b42eb923ae848f769240e5dc21ea8533
3
  size 368871908
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0788759e8c4b7f3a78fc3ea3720c9191452f80a1d21cc3885a007d8b69323b72
3
  size 368871908
checkpoint-93/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:05cdfe2df56b20774c596d833eca8b61230989f2f5c39397f44183d499bafc23
3
  size 737866955
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c85e0dc2c6e149acda4c56c375bb054ffaf0805433d746270d83ff47f15efdc0
3
  size 737866955
checkpoint-93/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:95e5b942d62434299e26ae77a7817d0da66f975a4b4278276a96ab34fdabade3
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1509f821eeec3d1883e4c8feb1c9a82904e7b01ad278fdb204cbc4aebc86cbb0
3
  size 1465
checkpoint-93/trainer_state.json CHANGED
@@ -11,76 +11,76 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.10752688172043011,
14
- "grad_norm": 3.951171875,
15
- "learning_rate": 3.2142857142857144e-05,
16
- "loss": 0.709462022781372,
17
  "step": 10
18
  },
19
  {
20
  "epoch": 0.21505376344086022,
21
- "grad_norm": 3.08203125,
22
- "learning_rate": 6.785714285714286e-05,
23
- "loss": 0.7023846626281738,
24
  "step": 20
25
  },
26
  {
27
  "epoch": 0.3225806451612903,
28
- "grad_norm": NaN,
29
- "learning_rate": 9.960159362549801e-05,
30
- "loss": 0.0,
31
  "step": 30
32
  },
33
  {
34
  "epoch": 0.43010752688172044,
35
- "grad_norm": NaN,
36
- "learning_rate": 9.56175298804781e-05,
37
- "loss": 0.0,
38
  "step": 40
39
  },
40
  {
41
  "epoch": 0.5376344086021505,
42
- "grad_norm": NaN,
43
- "learning_rate": 9.163346613545816e-05,
44
- "loss": 0.0,
45
  "step": 50
46
  },
47
  {
48
  "epoch": 0.6451612903225806,
49
- "grad_norm": NaN,
50
- "learning_rate": 8.764940239043824e-05,
51
- "loss": 0.0,
52
  "step": 60
53
  },
54
  {
55
  "epoch": 0.7526881720430108,
56
- "grad_norm": NaN,
57
- "learning_rate": 8.366533864541834e-05,
58
- "loss": 0.0,
59
  "step": 70
60
  },
61
  {
62
  "epoch": 0.8602150537634409,
63
- "grad_norm": NaN,
64
- "learning_rate": 7.968127490039841e-05,
65
- "loss": 0.0,
66
  "step": 80
67
  },
68
  {
69
  "epoch": 0.967741935483871,
70
- "grad_norm": NaN,
71
- "learning_rate": 7.569721115537849e-05,
72
- "loss": 0.0,
73
  "step": 90
74
  },
75
  {
76
  "epoch": 1.0,
77
  "eval_accuracy": 0.5,
78
- "eval_fallacy_f1": 0.0,
79
- "eval_loss": NaN,
80
  "eval_macro_f1": 0.3333333333333333,
81
- "eval_runtime": 1.4789,
82
- "eval_samples_per_second": 135.238,
83
- "eval_steps_per_second": 4.733,
84
  "step": 93
85
  }
86
  ],
 
11
  "log_history": [
12
  {
13
  "epoch": 0.10752688172043011,
14
+ "grad_norm": 3.23046875,
15
+ "learning_rate": 6.4285714285714295e-06,
16
+ "loss": 0.6944442749023437,
17
  "step": 10
18
  },
19
  {
20
  "epoch": 0.21505376344086022,
21
+ "grad_norm": 2.91796875,
22
+ "learning_rate": 1.3571428571428574e-05,
23
+ "loss": 0.6896929264068603,
24
  "step": 20
25
  },
26
  {
27
  "epoch": 0.3225806451612903,
28
+ "grad_norm": 1.4765625,
29
+ "learning_rate": 1.9920318725099602e-05,
30
+ "loss": 0.7293692588806152,
31
  "step": 30
32
  },
33
  {
34
  "epoch": 0.43010752688172044,
35
+ "grad_norm": 1.15625,
36
+ "learning_rate": 1.912350597609562e-05,
37
+ "loss": 0.6949648380279541,
38
  "step": 40
39
  },
40
  {
41
  "epoch": 0.5376344086021505,
42
+ "grad_norm": 2.798828125,
43
+ "learning_rate": 1.8326693227091633e-05,
44
+ "loss": 0.7167802810668945,
45
  "step": 50
46
  },
47
  {
48
  "epoch": 0.6451612903225806,
49
+ "grad_norm": 3.42578125,
50
+ "learning_rate": 1.752988047808765e-05,
51
+ "loss": 0.6947458267211915,
52
  "step": 60
53
  },
54
  {
55
  "epoch": 0.7526881720430108,
56
+ "grad_norm": 2.619140625,
57
+ "learning_rate": 1.6733067729083667e-05,
58
+ "loss": 0.7203916549682617,
59
  "step": 70
60
  },
61
  {
62
  "epoch": 0.8602150537634409,
63
+ "grad_norm": 3.4375,
64
+ "learning_rate": 1.593625498007968e-05,
65
+ "loss": 0.7472614288330078,
66
  "step": 80
67
  },
68
  {
69
  "epoch": 0.967741935483871,
70
+ "grad_norm": 1.080078125,
71
+ "learning_rate": 1.5139442231075698e-05,
72
+ "loss": 0.6916363716125489,
73
  "step": 90
74
  },
75
  {
76
  "epoch": 1.0,
77
  "eval_accuracy": 0.5,
78
+ "eval_fallacy_f1": 0.6666666666666666,
79
+ "eval_loss": 0.7128075957298279,
80
  "eval_macro_f1": 0.3333333333333333,
81
+ "eval_runtime": 1.5905,
82
+ "eval_samples_per_second": 125.747,
83
+ "eval_steps_per_second": 4.401,
84
  "step": 93
85
  }
86
  ],
checkpoint-93/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7b6a3d793e7ac1d4eb1cc2351ced6195da3065802884799f4e58ccc294d82e30
3
  size 5457
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:93f806474ebe5496f38d70c1271ce311df22cd265567c6605d78ff19cd04c25a
3
  size 5457