CodeIsAbstract commited on
Commit
03f45f3
·
verified ·
1 Parent(s): 0388459

Training in progress, step 500, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:80d69a236e68b6332db7d3cff5deaa06ec25ff0e5efa550677ce2f35df088680
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6974752fe7a3b14089ab2e7053fc764710e6d0ddbd1d7314081904519abc3ca2
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ac6bc441453e9b4734e133be3c600607e5b3dee32b860836792368241f27642d
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da8b0c6ec3a28101585919798344dd1a4d2e616af339b16dae843b9a7667d51
3
  size 1540661735
last-checkpoint/trainer_state.json CHANGED
@@ -11,90 +11,90 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.016666666666666666,
14
- "grad_norm": 1325.952880859375,
15
  "learning_rate": 0.00013066666666666668,
16
- "loss": 1512.93171875,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.03333333333333333,
21
- "grad_norm": 929.898681640625,
22
  "learning_rate": 0.000264,
23
- "loss": 1464.5940625,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.05,
28
- "grad_norm": 747.4642333984375,
29
  "learning_rate": 0.00039733333333333336,
30
- "loss": 1415.48578125,
31
  "step": 150
32
  },
33
  {
34
  "epoch": 0.06666666666666667,
35
- "grad_norm": 631.6712646484375,
36
  "learning_rate": 0.000399708326752494,
37
- "loss": 1384.57703125,
38
  "step": 200
39
  },
40
  {
41
  "epoch": 0.08333333333333333,
42
- "grad_norm": 805.9771728515625,
43
  "learning_rate": 0.0003988102673898103,
44
- "loss": 1370.675,
45
  "step": 250
46
  },
47
  {
48
  "epoch": 0.08333333333333333,
49
- "eval_accuracy": 0.18672140762463343,
50
- "eval_loss": 45.42939758300781,
51
- "eval_runtime": 25.5972,
52
- "eval_samples_per_second": 4.883,
53
- "eval_steps_per_second": 0.156,
54
  "step": 250
55
  },
56
  {
57
  "epoch": 0.1,
58
- "grad_norm": 653.5927124023438,
59
  "learning_rate": 0.00039730842777928766,
60
- "loss": 1365.14890625,
61
  "step": 300
62
  },
63
  {
64
  "epoch": 0.11666666666666667,
65
- "grad_norm": 995.5695190429688,
66
  "learning_rate": 0.0003952073689584629,
67
- "loss": 1359.084375,
68
  "step": 350
69
  },
70
  {
71
  "epoch": 0.13333333333333333,
72
- "grad_norm": 825.2788696289062,
73
  "learning_rate": 0.00039251347177392016,
74
- "loss": 1355.68390625,
75
  "step": 400
76
  },
77
  {
78
  "epoch": 0.15,
79
- "grad_norm": 615.8878784179688,
80
  "learning_rate": 0.00038923491750286954,
81
- "loss": 1353.1375,
82
  "step": 450
83
  },
84
  {
85
  "epoch": 0.16666666666666666,
86
- "grad_norm": 895.9261474609375,
87
  "learning_rate": 0.00038538166300687717,
88
- "loss": 1349.4459375,
89
  "step": 500
90
  },
91
  {
92
  "epoch": 0.16666666666666666,
93
- "eval_accuracy": 0.19390224828934507,
94
- "eval_loss": 44.819725036621094,
95
- "eval_runtime": 7.3949,
96
- "eval_samples_per_second": 16.904,
97
- "eval_steps_per_second": 0.541,
98
  "step": 500
99
  }
100
  ],
 
11
  "log_history": [
12
  {
13
  "epoch": 0.016666666666666666,
14
+ "grad_norm": 769.3955078125,
15
  "learning_rate": 0.00013066666666666668,
16
+ "loss": 2207.061875,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.03333333333333333,
21
+ "grad_norm": 416.4177551269531,
22
  "learning_rate": 0.000264,
23
+ "loss": 2157.63046875,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.05,
28
+ "grad_norm": 580.2691650390625,
29
  "learning_rate": 0.00039733333333333336,
30
+ "loss": 2088.078125,
31
  "step": 150
32
  },
33
  {
34
  "epoch": 0.06666666666666667,
35
+ "grad_norm": 518.3369140625,
36
  "learning_rate": 0.000399708326752494,
37
+ "loss": 2027.68953125,
38
  "step": 200
39
  },
40
  {
41
  "epoch": 0.08333333333333333,
42
+ "grad_norm": 343.1493225097656,
43
  "learning_rate": 0.0003988102673898103,
44
+ "loss": 1981.4253125,
45
  "step": 250
46
  },
47
  {
48
  "epoch": 0.08333333333333333,
49
+ "eval_accuracy": 0.1509169110459433,
50
+ "eval_loss": 65.10028076171875,
51
+ "eval_runtime": 22.9136,
52
+ "eval_samples_per_second": 5.455,
53
+ "eval_steps_per_second": 0.175,
54
  "step": 250
55
  },
56
  {
57
  "epoch": 0.1,
58
+ "grad_norm": 301.3949890136719,
59
  "learning_rate": 0.00039730842777928766,
60
+ "loss": 1950.15375,
61
  "step": 300
62
  },
63
  {
64
  "epoch": 0.11666666666666667,
65
+ "grad_norm": 479.62359619140625,
66
  "learning_rate": 0.0003952073689584629,
67
+ "loss": 1922.4278125,
68
  "step": 350
69
  },
70
  {
71
  "epoch": 0.13333333333333333,
72
+ "grad_norm": 360.29132080078125,
73
  "learning_rate": 0.00039251347177392016,
74
+ "loss": 1901.3628125,
75
  "step": 400
76
  },
77
  {
78
  "epoch": 0.15,
79
+ "grad_norm": 334.61279296875,
80
  "learning_rate": 0.00038923491750286954,
81
+ "loss": 1883.4759375,
82
  "step": 450
83
  },
84
  {
85
  "epoch": 0.16666666666666666,
86
+ "grad_norm": 390.5067443847656,
87
  "learning_rate": 0.00038538166300687717,
88
+ "loss": 1868.25234375,
89
  "step": 500
90
  },
91
  {
92
  "epoch": 0.16666666666666666,
93
+ "eval_accuracy": 0.1607761485826002,
94
+ "eval_loss": 61.64983367919922,
95
+ "eval_runtime": 7.4283,
96
+ "eval_samples_per_second": 16.827,
97
+ "eval_steps_per_second": 0.538,
98
  "step": 500
99
  }
100
  ],
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cdf1bf7ff316b803830588f07fd42e9d70dbb919d664b54789baf8adc99f17cf
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bbabebbe458c541319860a962d07ff797d86a73d64992f9e2f64d3843d3ad153
3
  size 5265