reneeice commited on
Commit
6e01285
·
verified ·
1 Parent(s): c97e492

Add files using upload-large-folder tool

Browse files
Files changed (50) hide show
  1. checkpoint-100/config.json +39 -0
  2. checkpoint-100/model.safetensors +3 -0
  3. checkpoint-100/rng_state.pth +3 -0
  4. checkpoint-100/scaler.pt +3 -0
  5. checkpoint-100/scheduler.pt +3 -0
  6. checkpoint-100/trainer_state.json +56 -0
  7. checkpoint-100/training_args.bin +3 -0
  8. checkpoint-200/config.json +39 -0
  9. checkpoint-200/model.safetensors +3 -0
  10. checkpoint-200/rng_state.pth +3 -0
  11. checkpoint-200/scaler.pt +3 -0
  12. checkpoint-200/scheduler.pt +3 -0
  13. checkpoint-200/trainer_state.json +78 -0
  14. checkpoint-200/training_args.bin +3 -0
  15. checkpoint-300/config.json +39 -0
  16. checkpoint-300/model.safetensors +3 -0
  17. checkpoint-300/rng_state.pth +3 -0
  18. checkpoint-300/scaler.pt +3 -0
  19. checkpoint-300/scheduler.pt +3 -0
  20. checkpoint-300/trainer_state.json +100 -0
  21. checkpoint-300/training_args.bin +3 -0
  22. checkpoint-400/config.json +39 -0
  23. checkpoint-400/model.safetensors +3 -0
  24. checkpoint-400/rng_state.pth +3 -0
  25. checkpoint-400/scaler.pt +3 -0
  26. checkpoint-400/scheduler.pt +3 -0
  27. checkpoint-400/trainer_state.json +122 -0
  28. checkpoint-400/training_args.bin +3 -0
  29. checkpoint-500/config.json +39 -0
  30. checkpoint-500/model.safetensors +3 -0
  31. checkpoint-500/optimizer.pt +3 -0
  32. checkpoint-500/rng_state.pth +3 -0
  33. checkpoint-500/scaler.pt +3 -0
  34. checkpoint-500/scheduler.pt +3 -0
  35. checkpoint-500/trainer_state.json +144 -0
  36. checkpoint-500/training_args.bin +3 -0
  37. checkpoint-600/config.json +39 -0
  38. checkpoint-600/model.safetensors +3 -0
  39. checkpoint-600/rng_state.pth +3 -0
  40. checkpoint-600/scaler.pt +3 -0
  41. checkpoint-600/scheduler.pt +3 -0
  42. checkpoint-600/trainer_state.json +166 -0
  43. checkpoint-600/training_args.bin +3 -0
  44. checkpoint-700/config.json +39 -0
  45. checkpoint-700/model.safetensors +3 -0
  46. checkpoint-700/rng_state.pth +3 -0
  47. checkpoint-700/scaler.pt +3 -0
  48. checkpoint-700/scheduler.pt +3 -0
  49. checkpoint-700/trainer_state.json +188 -0
  50. checkpoint-700/training_args.bin +3 -0
checkpoint-100/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-100/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6f51d528395b42388dcf0f534a6207a3f034d9b525416bc64b6f057902621c2f
3
+ size 1740304440
checkpoint-100/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:16e8aade09a90a40d007fa0bf00e1f86baea350c6f8ae65f4231eb9f856cfc06
3
+ size 14180
checkpoint-100/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:37d03bee491405f0804b15413c0e0b0f995c7932728fecb4f1497314d356e6f1
3
+ size 988
checkpoint-100/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc47c48cefa8582e9f5b6467027e7c306fdb33d55aa6a5a0b6c234dffed881d2
3
+ size 1064
checkpoint-100/trainer_state.json ADDED
@@ -0,0 +1,56 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.064,
6
+ "eval_steps": 100,
7
+ "global_step": 100,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ }
34
+ ],
35
+ "logging_steps": 50,
36
+ "max_steps": 1000,
37
+ "num_input_tokens_seen": 0,
38
+ "num_train_epochs": 1,
39
+ "save_steps": 100,
40
+ "stateful_callbacks": {
41
+ "TrainerControl": {
42
+ "args": {
43
+ "should_epoch_stop": false,
44
+ "should_evaluate": false,
45
+ "should_log": false,
46
+ "should_save": true,
47
+ "should_training_stop": false
48
+ },
49
+ "attributes": {}
50
+ }
51
+ },
52
+ "total_flos": 5953567215380736.0,
53
+ "train_batch_size": 4,
54
+ "trial_name": null,
55
+ "trial_params": null
56
+ }
checkpoint-100/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792
checkpoint-200/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-200/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3c2bc389a960d9dfdc929377e92c852281b996f497d8e85f7b6d92256e1d3fcc
3
+ size 1740304440
checkpoint-200/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:93a692cbb9fef17013b112e00e851a326507eef7fd870ba2bf3d5761da4b8273
3
+ size 14180
checkpoint-200/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f4d7eaa4548eb89bb14ef8ad634f33429d7875bdc4c1591b441fcb5c0f78db3b
3
+ size 988
checkpoint-200/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:124cf7a8b9959cc2e7286d1ca0fbfbdf1fd78046ddd7b8b0be8872a62c701348
3
+ size 1064
checkpoint-200/trainer_state.json ADDED
@@ -0,0 +1,78 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.128,
6
+ "eval_steps": 100,
7
+ "global_step": 200,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.096,
36
+ "grad_norm": 409.5372314453125,
37
+ "learning_rate": 9.511111111111111e-07,
38
+ "loss": 0.8091524505615234,
39
+ "step": 150
40
+ },
41
+ {
42
+ "epoch": 0.128,
43
+ "grad_norm": 4.935479640960693,
44
+ "learning_rate": 8.955555555555555e-07,
45
+ "loss": 0.9019821166992188,
46
+ "step": 200
47
+ },
48
+ {
49
+ "epoch": 0.128,
50
+ "eval_loss": 0.1397811472415924,
51
+ "eval_runtime": 320.5384,
52
+ "eval_samples_per_second": 6.24,
53
+ "eval_steps_per_second": 1.56,
54
+ "step": 200
55
+ }
56
+ ],
57
+ "logging_steps": 50,
58
+ "max_steps": 1000,
59
+ "num_input_tokens_seen": 0,
60
+ "num_train_epochs": 1,
61
+ "save_steps": 100,
62
+ "stateful_callbacks": {
63
+ "TrainerControl": {
64
+ "args": {
65
+ "should_epoch_stop": false,
66
+ "should_evaluate": false,
67
+ "should_log": false,
68
+ "should_save": true,
69
+ "should_training_stop": false
70
+ },
71
+ "attributes": {}
72
+ }
73
+ },
74
+ "total_flos": 1.190401098346536e+16,
75
+ "train_batch_size": 4,
76
+ "trial_name": null,
77
+ "trial_params": null
78
+ }
checkpoint-200/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792
checkpoint-300/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-300/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6e24387fdd245e292c16e2b79803483885069d736df1c42229dc489b2e3e761d
3
+ size 1740304440
checkpoint-300/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6f8d5624bd5068f2c5182c44c3fa271efb8419e50bcd1658bc28380f8fbfc352
3
+ size 14180
checkpoint-300/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f0032c98d04d71a11fda8b214fed42c7a7511d08bee284b55a738a2ecde039e2
3
+ size 988
checkpoint-300/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a1eb1ac6c98e1509a604f888f2e6f28bea80c725fcfd59330e3be3591813644b
3
+ size 1064
checkpoint-300/trainer_state.json ADDED
@@ -0,0 +1,100 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.192,
6
+ "eval_steps": 100,
7
+ "global_step": 300,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.096,
36
+ "grad_norm": 409.5372314453125,
37
+ "learning_rate": 9.511111111111111e-07,
38
+ "loss": 0.8091524505615234,
39
+ "step": 150
40
+ },
41
+ {
42
+ "epoch": 0.128,
43
+ "grad_norm": 4.935479640960693,
44
+ "learning_rate": 8.955555555555555e-07,
45
+ "loss": 0.9019821166992188,
46
+ "step": 200
47
+ },
48
+ {
49
+ "epoch": 0.128,
50
+ "eval_loss": 0.1397811472415924,
51
+ "eval_runtime": 320.5384,
52
+ "eval_samples_per_second": 6.24,
53
+ "eval_steps_per_second": 1.56,
54
+ "step": 200
55
+ },
56
+ {
57
+ "epoch": 0.16,
58
+ "grad_norm": 2.68009877204895,
59
+ "learning_rate": 8.399999999999999e-07,
60
+ "loss": 0.8488493347167969,
61
+ "step": 250
62
+ },
63
+ {
64
+ "epoch": 0.192,
65
+ "grad_norm": 250.0933380126953,
66
+ "learning_rate": 7.844444444444445e-07,
67
+ "loss": 0.8013427734375,
68
+ "step": 300
69
+ },
70
+ {
71
+ "epoch": 0.192,
72
+ "eval_loss": 0.13730598986148834,
73
+ "eval_runtime": 320.7296,
74
+ "eval_samples_per_second": 6.236,
75
+ "eval_steps_per_second": 1.559,
76
+ "step": 300
77
+ }
78
+ ],
79
+ "logging_steps": 50,
80
+ "max_steps": 1000,
81
+ "num_input_tokens_seen": 0,
82
+ "num_train_epochs": 1,
83
+ "save_steps": 100,
84
+ "stateful_callbacks": {
85
+ "TrainerControl": {
86
+ "args": {
87
+ "should_epoch_stop": false,
88
+ "should_evaluate": false,
89
+ "should_log": false,
90
+ "should_save": true,
91
+ "should_training_stop": false
92
+ },
93
+ "attributes": {}
94
+ }
95
+ },
96
+ "total_flos": 1.7856631699665456e+16,
97
+ "train_batch_size": 4,
98
+ "trial_name": null,
99
+ "trial_params": null
100
+ }
checkpoint-300/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792
checkpoint-400/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-400/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e510ff1c0d0b2a753b89342d15a84f3c8e0cb3518e9404ecf61a398d49072d42
3
+ size 1740304440
checkpoint-400/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:60324b2bab14319d4ed37f75c3ee04f669d54ee031664e663eda54c1034ebe85
3
+ size 14180
checkpoint-400/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b48f0fed3631545d5c0ac4432b6dc265c750aca3e8a89b3b4268785b1b87056f
3
+ size 988
checkpoint-400/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e8aa5b842d19939b9a7b1b29463530ead81aff748b3c7f3cc968c174806c2a57
3
+ size 1064
checkpoint-400/trainer_state.json ADDED
@@ -0,0 +1,122 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.256,
6
+ "eval_steps": 100,
7
+ "global_step": 400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.096,
36
+ "grad_norm": 409.5372314453125,
37
+ "learning_rate": 9.511111111111111e-07,
38
+ "loss": 0.8091524505615234,
39
+ "step": 150
40
+ },
41
+ {
42
+ "epoch": 0.128,
43
+ "grad_norm": 4.935479640960693,
44
+ "learning_rate": 8.955555555555555e-07,
45
+ "loss": 0.9019821166992188,
46
+ "step": 200
47
+ },
48
+ {
49
+ "epoch": 0.128,
50
+ "eval_loss": 0.1397811472415924,
51
+ "eval_runtime": 320.5384,
52
+ "eval_samples_per_second": 6.24,
53
+ "eval_steps_per_second": 1.56,
54
+ "step": 200
55
+ },
56
+ {
57
+ "epoch": 0.16,
58
+ "grad_norm": 2.68009877204895,
59
+ "learning_rate": 8.399999999999999e-07,
60
+ "loss": 0.8488493347167969,
61
+ "step": 250
62
+ },
63
+ {
64
+ "epoch": 0.192,
65
+ "grad_norm": 250.0933380126953,
66
+ "learning_rate": 7.844444444444445e-07,
67
+ "loss": 0.8013427734375,
68
+ "step": 300
69
+ },
70
+ {
71
+ "epoch": 0.192,
72
+ "eval_loss": 0.13730598986148834,
73
+ "eval_runtime": 320.7296,
74
+ "eval_samples_per_second": 6.236,
75
+ "eval_steps_per_second": 1.559,
76
+ "step": 300
77
+ },
78
+ {
79
+ "epoch": 0.224,
80
+ "grad_norm": 3.164937973022461,
81
+ "learning_rate": 7.288888888888889e-07,
82
+ "loss": 0.6347025299072265,
83
+ "step": 350
84
+ },
85
+ {
86
+ "epoch": 0.256,
87
+ "grad_norm": 120.01831817626953,
88
+ "learning_rate": 6.733333333333333e-07,
89
+ "loss": 0.960202407836914,
90
+ "step": 400
91
+ },
92
+ {
93
+ "epoch": 0.256,
94
+ "eval_loss": 0.12297496199607849,
95
+ "eval_runtime": 320.4414,
96
+ "eval_samples_per_second": 6.241,
97
+ "eval_steps_per_second": 1.56,
98
+ "step": 400
99
+ }
100
+ ],
101
+ "logging_steps": 50,
102
+ "max_steps": 1000,
103
+ "num_input_tokens_seen": 0,
104
+ "num_train_epochs": 1,
105
+ "save_steps": 100,
106
+ "stateful_callbacks": {
107
+ "TrainerControl": {
108
+ "args": {
109
+ "should_epoch_stop": false,
110
+ "should_evaluate": false,
111
+ "should_log": false,
112
+ "should_save": true,
113
+ "should_training_stop": false
114
+ },
115
+ "attributes": {}
116
+ }
117
+ },
118
+ "total_flos": 2.3807672490310176e+16,
119
+ "train_batch_size": 4,
120
+ "trial_name": null,
121
+ "trial_params": null
122
+ }
checkpoint-400/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792
checkpoint-500/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c41840a20abd987e0a6f2d9e2278dce7fa2bec86b10a4485b396d4f6d5555f48
3
+ size 1740304440
checkpoint-500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9e810d6ba6cd35e38138346e80dc488127ed759e6e40299ba97798ee34c783af
3
+ size 2271441914
checkpoint-500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:40e6457e5a15e10eebea51ab9d0765297dafb5eadc657de5b57d3781d638deaf
3
+ size 14180
checkpoint-500/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:626829538aca7940353b7f46f08c3f43239373a2e67000f06460ca4c197f4065
3
+ size 988
checkpoint-500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:215e94693570a82dbed7af5f4f9cffa462ea8649a10019126b61ab63c5495e59
3
+ size 1064
checkpoint-500/trainer_state.json ADDED
@@ -0,0 +1,144 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.32,
6
+ "eval_steps": 100,
7
+ "global_step": 500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.096,
36
+ "grad_norm": 409.5372314453125,
37
+ "learning_rate": 9.511111111111111e-07,
38
+ "loss": 0.8091524505615234,
39
+ "step": 150
40
+ },
41
+ {
42
+ "epoch": 0.128,
43
+ "grad_norm": 4.935479640960693,
44
+ "learning_rate": 8.955555555555555e-07,
45
+ "loss": 0.9019821166992188,
46
+ "step": 200
47
+ },
48
+ {
49
+ "epoch": 0.128,
50
+ "eval_loss": 0.1397811472415924,
51
+ "eval_runtime": 320.5384,
52
+ "eval_samples_per_second": 6.24,
53
+ "eval_steps_per_second": 1.56,
54
+ "step": 200
55
+ },
56
+ {
57
+ "epoch": 0.16,
58
+ "grad_norm": 2.68009877204895,
59
+ "learning_rate": 8.399999999999999e-07,
60
+ "loss": 0.8488493347167969,
61
+ "step": 250
62
+ },
63
+ {
64
+ "epoch": 0.192,
65
+ "grad_norm": 250.0933380126953,
66
+ "learning_rate": 7.844444444444445e-07,
67
+ "loss": 0.8013427734375,
68
+ "step": 300
69
+ },
70
+ {
71
+ "epoch": 0.192,
72
+ "eval_loss": 0.13730598986148834,
73
+ "eval_runtime": 320.7296,
74
+ "eval_samples_per_second": 6.236,
75
+ "eval_steps_per_second": 1.559,
76
+ "step": 300
77
+ },
78
+ {
79
+ "epoch": 0.224,
80
+ "grad_norm": 3.164937973022461,
81
+ "learning_rate": 7.288888888888889e-07,
82
+ "loss": 0.6347025299072265,
83
+ "step": 350
84
+ },
85
+ {
86
+ "epoch": 0.256,
87
+ "grad_norm": 120.01831817626953,
88
+ "learning_rate": 6.733333333333333e-07,
89
+ "loss": 0.960202407836914,
90
+ "step": 400
91
+ },
92
+ {
93
+ "epoch": 0.256,
94
+ "eval_loss": 0.12297496199607849,
95
+ "eval_runtime": 320.4414,
96
+ "eval_samples_per_second": 6.241,
97
+ "eval_steps_per_second": 1.56,
98
+ "step": 400
99
+ },
100
+ {
101
+ "epoch": 0.288,
102
+ "grad_norm": 25.20623779296875,
103
+ "learning_rate": 6.177777777777777e-07,
104
+ "loss": 0.7631096649169922,
105
+ "step": 450
106
+ },
107
+ {
108
+ "epoch": 0.32,
109
+ "grad_norm": 124.12076568603516,
110
+ "learning_rate": 5.622222222222222e-07,
111
+ "loss": 0.9197311401367188,
112
+ "step": 500
113
+ },
114
+ {
115
+ "epoch": 0.32,
116
+ "eval_loss": 0.13506844639778137,
117
+ "eval_runtime": 320.4909,
118
+ "eval_samples_per_second": 6.24,
119
+ "eval_steps_per_second": 1.56,
120
+ "step": 500
121
+ }
122
+ ],
123
+ "logging_steps": 50,
124
+ "max_steps": 1000,
125
+ "num_input_tokens_seen": 0,
126
+ "num_train_epochs": 1,
127
+ "save_steps": 100,
128
+ "stateful_callbacks": {
129
+ "TrainerControl": {
130
+ "args": {
131
+ "should_epoch_stop": false,
132
+ "should_evaluate": false,
133
+ "should_log": false,
134
+ "should_save": true,
135
+ "should_training_stop": false
136
+ },
137
+ "attributes": {}
138
+ }
139
+ },
140
+ "total_flos": 2.975877152705832e+16,
141
+ "train_batch_size": 4,
142
+ "trial_name": null,
143
+ "trial_params": null
144
+ }
checkpoint-500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792
checkpoint-600/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-600/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:18988f5ea942fa89e4a092078c8b3f3fbeb3856f07493d528ec810d7f838251e
3
+ size 1740304440
checkpoint-600/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:56a2fdf431c074b4cb70dda7a139d6d8a19ae50eba8f1bd05ac3e3177e25c88e
3
+ size 14180
checkpoint-600/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fcb65f7c732b29824f760066581ac9307df8061d26977f3ff63f0632ff073692
3
+ size 988
checkpoint-600/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1da014bf8a42665ddf5c484720cbba2070f1a3afe5db34d484a965add48bd2d9
3
+ size 1064
checkpoint-600/trainer_state.json ADDED
@@ -0,0 +1,166 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.384,
6
+ "eval_steps": 100,
7
+ "global_step": 600,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.096,
36
+ "grad_norm": 409.5372314453125,
37
+ "learning_rate": 9.511111111111111e-07,
38
+ "loss": 0.8091524505615234,
39
+ "step": 150
40
+ },
41
+ {
42
+ "epoch": 0.128,
43
+ "grad_norm": 4.935479640960693,
44
+ "learning_rate": 8.955555555555555e-07,
45
+ "loss": 0.9019821166992188,
46
+ "step": 200
47
+ },
48
+ {
49
+ "epoch": 0.128,
50
+ "eval_loss": 0.1397811472415924,
51
+ "eval_runtime": 320.5384,
52
+ "eval_samples_per_second": 6.24,
53
+ "eval_steps_per_second": 1.56,
54
+ "step": 200
55
+ },
56
+ {
57
+ "epoch": 0.16,
58
+ "grad_norm": 2.68009877204895,
59
+ "learning_rate": 8.399999999999999e-07,
60
+ "loss": 0.8488493347167969,
61
+ "step": 250
62
+ },
63
+ {
64
+ "epoch": 0.192,
65
+ "grad_norm": 250.0933380126953,
66
+ "learning_rate": 7.844444444444445e-07,
67
+ "loss": 0.8013427734375,
68
+ "step": 300
69
+ },
70
+ {
71
+ "epoch": 0.192,
72
+ "eval_loss": 0.13730598986148834,
73
+ "eval_runtime": 320.7296,
74
+ "eval_samples_per_second": 6.236,
75
+ "eval_steps_per_second": 1.559,
76
+ "step": 300
77
+ },
78
+ {
79
+ "epoch": 0.224,
80
+ "grad_norm": 3.164937973022461,
81
+ "learning_rate": 7.288888888888889e-07,
82
+ "loss": 0.6347025299072265,
83
+ "step": 350
84
+ },
85
+ {
86
+ "epoch": 0.256,
87
+ "grad_norm": 120.01831817626953,
88
+ "learning_rate": 6.733333333333333e-07,
89
+ "loss": 0.960202407836914,
90
+ "step": 400
91
+ },
92
+ {
93
+ "epoch": 0.256,
94
+ "eval_loss": 0.12297496199607849,
95
+ "eval_runtime": 320.4414,
96
+ "eval_samples_per_second": 6.241,
97
+ "eval_steps_per_second": 1.56,
98
+ "step": 400
99
+ },
100
+ {
101
+ "epoch": 0.288,
102
+ "grad_norm": 25.20623779296875,
103
+ "learning_rate": 6.177777777777777e-07,
104
+ "loss": 0.7631096649169922,
105
+ "step": 450
106
+ },
107
+ {
108
+ "epoch": 0.32,
109
+ "grad_norm": 124.12076568603516,
110
+ "learning_rate": 5.622222222222222e-07,
111
+ "loss": 0.9197311401367188,
112
+ "step": 500
113
+ },
114
+ {
115
+ "epoch": 0.32,
116
+ "eval_loss": 0.13506844639778137,
117
+ "eval_runtime": 320.4909,
118
+ "eval_samples_per_second": 6.24,
119
+ "eval_steps_per_second": 1.56,
120
+ "step": 500
121
+ },
122
+ {
123
+ "epoch": 0.352,
124
+ "grad_norm": 24.420225143432617,
125
+ "learning_rate": 5.066666666666667e-07,
126
+ "loss": 0.7606878662109375,
127
+ "step": 550
128
+ },
129
+ {
130
+ "epoch": 0.384,
131
+ "grad_norm": 354.97039794921875,
132
+ "learning_rate": 4.511111111111111e-07,
133
+ "loss": 0.7917160034179688,
134
+ "step": 600
135
+ },
136
+ {
137
+ "epoch": 0.384,
138
+ "eval_loss": 0.14342211186885834,
139
+ "eval_runtime": 313.4668,
140
+ "eval_samples_per_second": 6.38,
141
+ "eval_steps_per_second": 1.595,
142
+ "step": 600
143
+ }
144
+ ],
145
+ "logging_steps": 50,
146
+ "max_steps": 1000,
147
+ "num_input_tokens_seen": 0,
148
+ "num_train_epochs": 1,
149
+ "save_steps": 100,
150
+ "stateful_callbacks": {
151
+ "TrainerControl": {
152
+ "args": {
153
+ "should_epoch_stop": false,
154
+ "should_evaluate": false,
155
+ "should_log": false,
156
+ "should_save": true,
157
+ "should_training_stop": false
158
+ },
159
+ "attributes": {}
160
+ }
161
+ },
162
+ "total_flos": 3.570791931934176e+16,
163
+ "train_batch_size": 4,
164
+ "trial_name": null,
165
+ "trial_params": null
166
+ }
checkpoint-600/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792
checkpoint-700/config.json ADDED
@@ -0,0 +1,39 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": null,
7
+ "dtype": "float32",
8
+ "eos_token_id": null,
9
+ "hidden_act": "gelu",
10
+ "hidden_dropout_prob": 0.1,
11
+ "hidden_size": 1024,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 4096,
14
+ "layer_norm_eps": 1e-07,
15
+ "legacy": true,
16
+ "max_position_embeddings": 512,
17
+ "max_relative_positions": -1,
18
+ "model_type": "deberta-v2",
19
+ "norm_rel_ebd": "layer_norm",
20
+ "num_attention_heads": 16,
21
+ "num_hidden_layers": 24,
22
+ "pad_token_id": 0,
23
+ "pooler_dropout": 0,
24
+ "pooler_hidden_act": "gelu",
25
+ "pooler_hidden_size": 1024,
26
+ "pos_att_type": [
27
+ "p2c",
28
+ "c2p"
29
+ ],
30
+ "position_biased_input": false,
31
+ "position_buckets": 256,
32
+ "relative_attention": true,
33
+ "share_att_key": true,
34
+ "tie_word_embeddings": true,
35
+ "transformers_version": "5.12.1",
36
+ "type_vocab_size": 0,
37
+ "use_cache": false,
38
+ "vocab_size": 128100
39
+ }
checkpoint-700/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f272bca2fa45d8eab2903f6dd5c65ba31069d1a44a84bc417cdf35e496b8b80c
3
+ size 1740304440
checkpoint-700/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0aab418b245eac4a8b791f07c97230ee4c7b673a4eb8a04cdc2c305af309cbef
3
+ size 14180
checkpoint-700/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:63c0398359e885f2196fa72ee4be475e75de50479bda2cff1b0c6825b4ce37ea
3
+ size 988
checkpoint-700/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:06591d16f9a758f81bbcc69f12ba25035d86ebc49b91e73ab92a526cbf9d1d89
3
+ size 1064
checkpoint-700/trainer_state.json ADDED
@@ -0,0 +1,188 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.448,
6
+ "eval_steps": 100,
7
+ "global_step": 700,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.032,
14
+ "grad_norm": 25.09992027282715,
15
+ "learning_rate": 4.3999999999999997e-07,
16
+ "loss": 1.0546456146240235,
17
+ "step": 50
18
+ },
19
+ {
20
+ "epoch": 0.064,
21
+ "grad_norm": 44.00643539428711,
22
+ "learning_rate": 9.399999999999999e-07,
23
+ "loss": 1.2045201873779297,
24
+ "step": 100
25
+ },
26
+ {
27
+ "epoch": 0.064,
28
+ "eval_loss": 0.15259136259555817,
29
+ "eval_runtime": 320.8429,
30
+ "eval_samples_per_second": 6.234,
31
+ "eval_steps_per_second": 1.558,
32
+ "step": 100
33
+ },
34
+ {
35
+ "epoch": 0.096,
36
+ "grad_norm": 409.5372314453125,
37
+ "learning_rate": 9.511111111111111e-07,
38
+ "loss": 0.8091524505615234,
39
+ "step": 150
40
+ },
41
+ {
42
+ "epoch": 0.128,
43
+ "grad_norm": 4.935479640960693,
44
+ "learning_rate": 8.955555555555555e-07,
45
+ "loss": 0.9019821166992188,
46
+ "step": 200
47
+ },
48
+ {
49
+ "epoch": 0.128,
50
+ "eval_loss": 0.1397811472415924,
51
+ "eval_runtime": 320.5384,
52
+ "eval_samples_per_second": 6.24,
53
+ "eval_steps_per_second": 1.56,
54
+ "step": 200
55
+ },
56
+ {
57
+ "epoch": 0.16,
58
+ "grad_norm": 2.68009877204895,
59
+ "learning_rate": 8.399999999999999e-07,
60
+ "loss": 0.8488493347167969,
61
+ "step": 250
62
+ },
63
+ {
64
+ "epoch": 0.192,
65
+ "grad_norm": 250.0933380126953,
66
+ "learning_rate": 7.844444444444445e-07,
67
+ "loss": 0.8013427734375,
68
+ "step": 300
69
+ },
70
+ {
71
+ "epoch": 0.192,
72
+ "eval_loss": 0.13730598986148834,
73
+ "eval_runtime": 320.7296,
74
+ "eval_samples_per_second": 6.236,
75
+ "eval_steps_per_second": 1.559,
76
+ "step": 300
77
+ },
78
+ {
79
+ "epoch": 0.224,
80
+ "grad_norm": 3.164937973022461,
81
+ "learning_rate": 7.288888888888889e-07,
82
+ "loss": 0.6347025299072265,
83
+ "step": 350
84
+ },
85
+ {
86
+ "epoch": 0.256,
87
+ "grad_norm": 120.01831817626953,
88
+ "learning_rate": 6.733333333333333e-07,
89
+ "loss": 0.960202407836914,
90
+ "step": 400
91
+ },
92
+ {
93
+ "epoch": 0.256,
94
+ "eval_loss": 0.12297496199607849,
95
+ "eval_runtime": 320.4414,
96
+ "eval_samples_per_second": 6.241,
97
+ "eval_steps_per_second": 1.56,
98
+ "step": 400
99
+ },
100
+ {
101
+ "epoch": 0.288,
102
+ "grad_norm": 25.20623779296875,
103
+ "learning_rate": 6.177777777777777e-07,
104
+ "loss": 0.7631096649169922,
105
+ "step": 450
106
+ },
107
+ {
108
+ "epoch": 0.32,
109
+ "grad_norm": 124.12076568603516,
110
+ "learning_rate": 5.622222222222222e-07,
111
+ "loss": 0.9197311401367188,
112
+ "step": 500
113
+ },
114
+ {
115
+ "epoch": 0.32,
116
+ "eval_loss": 0.13506844639778137,
117
+ "eval_runtime": 320.4909,
118
+ "eval_samples_per_second": 6.24,
119
+ "eval_steps_per_second": 1.56,
120
+ "step": 500
121
+ },
122
+ {
123
+ "epoch": 0.352,
124
+ "grad_norm": 24.420225143432617,
125
+ "learning_rate": 5.066666666666667e-07,
126
+ "loss": 0.7606878662109375,
127
+ "step": 550
128
+ },
129
+ {
130
+ "epoch": 0.384,
131
+ "grad_norm": 354.97039794921875,
132
+ "learning_rate": 4.511111111111111e-07,
133
+ "loss": 0.7917160034179688,
134
+ "step": 600
135
+ },
136
+ {
137
+ "epoch": 0.384,
138
+ "eval_loss": 0.14342211186885834,
139
+ "eval_runtime": 313.4668,
140
+ "eval_samples_per_second": 6.38,
141
+ "eval_steps_per_second": 1.595,
142
+ "step": 600
143
+ },
144
+ {
145
+ "epoch": 0.416,
146
+ "grad_norm": 10.307374000549316,
147
+ "learning_rate": 3.955555555555555e-07,
148
+ "loss": 0.7462944030761719,
149
+ "step": 650
150
+ },
151
+ {
152
+ "epoch": 0.448,
153
+ "grad_norm": 318.738525390625,
154
+ "learning_rate": 3.4000000000000003e-07,
155
+ "loss": 0.7443762969970703,
156
+ "step": 700
157
+ },
158
+ {
159
+ "epoch": 0.448,
160
+ "eval_loss": 0.11785667389631271,
161
+ "eval_runtime": 320.2436,
162
+ "eval_samples_per_second": 6.245,
163
+ "eval_steps_per_second": 1.561,
164
+ "step": 700
165
+ }
166
+ ],
167
+ "logging_steps": 50,
168
+ "max_steps": 1000,
169
+ "num_input_tokens_seen": 0,
170
+ "num_train_epochs": 1,
171
+ "save_steps": 100,
172
+ "stateful_callbacks": {
173
+ "TrainerControl": {
174
+ "args": {
175
+ "should_epoch_stop": false,
176
+ "should_evaluate": false,
177
+ "should_log": false,
178
+ "should_save": true,
179
+ "should_training_stop": false
180
+ },
181
+ "attributes": {}
182
+ }
183
+ },
184
+ "total_flos": 4.16536597145749e+16,
185
+ "train_batch_size": 4,
186
+ "trial_name": null,
187
+ "trial_params": null
188
+ }
checkpoint-700/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
3
+ size 4792