Add files using upload-large-folder tool
Browse files- checkpoint-100/config.json +39 -0
- checkpoint-100/model.safetensors +3 -0
- checkpoint-100/rng_state.pth +3 -0
- checkpoint-100/scaler.pt +3 -0
- checkpoint-100/scheduler.pt +3 -0
- checkpoint-100/trainer_state.json +56 -0
- checkpoint-100/training_args.bin +3 -0
- checkpoint-200/config.json +39 -0
- checkpoint-200/model.safetensors +3 -0
- checkpoint-200/rng_state.pth +3 -0
- checkpoint-200/scaler.pt +3 -0
- checkpoint-200/scheduler.pt +3 -0
- checkpoint-200/trainer_state.json +78 -0
- checkpoint-200/training_args.bin +3 -0
- checkpoint-300/config.json +39 -0
- checkpoint-300/model.safetensors +3 -0
- checkpoint-300/rng_state.pth +3 -0
- checkpoint-300/scaler.pt +3 -0
- checkpoint-300/scheduler.pt +3 -0
- checkpoint-300/trainer_state.json +100 -0
- checkpoint-300/training_args.bin +3 -0
- checkpoint-400/config.json +39 -0
- checkpoint-400/model.safetensors +3 -0
- checkpoint-400/rng_state.pth +3 -0
- checkpoint-400/scaler.pt +3 -0
- checkpoint-400/scheduler.pt +3 -0
- checkpoint-400/trainer_state.json +122 -0
- checkpoint-400/training_args.bin +3 -0
- checkpoint-500/config.json +39 -0
- checkpoint-500/model.safetensors +3 -0
- checkpoint-500/optimizer.pt +3 -0
- checkpoint-500/rng_state.pth +3 -0
- checkpoint-500/scaler.pt +3 -0
- checkpoint-500/scheduler.pt +3 -0
- checkpoint-500/trainer_state.json +144 -0
- checkpoint-500/training_args.bin +3 -0
- checkpoint-600/config.json +39 -0
- checkpoint-600/model.safetensors +3 -0
- checkpoint-600/rng_state.pth +3 -0
- checkpoint-600/scaler.pt +3 -0
- checkpoint-600/scheduler.pt +3 -0
- checkpoint-600/trainer_state.json +166 -0
- checkpoint-600/training_args.bin +3 -0
- checkpoint-700/config.json +39 -0
- checkpoint-700/model.safetensors +3 -0
- checkpoint-700/rng_state.pth +3 -0
- checkpoint-700/scaler.pt +3 -0
- checkpoint-700/scheduler.pt +3 -0
- checkpoint-700/trainer_state.json +188 -0
- checkpoint-700/training_args.bin +3 -0
checkpoint-100/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-100/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6f51d528395b42388dcf0f534a6207a3f034d9b525416bc64b6f057902621c2f
|
| 3 |
+
size 1740304440
|
checkpoint-100/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:16e8aade09a90a40d007fa0bf00e1f86baea350c6f8ae65f4231eb9f856cfc06
|
| 3 |
+
size 14180
|
checkpoint-100/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:37d03bee491405f0804b15413c0e0b0f995c7932728fecb4f1497314d356e6f1
|
| 3 |
+
size 988
|
checkpoint-100/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bc47c48cefa8582e9f5b6467027e7c306fdb33d55aa6a5a0b6c234dffed881d2
|
| 3 |
+
size 1064
|
checkpoint-100/trainer_state.json
ADDED
|
@@ -0,0 +1,56 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.064,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 100,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
}
|
| 34 |
+
],
|
| 35 |
+
"logging_steps": 50,
|
| 36 |
+
"max_steps": 1000,
|
| 37 |
+
"num_input_tokens_seen": 0,
|
| 38 |
+
"num_train_epochs": 1,
|
| 39 |
+
"save_steps": 100,
|
| 40 |
+
"stateful_callbacks": {
|
| 41 |
+
"TrainerControl": {
|
| 42 |
+
"args": {
|
| 43 |
+
"should_epoch_stop": false,
|
| 44 |
+
"should_evaluate": false,
|
| 45 |
+
"should_log": false,
|
| 46 |
+
"should_save": true,
|
| 47 |
+
"should_training_stop": false
|
| 48 |
+
},
|
| 49 |
+
"attributes": {}
|
| 50 |
+
}
|
| 51 |
+
},
|
| 52 |
+
"total_flos": 5953567215380736.0,
|
| 53 |
+
"train_batch_size": 4,
|
| 54 |
+
"trial_name": null,
|
| 55 |
+
"trial_params": null
|
| 56 |
+
}
|
checkpoint-100/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|
checkpoint-200/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-200/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3c2bc389a960d9dfdc929377e92c852281b996f497d8e85f7b6d92256e1d3fcc
|
| 3 |
+
size 1740304440
|
checkpoint-200/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:93a692cbb9fef17013b112e00e851a326507eef7fd870ba2bf3d5761da4b8273
|
| 3 |
+
size 14180
|
checkpoint-200/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f4d7eaa4548eb89bb14ef8ad634f33429d7875bdc4c1591b441fcb5c0f78db3b
|
| 3 |
+
size 988
|
checkpoint-200/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:124cf7a8b9959cc2e7286d1ca0fbfbdf1fd78046ddd7b8b0be8872a62c701348
|
| 3 |
+
size 1064
|
checkpoint-200/trainer_state.json
ADDED
|
@@ -0,0 +1,78 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.128,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 200,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
},
|
| 34 |
+
{
|
| 35 |
+
"epoch": 0.096,
|
| 36 |
+
"grad_norm": 409.5372314453125,
|
| 37 |
+
"learning_rate": 9.511111111111111e-07,
|
| 38 |
+
"loss": 0.8091524505615234,
|
| 39 |
+
"step": 150
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"epoch": 0.128,
|
| 43 |
+
"grad_norm": 4.935479640960693,
|
| 44 |
+
"learning_rate": 8.955555555555555e-07,
|
| 45 |
+
"loss": 0.9019821166992188,
|
| 46 |
+
"step": 200
|
| 47 |
+
},
|
| 48 |
+
{
|
| 49 |
+
"epoch": 0.128,
|
| 50 |
+
"eval_loss": 0.1397811472415924,
|
| 51 |
+
"eval_runtime": 320.5384,
|
| 52 |
+
"eval_samples_per_second": 6.24,
|
| 53 |
+
"eval_steps_per_second": 1.56,
|
| 54 |
+
"step": 200
|
| 55 |
+
}
|
| 56 |
+
],
|
| 57 |
+
"logging_steps": 50,
|
| 58 |
+
"max_steps": 1000,
|
| 59 |
+
"num_input_tokens_seen": 0,
|
| 60 |
+
"num_train_epochs": 1,
|
| 61 |
+
"save_steps": 100,
|
| 62 |
+
"stateful_callbacks": {
|
| 63 |
+
"TrainerControl": {
|
| 64 |
+
"args": {
|
| 65 |
+
"should_epoch_stop": false,
|
| 66 |
+
"should_evaluate": false,
|
| 67 |
+
"should_log": false,
|
| 68 |
+
"should_save": true,
|
| 69 |
+
"should_training_stop": false
|
| 70 |
+
},
|
| 71 |
+
"attributes": {}
|
| 72 |
+
}
|
| 73 |
+
},
|
| 74 |
+
"total_flos": 1.190401098346536e+16,
|
| 75 |
+
"train_batch_size": 4,
|
| 76 |
+
"trial_name": null,
|
| 77 |
+
"trial_params": null
|
| 78 |
+
}
|
checkpoint-200/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|
checkpoint-300/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-300/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6e24387fdd245e292c16e2b79803483885069d736df1c42229dc489b2e3e761d
|
| 3 |
+
size 1740304440
|
checkpoint-300/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6f8d5624bd5068f2c5182c44c3fa271efb8419e50bcd1658bc28380f8fbfc352
|
| 3 |
+
size 14180
|
checkpoint-300/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f0032c98d04d71a11fda8b214fed42c7a7511d08bee284b55a738a2ecde039e2
|
| 3 |
+
size 988
|
checkpoint-300/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a1eb1ac6c98e1509a604f888f2e6f28bea80c725fcfd59330e3be3591813644b
|
| 3 |
+
size 1064
|
checkpoint-300/trainer_state.json
ADDED
|
@@ -0,0 +1,100 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.192,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 300,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
},
|
| 34 |
+
{
|
| 35 |
+
"epoch": 0.096,
|
| 36 |
+
"grad_norm": 409.5372314453125,
|
| 37 |
+
"learning_rate": 9.511111111111111e-07,
|
| 38 |
+
"loss": 0.8091524505615234,
|
| 39 |
+
"step": 150
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"epoch": 0.128,
|
| 43 |
+
"grad_norm": 4.935479640960693,
|
| 44 |
+
"learning_rate": 8.955555555555555e-07,
|
| 45 |
+
"loss": 0.9019821166992188,
|
| 46 |
+
"step": 200
|
| 47 |
+
},
|
| 48 |
+
{
|
| 49 |
+
"epoch": 0.128,
|
| 50 |
+
"eval_loss": 0.1397811472415924,
|
| 51 |
+
"eval_runtime": 320.5384,
|
| 52 |
+
"eval_samples_per_second": 6.24,
|
| 53 |
+
"eval_steps_per_second": 1.56,
|
| 54 |
+
"step": 200
|
| 55 |
+
},
|
| 56 |
+
{
|
| 57 |
+
"epoch": 0.16,
|
| 58 |
+
"grad_norm": 2.68009877204895,
|
| 59 |
+
"learning_rate": 8.399999999999999e-07,
|
| 60 |
+
"loss": 0.8488493347167969,
|
| 61 |
+
"step": 250
|
| 62 |
+
},
|
| 63 |
+
{
|
| 64 |
+
"epoch": 0.192,
|
| 65 |
+
"grad_norm": 250.0933380126953,
|
| 66 |
+
"learning_rate": 7.844444444444445e-07,
|
| 67 |
+
"loss": 0.8013427734375,
|
| 68 |
+
"step": 300
|
| 69 |
+
},
|
| 70 |
+
{
|
| 71 |
+
"epoch": 0.192,
|
| 72 |
+
"eval_loss": 0.13730598986148834,
|
| 73 |
+
"eval_runtime": 320.7296,
|
| 74 |
+
"eval_samples_per_second": 6.236,
|
| 75 |
+
"eval_steps_per_second": 1.559,
|
| 76 |
+
"step": 300
|
| 77 |
+
}
|
| 78 |
+
],
|
| 79 |
+
"logging_steps": 50,
|
| 80 |
+
"max_steps": 1000,
|
| 81 |
+
"num_input_tokens_seen": 0,
|
| 82 |
+
"num_train_epochs": 1,
|
| 83 |
+
"save_steps": 100,
|
| 84 |
+
"stateful_callbacks": {
|
| 85 |
+
"TrainerControl": {
|
| 86 |
+
"args": {
|
| 87 |
+
"should_epoch_stop": false,
|
| 88 |
+
"should_evaluate": false,
|
| 89 |
+
"should_log": false,
|
| 90 |
+
"should_save": true,
|
| 91 |
+
"should_training_stop": false
|
| 92 |
+
},
|
| 93 |
+
"attributes": {}
|
| 94 |
+
}
|
| 95 |
+
},
|
| 96 |
+
"total_flos": 1.7856631699665456e+16,
|
| 97 |
+
"train_batch_size": 4,
|
| 98 |
+
"trial_name": null,
|
| 99 |
+
"trial_params": null
|
| 100 |
+
}
|
checkpoint-300/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|
checkpoint-400/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-400/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e510ff1c0d0b2a753b89342d15a84f3c8e0cb3518e9404ecf61a398d49072d42
|
| 3 |
+
size 1740304440
|
checkpoint-400/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:60324b2bab14319d4ed37f75c3ee04f669d54ee031664e663eda54c1034ebe85
|
| 3 |
+
size 14180
|
checkpoint-400/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b48f0fed3631545d5c0ac4432b6dc265c750aca3e8a89b3b4268785b1b87056f
|
| 3 |
+
size 988
|
checkpoint-400/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e8aa5b842d19939b9a7b1b29463530ead81aff748b3c7f3cc968c174806c2a57
|
| 3 |
+
size 1064
|
checkpoint-400/trainer_state.json
ADDED
|
@@ -0,0 +1,122 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.256,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 400,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
},
|
| 34 |
+
{
|
| 35 |
+
"epoch": 0.096,
|
| 36 |
+
"grad_norm": 409.5372314453125,
|
| 37 |
+
"learning_rate": 9.511111111111111e-07,
|
| 38 |
+
"loss": 0.8091524505615234,
|
| 39 |
+
"step": 150
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"epoch": 0.128,
|
| 43 |
+
"grad_norm": 4.935479640960693,
|
| 44 |
+
"learning_rate": 8.955555555555555e-07,
|
| 45 |
+
"loss": 0.9019821166992188,
|
| 46 |
+
"step": 200
|
| 47 |
+
},
|
| 48 |
+
{
|
| 49 |
+
"epoch": 0.128,
|
| 50 |
+
"eval_loss": 0.1397811472415924,
|
| 51 |
+
"eval_runtime": 320.5384,
|
| 52 |
+
"eval_samples_per_second": 6.24,
|
| 53 |
+
"eval_steps_per_second": 1.56,
|
| 54 |
+
"step": 200
|
| 55 |
+
},
|
| 56 |
+
{
|
| 57 |
+
"epoch": 0.16,
|
| 58 |
+
"grad_norm": 2.68009877204895,
|
| 59 |
+
"learning_rate": 8.399999999999999e-07,
|
| 60 |
+
"loss": 0.8488493347167969,
|
| 61 |
+
"step": 250
|
| 62 |
+
},
|
| 63 |
+
{
|
| 64 |
+
"epoch": 0.192,
|
| 65 |
+
"grad_norm": 250.0933380126953,
|
| 66 |
+
"learning_rate": 7.844444444444445e-07,
|
| 67 |
+
"loss": 0.8013427734375,
|
| 68 |
+
"step": 300
|
| 69 |
+
},
|
| 70 |
+
{
|
| 71 |
+
"epoch": 0.192,
|
| 72 |
+
"eval_loss": 0.13730598986148834,
|
| 73 |
+
"eval_runtime": 320.7296,
|
| 74 |
+
"eval_samples_per_second": 6.236,
|
| 75 |
+
"eval_steps_per_second": 1.559,
|
| 76 |
+
"step": 300
|
| 77 |
+
},
|
| 78 |
+
{
|
| 79 |
+
"epoch": 0.224,
|
| 80 |
+
"grad_norm": 3.164937973022461,
|
| 81 |
+
"learning_rate": 7.288888888888889e-07,
|
| 82 |
+
"loss": 0.6347025299072265,
|
| 83 |
+
"step": 350
|
| 84 |
+
},
|
| 85 |
+
{
|
| 86 |
+
"epoch": 0.256,
|
| 87 |
+
"grad_norm": 120.01831817626953,
|
| 88 |
+
"learning_rate": 6.733333333333333e-07,
|
| 89 |
+
"loss": 0.960202407836914,
|
| 90 |
+
"step": 400
|
| 91 |
+
},
|
| 92 |
+
{
|
| 93 |
+
"epoch": 0.256,
|
| 94 |
+
"eval_loss": 0.12297496199607849,
|
| 95 |
+
"eval_runtime": 320.4414,
|
| 96 |
+
"eval_samples_per_second": 6.241,
|
| 97 |
+
"eval_steps_per_second": 1.56,
|
| 98 |
+
"step": 400
|
| 99 |
+
}
|
| 100 |
+
],
|
| 101 |
+
"logging_steps": 50,
|
| 102 |
+
"max_steps": 1000,
|
| 103 |
+
"num_input_tokens_seen": 0,
|
| 104 |
+
"num_train_epochs": 1,
|
| 105 |
+
"save_steps": 100,
|
| 106 |
+
"stateful_callbacks": {
|
| 107 |
+
"TrainerControl": {
|
| 108 |
+
"args": {
|
| 109 |
+
"should_epoch_stop": false,
|
| 110 |
+
"should_evaluate": false,
|
| 111 |
+
"should_log": false,
|
| 112 |
+
"should_save": true,
|
| 113 |
+
"should_training_stop": false
|
| 114 |
+
},
|
| 115 |
+
"attributes": {}
|
| 116 |
+
}
|
| 117 |
+
},
|
| 118 |
+
"total_flos": 2.3807672490310176e+16,
|
| 119 |
+
"train_batch_size": 4,
|
| 120 |
+
"trial_name": null,
|
| 121 |
+
"trial_params": null
|
| 122 |
+
}
|
checkpoint-400/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|
checkpoint-500/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-500/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c41840a20abd987e0a6f2d9e2278dce7fa2bec86b10a4485b396d4f6d5555f48
|
| 3 |
+
size 1740304440
|
checkpoint-500/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9e810d6ba6cd35e38138346e80dc488127ed759e6e40299ba97798ee34c783af
|
| 3 |
+
size 2271441914
|
checkpoint-500/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:40e6457e5a15e10eebea51ab9d0765297dafb5eadc657de5b57d3781d638deaf
|
| 3 |
+
size 14180
|
checkpoint-500/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:626829538aca7940353b7f46f08c3f43239373a2e67000f06460ca4c197f4065
|
| 3 |
+
size 988
|
checkpoint-500/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:215e94693570a82dbed7af5f4f9cffa462ea8649a10019126b61ab63c5495e59
|
| 3 |
+
size 1064
|
checkpoint-500/trainer_state.json
ADDED
|
@@ -0,0 +1,144 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.32,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 500,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
},
|
| 34 |
+
{
|
| 35 |
+
"epoch": 0.096,
|
| 36 |
+
"grad_norm": 409.5372314453125,
|
| 37 |
+
"learning_rate": 9.511111111111111e-07,
|
| 38 |
+
"loss": 0.8091524505615234,
|
| 39 |
+
"step": 150
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"epoch": 0.128,
|
| 43 |
+
"grad_norm": 4.935479640960693,
|
| 44 |
+
"learning_rate": 8.955555555555555e-07,
|
| 45 |
+
"loss": 0.9019821166992188,
|
| 46 |
+
"step": 200
|
| 47 |
+
},
|
| 48 |
+
{
|
| 49 |
+
"epoch": 0.128,
|
| 50 |
+
"eval_loss": 0.1397811472415924,
|
| 51 |
+
"eval_runtime": 320.5384,
|
| 52 |
+
"eval_samples_per_second": 6.24,
|
| 53 |
+
"eval_steps_per_second": 1.56,
|
| 54 |
+
"step": 200
|
| 55 |
+
},
|
| 56 |
+
{
|
| 57 |
+
"epoch": 0.16,
|
| 58 |
+
"grad_norm": 2.68009877204895,
|
| 59 |
+
"learning_rate": 8.399999999999999e-07,
|
| 60 |
+
"loss": 0.8488493347167969,
|
| 61 |
+
"step": 250
|
| 62 |
+
},
|
| 63 |
+
{
|
| 64 |
+
"epoch": 0.192,
|
| 65 |
+
"grad_norm": 250.0933380126953,
|
| 66 |
+
"learning_rate": 7.844444444444445e-07,
|
| 67 |
+
"loss": 0.8013427734375,
|
| 68 |
+
"step": 300
|
| 69 |
+
},
|
| 70 |
+
{
|
| 71 |
+
"epoch": 0.192,
|
| 72 |
+
"eval_loss": 0.13730598986148834,
|
| 73 |
+
"eval_runtime": 320.7296,
|
| 74 |
+
"eval_samples_per_second": 6.236,
|
| 75 |
+
"eval_steps_per_second": 1.559,
|
| 76 |
+
"step": 300
|
| 77 |
+
},
|
| 78 |
+
{
|
| 79 |
+
"epoch": 0.224,
|
| 80 |
+
"grad_norm": 3.164937973022461,
|
| 81 |
+
"learning_rate": 7.288888888888889e-07,
|
| 82 |
+
"loss": 0.6347025299072265,
|
| 83 |
+
"step": 350
|
| 84 |
+
},
|
| 85 |
+
{
|
| 86 |
+
"epoch": 0.256,
|
| 87 |
+
"grad_norm": 120.01831817626953,
|
| 88 |
+
"learning_rate": 6.733333333333333e-07,
|
| 89 |
+
"loss": 0.960202407836914,
|
| 90 |
+
"step": 400
|
| 91 |
+
},
|
| 92 |
+
{
|
| 93 |
+
"epoch": 0.256,
|
| 94 |
+
"eval_loss": 0.12297496199607849,
|
| 95 |
+
"eval_runtime": 320.4414,
|
| 96 |
+
"eval_samples_per_second": 6.241,
|
| 97 |
+
"eval_steps_per_second": 1.56,
|
| 98 |
+
"step": 400
|
| 99 |
+
},
|
| 100 |
+
{
|
| 101 |
+
"epoch": 0.288,
|
| 102 |
+
"grad_norm": 25.20623779296875,
|
| 103 |
+
"learning_rate": 6.177777777777777e-07,
|
| 104 |
+
"loss": 0.7631096649169922,
|
| 105 |
+
"step": 450
|
| 106 |
+
},
|
| 107 |
+
{
|
| 108 |
+
"epoch": 0.32,
|
| 109 |
+
"grad_norm": 124.12076568603516,
|
| 110 |
+
"learning_rate": 5.622222222222222e-07,
|
| 111 |
+
"loss": 0.9197311401367188,
|
| 112 |
+
"step": 500
|
| 113 |
+
},
|
| 114 |
+
{
|
| 115 |
+
"epoch": 0.32,
|
| 116 |
+
"eval_loss": 0.13506844639778137,
|
| 117 |
+
"eval_runtime": 320.4909,
|
| 118 |
+
"eval_samples_per_second": 6.24,
|
| 119 |
+
"eval_steps_per_second": 1.56,
|
| 120 |
+
"step": 500
|
| 121 |
+
}
|
| 122 |
+
],
|
| 123 |
+
"logging_steps": 50,
|
| 124 |
+
"max_steps": 1000,
|
| 125 |
+
"num_input_tokens_seen": 0,
|
| 126 |
+
"num_train_epochs": 1,
|
| 127 |
+
"save_steps": 100,
|
| 128 |
+
"stateful_callbacks": {
|
| 129 |
+
"TrainerControl": {
|
| 130 |
+
"args": {
|
| 131 |
+
"should_epoch_stop": false,
|
| 132 |
+
"should_evaluate": false,
|
| 133 |
+
"should_log": false,
|
| 134 |
+
"should_save": true,
|
| 135 |
+
"should_training_stop": false
|
| 136 |
+
},
|
| 137 |
+
"attributes": {}
|
| 138 |
+
}
|
| 139 |
+
},
|
| 140 |
+
"total_flos": 2.975877152705832e+16,
|
| 141 |
+
"train_batch_size": 4,
|
| 142 |
+
"trial_name": null,
|
| 143 |
+
"trial_params": null
|
| 144 |
+
}
|
checkpoint-500/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|
checkpoint-600/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-600/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:18988f5ea942fa89e4a092078c8b3f3fbeb3856f07493d528ec810d7f838251e
|
| 3 |
+
size 1740304440
|
checkpoint-600/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:56a2fdf431c074b4cb70dda7a139d6d8a19ae50eba8f1bd05ac3e3177e25c88e
|
| 3 |
+
size 14180
|
checkpoint-600/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:fcb65f7c732b29824f760066581ac9307df8061d26977f3ff63f0632ff073692
|
| 3 |
+
size 988
|
checkpoint-600/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1da014bf8a42665ddf5c484720cbba2070f1a3afe5db34d484a965add48bd2d9
|
| 3 |
+
size 1064
|
checkpoint-600/trainer_state.json
ADDED
|
@@ -0,0 +1,166 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.384,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 600,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
},
|
| 34 |
+
{
|
| 35 |
+
"epoch": 0.096,
|
| 36 |
+
"grad_norm": 409.5372314453125,
|
| 37 |
+
"learning_rate": 9.511111111111111e-07,
|
| 38 |
+
"loss": 0.8091524505615234,
|
| 39 |
+
"step": 150
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"epoch": 0.128,
|
| 43 |
+
"grad_norm": 4.935479640960693,
|
| 44 |
+
"learning_rate": 8.955555555555555e-07,
|
| 45 |
+
"loss": 0.9019821166992188,
|
| 46 |
+
"step": 200
|
| 47 |
+
},
|
| 48 |
+
{
|
| 49 |
+
"epoch": 0.128,
|
| 50 |
+
"eval_loss": 0.1397811472415924,
|
| 51 |
+
"eval_runtime": 320.5384,
|
| 52 |
+
"eval_samples_per_second": 6.24,
|
| 53 |
+
"eval_steps_per_second": 1.56,
|
| 54 |
+
"step": 200
|
| 55 |
+
},
|
| 56 |
+
{
|
| 57 |
+
"epoch": 0.16,
|
| 58 |
+
"grad_norm": 2.68009877204895,
|
| 59 |
+
"learning_rate": 8.399999999999999e-07,
|
| 60 |
+
"loss": 0.8488493347167969,
|
| 61 |
+
"step": 250
|
| 62 |
+
},
|
| 63 |
+
{
|
| 64 |
+
"epoch": 0.192,
|
| 65 |
+
"grad_norm": 250.0933380126953,
|
| 66 |
+
"learning_rate": 7.844444444444445e-07,
|
| 67 |
+
"loss": 0.8013427734375,
|
| 68 |
+
"step": 300
|
| 69 |
+
},
|
| 70 |
+
{
|
| 71 |
+
"epoch": 0.192,
|
| 72 |
+
"eval_loss": 0.13730598986148834,
|
| 73 |
+
"eval_runtime": 320.7296,
|
| 74 |
+
"eval_samples_per_second": 6.236,
|
| 75 |
+
"eval_steps_per_second": 1.559,
|
| 76 |
+
"step": 300
|
| 77 |
+
},
|
| 78 |
+
{
|
| 79 |
+
"epoch": 0.224,
|
| 80 |
+
"grad_norm": 3.164937973022461,
|
| 81 |
+
"learning_rate": 7.288888888888889e-07,
|
| 82 |
+
"loss": 0.6347025299072265,
|
| 83 |
+
"step": 350
|
| 84 |
+
},
|
| 85 |
+
{
|
| 86 |
+
"epoch": 0.256,
|
| 87 |
+
"grad_norm": 120.01831817626953,
|
| 88 |
+
"learning_rate": 6.733333333333333e-07,
|
| 89 |
+
"loss": 0.960202407836914,
|
| 90 |
+
"step": 400
|
| 91 |
+
},
|
| 92 |
+
{
|
| 93 |
+
"epoch": 0.256,
|
| 94 |
+
"eval_loss": 0.12297496199607849,
|
| 95 |
+
"eval_runtime": 320.4414,
|
| 96 |
+
"eval_samples_per_second": 6.241,
|
| 97 |
+
"eval_steps_per_second": 1.56,
|
| 98 |
+
"step": 400
|
| 99 |
+
},
|
| 100 |
+
{
|
| 101 |
+
"epoch": 0.288,
|
| 102 |
+
"grad_norm": 25.20623779296875,
|
| 103 |
+
"learning_rate": 6.177777777777777e-07,
|
| 104 |
+
"loss": 0.7631096649169922,
|
| 105 |
+
"step": 450
|
| 106 |
+
},
|
| 107 |
+
{
|
| 108 |
+
"epoch": 0.32,
|
| 109 |
+
"grad_norm": 124.12076568603516,
|
| 110 |
+
"learning_rate": 5.622222222222222e-07,
|
| 111 |
+
"loss": 0.9197311401367188,
|
| 112 |
+
"step": 500
|
| 113 |
+
},
|
| 114 |
+
{
|
| 115 |
+
"epoch": 0.32,
|
| 116 |
+
"eval_loss": 0.13506844639778137,
|
| 117 |
+
"eval_runtime": 320.4909,
|
| 118 |
+
"eval_samples_per_second": 6.24,
|
| 119 |
+
"eval_steps_per_second": 1.56,
|
| 120 |
+
"step": 500
|
| 121 |
+
},
|
| 122 |
+
{
|
| 123 |
+
"epoch": 0.352,
|
| 124 |
+
"grad_norm": 24.420225143432617,
|
| 125 |
+
"learning_rate": 5.066666666666667e-07,
|
| 126 |
+
"loss": 0.7606878662109375,
|
| 127 |
+
"step": 550
|
| 128 |
+
},
|
| 129 |
+
{
|
| 130 |
+
"epoch": 0.384,
|
| 131 |
+
"grad_norm": 354.97039794921875,
|
| 132 |
+
"learning_rate": 4.511111111111111e-07,
|
| 133 |
+
"loss": 0.7917160034179688,
|
| 134 |
+
"step": 600
|
| 135 |
+
},
|
| 136 |
+
{
|
| 137 |
+
"epoch": 0.384,
|
| 138 |
+
"eval_loss": 0.14342211186885834,
|
| 139 |
+
"eval_runtime": 313.4668,
|
| 140 |
+
"eval_samples_per_second": 6.38,
|
| 141 |
+
"eval_steps_per_second": 1.595,
|
| 142 |
+
"step": 600
|
| 143 |
+
}
|
| 144 |
+
],
|
| 145 |
+
"logging_steps": 50,
|
| 146 |
+
"max_steps": 1000,
|
| 147 |
+
"num_input_tokens_seen": 0,
|
| 148 |
+
"num_train_epochs": 1,
|
| 149 |
+
"save_steps": 100,
|
| 150 |
+
"stateful_callbacks": {
|
| 151 |
+
"TrainerControl": {
|
| 152 |
+
"args": {
|
| 153 |
+
"should_epoch_stop": false,
|
| 154 |
+
"should_evaluate": false,
|
| 155 |
+
"should_log": false,
|
| 156 |
+
"should_save": true,
|
| 157 |
+
"should_training_stop": false
|
| 158 |
+
},
|
| 159 |
+
"attributes": {}
|
| 160 |
+
}
|
| 161 |
+
},
|
| 162 |
+
"total_flos": 3.570791931934176e+16,
|
| 163 |
+
"train_batch_size": 4,
|
| 164 |
+
"trial_name": null,
|
| 165 |
+
"trial_params": null
|
| 166 |
+
}
|
checkpoint-600/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|
checkpoint-700/config.json
ADDED
|
@@ -0,0 +1,39 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"DebertaV2ForSequenceClassification"
|
| 4 |
+
],
|
| 5 |
+
"attention_probs_dropout_prob": 0.1,
|
| 6 |
+
"bos_token_id": null,
|
| 7 |
+
"dtype": "float32",
|
| 8 |
+
"eos_token_id": null,
|
| 9 |
+
"hidden_act": "gelu",
|
| 10 |
+
"hidden_dropout_prob": 0.1,
|
| 11 |
+
"hidden_size": 1024,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 4096,
|
| 14 |
+
"layer_norm_eps": 1e-07,
|
| 15 |
+
"legacy": true,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"max_relative_positions": -1,
|
| 18 |
+
"model_type": "deberta-v2",
|
| 19 |
+
"norm_rel_ebd": "layer_norm",
|
| 20 |
+
"num_attention_heads": 16,
|
| 21 |
+
"num_hidden_layers": 24,
|
| 22 |
+
"pad_token_id": 0,
|
| 23 |
+
"pooler_dropout": 0,
|
| 24 |
+
"pooler_hidden_act": "gelu",
|
| 25 |
+
"pooler_hidden_size": 1024,
|
| 26 |
+
"pos_att_type": [
|
| 27 |
+
"p2c",
|
| 28 |
+
"c2p"
|
| 29 |
+
],
|
| 30 |
+
"position_biased_input": false,
|
| 31 |
+
"position_buckets": 256,
|
| 32 |
+
"relative_attention": true,
|
| 33 |
+
"share_att_key": true,
|
| 34 |
+
"tie_word_embeddings": true,
|
| 35 |
+
"transformers_version": "5.12.1",
|
| 36 |
+
"type_vocab_size": 0,
|
| 37 |
+
"use_cache": false,
|
| 38 |
+
"vocab_size": 128100
|
| 39 |
+
}
|
checkpoint-700/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f272bca2fa45d8eab2903f6dd5c65ba31069d1a44a84bc417cdf35e496b8b80c
|
| 3 |
+
size 1740304440
|
checkpoint-700/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0aab418b245eac4a8b791f07c97230ee4c7b673a4eb8a04cdc2c305af309cbef
|
| 3 |
+
size 14180
|
checkpoint-700/scaler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:63c0398359e885f2196fa72ee4be475e75de50479bda2cff1b0c6825b4ce37ea
|
| 3 |
+
size 988
|
checkpoint-700/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:06591d16f9a758f81bbcc69f12ba25035d86ebc49b91e73ab92a526cbf9d1d89
|
| 3 |
+
size 1064
|
checkpoint-700/trainer_state.json
ADDED
|
@@ -0,0 +1,188 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.448,
|
| 6 |
+
"eval_steps": 100,
|
| 7 |
+
"global_step": 700,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.032,
|
| 14 |
+
"grad_norm": 25.09992027282715,
|
| 15 |
+
"learning_rate": 4.3999999999999997e-07,
|
| 16 |
+
"loss": 1.0546456146240235,
|
| 17 |
+
"step": 50
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.064,
|
| 21 |
+
"grad_norm": 44.00643539428711,
|
| 22 |
+
"learning_rate": 9.399999999999999e-07,
|
| 23 |
+
"loss": 1.2045201873779297,
|
| 24 |
+
"step": 100
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.064,
|
| 28 |
+
"eval_loss": 0.15259136259555817,
|
| 29 |
+
"eval_runtime": 320.8429,
|
| 30 |
+
"eval_samples_per_second": 6.234,
|
| 31 |
+
"eval_steps_per_second": 1.558,
|
| 32 |
+
"step": 100
|
| 33 |
+
},
|
| 34 |
+
{
|
| 35 |
+
"epoch": 0.096,
|
| 36 |
+
"grad_norm": 409.5372314453125,
|
| 37 |
+
"learning_rate": 9.511111111111111e-07,
|
| 38 |
+
"loss": 0.8091524505615234,
|
| 39 |
+
"step": 150
|
| 40 |
+
},
|
| 41 |
+
{
|
| 42 |
+
"epoch": 0.128,
|
| 43 |
+
"grad_norm": 4.935479640960693,
|
| 44 |
+
"learning_rate": 8.955555555555555e-07,
|
| 45 |
+
"loss": 0.9019821166992188,
|
| 46 |
+
"step": 200
|
| 47 |
+
},
|
| 48 |
+
{
|
| 49 |
+
"epoch": 0.128,
|
| 50 |
+
"eval_loss": 0.1397811472415924,
|
| 51 |
+
"eval_runtime": 320.5384,
|
| 52 |
+
"eval_samples_per_second": 6.24,
|
| 53 |
+
"eval_steps_per_second": 1.56,
|
| 54 |
+
"step": 200
|
| 55 |
+
},
|
| 56 |
+
{
|
| 57 |
+
"epoch": 0.16,
|
| 58 |
+
"grad_norm": 2.68009877204895,
|
| 59 |
+
"learning_rate": 8.399999999999999e-07,
|
| 60 |
+
"loss": 0.8488493347167969,
|
| 61 |
+
"step": 250
|
| 62 |
+
},
|
| 63 |
+
{
|
| 64 |
+
"epoch": 0.192,
|
| 65 |
+
"grad_norm": 250.0933380126953,
|
| 66 |
+
"learning_rate": 7.844444444444445e-07,
|
| 67 |
+
"loss": 0.8013427734375,
|
| 68 |
+
"step": 300
|
| 69 |
+
},
|
| 70 |
+
{
|
| 71 |
+
"epoch": 0.192,
|
| 72 |
+
"eval_loss": 0.13730598986148834,
|
| 73 |
+
"eval_runtime": 320.7296,
|
| 74 |
+
"eval_samples_per_second": 6.236,
|
| 75 |
+
"eval_steps_per_second": 1.559,
|
| 76 |
+
"step": 300
|
| 77 |
+
},
|
| 78 |
+
{
|
| 79 |
+
"epoch": 0.224,
|
| 80 |
+
"grad_norm": 3.164937973022461,
|
| 81 |
+
"learning_rate": 7.288888888888889e-07,
|
| 82 |
+
"loss": 0.6347025299072265,
|
| 83 |
+
"step": 350
|
| 84 |
+
},
|
| 85 |
+
{
|
| 86 |
+
"epoch": 0.256,
|
| 87 |
+
"grad_norm": 120.01831817626953,
|
| 88 |
+
"learning_rate": 6.733333333333333e-07,
|
| 89 |
+
"loss": 0.960202407836914,
|
| 90 |
+
"step": 400
|
| 91 |
+
},
|
| 92 |
+
{
|
| 93 |
+
"epoch": 0.256,
|
| 94 |
+
"eval_loss": 0.12297496199607849,
|
| 95 |
+
"eval_runtime": 320.4414,
|
| 96 |
+
"eval_samples_per_second": 6.241,
|
| 97 |
+
"eval_steps_per_second": 1.56,
|
| 98 |
+
"step": 400
|
| 99 |
+
},
|
| 100 |
+
{
|
| 101 |
+
"epoch": 0.288,
|
| 102 |
+
"grad_norm": 25.20623779296875,
|
| 103 |
+
"learning_rate": 6.177777777777777e-07,
|
| 104 |
+
"loss": 0.7631096649169922,
|
| 105 |
+
"step": 450
|
| 106 |
+
},
|
| 107 |
+
{
|
| 108 |
+
"epoch": 0.32,
|
| 109 |
+
"grad_norm": 124.12076568603516,
|
| 110 |
+
"learning_rate": 5.622222222222222e-07,
|
| 111 |
+
"loss": 0.9197311401367188,
|
| 112 |
+
"step": 500
|
| 113 |
+
},
|
| 114 |
+
{
|
| 115 |
+
"epoch": 0.32,
|
| 116 |
+
"eval_loss": 0.13506844639778137,
|
| 117 |
+
"eval_runtime": 320.4909,
|
| 118 |
+
"eval_samples_per_second": 6.24,
|
| 119 |
+
"eval_steps_per_second": 1.56,
|
| 120 |
+
"step": 500
|
| 121 |
+
},
|
| 122 |
+
{
|
| 123 |
+
"epoch": 0.352,
|
| 124 |
+
"grad_norm": 24.420225143432617,
|
| 125 |
+
"learning_rate": 5.066666666666667e-07,
|
| 126 |
+
"loss": 0.7606878662109375,
|
| 127 |
+
"step": 550
|
| 128 |
+
},
|
| 129 |
+
{
|
| 130 |
+
"epoch": 0.384,
|
| 131 |
+
"grad_norm": 354.97039794921875,
|
| 132 |
+
"learning_rate": 4.511111111111111e-07,
|
| 133 |
+
"loss": 0.7917160034179688,
|
| 134 |
+
"step": 600
|
| 135 |
+
},
|
| 136 |
+
{
|
| 137 |
+
"epoch": 0.384,
|
| 138 |
+
"eval_loss": 0.14342211186885834,
|
| 139 |
+
"eval_runtime": 313.4668,
|
| 140 |
+
"eval_samples_per_second": 6.38,
|
| 141 |
+
"eval_steps_per_second": 1.595,
|
| 142 |
+
"step": 600
|
| 143 |
+
},
|
| 144 |
+
{
|
| 145 |
+
"epoch": 0.416,
|
| 146 |
+
"grad_norm": 10.307374000549316,
|
| 147 |
+
"learning_rate": 3.955555555555555e-07,
|
| 148 |
+
"loss": 0.7462944030761719,
|
| 149 |
+
"step": 650
|
| 150 |
+
},
|
| 151 |
+
{
|
| 152 |
+
"epoch": 0.448,
|
| 153 |
+
"grad_norm": 318.738525390625,
|
| 154 |
+
"learning_rate": 3.4000000000000003e-07,
|
| 155 |
+
"loss": 0.7443762969970703,
|
| 156 |
+
"step": 700
|
| 157 |
+
},
|
| 158 |
+
{
|
| 159 |
+
"epoch": 0.448,
|
| 160 |
+
"eval_loss": 0.11785667389631271,
|
| 161 |
+
"eval_runtime": 320.2436,
|
| 162 |
+
"eval_samples_per_second": 6.245,
|
| 163 |
+
"eval_steps_per_second": 1.561,
|
| 164 |
+
"step": 700
|
| 165 |
+
}
|
| 166 |
+
],
|
| 167 |
+
"logging_steps": 50,
|
| 168 |
+
"max_steps": 1000,
|
| 169 |
+
"num_input_tokens_seen": 0,
|
| 170 |
+
"num_train_epochs": 1,
|
| 171 |
+
"save_steps": 100,
|
| 172 |
+
"stateful_callbacks": {
|
| 173 |
+
"TrainerControl": {
|
| 174 |
+
"args": {
|
| 175 |
+
"should_epoch_stop": false,
|
| 176 |
+
"should_evaluate": false,
|
| 177 |
+
"should_log": false,
|
| 178 |
+
"should_save": true,
|
| 179 |
+
"should_training_stop": false
|
| 180 |
+
},
|
| 181 |
+
"attributes": {}
|
| 182 |
+
}
|
| 183 |
+
},
|
| 184 |
+
"total_flos": 4.16536597145749e+16,
|
| 185 |
+
"train_batch_size": 4,
|
| 186 |
+
"trial_name": null,
|
| 187 |
+
"trial_params": null
|
| 188 |
+
}
|
checkpoint-700/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3da6e2a61b6bad49c09f23bbfa4f7ef9e3d7901027f4ad3d2b43105b61dd0d2d
|
| 3 |
+
size 4792
|