diff --git a/README.md b/README.md new file mode 100644 index 0000000000000000000000000000000000000000..12c94840fea8a3afce02142e31cf01d60d62dcbf --- /dev/null +++ b/README.md @@ -0,0 +1,57 @@ +--- +license: apache-2.0 +base_model: bert-base-cased +tags: +- generated_from_trainer +model-index: +- name: bert_trainer + results: [] +--- + + + +# bert_trainer + +This model is a fine-tuned version of [bert-base-cased](https://huggingface.co/bert-base-cased) on the None dataset. +It achieves the following results on the evaluation set: +- eval_loss: 0.6901 +- eval_accuracy: 0.7558 +- eval_runtime: 30.0507 +- eval_samples_per_second: 103.292 +- eval_steps_per_second: 25.823 +- epoch: 0.16 +- step: 250 + +## Model description + +More information needed + +## Intended uses & limitations + +More information needed + +## Training and evaluation data + +More information needed + +## Training procedure + +### Training hyperparameters + +The following hyperparameters were used during training: +- learning_rate: 6.036609853019458e-06 +- train_batch_size: 8 +- eval_batch_size: 4 +- seed: 42 +- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08 +- lr_scheduler_type: constant_with_warmup +- lr_scheduler_warmup_steps: 50 +- training_steps: 3000 + +### Framework versions + +- Transformers 4.36.0.dev0 +- Pytorch 2.1.1+cu121 +- Datasets 2.15.0 +- Tokenizers 0.15.0 diff --git a/config.json b/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..013d9b0b2d4d6c4aaa4e5b068c6535d11a141575 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd32e24b75429e0cb9367040b8e23512009bab779fbedc84c7cd676a547332c8 +size 433279996 diff --git a/run-0/checkpoint-2500/config.json b/run-0/checkpoint-2500/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-0/checkpoint-2500/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-0/checkpoint-2500/model.safetensors b/run-0/checkpoint-2500/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d9b70e6916f1aba89cd38259d579ec3a23c0826e --- /dev/null +++ b/run-0/checkpoint-2500/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4d3e6ee528249c0e1c6388d2e72c4e47db8e42f96022ddc8f107119bbde5e135 +size 433279996 diff --git a/run-0/checkpoint-2500/optimizer.pt b/run-0/checkpoint-2500/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..195d768201a726448ec3ad142d2dc8f6fdd7a37b --- /dev/null +++ b/run-0/checkpoint-2500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:48b0eabf74e09755cd69eb9a84a842e5681649a25f2c588f1e78331b8358fd78 +size 866681082 diff --git a/run-0/checkpoint-2500/rng_state.pth b/run-0/checkpoint-2500/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..b68d4eaf43291f178fb309f1adb0a7b459dd867c --- /dev/null +++ b/run-0/checkpoint-2500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e254f06883fec1e30ea9be59e97a84e2814064af09a93a2e0e9f4655ea082cd +size 14244 diff --git a/run-0/checkpoint-2500/scheduler.pt b/run-0/checkpoint-2500/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..6afcc1dd13ee28c42085442c72968a45793dc239 --- /dev/null +++ b/run-0/checkpoint-2500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:06617cdbcc181bf9ec7d4df7aa9e71ef685d4759e304bde8f28a58df45e09177 +size 1064 diff --git a/run-0/checkpoint-2500/trainer_state.json b/run-0/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0d5522cf8856455f0fa3be6d54a1e1b81449c798 --- /dev/null +++ b/run-0/checkpoint-2500/trainer_state.json @@ -0,0 +1,714 @@ +{ + "best_metric": 0.8743556701030928, + "best_model_checkpoint": "bert_trainer/run-0/checkpoint-1750", + "epoch": 3.2216494845360826, + "eval_steps": 250, + "global_step": 2500, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 2.650169893369787e-06, + "loss": 1.4561, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 5.300339786739574e-06, + "loss": 1.2146, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 5.300339786739574e-06, + "loss": 1.0949, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.9846, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.9161, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.8466, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 5.300339786739574e-06, + "loss": 0.7954, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.7311, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6688, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6816, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.7857603092783505, + "eval_loss": 0.6313713192939758, + "eval_runtime": 78.939, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.83, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6339, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6102, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6572, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6575, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5946, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5779, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5773, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5461, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.576, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4864, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8176546391752577, + "eval_loss": 0.5011568069458008, + "eval_runtime": 78.7987, + "eval_samples_per_second": 39.392, + "eval_steps_per_second": 9.848, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5618, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5325, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4656, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4966, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 5.300339786739574e-06, + "loss": 0.457, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4715, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4621, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4679, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4236, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 5.300339786739574e-06, + "loss": 0.399, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8443943298969072, + "eval_loss": 0.4396892488002777, + "eval_runtime": 78.9384, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.83, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4321, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3953, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.379, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3415, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3705, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3612, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4108, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4167, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3916, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3947, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8579252577319587, + "eval_loss": 0.40539947152137756, + "eval_runtime": 78.7689, + "eval_samples_per_second": 39.406, + "eval_steps_per_second": 9.852, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3812, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3804, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3783, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.337, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3191, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3277, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3601, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3932, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3964, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3705, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8524484536082474, + "eval_loss": 0.40534982085227966, + "eval_runtime": 78.953, + "eval_samples_per_second": 39.315, + "eval_steps_per_second": 9.829, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4567, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 5.300339786739574e-06, + "loss": 0.384, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3205, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3841, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.322, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3742, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3407, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3342, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3068, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3288, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8688788659793815, + "eval_loss": 0.36364319920539856, + "eval_runtime": 78.9463, + "eval_samples_per_second": 39.318, + "eval_steps_per_second": 9.829, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2918, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3571, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3341, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3162, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2384, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2934, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2686, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2806, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2897, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2417, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8743556701030928, + "eval_loss": 0.39001935720443726, + "eval_runtime": 78.9576, + "eval_samples_per_second": 39.312, + "eval_steps_per_second": 9.828, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2849, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2653, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2266, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2401, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2208, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2615, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2913, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2474, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2388, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2374, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8730670103092784, + "eval_loss": 0.39385583996772766, + "eval_runtime": 78.9575, + "eval_samples_per_second": 39.312, + "eval_steps_per_second": 9.828, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2697, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2592, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2636, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2349, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2697, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2507, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2608, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2463, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2408, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3525, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8627577319587629, + "eval_loss": 0.4113520085811615, + "eval_runtime": 78.9601, + "eval_samples_per_second": 39.311, + "eval_steps_per_second": 9.828, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3033, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2186, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2619, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1473, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1662, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1863, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1869, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1729, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1998, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1778, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.873389175257732, + "eval_loss": 0.44405418634414673, + "eval_runtime": 78.9751, + "eval_samples_per_second": 39.304, + "eval_steps_per_second": 9.826, + "step": 2500 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.0521042044565504e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 5.300339786739574e-06, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-0/checkpoint-2500/training_args.bin b/run-0/checkpoint-2500/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..ed612abf640aadfc105f23e03656a70e24f64012 --- /dev/null +++ b/run-0/checkpoint-2500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ff966c9d210a3dcc91765468d3bd580c3a94cec8f318bfe2ceb18c02bfa0afcf +size 4728 diff --git a/run-0/checkpoint-2750/config.json b/run-0/checkpoint-2750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-0/checkpoint-2750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-0/checkpoint-2750/model.safetensors b/run-0/checkpoint-2750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d85fb526b5aead523a5530042f0541c4ab977949 --- /dev/null +++ b/run-0/checkpoint-2750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1336ad1a77da09cbf25876d022a58770130c3b2ffe4b80c420562bcdc7d1ed9d +size 433279996 diff --git a/run-0/checkpoint-2750/optimizer.pt b/run-0/checkpoint-2750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..1a7af757084b4f22e993513dbac5aef7413da7e3 --- /dev/null +++ b/run-0/checkpoint-2750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1162a3ddf040cd09a94a4dd7463544f40b0659e8996a1d72eb0f3668b66b34d1 +size 866681082 diff --git a/run-0/checkpoint-2750/rng_state.pth b/run-0/checkpoint-2750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..eccfea317f0c1eb50423f8ebdfd26baba83a270c --- /dev/null +++ b/run-0/checkpoint-2750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2f146112a2b6651d5740f314c7a7760a6b10b307030d3ca8f929af57ce20006 +size 14244 diff --git a/run-0/checkpoint-2750/scheduler.pt b/run-0/checkpoint-2750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..df4bf57ce0cc683340536da88e18075ff404b462 --- /dev/null +++ b/run-0/checkpoint-2750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2990860678a4cf60168b8269ff8709a95193f5ee58d391b8ba0badb27d72ce0 +size 1064 diff --git a/run-0/checkpoint-2750/trainer_state.json b/run-0/checkpoint-2750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2b3cdb43c236983788c7e41785c396bd5fb79795 --- /dev/null +++ b/run-0/checkpoint-2750/trainer_state.json @@ -0,0 +1,783 @@ +{ + "best_metric": 0.8743556701030928, + "best_model_checkpoint": "bert_trainer/run-0/checkpoint-1750", + "epoch": 3.5438144329896906, + "eval_steps": 250, + "global_step": 2750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 2.650169893369787e-06, + "loss": 1.4561, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 5.300339786739574e-06, + "loss": 1.2146, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 5.300339786739574e-06, + "loss": 1.0949, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.9846, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.9161, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.8466, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 5.300339786739574e-06, + "loss": 0.7954, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.7311, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6688, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6816, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.7857603092783505, + "eval_loss": 0.6313713192939758, + "eval_runtime": 78.939, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.83, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6339, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6102, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6572, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6575, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5946, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5779, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5773, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5461, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.576, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4864, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8176546391752577, + "eval_loss": 0.5011568069458008, + "eval_runtime": 78.7987, + "eval_samples_per_second": 39.392, + "eval_steps_per_second": 9.848, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5618, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5325, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4656, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4966, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 5.300339786739574e-06, + "loss": 0.457, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4715, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4621, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4679, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4236, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 5.300339786739574e-06, + "loss": 0.399, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8443943298969072, + "eval_loss": 0.4396892488002777, + "eval_runtime": 78.9384, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.83, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4321, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3953, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.379, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3415, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3705, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3612, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4108, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4167, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3916, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3947, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8579252577319587, + "eval_loss": 0.40539947152137756, + "eval_runtime": 78.7689, + "eval_samples_per_second": 39.406, + "eval_steps_per_second": 9.852, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3812, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3804, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3783, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.337, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3191, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3277, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3601, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3932, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3964, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3705, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8524484536082474, + "eval_loss": 0.40534982085227966, + "eval_runtime": 78.953, + "eval_samples_per_second": 39.315, + "eval_steps_per_second": 9.829, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4567, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 5.300339786739574e-06, + "loss": 0.384, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3205, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3841, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.322, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3742, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3407, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3342, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3068, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3288, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8688788659793815, + "eval_loss": 0.36364319920539856, + "eval_runtime": 78.9463, + "eval_samples_per_second": 39.318, + "eval_steps_per_second": 9.829, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2918, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3571, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3341, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3162, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2384, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2934, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2686, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2806, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2897, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2417, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8743556701030928, + "eval_loss": 0.39001935720443726, + "eval_runtime": 78.9576, + "eval_samples_per_second": 39.312, + "eval_steps_per_second": 9.828, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2849, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2653, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2266, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2401, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2208, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2615, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2913, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2474, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2388, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2374, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8730670103092784, + "eval_loss": 0.39385583996772766, + "eval_runtime": 78.9575, + "eval_samples_per_second": 39.312, + "eval_steps_per_second": 9.828, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2697, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2592, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2636, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2349, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2697, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2507, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2608, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2463, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2408, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3525, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8627577319587629, + "eval_loss": 0.4113520085811615, + "eval_runtime": 78.9601, + "eval_samples_per_second": 39.311, + "eval_steps_per_second": 9.828, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3033, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2186, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2619, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1473, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1662, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1863, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1869, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1729, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1998, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1778, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.873389175257732, + "eval_loss": 0.44405418634414673, + "eval_runtime": 78.9751, + "eval_samples_per_second": 39.304, + "eval_steps_per_second": 9.826, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 5.300339786739574e-06, + "loss": 0.171, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1642, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2303, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2194, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1756, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1956, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2669, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1514, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1263, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 5.300339786739574e-06, + "loss": 0.259, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8566365979381443, + "eval_loss": 0.4988997280597687, + "eval_runtime": 78.9372, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.831, + "step": 2750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.1573514614421504e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 5.300339786739574e-06, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-0/checkpoint-2750/training_args.bin b/run-0/checkpoint-2750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..ed612abf640aadfc105f23e03656a70e24f64012 --- /dev/null +++ b/run-0/checkpoint-2750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ff966c9d210a3dcc91765468d3bd580c3a94cec8f318bfe2ceb18c02bfa0afcf +size 4728 diff --git a/run-0/checkpoint-3000/config.json b/run-0/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-0/checkpoint-3000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-0/checkpoint-3000/model.safetensors b/run-0/checkpoint-3000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e6b3751a07b0e06aa0faa00b5fb73a1de0138181 --- /dev/null +++ b/run-0/checkpoint-3000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:97635f937f6839acf8375df2ae47c49059b50b550f9a87c413496a140714f269 +size 433279996 diff --git a/run-0/checkpoint-3000/optimizer.pt b/run-0/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..1bdda14e4ec268063efeb2ae15e1100ced347770 --- /dev/null +++ b/run-0/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:255f8e93744d2bc7a27bc7622955b2b19abef2409dcd84b03f15ac2f69afffbf +size 866681082 diff --git a/run-0/checkpoint-3000/rng_state.pth b/run-0/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..134d7b84b2bcb7c8af8198d9d691b9391bfa81d0 --- /dev/null +++ b/run-0/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5475dcc749e5bb84d23e503506ffb30e2c214153e88098ffa2eba5466de55a64 +size 14244 diff --git a/run-0/checkpoint-3000/scheduler.pt b/run-0/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..121c91960c47c9b460c2730b0ddb66eecd67997f --- /dev/null +++ b/run-0/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11b18eab96c7f27ea28cf71b3d2f6754e002f163c751b2006fe6b5fd2f4b1877 +size 1064 diff --git a/run-0/checkpoint-3000/trainer_state.json b/run-0/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..db4d1128851b98c658dde2580e09dd609153bc53 --- /dev/null +++ b/run-0/checkpoint-3000/trainer_state.json @@ -0,0 +1,852 @@ +{ + "best_metric": 0.8798324742268041, + "best_model_checkpoint": "bert_trainer/run-0/checkpoint-3000", + "epoch": 3.865979381443299, + "eval_steps": 250, + "global_step": 3000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 2.650169893369787e-06, + "loss": 1.4561, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 5.300339786739574e-06, + "loss": 1.2146, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 5.300339786739574e-06, + "loss": 1.0949, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.9846, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.9161, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.8466, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 5.300339786739574e-06, + "loss": 0.7954, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.7311, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6688, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6816, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.7857603092783505, + "eval_loss": 0.6313713192939758, + "eval_runtime": 78.939, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.83, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6339, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6102, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6572, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.6575, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5946, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5779, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5773, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5461, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.576, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4864, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8176546391752577, + "eval_loss": 0.5011568069458008, + "eval_runtime": 78.7987, + "eval_samples_per_second": 39.392, + "eval_steps_per_second": 9.848, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5618, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.5325, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4656, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4966, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 5.300339786739574e-06, + "loss": 0.457, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4715, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4621, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4679, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4236, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 5.300339786739574e-06, + "loss": 0.399, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8443943298969072, + "eval_loss": 0.4396892488002777, + "eval_runtime": 78.9384, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.83, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4321, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3953, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.379, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3415, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3705, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3612, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4108, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4167, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3916, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3947, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8579252577319587, + "eval_loss": 0.40539947152137756, + "eval_runtime": 78.7689, + "eval_samples_per_second": 39.406, + "eval_steps_per_second": 9.852, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3812, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3804, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3783, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.337, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3191, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3277, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3601, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3932, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3964, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3705, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8524484536082474, + "eval_loss": 0.40534982085227966, + "eval_runtime": 78.953, + "eval_samples_per_second": 39.315, + "eval_steps_per_second": 9.829, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.4567, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 5.300339786739574e-06, + "loss": 0.384, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3205, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3841, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.322, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3742, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3407, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3342, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3068, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3288, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8688788659793815, + "eval_loss": 0.36364319920539856, + "eval_runtime": 78.9463, + "eval_samples_per_second": 39.318, + "eval_steps_per_second": 9.829, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2918, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3571, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3341, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3162, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2384, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2934, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2686, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2806, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2897, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2417, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8743556701030928, + "eval_loss": 0.39001935720443726, + "eval_runtime": 78.9576, + "eval_samples_per_second": 39.312, + "eval_steps_per_second": 9.828, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2849, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2653, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2266, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2401, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2208, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2615, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2913, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2474, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2388, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2374, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8730670103092784, + "eval_loss": 0.39385583996772766, + "eval_runtime": 78.9575, + "eval_samples_per_second": 39.312, + "eval_steps_per_second": 9.828, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2697, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2592, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2636, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2349, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2697, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2507, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2608, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2463, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2408, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3525, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8627577319587629, + "eval_loss": 0.4113520085811615, + "eval_runtime": 78.9601, + "eval_samples_per_second": 39.311, + "eval_steps_per_second": 9.828, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3033, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2186, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2619, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1473, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1662, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1863, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1869, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1729, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1998, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1778, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.873389175257732, + "eval_loss": 0.44405418634414673, + "eval_runtime": 78.9751, + "eval_samples_per_second": 39.304, + "eval_steps_per_second": 9.826, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 5.300339786739574e-06, + "loss": 0.171, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1642, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2303, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2194, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1756, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1956, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2669, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1514, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1263, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 5.300339786739574e-06, + "loss": 0.259, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8566365979381443, + "eval_loss": 0.4988997280597687, + "eval_runtime": 78.9372, + "eval_samples_per_second": 39.322, + "eval_steps_per_second": 9.831, + "step": 2750 + }, + { + "epoch": 3.58, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1378, + "step": 2775 + }, + { + "epoch": 3.61, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1588, + "step": 2800 + }, + { + "epoch": 3.64, + "learning_rate": 5.300339786739574e-06, + "loss": 0.179, + "step": 2825 + }, + { + "epoch": 3.67, + "learning_rate": 5.300339786739574e-06, + "loss": 0.3413, + "step": 2850 + }, + { + "epoch": 3.7, + "learning_rate": 5.300339786739574e-06, + "loss": 0.169, + "step": 2875 + }, + { + "epoch": 3.74, + "learning_rate": 5.300339786739574e-06, + "loss": 0.208, + "step": 2900 + }, + { + "epoch": 3.77, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1602, + "step": 2925 + }, + { + "epoch": 3.8, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1406, + "step": 2950 + }, + { + "epoch": 3.83, + "learning_rate": 5.300339786739574e-06, + "loss": 0.1519, + "step": 2975 + }, + { + "epoch": 3.87, + "learning_rate": 5.300339786739574e-06, + "loss": 0.2028, + "step": 3000 + }, + { + "epoch": 3.87, + "eval_accuracy": 0.8798324742268041, + "eval_loss": 0.46966859698295593, + "eval_runtime": 78.9816, + "eval_samples_per_second": 39.3, + "eval_steps_per_second": 9.825, + "step": 3000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.2625987184277504e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 5.300339786739574e-06, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-0/checkpoint-3000/training_args.bin b/run-0/checkpoint-3000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..ed612abf640aadfc105f23e03656a70e24f64012 --- /dev/null +++ b/run-0/checkpoint-3000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ff966c9d210a3dcc91765468d3bd580c3a94cec8f318bfe2ceb18c02bfa0afcf +size 4728 diff --git a/run-1/checkpoint-2000/config.json b/run-1/checkpoint-2000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-1/checkpoint-2000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-1/checkpoint-2000/model.safetensors b/run-1/checkpoint-2000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a8010001896f2472f492851d74d804defe6e47f0 --- /dev/null +++ b/run-1/checkpoint-2000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8d2979aaf550705ed15db92c754402c39bde2cf239b007351cd8d694f464ea9d +size 433279996 diff --git a/run-1/checkpoint-2000/optimizer.pt b/run-1/checkpoint-2000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..454aac267edf504cf40bc189b69e25eb7d6695ff --- /dev/null +++ b/run-1/checkpoint-2000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:797fb321bed095050f952383f9272d50d76f008a2b10fdb902f0877056a930b7 +size 866681082 diff --git a/run-1/checkpoint-2000/rng_state.pth b/run-1/checkpoint-2000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..46bfd402f6bfeab3339ef84c13f8bea7848fb6b2 --- /dev/null +++ b/run-1/checkpoint-2000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e5e36c9a58997a8fd5116115315a1541147a866ccc21b5fd8f202de7af5118db +size 14244 diff --git a/run-1/checkpoint-2000/scheduler.pt b/run-1/checkpoint-2000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..47a76f3370088b7968b8bc5c7998f52e0a621e4c --- /dev/null +++ b/run-1/checkpoint-2000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cd52d0eb8a495b5ec54fb0f307d28eec2eec58a5a5ce1ea1132a7d75494f126c +size 1064 diff --git a/run-1/checkpoint-2000/trainer_state.json b/run-1/checkpoint-2000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..cfdf261aab16857e5f04f042377c234ef50f67ed --- /dev/null +++ b/run-1/checkpoint-2000/trainer_state.json @@ -0,0 +1,576 @@ +{ + "best_metric": 0.8833762886597938, + "best_model_checkpoint": "bert_trainer/run-1/checkpoint-2000", + "epoch": 2.5773195876288657, + "eval_steps": 250, + "global_step": 2000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 8.555424210708822e-06, + "loss": 1.3732, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 1.0422, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.913, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.7626, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.7043, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.6356, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.6031, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5454, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4999, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5111, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8279639175257731, + "eval_loss": 0.4562760293483734, + "eval_runtime": 65.4867, + "eval_samples_per_second": 47.399, + "eval_steps_per_second": 11.85, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.511, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4849, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5027, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.565, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4704, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4931, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4647, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4491, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4752, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3899, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8630798969072165, + "eval_loss": 0.3841710388660431, + "eval_runtime": 65.5356, + "eval_samples_per_second": 47.364, + "eval_steps_per_second": 11.841, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.477, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3964, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3763, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3928, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4235, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4024, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4054, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3731, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3749, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3315, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8666237113402062, + "eval_loss": 0.3664605915546417, + "eval_runtime": 65.4939, + "eval_samples_per_second": 47.394, + "eval_steps_per_second": 11.848, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3572, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2822, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2383, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2685, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3076, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2832, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2976, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2826, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2585, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2816, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8753221649484536, + "eval_loss": 0.3534678518772125, + "eval_runtime": 65.5301, + "eval_samples_per_second": 47.368, + "eval_steps_per_second": 11.842, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2583, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2405, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2626, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1829, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.217, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2426, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2937, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.283, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2939, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2477, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8663015463917526, + "eval_loss": 0.37554699182510376, + "eval_runtime": 65.5483, + "eval_samples_per_second": 47.354, + "eval_steps_per_second": 11.839, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3323, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2489, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2451, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2911, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2348, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2565, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1898, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2489, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2442, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2745, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8717783505154639, + "eval_loss": 0.3890085220336914, + "eval_runtime": 65.5564, + "eval_samples_per_second": 47.349, + "eval_steps_per_second": 11.837, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.208, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2804, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.186, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.206, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1658, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1576, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1845, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1601, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1397, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.109, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8814432989690721, + "eval_loss": 0.5400919318199158, + "eval_runtime": 65.5029, + "eval_samples_per_second": 47.387, + "eval_steps_per_second": 11.847, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1069, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1495, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1209, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.134, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1357, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1114, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1436, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1775, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1232, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.115, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8833762886597938, + "eval_loss": 0.5348294973373413, + "eval_runtime": 67.3607, + "eval_samples_per_second": 46.08, + "eval_steps_per_second": 11.52, + "step": 2000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 8414518195998720.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.7110848421417645e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-1/checkpoint-2000/training_args.bin b/run-1/checkpoint-2000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..109d901eeee674be35ec2b799f5af2df7bfd73e8 --- /dev/null +++ b/run-1/checkpoint-2000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6ff7ff5e497d2fd17b0b0a335d1e1e52fdf9ab64c61fc776fe6063c480e0a9f6 +size 4728 diff --git a/run-1/checkpoint-2750/config.json b/run-1/checkpoint-2750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-1/checkpoint-2750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-1/checkpoint-2750/model.safetensors b/run-1/checkpoint-2750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..bd2f5acc4342501ad7f1398d2491b34d590db703 --- /dev/null +++ b/run-1/checkpoint-2750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5fdf1daffe1979f97111b495ac9166af3936db88484feea619daefa7ee4afe6e +size 433279996 diff --git a/run-1/checkpoint-2750/optimizer.pt b/run-1/checkpoint-2750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..395c3dcd9cfba1fc35887ad04a1193a52c5fafd4 --- /dev/null +++ b/run-1/checkpoint-2750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f352afcb5855371e75fc5f7c2a50086a26116ec8440ae8fb5ea58867ecb0b84f +size 866681082 diff --git a/run-1/checkpoint-2750/rng_state.pth b/run-1/checkpoint-2750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..eccfea317f0c1eb50423f8ebdfd26baba83a270c --- /dev/null +++ b/run-1/checkpoint-2750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2f146112a2b6651d5740f314c7a7760a6b10b307030d3ca8f929af57ce20006 +size 14244 diff --git a/run-1/checkpoint-2750/scheduler.pt b/run-1/checkpoint-2750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..0235d49c526c54a32729669b75557f34aa31afb1 --- /dev/null +++ b/run-1/checkpoint-2750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:35c90518991fb03cf3fc2f6874522e66785a9b1bb9f1028bbfcb60f66f6de8fd +size 1064 diff --git a/run-1/checkpoint-2750/trainer_state.json b/run-1/checkpoint-2750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6d7c6f47ad945c6fcf406c39e94ad446e520d58d --- /dev/null +++ b/run-1/checkpoint-2750/trainer_state.json @@ -0,0 +1,783 @@ +{ + "best_metric": 0.8833762886597938, + "best_model_checkpoint": "bert_trainer/run-1/checkpoint-2000", + "epoch": 3.5438144329896906, + "eval_steps": 250, + "global_step": 2750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 8.555424210708822e-06, + "loss": 1.3732, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 1.0422, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.913, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.7626, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.7043, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.6356, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.6031, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5454, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4999, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5111, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8279639175257731, + "eval_loss": 0.4562760293483734, + "eval_runtime": 65.4867, + "eval_samples_per_second": 47.399, + "eval_steps_per_second": 11.85, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.511, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4849, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5027, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.565, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4704, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4931, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4647, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4491, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4752, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3899, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8630798969072165, + "eval_loss": 0.3841710388660431, + "eval_runtime": 65.5356, + "eval_samples_per_second": 47.364, + "eval_steps_per_second": 11.841, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.477, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3964, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3763, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3928, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4235, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4024, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4054, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3731, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3749, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3315, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8666237113402062, + "eval_loss": 0.3664605915546417, + "eval_runtime": 65.4939, + "eval_samples_per_second": 47.394, + "eval_steps_per_second": 11.848, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3572, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2822, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2383, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2685, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3076, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2832, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2976, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2826, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2585, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2816, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8753221649484536, + "eval_loss": 0.3534678518772125, + "eval_runtime": 65.5301, + "eval_samples_per_second": 47.368, + "eval_steps_per_second": 11.842, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2583, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2405, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2626, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1829, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.217, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2426, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2937, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.283, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2939, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2477, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8663015463917526, + "eval_loss": 0.37554699182510376, + "eval_runtime": 65.5483, + "eval_samples_per_second": 47.354, + "eval_steps_per_second": 11.839, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3323, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2489, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2451, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2911, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2348, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2565, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1898, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2489, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2442, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2745, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8717783505154639, + "eval_loss": 0.3890085220336914, + "eval_runtime": 65.5564, + "eval_samples_per_second": 47.349, + "eval_steps_per_second": 11.837, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.208, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2804, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.186, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.206, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1658, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1576, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1845, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1601, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1397, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.109, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8814432989690721, + "eval_loss": 0.5400919318199158, + "eval_runtime": 65.5029, + "eval_samples_per_second": 47.387, + "eval_steps_per_second": 11.847, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1069, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1495, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1209, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.134, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1357, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1114, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1436, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1775, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1232, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.115, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8833762886597938, + "eval_loss": 0.5348294973373413, + "eval_runtime": 67.3607, + "eval_samples_per_second": 46.08, + "eval_steps_per_second": 11.52, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1429, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1612, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1565, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1188, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1576, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1832, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1643, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1668, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1984, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1839, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8424613402061856, + "eval_loss": 0.6889757513999939, + "eval_runtime": 65.603, + "eval_samples_per_second": 47.315, + "eval_steps_per_second": 11.829, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2497, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1096, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.157, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0431, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0428, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1085, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0781, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1603, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0825, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0855, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8759664948453608, + "eval_loss": 0.6595790982246399, + "eval_runtime": 65.5897, + "eval_samples_per_second": 47.324, + "eval_steps_per_second": 11.831, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0614, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0686, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0716, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1359, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0863, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0915, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0595, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0714, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0914, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0774, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8740335051546392, + "eval_loss": 0.7505560517311096, + "eval_runtime": 65.5758, + "eval_samples_per_second": 47.335, + "eval_steps_per_second": 11.834, + "step": 2750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.156930472414208e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 1.7110848421417645e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-1/checkpoint-2750/training_args.bin b/run-1/checkpoint-2750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..109d901eeee674be35ec2b799f5af2df7bfd73e8 --- /dev/null +++ b/run-1/checkpoint-2750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6ff7ff5e497d2fd17b0b0a335d1e1e52fdf9ab64c61fc776fe6063c480e0a9f6 +size 4728 diff --git a/run-1/checkpoint-3000/config.json b/run-1/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-1/checkpoint-3000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-1/checkpoint-3000/model.safetensors b/run-1/checkpoint-3000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..34f83183cbe147b3c9b8c42b78a397a1f4f02a21 --- /dev/null +++ b/run-1/checkpoint-3000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:de060276be3bcfe668ca25c8af00e40cad29ee8aaa2f3b02863a1935940a71e1 +size 433279996 diff --git a/run-1/checkpoint-3000/optimizer.pt b/run-1/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..82782b2d86815a1b6a1276cd29cc4f44e1de8313 --- /dev/null +++ b/run-1/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:10522d5e8817f1178a99dd7c1589a4fabda59fd8a020b8326b29d1d247dd0cdf +size 866681082 diff --git a/run-1/checkpoint-3000/rng_state.pth b/run-1/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..134d7b84b2bcb7c8af8198d9d691b9391bfa81d0 --- /dev/null +++ b/run-1/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5475dcc749e5bb84d23e503506ffb30e2c214153e88098ffa2eba5466de55a64 +size 14244 diff --git a/run-1/checkpoint-3000/scheduler.pt b/run-1/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..d8455aa1444c2f1f85c9fe850d966f461bfc0cd7 --- /dev/null +++ b/run-1/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:80bef91821d2e324748694916761e06c6958f568b9d748689db5bb337914680c +size 1064 diff --git a/run-1/checkpoint-3000/trainer_state.json b/run-1/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1c2ca14954ab2c1ac8accb0e34759bb98a1beaff --- /dev/null +++ b/run-1/checkpoint-3000/trainer_state.json @@ -0,0 +1,852 @@ +{ + "best_metric": 0.8833762886597938, + "best_model_checkpoint": "bert_trainer/run-1/checkpoint-2000", + "epoch": 3.865979381443299, + "eval_steps": 250, + "global_step": 3000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 8.555424210708822e-06, + "loss": 1.3732, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 1.0422, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.913, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.7626, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.7043, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.6356, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.6031, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5454, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4999, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5111, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8279639175257731, + "eval_loss": 0.4562760293483734, + "eval_runtime": 65.4867, + "eval_samples_per_second": 47.399, + "eval_steps_per_second": 11.85, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.511, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4849, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.5027, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.565, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4704, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4931, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4647, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4491, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4752, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3899, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8630798969072165, + "eval_loss": 0.3841710388660431, + "eval_runtime": 65.5356, + "eval_samples_per_second": 47.364, + "eval_steps_per_second": 11.841, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.477, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3964, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3763, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3928, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4235, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4024, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.4054, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3731, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3749, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3315, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8666237113402062, + "eval_loss": 0.3664605915546417, + "eval_runtime": 65.4939, + "eval_samples_per_second": 47.394, + "eval_steps_per_second": 11.848, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3572, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2822, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2383, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2685, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3076, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2832, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2976, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2826, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2585, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2816, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8753221649484536, + "eval_loss": 0.3534678518772125, + "eval_runtime": 65.5301, + "eval_samples_per_second": 47.368, + "eval_steps_per_second": 11.842, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2583, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2405, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2626, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1829, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.217, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2426, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2937, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.283, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2939, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2477, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8663015463917526, + "eval_loss": 0.37554699182510376, + "eval_runtime": 65.5483, + "eval_samples_per_second": 47.354, + "eval_steps_per_second": 11.839, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.3323, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2489, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2451, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2911, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2348, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2565, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1898, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2489, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2442, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2745, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8717783505154639, + "eval_loss": 0.3890085220336914, + "eval_runtime": 65.5564, + "eval_samples_per_second": 47.349, + "eval_steps_per_second": 11.837, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.208, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2804, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.186, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.206, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1658, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1576, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1845, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1601, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1397, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.109, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8814432989690721, + "eval_loss": 0.5400919318199158, + "eval_runtime": 65.5029, + "eval_samples_per_second": 47.387, + "eval_steps_per_second": 11.847, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1069, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1495, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1209, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.134, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1357, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1114, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1436, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1775, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1232, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.115, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8833762886597938, + "eval_loss": 0.5348294973373413, + "eval_runtime": 67.3607, + "eval_samples_per_second": 46.08, + "eval_steps_per_second": 11.52, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1429, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1612, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1565, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1188, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1576, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1832, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1643, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1668, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1984, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1839, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8424613402061856, + "eval_loss": 0.6889757513999939, + "eval_runtime": 65.603, + "eval_samples_per_second": 47.315, + "eval_steps_per_second": 11.829, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.2497, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1096, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.157, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0431, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0428, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1085, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0781, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1603, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0825, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0855, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8759664948453608, + "eval_loss": 0.6595790982246399, + "eval_runtime": 65.5897, + "eval_samples_per_second": 47.324, + "eval_steps_per_second": 11.831, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0614, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0686, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0716, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1359, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0863, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0915, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0595, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0714, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0914, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0774, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8740335051546392, + "eval_loss": 0.7505560517311096, + "eval_runtime": 65.5758, + "eval_samples_per_second": 47.335, + "eval_steps_per_second": 11.834, + "step": 2750 + }, + { + "epoch": 3.58, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0685, + "step": 2775 + }, + { + "epoch": 3.61, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.0943, + "step": 2800 + }, + { + "epoch": 3.64, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1181, + "step": 2825 + }, + { + "epoch": 3.67, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1302, + "step": 2850 + }, + { + "epoch": 3.7, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1058, + "step": 2875 + }, + { + "epoch": 3.74, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1235, + "step": 2900 + }, + { + "epoch": 3.77, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1278, + "step": 2925 + }, + { + "epoch": 3.8, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1172, + "step": 2950 + }, + { + "epoch": 3.83, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1461, + "step": 2975 + }, + { + "epoch": 3.87, + "learning_rate": 1.7110848421417645e-05, + "loss": 0.1213, + "step": 3000 + }, + { + "epoch": 3.87, + "eval_accuracy": 0.8762886597938144, + "eval_loss": 0.6005998849868774, + "eval_runtime": 65.6002, + "eval_samples_per_second": 47.317, + "eval_steps_per_second": 11.829, + "step": 3000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.262177729399808e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 1.7110848421417645e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-1/checkpoint-3000/training_args.bin b/run-1/checkpoint-3000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..109d901eeee674be35ec2b799f5af2df7bfd73e8 --- /dev/null +++ b/run-1/checkpoint-3000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6ff7ff5e497d2fd17b0b0a335d1e1e52fdf9ab64c61fc776fe6063c480e0a9f6 +size 4728 diff --git a/run-2/checkpoint-2500/config.json b/run-2/checkpoint-2500/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-2/checkpoint-2500/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-2/checkpoint-2500/model.safetensors b/run-2/checkpoint-2500/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..dd7c6fc1a7a1b8b4940782340e3d4369b15e2927 --- /dev/null +++ b/run-2/checkpoint-2500/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0935e9b504369338f73d7b5f1be94c932055cbd56ef6d774f770dfbab5f141e9 +size 433279996 diff --git a/run-2/checkpoint-2500/optimizer.pt b/run-2/checkpoint-2500/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..8bf76e4f8701803151ce94632fd9796d78e9303a --- /dev/null +++ b/run-2/checkpoint-2500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2a8f066b1a71ae52b3aa715094859018a19afc6f47f577e38281af9bc85a0c94 +size 866681082 diff --git a/run-2/checkpoint-2500/rng_state.pth b/run-2/checkpoint-2500/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..678868d7ddbe48969a0ad74f8269b1e79c19b902 --- /dev/null +++ b/run-2/checkpoint-2500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:63399af7a409c183004eb47ca7dbc6f06cf71063012d7d165e74c89aaf482739 +size 14244 diff --git a/run-2/checkpoint-2500/scheduler.pt b/run-2/checkpoint-2500/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..b3d45eb1cb9bf5bb59bf9fda1e35a9cd229942aa --- /dev/null +++ b/run-2/checkpoint-2500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:390b240ea9153d81514422429b6a6dd0ee903146d58db9794a5b9cd5cbdd2201 +size 1064 diff --git a/run-2/checkpoint-2500/trainer_state.json b/run-2/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9e70243a20c20ba35daeae940b7fde6bb239fb16 --- /dev/null +++ b/run-2/checkpoint-2500/trainer_state.json @@ -0,0 +1,714 @@ +{ + "best_metric": 0.8820876288659794, + "best_model_checkpoint": "bert_trainer/run-2/checkpoint-2000", + "epoch": 1.6118633139909737, + "eval_steps": 250, + "global_step": 2500, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 7.3571784276965265e-06, + "loss": 1.4073, + "step": 25 + }, + { + "epoch": 0.03, + "learning_rate": 1.4714356855393053e-05, + "loss": 1.1129, + "step": 50 + }, + { + "epoch": 0.05, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.9656, + "step": 75 + }, + { + "epoch": 0.06, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.8417, + "step": 100 + }, + { + "epoch": 0.08, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7486, + "step": 125 + }, + { + "epoch": 0.1, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.8348, + "step": 150 + }, + { + "epoch": 0.11, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7111, + "step": 175 + }, + { + "epoch": 0.13, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7337, + "step": 200 + }, + { + "epoch": 0.15, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6518, + "step": 225 + }, + { + "epoch": 0.16, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6243, + "step": 250 + }, + { + "epoch": 0.16, + "eval_accuracy": 0.8079896907216495, + "eval_loss": 0.5573504567146301, + "eval_runtime": 30.0553, + "eval_samples_per_second": 103.276, + "eval_steps_per_second": 25.819, + "step": 250 + }, + { + "epoch": 0.18, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5721, + "step": 275 + }, + { + "epoch": 0.19, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6388, + "step": 300 + }, + { + "epoch": 0.21, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5117, + "step": 325 + }, + { + "epoch": 0.23, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6148, + "step": 350 + }, + { + "epoch": 0.24, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4858, + "step": 375 + }, + { + "epoch": 0.26, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.564, + "step": 400 + }, + { + "epoch": 0.27, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5233, + "step": 425 + }, + { + "epoch": 0.29, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4727, + "step": 450 + }, + { + "epoch": 0.31, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4875, + "step": 475 + }, + { + "epoch": 0.32, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4832, + "step": 500 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8150773195876289, + "eval_loss": 0.4804709553718567, + "eval_runtime": 30.0129, + "eval_samples_per_second": 103.422, + "eval_steps_per_second": 25.856, + "step": 500 + }, + { + "epoch": 0.34, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4925, + "step": 525 + }, + { + "epoch": 0.35, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5027, + "step": 550 + }, + { + "epoch": 0.37, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4571, + "step": 575 + }, + { + "epoch": 0.39, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4987, + "step": 600 + }, + { + "epoch": 0.4, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6134, + "step": 625 + }, + { + "epoch": 0.42, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5213, + "step": 650 + }, + { + "epoch": 0.44, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6241, + "step": 675 + }, + { + "epoch": 0.45, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4945, + "step": 700 + }, + { + "epoch": 0.47, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4353, + "step": 725 + }, + { + "epoch": 0.48, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4177, + "step": 750 + }, + { + "epoch": 0.48, + "eval_accuracy": 0.8411726804123711, + "eval_loss": 0.4728888273239136, + "eval_runtime": 30.0028, + "eval_samples_per_second": 103.457, + "eval_steps_per_second": 25.864, + "step": 750 + }, + { + "epoch": 0.5, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5676, + "step": 775 + }, + { + "epoch": 0.52, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3918, + "step": 800 + }, + { + "epoch": 0.53, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3912, + "step": 825 + }, + { + "epoch": 0.55, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4507, + "step": 850 + }, + { + "epoch": 0.56, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3633, + "step": 875 + }, + { + "epoch": 0.58, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4406, + "step": 900 + }, + { + "epoch": 0.6, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5013, + "step": 925 + }, + { + "epoch": 0.61, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4385, + "step": 950 + }, + { + "epoch": 0.63, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4561, + "step": 975 + }, + { + "epoch": 0.64, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3917, + "step": 1000 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8579252577319587, + "eval_loss": 0.39569276571273804, + "eval_runtime": 30.0411, + "eval_samples_per_second": 103.325, + "eval_steps_per_second": 25.831, + "step": 1000 + }, + { + "epoch": 0.66, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4627, + "step": 1025 + }, + { + "epoch": 0.68, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4514, + "step": 1050 + }, + { + "epoch": 0.69, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4927, + "step": 1075 + }, + { + "epoch": 0.71, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3795, + "step": 1100 + }, + { + "epoch": 0.73, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3668, + "step": 1125 + }, + { + "epoch": 0.74, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4083, + "step": 1150 + }, + { + "epoch": 0.76, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4631, + "step": 1175 + }, + { + "epoch": 0.77, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4035, + "step": 1200 + }, + { + "epoch": 0.79, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3476, + "step": 1225 + }, + { + "epoch": 0.81, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5089, + "step": 1250 + }, + { + "epoch": 0.81, + "eval_accuracy": 0.8479381443298969, + "eval_loss": 0.4126531481742859, + "eval_runtime": 30.0563, + "eval_samples_per_second": 103.273, + "eval_steps_per_second": 25.818, + "step": 1250 + }, + { + "epoch": 0.82, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4805, + "step": 1275 + }, + { + "epoch": 0.84, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3949, + "step": 1300 + }, + { + "epoch": 0.85, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3993, + "step": 1325 + }, + { + "epoch": 0.87, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4719, + "step": 1350 + }, + { + "epoch": 0.89, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4545, + "step": 1375 + }, + { + "epoch": 0.9, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3411, + "step": 1400 + }, + { + "epoch": 0.92, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4989, + "step": 1425 + }, + { + "epoch": 0.93, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4016, + "step": 1450 + }, + { + "epoch": 0.95, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3826, + "step": 1475 + }, + { + "epoch": 0.97, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.376, + "step": 1500 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8724226804123711, + "eval_loss": 0.3830737769603729, + "eval_runtime": 30.0147, + "eval_samples_per_second": 103.416, + "eval_steps_per_second": 25.854, + "step": 1500 + }, + { + "epoch": 0.98, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4116, + "step": 1525 + }, + { + "epoch": 1.0, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3377, + "step": 1550 + }, + { + "epoch": 1.02, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2881, + "step": 1575 + }, + { + "epoch": 1.03, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2914, + "step": 1600 + }, + { + "epoch": 1.05, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2836, + "step": 1625 + }, + { + "epoch": 1.06, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3338, + "step": 1650 + }, + { + "epoch": 1.08, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3104, + "step": 1675 + }, + { + "epoch": 1.1, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2209, + "step": 1700 + }, + { + "epoch": 1.11, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3869, + "step": 1725 + }, + { + "epoch": 1.13, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2869, + "step": 1750 + }, + { + "epoch": 1.13, + "eval_accuracy": 0.8756443298969072, + "eval_loss": 0.49572044610977173, + "eval_runtime": 30.0097, + "eval_samples_per_second": 103.433, + "eval_steps_per_second": 25.858, + "step": 1750 + }, + { + "epoch": 1.14, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2977, + "step": 1775 + }, + { + "epoch": 1.16, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3765, + "step": 1800 + }, + { + "epoch": 1.18, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3517, + "step": 1825 + }, + { + "epoch": 1.19, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.342, + "step": 1850 + }, + { + "epoch": 1.21, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.248, + "step": 1875 + }, + { + "epoch": 1.23, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3462, + "step": 1900 + }, + { + "epoch": 1.24, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2848, + "step": 1925 + }, + { + "epoch": 1.26, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3189, + "step": 1950 + }, + { + "epoch": 1.27, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2977, + "step": 1975 + }, + { + "epoch": 1.29, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2707, + "step": 2000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8820876288659794, + "eval_loss": 0.4196120500564575, + "eval_runtime": 30.0474, + "eval_samples_per_second": 103.303, + "eval_steps_per_second": 25.826, + "step": 2000 + }, + { + "epoch": 1.31, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3122, + "step": 2025 + }, + { + "epoch": 1.32, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2782, + "step": 2050 + }, + { + "epoch": 1.34, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2473, + "step": 2075 + }, + { + "epoch": 1.35, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3009, + "step": 2100 + }, + { + "epoch": 1.37, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2717, + "step": 2125 + }, + { + "epoch": 1.39, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4527, + "step": 2150 + }, + { + "epoch": 1.4, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1456, + "step": 2175 + }, + { + "epoch": 1.42, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3033, + "step": 2200 + }, + { + "epoch": 1.43, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2462, + "step": 2225 + }, + { + "epoch": 1.45, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1881, + "step": 2250 + }, + { + "epoch": 1.45, + "eval_accuracy": 0.876610824742268, + "eval_loss": 0.48145169019699097, + "eval_runtime": 30.011, + "eval_samples_per_second": 103.429, + "eval_steps_per_second": 25.857, + "step": 2250 + }, + { + "epoch": 1.47, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3002, + "step": 2275 + }, + { + "epoch": 1.48, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2344, + "step": 2300 + }, + { + "epoch": 1.5, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4302, + "step": 2325 + }, + { + "epoch": 1.52, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1932, + "step": 2350 + }, + { + "epoch": 1.53, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2573, + "step": 2375 + }, + { + "epoch": 1.55, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3697, + "step": 2400 + }, + { + "epoch": 1.56, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3531, + "step": 2425 + }, + { + "epoch": 1.58, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3102, + "step": 2450 + }, + { + "epoch": 1.6, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3344, + "step": 2475 + }, + { + "epoch": 1.61, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2301, + "step": 2500 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8646907216494846, + "eval_loss": 0.5154445171356201, + "eval_runtime": 30.0652, + "eval_samples_per_second": 103.242, + "eval_steps_per_second": 25.811, + "step": 2500 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 250, + "total_flos": 5261836612995072.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.4714356855393053e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 8 + } +} diff --git a/run-2/checkpoint-2500/training_args.bin b/run-2/checkpoint-2500/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..e230b2b0691c2ba955d08c27b01c43281c9d4fbc --- /dev/null +++ b/run-2/checkpoint-2500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40bef76d9ba6b7f9c82fb91b5dea666f234a2847e28cb2faf44f5ca8e9ea5d19 +size 4728 diff --git a/run-2/checkpoint-2750/config.json b/run-2/checkpoint-2750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-2/checkpoint-2750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-2/checkpoint-2750/model.safetensors b/run-2/checkpoint-2750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0c32428bafca9e21ad0395f6a18bd0aa9bce112e --- /dev/null +++ b/run-2/checkpoint-2750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c210fb994a6336c42ca80164f32a4333330de92d54271f83d4b0eddea8243960 +size 433279996 diff --git a/run-2/checkpoint-2750/optimizer.pt b/run-2/checkpoint-2750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..37023a45550ff1d4f08e47282be949861db1ce4b --- /dev/null +++ b/run-2/checkpoint-2750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:18db280778e9705d46ece0c5745141d160acca15de8c7f69593f0abeb9bc6049 +size 866681082 diff --git a/run-2/checkpoint-2750/rng_state.pth b/run-2/checkpoint-2750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..ecabdb8c07de6e55c7332facacb47f6edf2a41ca --- /dev/null +++ b/run-2/checkpoint-2750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fd2745a1e1a49ccd51b48496c3e2a5d498e0bdad8fb3f45b3589cf70267b4702 +size 14244 diff --git a/run-2/checkpoint-2750/scheduler.pt b/run-2/checkpoint-2750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..5dc9e10f82f2385da43c97d0d649cda49d18620e --- /dev/null +++ b/run-2/checkpoint-2750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2649d982abf02498484134a6453860cae843bf59a4a4be51c1d55980e8ec4c87 +size 1064 diff --git a/run-2/checkpoint-2750/trainer_state.json b/run-2/checkpoint-2750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..438049d0b4c5bb942f3efe4db70cbc141b4e1387 --- /dev/null +++ b/run-2/checkpoint-2750/trainer_state.json @@ -0,0 +1,783 @@ +{ + "best_metric": 0.8820876288659794, + "best_model_checkpoint": "bert_trainer/run-2/checkpoint-2000", + "epoch": 1.773049645390071, + "eval_steps": 250, + "global_step": 2750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 7.3571784276965265e-06, + "loss": 1.4073, + "step": 25 + }, + { + "epoch": 0.03, + "learning_rate": 1.4714356855393053e-05, + "loss": 1.1129, + "step": 50 + }, + { + "epoch": 0.05, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.9656, + "step": 75 + }, + { + "epoch": 0.06, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.8417, + "step": 100 + }, + { + "epoch": 0.08, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7486, + "step": 125 + }, + { + "epoch": 0.1, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.8348, + "step": 150 + }, + { + "epoch": 0.11, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7111, + "step": 175 + }, + { + "epoch": 0.13, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7337, + "step": 200 + }, + { + "epoch": 0.15, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6518, + "step": 225 + }, + { + "epoch": 0.16, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6243, + "step": 250 + }, + { + "epoch": 0.16, + "eval_accuracy": 0.8079896907216495, + "eval_loss": 0.5573504567146301, + "eval_runtime": 30.0553, + "eval_samples_per_second": 103.276, + "eval_steps_per_second": 25.819, + "step": 250 + }, + { + "epoch": 0.18, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5721, + "step": 275 + }, + { + "epoch": 0.19, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6388, + "step": 300 + }, + { + "epoch": 0.21, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5117, + "step": 325 + }, + { + "epoch": 0.23, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6148, + "step": 350 + }, + { + "epoch": 0.24, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4858, + "step": 375 + }, + { + "epoch": 0.26, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.564, + "step": 400 + }, + { + "epoch": 0.27, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5233, + "step": 425 + }, + { + "epoch": 0.29, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4727, + "step": 450 + }, + { + "epoch": 0.31, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4875, + "step": 475 + }, + { + "epoch": 0.32, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4832, + "step": 500 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8150773195876289, + "eval_loss": 0.4804709553718567, + "eval_runtime": 30.0129, + "eval_samples_per_second": 103.422, + "eval_steps_per_second": 25.856, + "step": 500 + }, + { + "epoch": 0.34, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4925, + "step": 525 + }, + { + "epoch": 0.35, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5027, + "step": 550 + }, + { + "epoch": 0.37, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4571, + "step": 575 + }, + { + "epoch": 0.39, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4987, + "step": 600 + }, + { + "epoch": 0.4, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6134, + "step": 625 + }, + { + "epoch": 0.42, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5213, + "step": 650 + }, + { + "epoch": 0.44, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6241, + "step": 675 + }, + { + "epoch": 0.45, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4945, + "step": 700 + }, + { + "epoch": 0.47, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4353, + "step": 725 + }, + { + "epoch": 0.48, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4177, + "step": 750 + }, + { + "epoch": 0.48, + "eval_accuracy": 0.8411726804123711, + "eval_loss": 0.4728888273239136, + "eval_runtime": 30.0028, + "eval_samples_per_second": 103.457, + "eval_steps_per_second": 25.864, + "step": 750 + }, + { + "epoch": 0.5, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5676, + "step": 775 + }, + { + "epoch": 0.52, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3918, + "step": 800 + }, + { + "epoch": 0.53, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3912, + "step": 825 + }, + { + "epoch": 0.55, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4507, + "step": 850 + }, + { + "epoch": 0.56, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3633, + "step": 875 + }, + { + "epoch": 0.58, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4406, + "step": 900 + }, + { + "epoch": 0.6, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5013, + "step": 925 + }, + { + "epoch": 0.61, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4385, + "step": 950 + }, + { + "epoch": 0.63, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4561, + "step": 975 + }, + { + "epoch": 0.64, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3917, + "step": 1000 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8579252577319587, + "eval_loss": 0.39569276571273804, + "eval_runtime": 30.0411, + "eval_samples_per_second": 103.325, + "eval_steps_per_second": 25.831, + "step": 1000 + }, + { + "epoch": 0.66, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4627, + "step": 1025 + }, + { + "epoch": 0.68, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4514, + "step": 1050 + }, + { + "epoch": 0.69, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4927, + "step": 1075 + }, + { + "epoch": 0.71, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3795, + "step": 1100 + }, + { + "epoch": 0.73, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3668, + "step": 1125 + }, + { + "epoch": 0.74, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4083, + "step": 1150 + }, + { + "epoch": 0.76, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4631, + "step": 1175 + }, + { + "epoch": 0.77, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4035, + "step": 1200 + }, + { + "epoch": 0.79, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3476, + "step": 1225 + }, + { + "epoch": 0.81, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5089, + "step": 1250 + }, + { + "epoch": 0.81, + "eval_accuracy": 0.8479381443298969, + "eval_loss": 0.4126531481742859, + "eval_runtime": 30.0563, + "eval_samples_per_second": 103.273, + "eval_steps_per_second": 25.818, + "step": 1250 + }, + { + "epoch": 0.82, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4805, + "step": 1275 + }, + { + "epoch": 0.84, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3949, + "step": 1300 + }, + { + "epoch": 0.85, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3993, + "step": 1325 + }, + { + "epoch": 0.87, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4719, + "step": 1350 + }, + { + "epoch": 0.89, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4545, + "step": 1375 + }, + { + "epoch": 0.9, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3411, + "step": 1400 + }, + { + "epoch": 0.92, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4989, + "step": 1425 + }, + { + "epoch": 0.93, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4016, + "step": 1450 + }, + { + "epoch": 0.95, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3826, + "step": 1475 + }, + { + "epoch": 0.97, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.376, + "step": 1500 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8724226804123711, + "eval_loss": 0.3830737769603729, + "eval_runtime": 30.0147, + "eval_samples_per_second": 103.416, + "eval_steps_per_second": 25.854, + "step": 1500 + }, + { + "epoch": 0.98, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4116, + "step": 1525 + }, + { + "epoch": 1.0, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3377, + "step": 1550 + }, + { + "epoch": 1.02, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2881, + "step": 1575 + }, + { + "epoch": 1.03, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2914, + "step": 1600 + }, + { + "epoch": 1.05, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2836, + "step": 1625 + }, + { + "epoch": 1.06, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3338, + "step": 1650 + }, + { + "epoch": 1.08, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3104, + "step": 1675 + }, + { + "epoch": 1.1, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2209, + "step": 1700 + }, + { + "epoch": 1.11, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3869, + "step": 1725 + }, + { + "epoch": 1.13, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2869, + "step": 1750 + }, + { + "epoch": 1.13, + "eval_accuracy": 0.8756443298969072, + "eval_loss": 0.49572044610977173, + "eval_runtime": 30.0097, + "eval_samples_per_second": 103.433, + "eval_steps_per_second": 25.858, + "step": 1750 + }, + { + "epoch": 1.14, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2977, + "step": 1775 + }, + { + "epoch": 1.16, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3765, + "step": 1800 + }, + { + "epoch": 1.18, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3517, + "step": 1825 + }, + { + "epoch": 1.19, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.342, + "step": 1850 + }, + { + "epoch": 1.21, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.248, + "step": 1875 + }, + { + "epoch": 1.23, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3462, + "step": 1900 + }, + { + "epoch": 1.24, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2848, + "step": 1925 + }, + { + "epoch": 1.26, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3189, + "step": 1950 + }, + { + "epoch": 1.27, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2977, + "step": 1975 + }, + { + "epoch": 1.29, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2707, + "step": 2000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8820876288659794, + "eval_loss": 0.4196120500564575, + "eval_runtime": 30.0474, + "eval_samples_per_second": 103.303, + "eval_steps_per_second": 25.826, + "step": 2000 + }, + { + "epoch": 1.31, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3122, + "step": 2025 + }, + { + "epoch": 1.32, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2782, + "step": 2050 + }, + { + "epoch": 1.34, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2473, + "step": 2075 + }, + { + "epoch": 1.35, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3009, + "step": 2100 + }, + { + "epoch": 1.37, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2717, + "step": 2125 + }, + { + "epoch": 1.39, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4527, + "step": 2150 + }, + { + "epoch": 1.4, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1456, + "step": 2175 + }, + { + "epoch": 1.42, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3033, + "step": 2200 + }, + { + "epoch": 1.43, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2462, + "step": 2225 + }, + { + "epoch": 1.45, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1881, + "step": 2250 + }, + { + "epoch": 1.45, + "eval_accuracy": 0.876610824742268, + "eval_loss": 0.48145169019699097, + "eval_runtime": 30.011, + "eval_samples_per_second": 103.429, + "eval_steps_per_second": 25.857, + "step": 2250 + }, + { + "epoch": 1.47, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3002, + "step": 2275 + }, + { + "epoch": 1.48, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2344, + "step": 2300 + }, + { + "epoch": 1.5, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4302, + "step": 2325 + }, + { + "epoch": 1.52, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1932, + "step": 2350 + }, + { + "epoch": 1.53, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2573, + "step": 2375 + }, + { + "epoch": 1.55, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3697, + "step": 2400 + }, + { + "epoch": 1.56, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3531, + "step": 2425 + }, + { + "epoch": 1.58, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3102, + "step": 2450 + }, + { + "epoch": 1.6, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3344, + "step": 2475 + }, + { + "epoch": 1.61, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2301, + "step": 2500 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8646907216494846, + "eval_loss": 0.5154445171356201, + "eval_runtime": 30.0652, + "eval_samples_per_second": 103.242, + "eval_steps_per_second": 25.811, + "step": 2500 + }, + { + "epoch": 1.63, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3972, + "step": 2525 + }, + { + "epoch": 1.64, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3339, + "step": 2550 + }, + { + "epoch": 1.66, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.334, + "step": 2575 + }, + { + "epoch": 1.68, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2085, + "step": 2600 + }, + { + "epoch": 1.69, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2737, + "step": 2625 + }, + { + "epoch": 1.71, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3618, + "step": 2650 + }, + { + "epoch": 1.72, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3648, + "step": 2675 + }, + { + "epoch": 1.74, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4173, + "step": 2700 + }, + { + "epoch": 1.76, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2908, + "step": 2725 + }, + { + "epoch": 1.77, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2368, + "step": 2750 + }, + { + "epoch": 1.77, + "eval_accuracy": 0.8817654639175257, + "eval_loss": 0.4021648168563843, + "eval_runtime": 30.0057, + "eval_samples_per_second": 103.447, + "eval_steps_per_second": 25.862, + "step": 2750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 250, + "total_flos": 5788072897923072.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.4714356855393053e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 8 + } +} diff --git a/run-2/checkpoint-2750/training_args.bin b/run-2/checkpoint-2750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..e230b2b0691c2ba955d08c27b01c43281c9d4fbc --- /dev/null +++ b/run-2/checkpoint-2750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40bef76d9ba6b7f9c82fb91b5dea666f234a2847e28cb2faf44f5ca8e9ea5d19 +size 4728 diff --git a/run-2/checkpoint-3000/config.json b/run-2/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-2/checkpoint-3000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-2/checkpoint-3000/model.safetensors b/run-2/checkpoint-3000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..987fd84b572e548945a6a5d9dcaf8b3a213c9c51 --- /dev/null +++ b/run-2/checkpoint-3000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1324cd5b343ad24109e6853a17728a3c5d9c7424de3134f62b0784f1f159efc0 +size 433279996 diff --git a/run-2/checkpoint-3000/optimizer.pt b/run-2/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..e5b0448c1e0287fc702490f2d9ab6ace8ee7a655 --- /dev/null +++ b/run-2/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8fc5a0a580536a36fe6b033505639d32cd0293f8d41ff8aca99ad73d7a97adfb +size 866681082 diff --git a/run-2/checkpoint-3000/rng_state.pth b/run-2/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..d717cb03d14eef32afe17820643b27cad107af13 --- /dev/null +++ b/run-2/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a039281de77e6b9a31e662411886dca5f1d510240f4f6e504c9f52ef9b31a88b +size 14244 diff --git a/run-2/checkpoint-3000/scheduler.pt b/run-2/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..8c2c9740c2d9a0d3e37317dac79d7846c0ec9e50 --- /dev/null +++ b/run-2/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7938821ec967969ef940b4f317cf1e8213f672949806cb73a03d1ac52e895231 +size 1064 diff --git a/run-2/checkpoint-3000/trainer_state.json b/run-2/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1d61c4930ff0f9bf2842f96845dd688c92526f46 --- /dev/null +++ b/run-2/checkpoint-3000/trainer_state.json @@ -0,0 +1,852 @@ +{ + "best_metric": 0.882409793814433, + "best_model_checkpoint": "bert_trainer/run-2/checkpoint-3000", + "epoch": 1.9342359767891684, + "eval_steps": 250, + "global_step": 3000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 7.3571784276965265e-06, + "loss": 1.4073, + "step": 25 + }, + { + "epoch": 0.03, + "learning_rate": 1.4714356855393053e-05, + "loss": 1.1129, + "step": 50 + }, + { + "epoch": 0.05, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.9656, + "step": 75 + }, + { + "epoch": 0.06, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.8417, + "step": 100 + }, + { + "epoch": 0.08, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7486, + "step": 125 + }, + { + "epoch": 0.1, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.8348, + "step": 150 + }, + { + "epoch": 0.11, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7111, + "step": 175 + }, + { + "epoch": 0.13, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.7337, + "step": 200 + }, + { + "epoch": 0.15, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6518, + "step": 225 + }, + { + "epoch": 0.16, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6243, + "step": 250 + }, + { + "epoch": 0.16, + "eval_accuracy": 0.8079896907216495, + "eval_loss": 0.5573504567146301, + "eval_runtime": 30.0553, + "eval_samples_per_second": 103.276, + "eval_steps_per_second": 25.819, + "step": 250 + }, + { + "epoch": 0.18, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5721, + "step": 275 + }, + { + "epoch": 0.19, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6388, + "step": 300 + }, + { + "epoch": 0.21, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5117, + "step": 325 + }, + { + "epoch": 0.23, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6148, + "step": 350 + }, + { + "epoch": 0.24, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4858, + "step": 375 + }, + { + "epoch": 0.26, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.564, + "step": 400 + }, + { + "epoch": 0.27, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5233, + "step": 425 + }, + { + "epoch": 0.29, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4727, + "step": 450 + }, + { + "epoch": 0.31, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4875, + "step": 475 + }, + { + "epoch": 0.32, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4832, + "step": 500 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8150773195876289, + "eval_loss": 0.4804709553718567, + "eval_runtime": 30.0129, + "eval_samples_per_second": 103.422, + "eval_steps_per_second": 25.856, + "step": 500 + }, + { + "epoch": 0.34, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4925, + "step": 525 + }, + { + "epoch": 0.35, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5027, + "step": 550 + }, + { + "epoch": 0.37, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4571, + "step": 575 + }, + { + "epoch": 0.39, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4987, + "step": 600 + }, + { + "epoch": 0.4, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6134, + "step": 625 + }, + { + "epoch": 0.42, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5213, + "step": 650 + }, + { + "epoch": 0.44, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.6241, + "step": 675 + }, + { + "epoch": 0.45, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4945, + "step": 700 + }, + { + "epoch": 0.47, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4353, + "step": 725 + }, + { + "epoch": 0.48, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4177, + "step": 750 + }, + { + "epoch": 0.48, + "eval_accuracy": 0.8411726804123711, + "eval_loss": 0.4728888273239136, + "eval_runtime": 30.0028, + "eval_samples_per_second": 103.457, + "eval_steps_per_second": 25.864, + "step": 750 + }, + { + "epoch": 0.5, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5676, + "step": 775 + }, + { + "epoch": 0.52, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3918, + "step": 800 + }, + { + "epoch": 0.53, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3912, + "step": 825 + }, + { + "epoch": 0.55, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4507, + "step": 850 + }, + { + "epoch": 0.56, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3633, + "step": 875 + }, + { + "epoch": 0.58, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4406, + "step": 900 + }, + { + "epoch": 0.6, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5013, + "step": 925 + }, + { + "epoch": 0.61, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4385, + "step": 950 + }, + { + "epoch": 0.63, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4561, + "step": 975 + }, + { + "epoch": 0.64, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3917, + "step": 1000 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8579252577319587, + "eval_loss": 0.39569276571273804, + "eval_runtime": 30.0411, + "eval_samples_per_second": 103.325, + "eval_steps_per_second": 25.831, + "step": 1000 + }, + { + "epoch": 0.66, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4627, + "step": 1025 + }, + { + "epoch": 0.68, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4514, + "step": 1050 + }, + { + "epoch": 0.69, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4927, + "step": 1075 + }, + { + "epoch": 0.71, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3795, + "step": 1100 + }, + { + "epoch": 0.73, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3668, + "step": 1125 + }, + { + "epoch": 0.74, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4083, + "step": 1150 + }, + { + "epoch": 0.76, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4631, + "step": 1175 + }, + { + "epoch": 0.77, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4035, + "step": 1200 + }, + { + "epoch": 0.79, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3476, + "step": 1225 + }, + { + "epoch": 0.81, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.5089, + "step": 1250 + }, + { + "epoch": 0.81, + "eval_accuracy": 0.8479381443298969, + "eval_loss": 0.4126531481742859, + "eval_runtime": 30.0563, + "eval_samples_per_second": 103.273, + "eval_steps_per_second": 25.818, + "step": 1250 + }, + { + "epoch": 0.82, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4805, + "step": 1275 + }, + { + "epoch": 0.84, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3949, + "step": 1300 + }, + { + "epoch": 0.85, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3993, + "step": 1325 + }, + { + "epoch": 0.87, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4719, + "step": 1350 + }, + { + "epoch": 0.89, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4545, + "step": 1375 + }, + { + "epoch": 0.9, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3411, + "step": 1400 + }, + { + "epoch": 0.92, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4989, + "step": 1425 + }, + { + "epoch": 0.93, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4016, + "step": 1450 + }, + { + "epoch": 0.95, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3826, + "step": 1475 + }, + { + "epoch": 0.97, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.376, + "step": 1500 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8724226804123711, + "eval_loss": 0.3830737769603729, + "eval_runtime": 30.0147, + "eval_samples_per_second": 103.416, + "eval_steps_per_second": 25.854, + "step": 1500 + }, + { + "epoch": 0.98, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4116, + "step": 1525 + }, + { + "epoch": 1.0, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3377, + "step": 1550 + }, + { + "epoch": 1.02, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2881, + "step": 1575 + }, + { + "epoch": 1.03, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2914, + "step": 1600 + }, + { + "epoch": 1.05, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2836, + "step": 1625 + }, + { + "epoch": 1.06, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3338, + "step": 1650 + }, + { + "epoch": 1.08, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3104, + "step": 1675 + }, + { + "epoch": 1.1, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2209, + "step": 1700 + }, + { + "epoch": 1.11, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3869, + "step": 1725 + }, + { + "epoch": 1.13, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2869, + "step": 1750 + }, + { + "epoch": 1.13, + "eval_accuracy": 0.8756443298969072, + "eval_loss": 0.49572044610977173, + "eval_runtime": 30.0097, + "eval_samples_per_second": 103.433, + "eval_steps_per_second": 25.858, + "step": 1750 + }, + { + "epoch": 1.14, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2977, + "step": 1775 + }, + { + "epoch": 1.16, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3765, + "step": 1800 + }, + { + "epoch": 1.18, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3517, + "step": 1825 + }, + { + "epoch": 1.19, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.342, + "step": 1850 + }, + { + "epoch": 1.21, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.248, + "step": 1875 + }, + { + "epoch": 1.23, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3462, + "step": 1900 + }, + { + "epoch": 1.24, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2848, + "step": 1925 + }, + { + "epoch": 1.26, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3189, + "step": 1950 + }, + { + "epoch": 1.27, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2977, + "step": 1975 + }, + { + "epoch": 1.29, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2707, + "step": 2000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8820876288659794, + "eval_loss": 0.4196120500564575, + "eval_runtime": 30.0474, + "eval_samples_per_second": 103.303, + "eval_steps_per_second": 25.826, + "step": 2000 + }, + { + "epoch": 1.31, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3122, + "step": 2025 + }, + { + "epoch": 1.32, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2782, + "step": 2050 + }, + { + "epoch": 1.34, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2473, + "step": 2075 + }, + { + "epoch": 1.35, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3009, + "step": 2100 + }, + { + "epoch": 1.37, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2717, + "step": 2125 + }, + { + "epoch": 1.39, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4527, + "step": 2150 + }, + { + "epoch": 1.4, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1456, + "step": 2175 + }, + { + "epoch": 1.42, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3033, + "step": 2200 + }, + { + "epoch": 1.43, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2462, + "step": 2225 + }, + { + "epoch": 1.45, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1881, + "step": 2250 + }, + { + "epoch": 1.45, + "eval_accuracy": 0.876610824742268, + "eval_loss": 0.48145169019699097, + "eval_runtime": 30.011, + "eval_samples_per_second": 103.429, + "eval_steps_per_second": 25.857, + "step": 2250 + }, + { + "epoch": 1.47, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3002, + "step": 2275 + }, + { + "epoch": 1.48, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2344, + "step": 2300 + }, + { + "epoch": 1.5, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4302, + "step": 2325 + }, + { + "epoch": 1.52, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1932, + "step": 2350 + }, + { + "epoch": 1.53, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2573, + "step": 2375 + }, + { + "epoch": 1.55, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3697, + "step": 2400 + }, + { + "epoch": 1.56, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3531, + "step": 2425 + }, + { + "epoch": 1.58, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3102, + "step": 2450 + }, + { + "epoch": 1.6, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3344, + "step": 2475 + }, + { + "epoch": 1.61, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2301, + "step": 2500 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8646907216494846, + "eval_loss": 0.5154445171356201, + "eval_runtime": 30.0652, + "eval_samples_per_second": 103.242, + "eval_steps_per_second": 25.811, + "step": 2500 + }, + { + "epoch": 1.63, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3972, + "step": 2525 + }, + { + "epoch": 1.64, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3339, + "step": 2550 + }, + { + "epoch": 1.66, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.334, + "step": 2575 + }, + { + "epoch": 1.68, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2085, + "step": 2600 + }, + { + "epoch": 1.69, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2737, + "step": 2625 + }, + { + "epoch": 1.71, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3618, + "step": 2650 + }, + { + "epoch": 1.72, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3648, + "step": 2675 + }, + { + "epoch": 1.74, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.4173, + "step": 2700 + }, + { + "epoch": 1.76, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2908, + "step": 2725 + }, + { + "epoch": 1.77, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2368, + "step": 2750 + }, + { + "epoch": 1.77, + "eval_accuracy": 0.8817654639175257, + "eval_loss": 0.4021648168563843, + "eval_runtime": 30.0057, + "eval_samples_per_second": 103.447, + "eval_steps_per_second": 25.862, + "step": 2750 + }, + { + "epoch": 1.79, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2185, + "step": 2775 + }, + { + "epoch": 1.81, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3783, + "step": 2800 + }, + { + "epoch": 1.82, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2199, + "step": 2825 + }, + { + "epoch": 1.84, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2365, + "step": 2850 + }, + { + "epoch": 1.85, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2724, + "step": 2875 + }, + { + "epoch": 1.87, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2973, + "step": 2900 + }, + { + "epoch": 1.89, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.1881, + "step": 2925 + }, + { + "epoch": 1.9, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2876, + "step": 2950 + }, + { + "epoch": 1.92, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.2775, + "step": 2975 + }, + { + "epoch": 1.93, + "learning_rate": 1.4714356855393053e-05, + "loss": 0.3342, + "step": 3000 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.882409793814433, + "eval_loss": 0.46482139825820923, + "eval_runtime": 30.0087, + "eval_samples_per_second": 103.437, + "eval_steps_per_second": 25.859, + "step": 3000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 250, + "total_flos": 6314309182851072.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.4714356855393053e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 8 + } +} diff --git a/run-2/checkpoint-3000/training_args.bin b/run-2/checkpoint-3000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..e230b2b0691c2ba955d08c27b01c43281c9d4fbc --- /dev/null +++ b/run-2/checkpoint-3000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40bef76d9ba6b7f9c82fb91b5dea666f234a2847e28cb2faf44f5ca8e9ea5d19 +size 4728 diff --git a/run-3/checkpoint-2500/config.json b/run-3/checkpoint-2500/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-3/checkpoint-2500/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-3/checkpoint-2500/model.safetensors b/run-3/checkpoint-2500/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d37b0bc616953f5a9dcd49129e8e6195c50af76b --- /dev/null +++ b/run-3/checkpoint-2500/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c0cc7504acb0df38cf2b8397879c678cc053c99d057855e90ceacb0fc02033b9 +size 433279996 diff --git a/run-3/checkpoint-2500/optimizer.pt b/run-3/checkpoint-2500/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..799acdddf0314a85dc12a777caa4e600b65fee8b --- /dev/null +++ b/run-3/checkpoint-2500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8aefff0ed89024633b56e88d5acb54c3869bf92689d5a6a722d49dbf6579f91a +size 866681082 diff --git a/run-3/checkpoint-2500/rng_state.pth b/run-3/checkpoint-2500/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..678868d7ddbe48969a0ad74f8269b1e79c19b902 --- /dev/null +++ b/run-3/checkpoint-2500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:63399af7a409c183004eb47ca7dbc6f06cf71063012d7d165e74c89aaf482739 +size 14244 diff --git a/run-3/checkpoint-2500/scheduler.pt b/run-3/checkpoint-2500/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..57daf78c38c291afbf56264150d165a16b1b1585 --- /dev/null +++ b/run-3/checkpoint-2500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:64d403cc14cfc7d49ef4f76591323ffab474e41871c823468df2cfb7721d0f76 +size 1064 diff --git a/run-3/checkpoint-2500/trainer_state.json b/run-3/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e1a547730be2031e24914b76bf9f811d0adfbe5d --- /dev/null +++ b/run-3/checkpoint-2500/trainer_state.json @@ -0,0 +1,714 @@ +{ + "best_metric": 0.8730670103092784, + "best_model_checkpoint": "bert_trainer/run-3/checkpoint-2000", + "epoch": 1.6118633139909737, + "eval_steps": 250, + "global_step": 2500, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 1.3880483293934951e-05, + "loss": 1.3534, + "step": 25 + }, + { + "epoch": 0.03, + "learning_rate": 2.7760966587869903e-05, + "loss": 1.0289, + "step": 50 + }, + { + "epoch": 0.05, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.8774, + "step": 75 + }, + { + "epoch": 0.06, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.7025, + "step": 100 + }, + { + "epoch": 0.08, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.8032, + "step": 125 + }, + { + "epoch": 0.1, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.808, + "step": 150 + }, + { + "epoch": 0.11, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.651, + "step": 175 + }, + { + "epoch": 0.13, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.6946, + "step": 200 + }, + { + "epoch": 0.15, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.6587, + "step": 225 + }, + { + "epoch": 0.16, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5824, + "step": 250 + }, + { + "epoch": 0.16, + "eval_accuracy": 0.8112113402061856, + "eval_loss": 0.5165922045707703, + "eval_runtime": 30.3844, + "eval_samples_per_second": 102.158, + "eval_steps_per_second": 6.385, + "step": 250 + }, + { + "epoch": 0.18, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.546, + "step": 275 + }, + { + "epoch": 0.19, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5713, + "step": 300 + }, + { + "epoch": 0.21, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4633, + "step": 325 + }, + { + "epoch": 0.23, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5839, + "step": 350 + }, + { + "epoch": 0.24, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4685, + "step": 375 + }, + { + "epoch": 0.26, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5632, + "step": 400 + }, + { + "epoch": 0.27, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.52, + "step": 425 + }, + { + "epoch": 0.29, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5565, + "step": 450 + }, + { + "epoch": 0.31, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5394, + "step": 475 + }, + { + "epoch": 0.32, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4944, + "step": 500 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8244201030927835, + "eval_loss": 0.4521254003047943, + "eval_runtime": 30.375, + "eval_samples_per_second": 102.189, + "eval_steps_per_second": 6.387, + "step": 500 + }, + { + "epoch": 0.34, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5233, + "step": 525 + }, + { + "epoch": 0.35, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.475, + "step": 550 + }, + { + "epoch": 0.37, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4169, + "step": 575 + }, + { + "epoch": 0.39, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4961, + "step": 600 + }, + { + "epoch": 0.4, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5372, + "step": 625 + }, + { + "epoch": 0.42, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5151, + "step": 650 + }, + { + "epoch": 0.44, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5491, + "step": 675 + }, + { + "epoch": 0.45, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4596, + "step": 700 + }, + { + "epoch": 0.47, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4722, + "step": 725 + }, + { + "epoch": 0.48, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3632, + "step": 750 + }, + { + "epoch": 0.48, + "eval_accuracy": 0.8344072164948454, + "eval_loss": 0.48342078924179077, + "eval_runtime": 30.4129, + "eval_samples_per_second": 102.062, + "eval_steps_per_second": 6.379, + "step": 750 + }, + { + "epoch": 0.5, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5665, + "step": 775 + }, + { + "epoch": 0.52, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3748, + "step": 800 + }, + { + "epoch": 0.53, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4397, + "step": 825 + }, + { + "epoch": 0.55, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4141, + "step": 850 + }, + { + "epoch": 0.56, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4029, + "step": 875 + }, + { + "epoch": 0.58, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4191, + "step": 900 + }, + { + "epoch": 0.6, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5094, + "step": 925 + }, + { + "epoch": 0.61, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4308, + "step": 950 + }, + { + "epoch": 0.63, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3921, + "step": 975 + }, + { + "epoch": 0.64, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4381, + "step": 1000 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8588917525773195, + "eval_loss": 0.4446374177932739, + "eval_runtime": 29.9606, + "eval_samples_per_second": 103.603, + "eval_steps_per_second": 6.475, + "step": 1000 + }, + { + "epoch": 0.66, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4766, + "step": 1025 + }, + { + "epoch": 0.68, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4957, + "step": 1050 + }, + { + "epoch": 0.69, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4285, + "step": 1075 + }, + { + "epoch": 0.71, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3494, + "step": 1100 + }, + { + "epoch": 0.73, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4066, + "step": 1125 + }, + { + "epoch": 0.74, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3833, + "step": 1150 + }, + { + "epoch": 0.76, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4553, + "step": 1175 + }, + { + "epoch": 0.77, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4185, + "step": 1200 + }, + { + "epoch": 0.79, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3519, + "step": 1225 + }, + { + "epoch": 0.81, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4848, + "step": 1250 + }, + { + "epoch": 0.81, + "eval_accuracy": 0.8582474226804123, + "eval_loss": 0.408128023147583, + "eval_runtime": 29.8798, + "eval_samples_per_second": 103.883, + "eval_steps_per_second": 6.493, + "step": 1250 + }, + { + "epoch": 0.82, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.539, + "step": 1275 + }, + { + "epoch": 0.84, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3632, + "step": 1300 + }, + { + "epoch": 0.85, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3861, + "step": 1325 + }, + { + "epoch": 0.87, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5181, + "step": 1350 + }, + { + "epoch": 0.89, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4158, + "step": 1375 + }, + { + "epoch": 0.9, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3584, + "step": 1400 + }, + { + "epoch": 0.92, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4162, + "step": 1425 + }, + { + "epoch": 0.93, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4607, + "step": 1450 + }, + { + "epoch": 0.95, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4146, + "step": 1475 + }, + { + "epoch": 0.97, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3954, + "step": 1500 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8714561855670103, + "eval_loss": 0.38059666752815247, + "eval_runtime": 29.8772, + "eval_samples_per_second": 103.892, + "eval_steps_per_second": 6.493, + "step": 1500 + }, + { + "epoch": 0.98, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3881, + "step": 1525 + }, + { + "epoch": 1.0, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3825, + "step": 1550 + }, + { + "epoch": 1.02, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3082, + "step": 1575 + }, + { + "epoch": 1.03, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3367, + "step": 1600 + }, + { + "epoch": 1.05, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3191, + "step": 1625 + }, + { + "epoch": 1.06, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3298, + "step": 1650 + }, + { + "epoch": 1.08, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2631, + "step": 1675 + }, + { + "epoch": 1.1, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1897, + "step": 1700 + }, + { + "epoch": 1.11, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3901, + "step": 1725 + }, + { + "epoch": 1.13, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3268, + "step": 1750 + }, + { + "epoch": 1.13, + "eval_accuracy": 0.8714561855670103, + "eval_loss": 0.5426503419876099, + "eval_runtime": 29.922, + "eval_samples_per_second": 103.737, + "eval_steps_per_second": 6.484, + "step": 1750 + }, + { + "epoch": 1.14, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2771, + "step": 1775 + }, + { + "epoch": 1.16, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3346, + "step": 1800 + }, + { + "epoch": 1.18, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.312, + "step": 1825 + }, + { + "epoch": 1.19, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3482, + "step": 1850 + }, + { + "epoch": 1.21, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3186, + "step": 1875 + }, + { + "epoch": 1.23, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.317, + "step": 1900 + }, + { + "epoch": 1.24, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3214, + "step": 1925 + }, + { + "epoch": 1.26, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2073, + "step": 1950 + }, + { + "epoch": 1.27, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3709, + "step": 1975 + }, + { + "epoch": 1.29, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2492, + "step": 2000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8730670103092784, + "eval_loss": 0.4012953042984009, + "eval_runtime": 29.8764, + "eval_samples_per_second": 103.895, + "eval_steps_per_second": 6.493, + "step": 2000 + }, + { + "epoch": 1.31, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2831, + "step": 2025 + }, + { + "epoch": 1.32, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2479, + "step": 2050 + }, + { + "epoch": 1.34, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2467, + "step": 2075 + }, + { + "epoch": 1.35, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.332, + "step": 2100 + }, + { + "epoch": 1.37, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2565, + "step": 2125 + }, + { + "epoch": 1.39, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4016, + "step": 2150 + }, + { + "epoch": 1.4, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1485, + "step": 2175 + }, + { + "epoch": 1.42, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3333, + "step": 2200 + }, + { + "epoch": 1.43, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3541, + "step": 2225 + }, + { + "epoch": 1.45, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1829, + "step": 2250 + }, + { + "epoch": 1.45, + "eval_accuracy": 0.8704896907216495, + "eval_loss": 0.49169790744781494, + "eval_runtime": 29.9217, + "eval_samples_per_second": 103.737, + "eval_steps_per_second": 6.484, + "step": 2250 + }, + { + "epoch": 1.47, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2888, + "step": 2275 + }, + { + "epoch": 1.48, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2472, + "step": 2300 + }, + { + "epoch": 1.5, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3547, + "step": 2325 + }, + { + "epoch": 1.52, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1869, + "step": 2350 + }, + { + "epoch": 1.53, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3094, + "step": 2375 + }, + { + "epoch": 1.55, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.314, + "step": 2400 + }, + { + "epoch": 1.56, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3161, + "step": 2425 + }, + { + "epoch": 1.58, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3445, + "step": 2450 + }, + { + "epoch": 1.6, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4138, + "step": 2475 + }, + { + "epoch": 1.61, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2214, + "step": 2500 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.852770618556701, + "eval_loss": 0.5358509421348572, + "eval_runtime": 29.9717, + "eval_samples_per_second": 103.564, + "eval_steps_per_second": 6.473, + "step": 2500 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 250, + "total_flos": 5261836612995072.0, + "trial_name": null, + "trial_params": { + "learning_rate": 2.7760966587869903e-05, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 8 + } +} diff --git a/run-3/checkpoint-2500/training_args.bin b/run-3/checkpoint-2500/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..50cc4ec23d371b30ae6512db04b9c655f9dcecd3 --- /dev/null +++ b/run-3/checkpoint-2500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2175af5e4c44e0db4ee2b9299c68887232a3ab86bd73b88fdec63aaf1669da81 +size 4728 diff --git a/run-3/checkpoint-2750/config.json b/run-3/checkpoint-2750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-3/checkpoint-2750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-3/checkpoint-2750/model.safetensors b/run-3/checkpoint-2750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a756a2e7d8572f1c45af4d33d96c71911ca547ed --- /dev/null +++ b/run-3/checkpoint-2750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:677860fa8e1e6f97f106d175e4bf43a3ee5a373c005215685688306dcfa72a49 +size 433279996 diff --git a/run-3/checkpoint-2750/optimizer.pt b/run-3/checkpoint-2750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..5c6366ca682433d334b91ae4ddf51642e26b44b7 --- /dev/null +++ b/run-3/checkpoint-2750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:35f9e541a8c8ecfe7e4c311480c4f8686b0203294e2325962ab05d3786317e2d +size 866681082 diff --git a/run-3/checkpoint-2750/rng_state.pth b/run-3/checkpoint-2750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..ecabdb8c07de6e55c7332facacb47f6edf2a41ca --- /dev/null +++ b/run-3/checkpoint-2750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fd2745a1e1a49ccd51b48496c3e2a5d498e0bdad8fb3f45b3589cf70267b4702 +size 14244 diff --git a/run-3/checkpoint-2750/scheduler.pt b/run-3/checkpoint-2750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..db757bdc64cc1181d0dc1fa9756cbb6d8d71361d --- /dev/null +++ b/run-3/checkpoint-2750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c9d874b36e5555754e89b613b4b82c5013e5f20218f93ef6d523732fbbfbbbb3 +size 1064 diff --git a/run-3/checkpoint-2750/trainer_state.json b/run-3/checkpoint-2750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ec6a3a82fe542f5dcf423ffeffd2e5a2deee9fc7 --- /dev/null +++ b/run-3/checkpoint-2750/trainer_state.json @@ -0,0 +1,783 @@ +{ + "best_metric": 0.884020618556701, + "best_model_checkpoint": "bert_trainer/run-3/checkpoint-2750", + "epoch": 1.773049645390071, + "eval_steps": 250, + "global_step": 2750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 1.3880483293934951e-05, + "loss": 1.3534, + "step": 25 + }, + { + "epoch": 0.03, + "learning_rate": 2.7760966587869903e-05, + "loss": 1.0289, + "step": 50 + }, + { + "epoch": 0.05, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.8774, + "step": 75 + }, + { + "epoch": 0.06, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.7025, + "step": 100 + }, + { + "epoch": 0.08, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.8032, + "step": 125 + }, + { + "epoch": 0.1, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.808, + "step": 150 + }, + { + "epoch": 0.11, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.651, + "step": 175 + }, + { + "epoch": 0.13, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.6946, + "step": 200 + }, + { + "epoch": 0.15, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.6587, + "step": 225 + }, + { + "epoch": 0.16, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5824, + "step": 250 + }, + { + "epoch": 0.16, + "eval_accuracy": 0.8112113402061856, + "eval_loss": 0.5165922045707703, + "eval_runtime": 30.3844, + "eval_samples_per_second": 102.158, + "eval_steps_per_second": 6.385, + "step": 250 + }, + { + "epoch": 0.18, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.546, + "step": 275 + }, + { + "epoch": 0.19, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5713, + "step": 300 + }, + { + "epoch": 0.21, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4633, + "step": 325 + }, + { + "epoch": 0.23, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5839, + "step": 350 + }, + { + "epoch": 0.24, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4685, + "step": 375 + }, + { + "epoch": 0.26, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5632, + "step": 400 + }, + { + "epoch": 0.27, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.52, + "step": 425 + }, + { + "epoch": 0.29, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5565, + "step": 450 + }, + { + "epoch": 0.31, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5394, + "step": 475 + }, + { + "epoch": 0.32, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4944, + "step": 500 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8244201030927835, + "eval_loss": 0.4521254003047943, + "eval_runtime": 30.375, + "eval_samples_per_second": 102.189, + "eval_steps_per_second": 6.387, + "step": 500 + }, + { + "epoch": 0.34, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5233, + "step": 525 + }, + { + "epoch": 0.35, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.475, + "step": 550 + }, + { + "epoch": 0.37, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4169, + "step": 575 + }, + { + "epoch": 0.39, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4961, + "step": 600 + }, + { + "epoch": 0.4, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5372, + "step": 625 + }, + { + "epoch": 0.42, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5151, + "step": 650 + }, + { + "epoch": 0.44, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5491, + "step": 675 + }, + { + "epoch": 0.45, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4596, + "step": 700 + }, + { + "epoch": 0.47, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4722, + "step": 725 + }, + { + "epoch": 0.48, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3632, + "step": 750 + }, + { + "epoch": 0.48, + "eval_accuracy": 0.8344072164948454, + "eval_loss": 0.48342078924179077, + "eval_runtime": 30.4129, + "eval_samples_per_second": 102.062, + "eval_steps_per_second": 6.379, + "step": 750 + }, + { + "epoch": 0.5, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5665, + "step": 775 + }, + { + "epoch": 0.52, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3748, + "step": 800 + }, + { + "epoch": 0.53, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4397, + "step": 825 + }, + { + "epoch": 0.55, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4141, + "step": 850 + }, + { + "epoch": 0.56, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4029, + "step": 875 + }, + { + "epoch": 0.58, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4191, + "step": 900 + }, + { + "epoch": 0.6, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5094, + "step": 925 + }, + { + "epoch": 0.61, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4308, + "step": 950 + }, + { + "epoch": 0.63, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3921, + "step": 975 + }, + { + "epoch": 0.64, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4381, + "step": 1000 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8588917525773195, + "eval_loss": 0.4446374177932739, + "eval_runtime": 29.9606, + "eval_samples_per_second": 103.603, + "eval_steps_per_second": 6.475, + "step": 1000 + }, + { + "epoch": 0.66, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4766, + "step": 1025 + }, + { + "epoch": 0.68, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4957, + "step": 1050 + }, + { + "epoch": 0.69, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4285, + "step": 1075 + }, + { + "epoch": 0.71, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3494, + "step": 1100 + }, + { + "epoch": 0.73, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4066, + "step": 1125 + }, + { + "epoch": 0.74, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3833, + "step": 1150 + }, + { + "epoch": 0.76, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4553, + "step": 1175 + }, + { + "epoch": 0.77, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4185, + "step": 1200 + }, + { + "epoch": 0.79, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3519, + "step": 1225 + }, + { + "epoch": 0.81, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4848, + "step": 1250 + }, + { + "epoch": 0.81, + "eval_accuracy": 0.8582474226804123, + "eval_loss": 0.408128023147583, + "eval_runtime": 29.8798, + "eval_samples_per_second": 103.883, + "eval_steps_per_second": 6.493, + "step": 1250 + }, + { + "epoch": 0.82, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.539, + "step": 1275 + }, + { + "epoch": 0.84, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3632, + "step": 1300 + }, + { + "epoch": 0.85, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3861, + "step": 1325 + }, + { + "epoch": 0.87, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5181, + "step": 1350 + }, + { + "epoch": 0.89, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4158, + "step": 1375 + }, + { + "epoch": 0.9, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3584, + "step": 1400 + }, + { + "epoch": 0.92, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4162, + "step": 1425 + }, + { + "epoch": 0.93, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4607, + "step": 1450 + }, + { + "epoch": 0.95, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4146, + "step": 1475 + }, + { + "epoch": 0.97, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3954, + "step": 1500 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8714561855670103, + "eval_loss": 0.38059666752815247, + "eval_runtime": 29.8772, + "eval_samples_per_second": 103.892, + "eval_steps_per_second": 6.493, + "step": 1500 + }, + { + "epoch": 0.98, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3881, + "step": 1525 + }, + { + "epoch": 1.0, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3825, + "step": 1550 + }, + { + "epoch": 1.02, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3082, + "step": 1575 + }, + { + "epoch": 1.03, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3367, + "step": 1600 + }, + { + "epoch": 1.05, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3191, + "step": 1625 + }, + { + "epoch": 1.06, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3298, + "step": 1650 + }, + { + "epoch": 1.08, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2631, + "step": 1675 + }, + { + "epoch": 1.1, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1897, + "step": 1700 + }, + { + "epoch": 1.11, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3901, + "step": 1725 + }, + { + "epoch": 1.13, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3268, + "step": 1750 + }, + { + "epoch": 1.13, + "eval_accuracy": 0.8714561855670103, + "eval_loss": 0.5426503419876099, + "eval_runtime": 29.922, + "eval_samples_per_second": 103.737, + "eval_steps_per_second": 6.484, + "step": 1750 + }, + { + "epoch": 1.14, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2771, + "step": 1775 + }, + { + "epoch": 1.16, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3346, + "step": 1800 + }, + { + "epoch": 1.18, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.312, + "step": 1825 + }, + { + "epoch": 1.19, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3482, + "step": 1850 + }, + { + "epoch": 1.21, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3186, + "step": 1875 + }, + { + "epoch": 1.23, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.317, + "step": 1900 + }, + { + "epoch": 1.24, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3214, + "step": 1925 + }, + { + "epoch": 1.26, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2073, + "step": 1950 + }, + { + "epoch": 1.27, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3709, + "step": 1975 + }, + { + "epoch": 1.29, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2492, + "step": 2000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8730670103092784, + "eval_loss": 0.4012953042984009, + "eval_runtime": 29.8764, + "eval_samples_per_second": 103.895, + "eval_steps_per_second": 6.493, + "step": 2000 + }, + { + "epoch": 1.31, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2831, + "step": 2025 + }, + { + "epoch": 1.32, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2479, + "step": 2050 + }, + { + "epoch": 1.34, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2467, + "step": 2075 + }, + { + "epoch": 1.35, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.332, + "step": 2100 + }, + { + "epoch": 1.37, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2565, + "step": 2125 + }, + { + "epoch": 1.39, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4016, + "step": 2150 + }, + { + "epoch": 1.4, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1485, + "step": 2175 + }, + { + "epoch": 1.42, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3333, + "step": 2200 + }, + { + "epoch": 1.43, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3541, + "step": 2225 + }, + { + "epoch": 1.45, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1829, + "step": 2250 + }, + { + "epoch": 1.45, + "eval_accuracy": 0.8704896907216495, + "eval_loss": 0.49169790744781494, + "eval_runtime": 29.9217, + "eval_samples_per_second": 103.737, + "eval_steps_per_second": 6.484, + "step": 2250 + }, + { + "epoch": 1.47, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2888, + "step": 2275 + }, + { + "epoch": 1.48, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2472, + "step": 2300 + }, + { + "epoch": 1.5, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3547, + "step": 2325 + }, + { + "epoch": 1.52, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1869, + "step": 2350 + }, + { + "epoch": 1.53, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3094, + "step": 2375 + }, + { + "epoch": 1.55, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.314, + "step": 2400 + }, + { + "epoch": 1.56, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3161, + "step": 2425 + }, + { + "epoch": 1.58, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3445, + "step": 2450 + }, + { + "epoch": 1.6, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4138, + "step": 2475 + }, + { + "epoch": 1.61, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2214, + "step": 2500 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.852770618556701, + "eval_loss": 0.5358509421348572, + "eval_runtime": 29.9717, + "eval_samples_per_second": 103.564, + "eval_steps_per_second": 6.473, + "step": 2500 + }, + { + "epoch": 1.63, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3897, + "step": 2525 + }, + { + "epoch": 1.64, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3371, + "step": 2550 + }, + { + "epoch": 1.66, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3278, + "step": 2575 + }, + { + "epoch": 1.68, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2226, + "step": 2600 + }, + { + "epoch": 1.69, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2836, + "step": 2625 + }, + { + "epoch": 1.71, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3236, + "step": 2650 + }, + { + "epoch": 1.72, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3125, + "step": 2675 + }, + { + "epoch": 1.74, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3267, + "step": 2700 + }, + { + "epoch": 1.76, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2427, + "step": 2725 + }, + { + "epoch": 1.77, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2973, + "step": 2750 + }, + { + "epoch": 1.77, + "eval_accuracy": 0.884020618556701, + "eval_loss": 0.42780932784080505, + "eval_runtime": 29.8873, + "eval_samples_per_second": 103.857, + "eval_steps_per_second": 6.491, + "step": 2750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 250, + "total_flos": 5788072897923072.0, + "trial_name": null, + "trial_params": { + "learning_rate": 2.7760966587869903e-05, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 8 + } +} diff --git a/run-3/checkpoint-2750/training_args.bin b/run-3/checkpoint-2750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..50cc4ec23d371b30ae6512db04b9c655f9dcecd3 --- /dev/null +++ b/run-3/checkpoint-2750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2175af5e4c44e0db4ee2b9299c68887232a3ab86bd73b88fdec63aaf1669da81 +size 4728 diff --git a/run-3/checkpoint-3000/config.json b/run-3/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-3/checkpoint-3000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-3/checkpoint-3000/model.safetensors b/run-3/checkpoint-3000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ba42277f4f96cd3879fa9109321eaeed83957229 --- /dev/null +++ b/run-3/checkpoint-3000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e26d6088b3cba4720112b0132a302a5c942d74195dbc2a3eb65e03180472fcf +size 433279996 diff --git a/run-3/checkpoint-3000/optimizer.pt b/run-3/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..f314713207bdb6ca5f3f33fe1ee5fd5e0cab194d --- /dev/null +++ b/run-3/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:80ed5d176426e957d86161b3e55b2b6ce0107a51eceddad1b88636534d9ae037 +size 866681082 diff --git a/run-3/checkpoint-3000/rng_state.pth b/run-3/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..d717cb03d14eef32afe17820643b27cad107af13 --- /dev/null +++ b/run-3/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a039281de77e6b9a31e662411886dca5f1d510240f4f6e504c9f52ef9b31a88b +size 14244 diff --git a/run-3/checkpoint-3000/scheduler.pt b/run-3/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..8d59179f2c37453561005d5c96abea3825b87060 --- /dev/null +++ b/run-3/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:adff77cc27f1038a8d6aff025d674cc722f885f789d53f585dab426dcbbeb171 +size 1064 diff --git a/run-3/checkpoint-3000/trainer_state.json b/run-3/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..17944facbb42fd63e447573ca9022afb2d05d42a --- /dev/null +++ b/run-3/checkpoint-3000/trainer_state.json @@ -0,0 +1,852 @@ +{ + "best_metric": 0.884020618556701, + "best_model_checkpoint": "bert_trainer/run-3/checkpoint-2750", + "epoch": 1.9342359767891684, + "eval_steps": 250, + "global_step": 3000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.02, + "learning_rate": 1.3880483293934951e-05, + "loss": 1.3534, + "step": 25 + }, + { + "epoch": 0.03, + "learning_rate": 2.7760966587869903e-05, + "loss": 1.0289, + "step": 50 + }, + { + "epoch": 0.05, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.8774, + "step": 75 + }, + { + "epoch": 0.06, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.7025, + "step": 100 + }, + { + "epoch": 0.08, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.8032, + "step": 125 + }, + { + "epoch": 0.1, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.808, + "step": 150 + }, + { + "epoch": 0.11, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.651, + "step": 175 + }, + { + "epoch": 0.13, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.6946, + "step": 200 + }, + { + "epoch": 0.15, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.6587, + "step": 225 + }, + { + "epoch": 0.16, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5824, + "step": 250 + }, + { + "epoch": 0.16, + "eval_accuracy": 0.8112113402061856, + "eval_loss": 0.5165922045707703, + "eval_runtime": 30.3844, + "eval_samples_per_second": 102.158, + "eval_steps_per_second": 6.385, + "step": 250 + }, + { + "epoch": 0.18, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.546, + "step": 275 + }, + { + "epoch": 0.19, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5713, + "step": 300 + }, + { + "epoch": 0.21, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4633, + "step": 325 + }, + { + "epoch": 0.23, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5839, + "step": 350 + }, + { + "epoch": 0.24, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4685, + "step": 375 + }, + { + "epoch": 0.26, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5632, + "step": 400 + }, + { + "epoch": 0.27, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.52, + "step": 425 + }, + { + "epoch": 0.29, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5565, + "step": 450 + }, + { + "epoch": 0.31, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5394, + "step": 475 + }, + { + "epoch": 0.32, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4944, + "step": 500 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8244201030927835, + "eval_loss": 0.4521254003047943, + "eval_runtime": 30.375, + "eval_samples_per_second": 102.189, + "eval_steps_per_second": 6.387, + "step": 500 + }, + { + "epoch": 0.34, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5233, + "step": 525 + }, + { + "epoch": 0.35, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.475, + "step": 550 + }, + { + "epoch": 0.37, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4169, + "step": 575 + }, + { + "epoch": 0.39, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4961, + "step": 600 + }, + { + "epoch": 0.4, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5372, + "step": 625 + }, + { + "epoch": 0.42, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5151, + "step": 650 + }, + { + "epoch": 0.44, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5491, + "step": 675 + }, + { + "epoch": 0.45, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4596, + "step": 700 + }, + { + "epoch": 0.47, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4722, + "step": 725 + }, + { + "epoch": 0.48, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3632, + "step": 750 + }, + { + "epoch": 0.48, + "eval_accuracy": 0.8344072164948454, + "eval_loss": 0.48342078924179077, + "eval_runtime": 30.4129, + "eval_samples_per_second": 102.062, + "eval_steps_per_second": 6.379, + "step": 750 + }, + { + "epoch": 0.5, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5665, + "step": 775 + }, + { + "epoch": 0.52, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3748, + "step": 800 + }, + { + "epoch": 0.53, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4397, + "step": 825 + }, + { + "epoch": 0.55, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4141, + "step": 850 + }, + { + "epoch": 0.56, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4029, + "step": 875 + }, + { + "epoch": 0.58, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4191, + "step": 900 + }, + { + "epoch": 0.6, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5094, + "step": 925 + }, + { + "epoch": 0.61, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4308, + "step": 950 + }, + { + "epoch": 0.63, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3921, + "step": 975 + }, + { + "epoch": 0.64, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4381, + "step": 1000 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8588917525773195, + "eval_loss": 0.4446374177932739, + "eval_runtime": 29.9606, + "eval_samples_per_second": 103.603, + "eval_steps_per_second": 6.475, + "step": 1000 + }, + { + "epoch": 0.66, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4766, + "step": 1025 + }, + { + "epoch": 0.68, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4957, + "step": 1050 + }, + { + "epoch": 0.69, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4285, + "step": 1075 + }, + { + "epoch": 0.71, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3494, + "step": 1100 + }, + { + "epoch": 0.73, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4066, + "step": 1125 + }, + { + "epoch": 0.74, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3833, + "step": 1150 + }, + { + "epoch": 0.76, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4553, + "step": 1175 + }, + { + "epoch": 0.77, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4185, + "step": 1200 + }, + { + "epoch": 0.79, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3519, + "step": 1225 + }, + { + "epoch": 0.81, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4848, + "step": 1250 + }, + { + "epoch": 0.81, + "eval_accuracy": 0.8582474226804123, + "eval_loss": 0.408128023147583, + "eval_runtime": 29.8798, + "eval_samples_per_second": 103.883, + "eval_steps_per_second": 6.493, + "step": 1250 + }, + { + "epoch": 0.82, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.539, + "step": 1275 + }, + { + "epoch": 0.84, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3632, + "step": 1300 + }, + { + "epoch": 0.85, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3861, + "step": 1325 + }, + { + "epoch": 0.87, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.5181, + "step": 1350 + }, + { + "epoch": 0.89, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4158, + "step": 1375 + }, + { + "epoch": 0.9, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3584, + "step": 1400 + }, + { + "epoch": 0.92, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4162, + "step": 1425 + }, + { + "epoch": 0.93, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4607, + "step": 1450 + }, + { + "epoch": 0.95, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4146, + "step": 1475 + }, + { + "epoch": 0.97, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3954, + "step": 1500 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8714561855670103, + "eval_loss": 0.38059666752815247, + "eval_runtime": 29.8772, + "eval_samples_per_second": 103.892, + "eval_steps_per_second": 6.493, + "step": 1500 + }, + { + "epoch": 0.98, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3881, + "step": 1525 + }, + { + "epoch": 1.0, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3825, + "step": 1550 + }, + { + "epoch": 1.02, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3082, + "step": 1575 + }, + { + "epoch": 1.03, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3367, + "step": 1600 + }, + { + "epoch": 1.05, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3191, + "step": 1625 + }, + { + "epoch": 1.06, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3298, + "step": 1650 + }, + { + "epoch": 1.08, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2631, + "step": 1675 + }, + { + "epoch": 1.1, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1897, + "step": 1700 + }, + { + "epoch": 1.11, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3901, + "step": 1725 + }, + { + "epoch": 1.13, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3268, + "step": 1750 + }, + { + "epoch": 1.13, + "eval_accuracy": 0.8714561855670103, + "eval_loss": 0.5426503419876099, + "eval_runtime": 29.922, + "eval_samples_per_second": 103.737, + "eval_steps_per_second": 6.484, + "step": 1750 + }, + { + "epoch": 1.14, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2771, + "step": 1775 + }, + { + "epoch": 1.16, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3346, + "step": 1800 + }, + { + "epoch": 1.18, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.312, + "step": 1825 + }, + { + "epoch": 1.19, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3482, + "step": 1850 + }, + { + "epoch": 1.21, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3186, + "step": 1875 + }, + { + "epoch": 1.23, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.317, + "step": 1900 + }, + { + "epoch": 1.24, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3214, + "step": 1925 + }, + { + "epoch": 1.26, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2073, + "step": 1950 + }, + { + "epoch": 1.27, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3709, + "step": 1975 + }, + { + "epoch": 1.29, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2492, + "step": 2000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8730670103092784, + "eval_loss": 0.4012953042984009, + "eval_runtime": 29.8764, + "eval_samples_per_second": 103.895, + "eval_steps_per_second": 6.493, + "step": 2000 + }, + { + "epoch": 1.31, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2831, + "step": 2025 + }, + { + "epoch": 1.32, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2479, + "step": 2050 + }, + { + "epoch": 1.34, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2467, + "step": 2075 + }, + { + "epoch": 1.35, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.332, + "step": 2100 + }, + { + "epoch": 1.37, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2565, + "step": 2125 + }, + { + "epoch": 1.39, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4016, + "step": 2150 + }, + { + "epoch": 1.4, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1485, + "step": 2175 + }, + { + "epoch": 1.42, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3333, + "step": 2200 + }, + { + "epoch": 1.43, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3541, + "step": 2225 + }, + { + "epoch": 1.45, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1829, + "step": 2250 + }, + { + "epoch": 1.45, + "eval_accuracy": 0.8704896907216495, + "eval_loss": 0.49169790744781494, + "eval_runtime": 29.9217, + "eval_samples_per_second": 103.737, + "eval_steps_per_second": 6.484, + "step": 2250 + }, + { + "epoch": 1.47, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2888, + "step": 2275 + }, + { + "epoch": 1.48, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2472, + "step": 2300 + }, + { + "epoch": 1.5, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3547, + "step": 2325 + }, + { + "epoch": 1.52, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.1869, + "step": 2350 + }, + { + "epoch": 1.53, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3094, + "step": 2375 + }, + { + "epoch": 1.55, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.314, + "step": 2400 + }, + { + "epoch": 1.56, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3161, + "step": 2425 + }, + { + "epoch": 1.58, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3445, + "step": 2450 + }, + { + "epoch": 1.6, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.4138, + "step": 2475 + }, + { + "epoch": 1.61, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2214, + "step": 2500 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.852770618556701, + "eval_loss": 0.5358509421348572, + "eval_runtime": 29.9717, + "eval_samples_per_second": 103.564, + "eval_steps_per_second": 6.473, + "step": 2500 + }, + { + "epoch": 1.63, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3897, + "step": 2525 + }, + { + "epoch": 1.64, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3371, + "step": 2550 + }, + { + "epoch": 1.66, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3278, + "step": 2575 + }, + { + "epoch": 1.68, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2226, + "step": 2600 + }, + { + "epoch": 1.69, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2836, + "step": 2625 + }, + { + "epoch": 1.71, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3236, + "step": 2650 + }, + { + "epoch": 1.72, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3125, + "step": 2675 + }, + { + "epoch": 1.74, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3267, + "step": 2700 + }, + { + "epoch": 1.76, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2427, + "step": 2725 + }, + { + "epoch": 1.77, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2973, + "step": 2750 + }, + { + "epoch": 1.77, + "eval_accuracy": 0.884020618556701, + "eval_loss": 0.42780932784080505, + "eval_runtime": 29.8873, + "eval_samples_per_second": 103.857, + "eval_steps_per_second": 6.491, + "step": 2750 + }, + { + "epoch": 1.79, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2346, + "step": 2775 + }, + { + "epoch": 1.81, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3316, + "step": 2800 + }, + { + "epoch": 1.82, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2187, + "step": 2825 + }, + { + "epoch": 1.84, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2961, + "step": 2850 + }, + { + "epoch": 1.85, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2899, + "step": 2875 + }, + { + "epoch": 1.87, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3272, + "step": 2900 + }, + { + "epoch": 1.89, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2203, + "step": 2925 + }, + { + "epoch": 1.9, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.2468, + "step": 2950 + }, + { + "epoch": 1.92, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3294, + "step": 2975 + }, + { + "epoch": 1.93, + "learning_rate": 2.7760966587869903e-05, + "loss": 0.3101, + "step": 3000 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8695231958762887, + "eval_loss": 0.4797918200492859, + "eval_runtime": 29.9807, + "eval_samples_per_second": 103.533, + "eval_steps_per_second": 6.471, + "step": 3000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 250, + "total_flos": 6314309182851072.0, + "trial_name": null, + "trial_params": { + "learning_rate": 2.7760966587869903e-05, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 8 + } +} diff --git a/run-3/checkpoint-3000/training_args.bin b/run-3/checkpoint-3000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..50cc4ec23d371b30ae6512db04b9c655f9dcecd3 --- /dev/null +++ b/run-3/checkpoint-3000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2175af5e4c44e0db4ee2b9299c68887232a3ab86bd73b88fdec63aaf1669da81 +size 4728 diff --git a/run-4/checkpoint-2500/config.json b/run-4/checkpoint-2500/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-4/checkpoint-2500/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-4/checkpoint-2500/model.safetensors b/run-4/checkpoint-2500/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..764a3c76b17d0ffea12ca0c623fedbf064048988 --- /dev/null +++ b/run-4/checkpoint-2500/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:38e2b4a9a173b8acab929cb2ea204720af2cf0b255f90e55be522fb34c041a5e +size 433279996 diff --git a/run-4/checkpoint-2500/optimizer.pt b/run-4/checkpoint-2500/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..7adcddbc1f5987df5fd46aeddcaee990244558ef --- /dev/null +++ b/run-4/checkpoint-2500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:545f26d60a5ff182494efe05a78b6cf5421600caa72c9185beb786836356493b +size 866681082 diff --git a/run-4/checkpoint-2500/rng_state.pth b/run-4/checkpoint-2500/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..b68d4eaf43291f178fb309f1adb0a7b459dd867c --- /dev/null +++ b/run-4/checkpoint-2500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e254f06883fec1e30ea9be59e97a84e2814064af09a93a2e0e9f4655ea082cd +size 14244 diff --git a/run-4/checkpoint-2500/scheduler.pt b/run-4/checkpoint-2500/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..9bc70f9430d850a7bb7555debaa663376c20362c --- /dev/null +++ b/run-4/checkpoint-2500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3aa13ef7864fffc27c66f8187bba19305ec4a345e5fb010f3e70efbb9f481b37 +size 1064 diff --git a/run-4/checkpoint-2500/trainer_state.json b/run-4/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0f1d6e9979f2385d7d70e25b9c727d88e07f9fd1 --- /dev/null +++ b/run-4/checkpoint-2500/trainer_state.json @@ -0,0 +1,714 @@ +{ + "best_metric": 0.8788659793814433, + "best_model_checkpoint": "bert_trainer/run-4/checkpoint-2000", + "epoch": 3.2216494845360826, + "eval_steps": 250, + "global_step": 2500, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 3.6540885491028537e-06, + "loss": 1.4368, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 7.308177098205707e-06, + "loss": 1.1679, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 7.308177098205707e-06, + "loss": 1.0475, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.9295, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.8447, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.7885, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 7.308177098205707e-06, + "loss": 0.7324, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6723, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6116, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6183, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8028350515463918, + "eval_loss": 0.5710608959197998, + "eval_runtime": 70.1794, + "eval_samples_per_second": 44.229, + "eval_steps_per_second": 2.764, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5932, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5536, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6114, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6167, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.558, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5465, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.538, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5061, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5338, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4463, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8350515463917526, + "eval_loss": 0.46032479405403137, + "eval_runtime": 70.1578, + "eval_samples_per_second": 44.243, + "eval_steps_per_second": 2.765, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 7.308177098205707e-06, + "loss": 0.537, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4766, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.425, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4592, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4481, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4451, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4429, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4401, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3966, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3764, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8547036082474226, + "eval_loss": 0.4088385999202728, + "eval_runtime": 70.1255, + "eval_samples_per_second": 44.263, + "eval_steps_per_second": 2.766, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4036, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.351, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3393, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3148, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3454, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3262, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3758, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3801, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3554, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3555, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8692010309278351, + "eval_loss": 0.3840981423854828, + "eval_runtime": 70.1528, + "eval_samples_per_second": 44.246, + "eval_steps_per_second": 2.765, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3394, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3371, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3528, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2884, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2866, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2951, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.325, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3478, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3645, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3301, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8521262886597938, + "eval_loss": 0.4127959907054901, + "eval_runtime": 70.9551, + "eval_samples_per_second": 43.746, + "eval_steps_per_second": 2.734, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4149, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3465, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2909, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3678, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2809, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.346, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3013, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2969, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2765, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2965, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8717783505154639, + "eval_loss": 0.3640108108520508, + "eval_runtime": 70.1759, + "eval_samples_per_second": 44.232, + "eval_steps_per_second": 2.764, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2653, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3222, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2863, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2854, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2044, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.255, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2318, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2424, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2679, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.213, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8772551546391752, + "eval_loss": 0.41377973556518555, + "eval_runtime": 70.1634, + "eval_samples_per_second": 44.24, + "eval_steps_per_second": 2.765, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2542, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2385, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1808, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 7.308177098205707e-06, + "loss": 0.214, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1793, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2128, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2436, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2224, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1998, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1944, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8788659793814433, + "eval_loss": 0.3984367251396179, + "eval_runtime": 70.1229, + "eval_samples_per_second": 44.265, + "eval_steps_per_second": 2.767, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2178, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2343, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2365, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1938, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2154, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2159, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2322, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2187, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2133, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3084, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8663015463917526, + "eval_loss": 0.41974076628685, + "eval_runtime": 70.1419, + "eval_samples_per_second": 44.253, + "eval_steps_per_second": 2.766, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2541, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1746, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2357, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.0945, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1552, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1606, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1474, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1521, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1468, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1137, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8788659793814433, + "eval_loss": 0.4812679588794708, + "eval_runtime": 70.1728, + "eval_samples_per_second": 44.234, + "eval_steps_per_second": 2.765, + "step": 2500 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.051683215428608e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 7.308177098205707e-06, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 16 + } +} diff --git a/run-4/checkpoint-2500/training_args.bin b/run-4/checkpoint-2500/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..6c7cb475dec463c51866e7796afcdd113cd2e8b9 --- /dev/null +++ b/run-4/checkpoint-2500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:866e09946e4ff26c3eb6ee3eebf4634a20a78365e95d2455b97ebf938806bdf9 +size 4728 diff --git a/run-4/checkpoint-2750/config.json b/run-4/checkpoint-2750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-4/checkpoint-2750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-4/checkpoint-2750/model.safetensors b/run-4/checkpoint-2750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e899289721183f787e33d8bc8a0e06d748d44932 --- /dev/null +++ b/run-4/checkpoint-2750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:486ca5c0c52964413206c1ba7362fa5fe2c9671505111fec7d6747031b5ebabd +size 433279996 diff --git a/run-4/checkpoint-2750/optimizer.pt b/run-4/checkpoint-2750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..abc3600fa1b368b672b59c0059f326c7c38b8931 --- /dev/null +++ b/run-4/checkpoint-2750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3a91fa5a2133d9a8de8ac1ea0fc5aafc6ffbd52ee2406d901de1c93557543f90 +size 866681082 diff --git a/run-4/checkpoint-2750/rng_state.pth b/run-4/checkpoint-2750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..eccfea317f0c1eb50423f8ebdfd26baba83a270c --- /dev/null +++ b/run-4/checkpoint-2750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2f146112a2b6651d5740f314c7a7760a6b10b307030d3ca8f929af57ce20006 +size 14244 diff --git a/run-4/checkpoint-2750/scheduler.pt b/run-4/checkpoint-2750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..d3dfafe392e19cbef22ac0c0b38a610057603ecf --- /dev/null +++ b/run-4/checkpoint-2750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:22eba7af503e4ee52d91910c6a53cc8801228b83199f3004c41b5caee2b570b7 +size 1064 diff --git a/run-4/checkpoint-2750/trainer_state.json b/run-4/checkpoint-2750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..07ffbc7ebf99c1425a8c3c746b4605e548323dc2 --- /dev/null +++ b/run-4/checkpoint-2750/trainer_state.json @@ -0,0 +1,783 @@ +{ + "best_metric": 0.8788659793814433, + "best_model_checkpoint": "bert_trainer/run-4/checkpoint-2000", + "epoch": 3.5438144329896906, + "eval_steps": 250, + "global_step": 2750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 3.6540885491028537e-06, + "loss": 1.4368, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 7.308177098205707e-06, + "loss": 1.1679, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 7.308177098205707e-06, + "loss": 1.0475, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.9295, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.8447, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.7885, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 7.308177098205707e-06, + "loss": 0.7324, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6723, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6116, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6183, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8028350515463918, + "eval_loss": 0.5710608959197998, + "eval_runtime": 70.1794, + "eval_samples_per_second": 44.229, + "eval_steps_per_second": 2.764, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5932, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5536, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6114, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6167, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.558, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5465, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.538, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5061, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5338, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4463, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8350515463917526, + "eval_loss": 0.46032479405403137, + "eval_runtime": 70.1578, + "eval_samples_per_second": 44.243, + "eval_steps_per_second": 2.765, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 7.308177098205707e-06, + "loss": 0.537, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4766, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.425, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4592, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4481, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4451, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4429, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4401, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3966, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3764, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8547036082474226, + "eval_loss": 0.4088385999202728, + "eval_runtime": 70.1255, + "eval_samples_per_second": 44.263, + "eval_steps_per_second": 2.766, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4036, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.351, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3393, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3148, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3454, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3262, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3758, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3801, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3554, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3555, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8692010309278351, + "eval_loss": 0.3840981423854828, + "eval_runtime": 70.1528, + "eval_samples_per_second": 44.246, + "eval_steps_per_second": 2.765, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3394, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3371, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3528, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2884, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2866, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2951, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.325, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3478, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3645, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3301, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8521262886597938, + "eval_loss": 0.4127959907054901, + "eval_runtime": 70.9551, + "eval_samples_per_second": 43.746, + "eval_steps_per_second": 2.734, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4149, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3465, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2909, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3678, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2809, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.346, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3013, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2969, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2765, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2965, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8717783505154639, + "eval_loss": 0.3640108108520508, + "eval_runtime": 70.1759, + "eval_samples_per_second": 44.232, + "eval_steps_per_second": 2.764, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2653, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3222, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2863, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2854, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2044, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.255, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2318, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2424, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2679, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.213, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8772551546391752, + "eval_loss": 0.41377973556518555, + "eval_runtime": 70.1634, + "eval_samples_per_second": 44.24, + "eval_steps_per_second": 2.765, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2542, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2385, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1808, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 7.308177098205707e-06, + "loss": 0.214, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1793, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2128, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2436, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2224, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1998, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1944, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8788659793814433, + "eval_loss": 0.3984367251396179, + "eval_runtime": 70.1229, + "eval_samples_per_second": 44.265, + "eval_steps_per_second": 2.767, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2178, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2343, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2365, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1938, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2154, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2159, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2322, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2187, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2133, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3084, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8663015463917526, + "eval_loss": 0.41974076628685, + "eval_runtime": 70.1419, + "eval_samples_per_second": 44.253, + "eval_steps_per_second": 2.766, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2541, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1746, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2357, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.0945, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1552, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1606, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1474, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1521, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1468, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1137, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8788659793814433, + "eval_loss": 0.4812679588794708, + "eval_runtime": 70.1728, + "eval_samples_per_second": 44.234, + "eval_steps_per_second": 2.765, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1419, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1269, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1658, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1867, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1526, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1581, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1578, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1197, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1238, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1939, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8624355670103093, + "eval_loss": 0.5447501540184021, + "eval_runtime": 70.1531, + "eval_samples_per_second": 44.246, + "eval_steps_per_second": 2.765, + "step": 2750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.156930472414208e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 7.308177098205707e-06, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 16 + } +} diff --git a/run-4/checkpoint-2750/training_args.bin b/run-4/checkpoint-2750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..6c7cb475dec463c51866e7796afcdd113cd2e8b9 --- /dev/null +++ b/run-4/checkpoint-2750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:866e09946e4ff26c3eb6ee3eebf4634a20a78365e95d2455b97ebf938806bdf9 +size 4728 diff --git a/run-4/checkpoint-3000/config.json b/run-4/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-4/checkpoint-3000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-4/checkpoint-3000/model.safetensors b/run-4/checkpoint-3000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..30e6b20d1ae88d09befe62bb58cdb97a3b36e7e2 --- /dev/null +++ b/run-4/checkpoint-3000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6c21d389222553424951b7378043b4432e37b02ab80729327bfc65b032789334 +size 433279996 diff --git a/run-4/checkpoint-3000/optimizer.pt b/run-4/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..d4bc172c85daf720ef051a6b7486e12d3ca9720f --- /dev/null +++ b/run-4/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a104b92a9e5b64cb1e9ece8a7a20b08272a5cc3a3076ebda7e19b92b5c8aa6bf +size 866681082 diff --git a/run-4/checkpoint-3000/rng_state.pth b/run-4/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..134d7b84b2bcb7c8af8198d9d691b9391bfa81d0 --- /dev/null +++ b/run-4/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5475dcc749e5bb84d23e503506ffb30e2c214153e88098ffa2eba5466de55a64 +size 14244 diff --git a/run-4/checkpoint-3000/scheduler.pt b/run-4/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..969b98116995fe54b9fbf54a1be122c61a91281b --- /dev/null +++ b/run-4/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1d1a53eb60f72a811e542c634ff3778420f241e816a8829f657b152fb1c35264 +size 1064 diff --git a/run-4/checkpoint-3000/trainer_state.json b/run-4/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6723a6c35cb882a4869c8253d5ac759f6cae82d6 --- /dev/null +++ b/run-4/checkpoint-3000/trainer_state.json @@ -0,0 +1,852 @@ +{ + "best_metric": 0.8830541237113402, + "best_model_checkpoint": "bert_trainer/run-4/checkpoint-3000", + "epoch": 3.865979381443299, + "eval_steps": 250, + "global_step": 3000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 3.6540885491028537e-06, + "loss": 1.4368, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 7.308177098205707e-06, + "loss": 1.1679, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 7.308177098205707e-06, + "loss": 1.0475, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.9295, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.8447, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.7885, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 7.308177098205707e-06, + "loss": 0.7324, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6723, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6116, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6183, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.8028350515463918, + "eval_loss": 0.5710608959197998, + "eval_runtime": 70.1794, + "eval_samples_per_second": 44.229, + "eval_steps_per_second": 2.764, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5932, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5536, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6114, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.6167, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.558, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5465, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.538, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5061, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.5338, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4463, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8350515463917526, + "eval_loss": 0.46032479405403137, + "eval_runtime": 70.1578, + "eval_samples_per_second": 44.243, + "eval_steps_per_second": 2.765, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 7.308177098205707e-06, + "loss": 0.537, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4766, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.425, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4592, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4481, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4451, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4429, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4401, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3966, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3764, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8547036082474226, + "eval_loss": 0.4088385999202728, + "eval_runtime": 70.1255, + "eval_samples_per_second": 44.263, + "eval_steps_per_second": 2.766, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4036, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.351, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3393, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3148, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3454, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3262, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3758, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3801, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3554, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3555, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8692010309278351, + "eval_loss": 0.3840981423854828, + "eval_runtime": 70.1528, + "eval_samples_per_second": 44.246, + "eval_steps_per_second": 2.765, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3394, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3371, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3528, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2884, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2866, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2951, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.325, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3478, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3645, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3301, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8521262886597938, + "eval_loss": 0.4127959907054901, + "eval_runtime": 70.9551, + "eval_samples_per_second": 43.746, + "eval_steps_per_second": 2.734, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.4149, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3465, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2909, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3678, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2809, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.346, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3013, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2969, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2765, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2965, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8717783505154639, + "eval_loss": 0.3640108108520508, + "eval_runtime": 70.1759, + "eval_samples_per_second": 44.232, + "eval_steps_per_second": 2.764, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2653, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3222, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2863, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2854, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2044, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 7.308177098205707e-06, + "loss": 0.255, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2318, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2424, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2679, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 7.308177098205707e-06, + "loss": 0.213, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8772551546391752, + "eval_loss": 0.41377973556518555, + "eval_runtime": 70.1634, + "eval_samples_per_second": 44.24, + "eval_steps_per_second": 2.765, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2542, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2385, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1808, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 7.308177098205707e-06, + "loss": 0.214, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1793, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2128, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2436, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2224, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1998, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1944, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8788659793814433, + "eval_loss": 0.3984367251396179, + "eval_runtime": 70.1229, + "eval_samples_per_second": 44.265, + "eval_steps_per_second": 2.767, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2178, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2343, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2365, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1938, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2154, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2159, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2322, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2187, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2133, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 7.308177098205707e-06, + "loss": 0.3084, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8663015463917526, + "eval_loss": 0.41974076628685, + "eval_runtime": 70.1419, + "eval_samples_per_second": 44.253, + "eval_steps_per_second": 2.766, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2541, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1746, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2357, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 7.308177098205707e-06, + "loss": 0.0945, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1552, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1606, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1474, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1521, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1468, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1137, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8788659793814433, + "eval_loss": 0.4812679588794708, + "eval_runtime": 70.1728, + "eval_samples_per_second": 44.234, + "eval_steps_per_second": 2.765, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1419, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1269, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1658, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1867, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1526, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1581, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1578, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1197, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1238, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1939, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8624355670103093, + "eval_loss": 0.5447501540184021, + "eval_runtime": 70.1531, + "eval_samples_per_second": 44.246, + "eval_steps_per_second": 2.765, + "step": 2750 + }, + { + "epoch": 3.58, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1061, + "step": 2775 + }, + { + "epoch": 3.61, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1304, + "step": 2800 + }, + { + "epoch": 3.64, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1149, + "step": 2825 + }, + { + "epoch": 3.67, + "learning_rate": 7.308177098205707e-06, + "loss": 0.2885, + "step": 2850 + }, + { + "epoch": 3.7, + "learning_rate": 7.308177098205707e-06, + "loss": 0.0996, + "step": 2875 + }, + { + "epoch": 3.74, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1914, + "step": 2900 + }, + { + "epoch": 3.77, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1325, + "step": 2925 + }, + { + "epoch": 3.8, + "learning_rate": 7.308177098205707e-06, + "loss": 0.115, + "step": 2950 + }, + { + "epoch": 3.83, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1132, + "step": 2975 + }, + { + "epoch": 3.87, + "learning_rate": 7.308177098205707e-06, + "loss": 0.1746, + "step": 3000 + }, + { + "epoch": 3.87, + "eval_accuracy": 0.8830541237113402, + "eval_loss": 0.5246909856796265, + "eval_runtime": 70.1829, + "eval_samples_per_second": 44.227, + "eval_steps_per_second": 2.764, + "step": 3000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.262177729399808e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 7.308177098205707e-06, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 16 + } +} diff --git a/run-4/checkpoint-3000/training_args.bin b/run-4/checkpoint-3000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..6c7cb475dec463c51866e7796afcdd113cd2e8b9 --- /dev/null +++ b/run-4/checkpoint-3000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:866e09946e4ff26c3eb6ee3eebf4634a20a78365e95d2455b97ebf938806bdf9 +size 4728 diff --git a/run-5/checkpoint-1000/config.json b/run-5/checkpoint-1000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-5/checkpoint-1000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-5/checkpoint-1000/model.safetensors b/run-5/checkpoint-1000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7ade02a7f503efe01f3885e22e55af5b01d0ce97 --- /dev/null +++ b/run-5/checkpoint-1000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:469d9d7e0084db7398eba3dacd3f166f7f8e71c57b73cb964a58ee2688b73037 +size 433279996 diff --git a/run-5/checkpoint-1000/optimizer.pt b/run-5/checkpoint-1000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..0a24a594dc0ccfc9351c7718405853e9f762d5e6 --- /dev/null +++ b/run-5/checkpoint-1000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:68d10ba89e115ecac8b0d07a5467069a7c72e5e4cac8c8ec5f18dab8c19c2047 +size 866681082 diff --git a/run-5/checkpoint-1000/rng_state.pth b/run-5/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..45858f484cdbd5c8a3b0751391a982be12a141a2 --- /dev/null +++ b/run-5/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3f127fb2222d61995ad048f04448774ec877fc92b6c22fe18f0a1e0d3e5e9d66 +size 14244 diff --git a/run-5/checkpoint-1000/scheduler.pt b/run-5/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..f6d53b17c9894e340ee6980d64f5c494464af7e7 --- /dev/null +++ b/run-5/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0b42b5358e79bac2e4f3421f572886fd62aeabc2b0997925b0793c7cd8f8ab88 +size 1064 diff --git a/run-5/checkpoint-1000/trainer_state.json b/run-5/checkpoint-1000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..384d4276692a107a83b078a8861fd59896f7b0e6 --- /dev/null +++ b/run-5/checkpoint-1000/trainer_state.json @@ -0,0 +1,300 @@ +{ + "best_metric": 0.8701675257731959, + "best_model_checkpoint": "bert_trainer/run-5/checkpoint-1000", + "epoch": 1.2886597938144329, + "eval_steps": 250, + "global_step": 1000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 2.467798096290063e-05, + "loss": 1.272, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 4.935596192580126e-05, + "loss": 0.8731, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 4.935596192580126e-05, + "loss": 0.7963, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 4.935596192580126e-05, + "loss": 0.7036, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 4.935596192580126e-05, + "loss": 0.6194, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 4.935596192580126e-05, + "loss": 0.6329, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5739, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5285, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5168, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4854, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.821520618556701, + "eval_loss": 0.4599289894104004, + "eval_runtime": 58.688, + "eval_samples_per_second": 52.89, + "eval_steps_per_second": 13.222, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4925, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4808, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5584, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5209, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4384, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4718, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4559, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4387, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4696, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3684, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8563144329896907, + "eval_loss": 0.4029282331466675, + "eval_runtime": 58.7278, + "eval_samples_per_second": 52.854, + "eval_steps_per_second": 13.214, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4881, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4714, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3966, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3674, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4573, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4286, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4245, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 4.935596192580126e-05, + "loss": 0.449, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4077, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3337, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8653350515463918, + "eval_loss": 0.38506096601486206, + "eval_runtime": 61.6758, + "eval_samples_per_second": 50.328, + "eval_steps_per_second": 12.582, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3939, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3132, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2318, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2247, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3177, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2383, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 4.935596192580126e-05, + "loss": 0.264, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2581, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2401, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3105, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8701675257731959, + "eval_loss": 0.4053144156932831, + "eval_runtime": 29.7918, + "eval_samples_per_second": 104.19, + "eval_steps_per_second": 26.047, + "step": 1000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 4207259097999360.0, + "trial_name": null, + "trial_params": { + "learning_rate": 4.935596192580126e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-5/checkpoint-1000/training_args.bin b/run-5/checkpoint-1000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..8c0bea560e0ecbe2e0ce61eade6c983ffb635abd --- /dev/null +++ b/run-5/checkpoint-1000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd3e53a63a07d35b153ee5aa4f711ac963c5d7f1200ab355158bc4f46fde13a2 +size 4728 diff --git a/run-5/checkpoint-1250/config.json b/run-5/checkpoint-1250/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-5/checkpoint-1250/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-5/checkpoint-1250/model.safetensors b/run-5/checkpoint-1250/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6a5de2c2c14801cae8654da2aa2358a72df67246 --- /dev/null +++ b/run-5/checkpoint-1250/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:17e888c37dcce0a7c69cc995922daebe7a6e90ffc9c6f465e4c461d7de9437fa +size 433279996 diff --git a/run-5/checkpoint-1250/optimizer.pt b/run-5/checkpoint-1250/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..9c98dd85f12ba29682c62bd91cf9cea9cf8fe096 --- /dev/null +++ b/run-5/checkpoint-1250/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:59c7fb910d6356b0734921d203f1f3aca5a2f2c1fa0dd1570ca034b745955204 +size 866681082 diff --git a/run-5/checkpoint-1250/rng_state.pth b/run-5/checkpoint-1250/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..3bb44747e763c2dcc401f44214da0576e4e803e4 --- /dev/null +++ b/run-5/checkpoint-1250/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7574999ed41e46ff3f6ab95ff2dff5798096013a38c58ca815181da639e6399c +size 14244 diff --git a/run-5/checkpoint-1250/scheduler.pt b/run-5/checkpoint-1250/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cb419694d665e2f671d104f48c4261b32ba50070 --- /dev/null +++ b/run-5/checkpoint-1250/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4d54350316be87d12d65b9d4c64ff7b6c9cc504b19f56b223d0afb962580b80c +size 1064 diff --git a/run-5/checkpoint-1250/trainer_state.json b/run-5/checkpoint-1250/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7ad87b650d4078a1e3597ca68056bcb35a7b8e9f --- /dev/null +++ b/run-5/checkpoint-1250/trainer_state.json @@ -0,0 +1,369 @@ +{ + "best_metric": 0.8701675257731959, + "best_model_checkpoint": "bert_trainer/run-5/checkpoint-1000", + "epoch": 1.6108247422680413, + "eval_steps": 250, + "global_step": 1250, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 2.467798096290063e-05, + "loss": 1.272, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 4.935596192580126e-05, + "loss": 0.8731, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 4.935596192580126e-05, + "loss": 0.7963, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 4.935596192580126e-05, + "loss": 0.7036, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 4.935596192580126e-05, + "loss": 0.6194, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 4.935596192580126e-05, + "loss": 0.6329, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5739, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5285, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5168, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4854, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.821520618556701, + "eval_loss": 0.4599289894104004, + "eval_runtime": 58.688, + "eval_samples_per_second": 52.89, + "eval_steps_per_second": 13.222, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4925, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4808, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5584, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5209, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4384, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4718, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4559, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4387, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4696, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3684, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8563144329896907, + "eval_loss": 0.4029282331466675, + "eval_runtime": 58.7278, + "eval_samples_per_second": 52.854, + "eval_steps_per_second": 13.214, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4881, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4714, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3966, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3674, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4573, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4286, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4245, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 4.935596192580126e-05, + "loss": 0.449, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4077, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3337, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8653350515463918, + "eval_loss": 0.38506096601486206, + "eval_runtime": 61.6758, + "eval_samples_per_second": 50.328, + "eval_steps_per_second": 12.582, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3939, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3132, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2318, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2247, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3177, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2383, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 4.935596192580126e-05, + "loss": 0.264, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2581, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2401, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3105, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8701675257731959, + "eval_loss": 0.4053144156932831, + "eval_runtime": 29.7918, + "eval_samples_per_second": 104.19, + "eval_steps_per_second": 26.047, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 4.935596192580126e-05, + "loss": 0.267, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2586, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2878, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2126, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2285, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2599, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2691, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2536, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2712, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 4.935596192580126e-05, + "loss": 0.2093, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8427835051546392, + "eval_loss": 0.4850337505340576, + "eval_runtime": 29.7884, + "eval_samples_per_second": 104.202, + "eval_steps_per_second": 26.05, + "step": 1250 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 5259731667855360.0, + "trial_name": null, + "trial_params": { + "learning_rate": 4.935596192580126e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-5/checkpoint-1250/training_args.bin b/run-5/checkpoint-1250/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..8c0bea560e0ecbe2e0ce61eade6c983ffb635abd --- /dev/null +++ b/run-5/checkpoint-1250/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd3e53a63a07d35b153ee5aa4f711ac963c5d7f1200ab355158bc4f46fde13a2 +size 4728 diff --git a/run-5/checkpoint-750/config.json b/run-5/checkpoint-750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-5/checkpoint-750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-5/checkpoint-750/model.safetensors b/run-5/checkpoint-750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..00c8c55e6afff41ae1698a0bb3817351a8e97814 --- /dev/null +++ b/run-5/checkpoint-750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:30a670a2662b0f3604ed2cdb9ae2df14abe44a59d567d23dd388ba6319780b42 +size 433279996 diff --git a/run-5/checkpoint-750/optimizer.pt b/run-5/checkpoint-750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..cf740e85a4a4089515954532f438c36cbfedcdf4 --- /dev/null +++ b/run-5/checkpoint-750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:48660ab89cc1dea1ab3d1a5771920a6fa536265fbd831ea59cdd80d97f56fbe2 +size 866681082 diff --git a/run-5/checkpoint-750/rng_state.pth b/run-5/checkpoint-750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..6407065aa4db83f99f5a45763c8e9df6113317dc --- /dev/null +++ b/run-5/checkpoint-750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:313bcb5b7ecc55139fd93d2a4ca526db70984f77ae2f25de8ef8161d3c44ab0a +size 14244 diff --git a/run-5/checkpoint-750/scheduler.pt b/run-5/checkpoint-750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..778c7a5738b4abf10125b5aeb8f1d9c4772492f4 --- /dev/null +++ b/run-5/checkpoint-750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:58f6c584236f9863ac0de5373e8e0869d7ad3a7ba953a14d8392d38517f41389 +size 1064 diff --git a/run-5/checkpoint-750/trainer_state.json b/run-5/checkpoint-750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aba08aba2e2ebd269a77355d84c47aeb29e79f63 --- /dev/null +++ b/run-5/checkpoint-750/trainer_state.json @@ -0,0 +1,231 @@ +{ + "best_metric": 0.8653350515463918, + "best_model_checkpoint": "bert_trainer/run-5/checkpoint-750", + "epoch": 0.9664948453608248, + "eval_steps": 250, + "global_step": 750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 2.467798096290063e-05, + "loss": 1.272, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 4.935596192580126e-05, + "loss": 0.8731, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 4.935596192580126e-05, + "loss": 0.7963, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 4.935596192580126e-05, + "loss": 0.7036, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 4.935596192580126e-05, + "loss": 0.6194, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 4.935596192580126e-05, + "loss": 0.6329, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5739, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5285, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5168, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4854, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.821520618556701, + "eval_loss": 0.4599289894104004, + "eval_runtime": 58.688, + "eval_samples_per_second": 52.89, + "eval_steps_per_second": 13.222, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4925, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4808, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5584, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 4.935596192580126e-05, + "loss": 0.5209, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4384, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4718, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4559, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4387, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4696, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3684, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.8563144329896907, + "eval_loss": 0.4029282331466675, + "eval_runtime": 58.7278, + "eval_samples_per_second": 52.854, + "eval_steps_per_second": 13.214, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4881, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4714, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3966, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3674, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4573, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4286, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4245, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 4.935596192580126e-05, + "loss": 0.449, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 4.935596192580126e-05, + "loss": 0.4077, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 4.935596192580126e-05, + "loss": 0.3337, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.8653350515463918, + "eval_loss": 0.38506096601486206, + "eval_runtime": 61.6758, + "eval_samples_per_second": 50.328, + "eval_steps_per_second": 12.582, + "step": 750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 3157417709568000.0, + "trial_name": null, + "trial_params": { + "learning_rate": 4.935596192580126e-05, + "per_device_eval_batch_size": 4, + "per_device_train_batch_size": 16 + } +} diff --git a/run-5/checkpoint-750/training_args.bin b/run-5/checkpoint-750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..8c0bea560e0ecbe2e0ce61eade6c983ffb635abd --- /dev/null +++ b/run-5/checkpoint-750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd3e53a63a07d35b153ee5aa4f711ac963c5d7f1200ab355158bc4f46fde13a2 +size 4728 diff --git a/run-6/checkpoint-2500/config.json b/run-6/checkpoint-2500/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-6/checkpoint-2500/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-6/checkpoint-2500/model.safetensors b/run-6/checkpoint-2500/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..accb6d03c4d3cef1ba5a4dd5395877b3c2ef7dd6 --- /dev/null +++ b/run-6/checkpoint-2500/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:386c0ee3a33be4c3207118b31663fb490c5dde725ae1eecc9129ccdc761dc364 +size 433279996 diff --git a/run-6/checkpoint-2500/optimizer.pt b/run-6/checkpoint-2500/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..8e064d4b966dbba2185c703a158030c1b58d8ccc --- /dev/null +++ b/run-6/checkpoint-2500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8136063276e926d813f88666638eb94f312fca88c2aac4e3860e2ea4e96c6b82 +size 866681082 diff --git a/run-6/checkpoint-2500/rng_state.pth b/run-6/checkpoint-2500/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..b68d4eaf43291f178fb309f1adb0a7b459dd867c --- /dev/null +++ b/run-6/checkpoint-2500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e254f06883fec1e30ea9be59e97a84e2814064af09a93a2e0e9f4655ea082cd +size 14244 diff --git a/run-6/checkpoint-2500/scheduler.pt b/run-6/checkpoint-2500/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..3e82d9742c1f67b44f780251a8414729b2e74028 --- /dev/null +++ b/run-6/checkpoint-2500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:eb748be919948975ed25907f83de9335eb0ccfb462db0e334f6124c2b473bfdd +size 1064 diff --git a/run-6/checkpoint-2500/trainer_state.json b/run-6/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..12906e4365a24c517bec62fd5a77daa3a76837c2 --- /dev/null +++ b/run-6/checkpoint-2500/trainer_state.json @@ -0,0 +1,714 @@ +{ + "best_metric": 0.8353737113402062, + "best_model_checkpoint": "bert_trainer/run-6/checkpoint-2500", + "epoch": 3.2216494845360826, + "eval_steps": 250, + "global_step": 2500, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 5.985683583902487e-07, + "loss": 1.498, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.4082, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.2917, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.2083, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.1513, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.1182, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0869, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0574, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9843, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0196, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.6401417525773195, + "eval_loss": 0.9714874029159546, + "eval_runtime": 53.062, + "eval_samples_per_second": 58.498, + "eval_steps_per_second": 3.656, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9886, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9861, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9746, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9386, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9046, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9213, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.892, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8545, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.87, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8463, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.6978092783505154, + "eval_loss": 0.810293436050415, + "eval_runtime": 53.0534, + "eval_samples_per_second": 58.507, + "eval_steps_per_second": 3.657, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8516, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8086, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7894, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7754, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7558, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7155, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7151, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.758, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6958, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.68, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.7503221649484536, + "eval_loss": 0.6983952522277832, + "eval_runtime": 57.8438, + "eval_samples_per_second": 53.662, + "eval_steps_per_second": 3.354, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6553, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6829, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7116, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6283, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6559, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6118, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6675, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6426, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6344, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6754, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.7970360824742269, + "eval_loss": 0.6213943362236023, + "eval_runtime": 57.838, + "eval_samples_per_second": 53.667, + "eval_steps_per_second": 3.354, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6535, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.64, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6442, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5873, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.587, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5789, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.605, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6078, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6431, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5824, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.803479381443299, + "eval_loss": 0.5681772232055664, + "eval_runtime": 57.809, + "eval_samples_per_second": 53.694, + "eval_steps_per_second": 3.356, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.648, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5709, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5504, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5699, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5575, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5644, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.587, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5094, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5724, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5652, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8128221649484536, + "eval_loss": 0.5369997024536133, + "eval_runtime": 57.8152, + "eval_samples_per_second": 53.688, + "eval_steps_per_second": 3.356, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5197, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5499, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.58, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5348, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4741, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5582, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5219, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4802, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5147, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4912, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8234536082474226, + "eval_loss": 0.5059388279914856, + "eval_runtime": 57.8239, + "eval_samples_per_second": 53.68, + "eval_steps_per_second": 3.355, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5133, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4629, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4696, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4623, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4649, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5314, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4974, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.464, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5332, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4694, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8286082474226805, + "eval_loss": 0.48415493965148926, + "eval_runtime": 57.8531, + "eval_samples_per_second": 53.653, + "eval_steps_per_second": 3.353, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5191, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4969, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4499, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5144, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.482, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4193, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4928, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4515, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4775, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5456, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.833118556701031, + "eval_loss": 0.4647773802280426, + "eval_runtime": 57.8252, + "eval_samples_per_second": 53.679, + "eval_steps_per_second": 3.355, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5226, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4159, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4486, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3866, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4634, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4179, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4446, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4606, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4261, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3907, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8353737113402062, + "eval_loss": 0.45589184761047363, + "eval_runtime": 57.8334, + "eval_samples_per_second": 53.671, + "eval_steps_per_second": 3.354, + "step": 2500 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.051683215428608e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 1.1971367167804974e-06, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 16 + } +} diff --git a/run-6/checkpoint-2500/training_args.bin b/run-6/checkpoint-2500/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..fb68c4d48e2b11b9c1da4d8eda6ee91004244ec7 --- /dev/null +++ b/run-6/checkpoint-2500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04a33255eeb366639c63b8cb3420b4a0657a70d449a809b3f07061def559312b +size 4728 diff --git a/run-6/checkpoint-2750/config.json b/run-6/checkpoint-2750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-6/checkpoint-2750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-6/checkpoint-2750/model.safetensors b/run-6/checkpoint-2750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..45157545903a0060e30153929d2781dda15a3adb --- /dev/null +++ b/run-6/checkpoint-2750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11baed352187d9b2cc06893e83e1e10a8177e636488900626143359548936a66 +size 433279996 diff --git a/run-6/checkpoint-2750/optimizer.pt b/run-6/checkpoint-2750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..c5fa823b28e4915d9f797d71e5a437c68bfc51f3 --- /dev/null +++ b/run-6/checkpoint-2750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3588b421761e3f3cbe03fc46841f87bc2094d3cbf4c740c11195fe29a3cb99eb +size 866681082 diff --git a/run-6/checkpoint-2750/rng_state.pth b/run-6/checkpoint-2750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..eccfea317f0c1eb50423f8ebdfd26baba83a270c --- /dev/null +++ b/run-6/checkpoint-2750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2f146112a2b6651d5740f314c7a7760a6b10b307030d3ca8f929af57ce20006 +size 14244 diff --git a/run-6/checkpoint-2750/scheduler.pt b/run-6/checkpoint-2750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..4b02ecc615c41e3fdb185bbdf403961fac2c5bca --- /dev/null +++ b/run-6/checkpoint-2750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a4e3e33a7532894bf764d3712f50f39409ac119fe6cbb287875a78200f1486c1 +size 1064 diff --git a/run-6/checkpoint-2750/trainer_state.json b/run-6/checkpoint-2750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8278e5a63559fc88e409176e0b1177a9b9d283a9 --- /dev/null +++ b/run-6/checkpoint-2750/trainer_state.json @@ -0,0 +1,783 @@ +{ + "best_metric": 0.8472938144329897, + "best_model_checkpoint": "bert_trainer/run-6/checkpoint-2750", + "epoch": 3.5438144329896906, + "eval_steps": 250, + "global_step": 2750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 5.985683583902487e-07, + "loss": 1.498, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.4082, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.2917, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.2083, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.1513, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.1182, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0869, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0574, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9843, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0196, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.6401417525773195, + "eval_loss": 0.9714874029159546, + "eval_runtime": 53.062, + "eval_samples_per_second": 58.498, + "eval_steps_per_second": 3.656, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9886, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9861, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9746, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9386, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9046, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9213, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.892, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8545, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.87, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8463, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.6978092783505154, + "eval_loss": 0.810293436050415, + "eval_runtime": 53.0534, + "eval_samples_per_second": 58.507, + "eval_steps_per_second": 3.657, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8516, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8086, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7894, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7754, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7558, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7155, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7151, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.758, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6958, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.68, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.7503221649484536, + "eval_loss": 0.6983952522277832, + "eval_runtime": 57.8438, + "eval_samples_per_second": 53.662, + "eval_steps_per_second": 3.354, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6553, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6829, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7116, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6283, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6559, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6118, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6675, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6426, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6344, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6754, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.7970360824742269, + "eval_loss": 0.6213943362236023, + "eval_runtime": 57.838, + "eval_samples_per_second": 53.667, + "eval_steps_per_second": 3.354, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6535, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.64, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6442, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5873, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.587, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5789, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.605, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6078, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6431, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5824, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.803479381443299, + "eval_loss": 0.5681772232055664, + "eval_runtime": 57.809, + "eval_samples_per_second": 53.694, + "eval_steps_per_second": 3.356, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.648, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5709, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5504, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5699, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5575, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5644, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.587, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5094, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5724, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5652, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8128221649484536, + "eval_loss": 0.5369997024536133, + "eval_runtime": 57.8152, + "eval_samples_per_second": 53.688, + "eval_steps_per_second": 3.356, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5197, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5499, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.58, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5348, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4741, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5582, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5219, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4802, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5147, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4912, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8234536082474226, + "eval_loss": 0.5059388279914856, + "eval_runtime": 57.8239, + "eval_samples_per_second": 53.68, + "eval_steps_per_second": 3.355, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5133, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4629, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4696, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4623, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4649, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5314, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4974, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.464, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5332, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4694, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8286082474226805, + "eval_loss": 0.48415493965148926, + "eval_runtime": 57.8531, + "eval_samples_per_second": 53.653, + "eval_steps_per_second": 3.353, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5191, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4969, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4499, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5144, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.482, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4193, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4928, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4515, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4775, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5456, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.833118556701031, + "eval_loss": 0.4647773802280426, + "eval_runtime": 57.8252, + "eval_samples_per_second": 53.679, + "eval_steps_per_second": 3.355, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5226, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4159, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4486, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3866, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4634, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4179, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4446, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4606, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4261, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3907, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8353737113402062, + "eval_loss": 0.45589184761047363, + "eval_runtime": 57.8334, + "eval_samples_per_second": 53.671, + "eval_steps_per_second": 3.354, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3983, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4491, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4599, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4581, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4318, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4607, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5343, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.437, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3962, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4803, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8472938144329897, + "eval_loss": 0.43914180994033813, + "eval_runtime": 57.8467, + "eval_samples_per_second": 53.659, + "eval_steps_per_second": 3.354, + "step": 2750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.156930472414208e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 1.1971367167804974e-06, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 16 + } +} diff --git a/run-6/checkpoint-2750/training_args.bin b/run-6/checkpoint-2750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..fb68c4d48e2b11b9c1da4d8eda6ee91004244ec7 --- /dev/null +++ b/run-6/checkpoint-2750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04a33255eeb366639c63b8cb3420b4a0657a70d449a809b3f07061def559312b +size 4728 diff --git a/run-6/checkpoint-3000/config.json b/run-6/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-6/checkpoint-3000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-6/checkpoint-3000/model.safetensors b/run-6/checkpoint-3000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ffd8c01d5fab941cdbd616013853960b697e2a12 --- /dev/null +++ b/run-6/checkpoint-3000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9574990c14799882e496a412cc1ad7930b3d27a56a724d332786042f8f279990 +size 433279996 diff --git a/run-6/checkpoint-3000/optimizer.pt b/run-6/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..63946cc0fa7ab411f4eada51b3c88417ea0ad5d3 --- /dev/null +++ b/run-6/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:85a60fdadebd33b9befa0b30d21b1b3d20c4dd5ba9d5ea6787614d9eabc4ddeb +size 866681082 diff --git a/run-6/checkpoint-3000/rng_state.pth b/run-6/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..134d7b84b2bcb7c8af8198d9d691b9391bfa81d0 --- /dev/null +++ b/run-6/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5475dcc749e5bb84d23e503506ffb30e2c214153e88098ffa2eba5466de55a64 +size 14244 diff --git a/run-6/checkpoint-3000/scheduler.pt b/run-6/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..863a9e14258474d76125b72077b62e80569fd25c --- /dev/null +++ b/run-6/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ba07881e6660efa5f6b75d7be0a56065646b8e0d831a6642180986b9ae5cdd1f +size 1064 diff --git a/run-6/checkpoint-3000/trainer_state.json b/run-6/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0ea62167e49da0585fe48cbd9ba646c26b931194 --- /dev/null +++ b/run-6/checkpoint-3000/trainer_state.json @@ -0,0 +1,852 @@ +{ + "best_metric": 0.8472938144329897, + "best_model_checkpoint": "bert_trainer/run-6/checkpoint-2750", + "epoch": 3.865979381443299, + "eval_steps": 250, + "global_step": 3000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 5.985683583902487e-07, + "loss": 1.498, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.4082, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.2917, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.2083, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.1513, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.1182, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0869, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0574, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9843, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 1.0196, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.6401417525773195, + "eval_loss": 0.9714874029159546, + "eval_runtime": 53.062, + "eval_samples_per_second": 58.498, + "eval_steps_per_second": 3.656, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9886, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9861, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9746, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9386, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9046, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.9213, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.892, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8545, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.87, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8463, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.6978092783505154, + "eval_loss": 0.810293436050415, + "eval_runtime": 53.0534, + "eval_samples_per_second": 58.507, + "eval_steps_per_second": 3.657, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8516, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.8086, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7894, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7754, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7558, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7155, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7151, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.758, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6958, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.68, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.7503221649484536, + "eval_loss": 0.6983952522277832, + "eval_runtime": 57.8438, + "eval_samples_per_second": 53.662, + "eval_steps_per_second": 3.354, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6553, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6829, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.7116, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6283, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6559, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6118, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6675, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6426, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6344, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6754, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.7970360824742269, + "eval_loss": 0.6213943362236023, + "eval_runtime": 57.838, + "eval_samples_per_second": 53.667, + "eval_steps_per_second": 3.354, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6535, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.64, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6442, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5873, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.587, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5789, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.605, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6078, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.6431, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5824, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.803479381443299, + "eval_loss": 0.5681772232055664, + "eval_runtime": 57.809, + "eval_samples_per_second": 53.694, + "eval_steps_per_second": 3.356, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.648, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5709, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5504, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5699, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5575, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5644, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.587, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5094, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5724, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5652, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8128221649484536, + "eval_loss": 0.5369997024536133, + "eval_runtime": 57.8152, + "eval_samples_per_second": 53.688, + "eval_steps_per_second": 3.356, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5197, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5499, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.58, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5348, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4741, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5582, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5219, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4802, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5147, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4912, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8234536082474226, + "eval_loss": 0.5059388279914856, + "eval_runtime": 57.8239, + "eval_samples_per_second": 53.68, + "eval_steps_per_second": 3.355, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5133, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4629, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4696, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4623, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4649, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5314, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4974, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.464, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5332, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4694, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8286082474226805, + "eval_loss": 0.48415493965148926, + "eval_runtime": 57.8531, + "eval_samples_per_second": 53.653, + "eval_steps_per_second": 3.353, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5191, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4969, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4499, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5144, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.482, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4193, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4928, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4515, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4775, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5456, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.833118556701031, + "eval_loss": 0.4647773802280426, + "eval_runtime": 57.8252, + "eval_samples_per_second": 53.679, + "eval_steps_per_second": 3.355, + "step": 2250 + }, + { + "epoch": 2.93, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5226, + "step": 2275 + }, + { + "epoch": 2.96, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4159, + "step": 2300 + }, + { + "epoch": 3.0, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4486, + "step": 2325 + }, + { + "epoch": 3.03, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3866, + "step": 2350 + }, + { + "epoch": 3.06, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4634, + "step": 2375 + }, + { + "epoch": 3.09, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4179, + "step": 2400 + }, + { + "epoch": 3.12, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4446, + "step": 2425 + }, + { + "epoch": 3.16, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4606, + "step": 2450 + }, + { + "epoch": 3.19, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4261, + "step": 2475 + }, + { + "epoch": 3.22, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3907, + "step": 2500 + }, + { + "epoch": 3.22, + "eval_accuracy": 0.8353737113402062, + "eval_loss": 0.45589184761047363, + "eval_runtime": 57.8334, + "eval_samples_per_second": 53.671, + "eval_steps_per_second": 3.354, + "step": 2500 + }, + { + "epoch": 3.25, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3983, + "step": 2525 + }, + { + "epoch": 3.29, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4491, + "step": 2550 + }, + { + "epoch": 3.32, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4599, + "step": 2575 + }, + { + "epoch": 3.35, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4581, + "step": 2600 + }, + { + "epoch": 3.38, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4318, + "step": 2625 + }, + { + "epoch": 3.41, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4607, + "step": 2650 + }, + { + "epoch": 3.45, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5343, + "step": 2675 + }, + { + "epoch": 3.48, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.437, + "step": 2700 + }, + { + "epoch": 3.51, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3962, + "step": 2725 + }, + { + "epoch": 3.54, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4803, + "step": 2750 + }, + { + "epoch": 3.54, + "eval_accuracy": 0.8472938144329897, + "eval_loss": 0.43914180994033813, + "eval_runtime": 57.8467, + "eval_samples_per_second": 53.659, + "eval_steps_per_second": 3.354, + "step": 2750 + }, + { + "epoch": 3.58, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3769, + "step": 2775 + }, + { + "epoch": 3.61, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3426, + "step": 2800 + }, + { + "epoch": 3.64, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.419, + "step": 2825 + }, + { + "epoch": 3.67, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.5138, + "step": 2850 + }, + { + "epoch": 3.7, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3962, + "step": 2875 + }, + { + "epoch": 3.74, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3931, + "step": 2900 + }, + { + "epoch": 3.77, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3926, + "step": 2925 + }, + { + "epoch": 3.8, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3425, + "step": 2950 + }, + { + "epoch": 3.83, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.3612, + "step": 2975 + }, + { + "epoch": 3.87, + "learning_rate": 1.1971367167804974e-06, + "loss": 0.4456, + "step": 3000 + }, + { + "epoch": 3.87, + "eval_accuracy": 0.8392396907216495, + "eval_loss": 0.44415542483329773, + "eval_runtime": 57.8667, + "eval_samples_per_second": 53.641, + "eval_steps_per_second": 3.353, + "step": 3000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 1.262177729399808e+16, + "trial_name": null, + "trial_params": { + "learning_rate": 1.1971367167804974e-06, + "per_device_eval_batch_size": 16, + "per_device_train_batch_size": 16 + } +} diff --git a/run-6/checkpoint-3000/training_args.bin b/run-6/checkpoint-3000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..fb68c4d48e2b11b9c1da4d8eda6ee91004244ec7 --- /dev/null +++ b/run-6/checkpoint-3000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:04a33255eeb366639c63b8cb3420b4a0657a70d449a809b3f07061def559312b +size 4728 diff --git a/run-9/checkpoint-1750/config.json b/run-9/checkpoint-1750/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-9/checkpoint-1750/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-9/checkpoint-1750/model.safetensors b/run-9/checkpoint-1750/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f14b15ba1968e6f7625163db299367b497927c8b --- /dev/null +++ b/run-9/checkpoint-1750/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5283073d957e54f92c3388d7c565ed89b4aacc6f9cb3110fd1c50384f297e39c +size 433279996 diff --git a/run-9/checkpoint-1750/optimizer.pt b/run-9/checkpoint-1750/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..402202894b27724775aecaff0e5a1e721259b4ff --- /dev/null +++ b/run-9/checkpoint-1750/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9e71068dadbfb72aa6c89509c5fb418d3a6e0f50c08d32aea0194db46019803e +size 866681082 diff --git a/run-9/checkpoint-1750/rng_state.pth b/run-9/checkpoint-1750/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..365c9213082b250ded7fb86003f89dc68f396aad --- /dev/null +++ b/run-9/checkpoint-1750/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:57a5c388b76bb6f1ac90bbf9bb082c12e6642eaa83617e4fc9e06ed5e1cf1545 +size 14244 diff --git a/run-9/checkpoint-1750/scheduler.pt b/run-9/checkpoint-1750/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..1f0d55f356a4385451b5988b183c827ecac36c9d --- /dev/null +++ b/run-9/checkpoint-1750/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f63639b497a41b1bcb09c1c9b441f0b2f736e46c40294767dd582f2f08db4e4d +size 1064 diff --git a/run-9/checkpoint-1750/trainer_state.json b/run-9/checkpoint-1750/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b2adb5c983d1366fbf6e435e5e69d4386499e54f --- /dev/null +++ b/run-9/checkpoint-1750/trainer_state.json @@ -0,0 +1,507 @@ +{ + "best_metric": 0.8392396907216495, + "best_model_checkpoint": "bert_trainer/run-9/checkpoint-1750", + "epoch": 2.2551546391752577, + "eval_steps": 250, + "global_step": 1750, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 9.145788393269186e-07, + "loss": 1.4915, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.3598, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.236, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.1509, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0855, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0437, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0172, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9849, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9064, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9487, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.6591494845360825, + "eval_loss": 0.8960067629814148, + "eval_runtime": 122.5176, + "eval_samples_per_second": 25.335, + "eval_steps_per_second": 3.167, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8996, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9016, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8801, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8536, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7811, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7948, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7839, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7311, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7656, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7055, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.7625644329896907, + "eval_loss": 0.6912322640419006, + "eval_runtime": 122.6001, + "eval_samples_per_second": 25.318, + "eval_steps_per_second": 3.165, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7169, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6942, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6771, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6848, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6452, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5975, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6137, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6439, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.583, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5757, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.7976804123711341, + "eval_loss": 0.6034093499183655, + "eval_runtime": 122.5716, + "eval_samples_per_second": 25.324, + "eval_steps_per_second": 3.165, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5678, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5788, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6069, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5188, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.541, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5249, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5842, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5603, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5493, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5698, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8115335051546392, + "eval_loss": 0.5344901084899902, + "eval_runtime": 122.5922, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5672, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5462, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5508, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4896, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4862, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4929, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5232, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5364, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5632, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5132, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8273195876288659, + "eval_loss": 0.48882216215133667, + "eval_runtime": 122.5903, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.576, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4969, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4696, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4845, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4698, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4927, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5179, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4551, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4904, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4827, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8308634020618557, + "eval_loss": 0.4661047160625458, + "eval_runtime": 122.592, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4411, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4854, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5067, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4561, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3969, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4659, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4459, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4026, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4394, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.415, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8392396907216495, + "eval_loss": 0.44272318482398987, + "eval_runtime": 122.5862, + "eval_samples_per_second": 25.321, + "eval_steps_per_second": 3.165, + "step": 1750 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 7362045626142720.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.8291576786538372e-06, + "per_device_eval_batch_size": 8, + "per_device_train_batch_size": 16 + } +} diff --git a/run-9/checkpoint-1750/training_args.bin b/run-9/checkpoint-1750/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..d01748e8cc129c4b09069f528a297f98c941f37e --- /dev/null +++ b/run-9/checkpoint-1750/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70462f89ef937a1a86b5f8cab0925039614416b5adeac1118b8269d0bb3e4722 +size 4728 diff --git a/run-9/checkpoint-2000/config.json b/run-9/checkpoint-2000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-9/checkpoint-2000/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-9/checkpoint-2000/model.safetensors b/run-9/checkpoint-2000/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..5edcd4b3708dad030076e0756cc62c3bac624518 --- /dev/null +++ b/run-9/checkpoint-2000/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:61ade75a9e1b1ecceaf9c3b6d4d2b432f7942903a2c8ff777c087a102f597af8 +size 433279996 diff --git a/run-9/checkpoint-2000/optimizer.pt b/run-9/checkpoint-2000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..75fe8f26da52789f4469cc887d09674410fbf54d --- /dev/null +++ b/run-9/checkpoint-2000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:abf550de505e93236aafdea16088c2fc9d9641e0710fb9a6dcfbac52a953c20b +size 866681082 diff --git a/run-9/checkpoint-2000/rng_state.pth b/run-9/checkpoint-2000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..46bfd402f6bfeab3339ef84c13f8bea7848fb6b2 --- /dev/null +++ b/run-9/checkpoint-2000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e5e36c9a58997a8fd5116115315a1541147a866ccc21b5fd8f202de7af5118db +size 14244 diff --git a/run-9/checkpoint-2000/scheduler.pt b/run-9/checkpoint-2000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..eceb3815b3745f2bef9329ebf24523948ce8f598 --- /dev/null +++ b/run-9/checkpoint-2000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:097a5497f7b984c5ac3a57126cc83e212503929cd40590ee21ece1f9e741389b +size 1064 diff --git a/run-9/checkpoint-2000/trainer_state.json b/run-9/checkpoint-2000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..778177374daf437b693f78b6aa7fc540595264ca --- /dev/null +++ b/run-9/checkpoint-2000/trainer_state.json @@ -0,0 +1,576 @@ +{ + "best_metric": 0.8456829896907216, + "best_model_checkpoint": "bert_trainer/run-9/checkpoint-2000", + "epoch": 2.5773195876288657, + "eval_steps": 250, + "global_step": 2000, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 9.145788393269186e-07, + "loss": 1.4915, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.3598, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.236, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.1509, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0855, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0437, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0172, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9849, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9064, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9487, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.6591494845360825, + "eval_loss": 0.8960067629814148, + "eval_runtime": 122.5176, + "eval_samples_per_second": 25.335, + "eval_steps_per_second": 3.167, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8996, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9016, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8801, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8536, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7811, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7948, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7839, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7311, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7656, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7055, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.7625644329896907, + "eval_loss": 0.6912322640419006, + "eval_runtime": 122.6001, + "eval_samples_per_second": 25.318, + "eval_steps_per_second": 3.165, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7169, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6942, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6771, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6848, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6452, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5975, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6137, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6439, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.583, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5757, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.7976804123711341, + "eval_loss": 0.6034093499183655, + "eval_runtime": 122.5716, + "eval_samples_per_second": 25.324, + "eval_steps_per_second": 3.165, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5678, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5788, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6069, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5188, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.541, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5249, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5842, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5603, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5493, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5698, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8115335051546392, + "eval_loss": 0.5344901084899902, + "eval_runtime": 122.5922, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5672, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5462, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5508, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4896, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4862, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4929, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5232, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5364, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5632, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5132, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8273195876288659, + "eval_loss": 0.48882216215133667, + "eval_runtime": 122.5903, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.576, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4969, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4696, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4845, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4698, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4927, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5179, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4551, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4904, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4827, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8308634020618557, + "eval_loss": 0.4661047160625458, + "eval_runtime": 122.592, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4411, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4854, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5067, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4561, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3969, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4659, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4459, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4026, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4394, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.415, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8392396907216495, + "eval_loss": 0.44272318482398987, + "eval_runtime": 122.5862, + "eval_samples_per_second": 25.321, + "eval_steps_per_second": 3.165, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4331, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3842, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3963, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3876, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3826, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4407, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4261, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.394, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4411, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3936, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8456829896907216, + "eval_loss": 0.43213754892349243, + "eval_runtime": 122.5974, + "eval_samples_per_second": 25.319, + "eval_steps_per_second": 3.165, + "step": 2000 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 8414518195998720.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.8291576786538372e-06, + "per_device_eval_batch_size": 8, + "per_device_train_batch_size": 16 + } +} diff --git a/run-9/checkpoint-2000/training_args.bin b/run-9/checkpoint-2000/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..d01748e8cc129c4b09069f528a297f98c941f37e --- /dev/null +++ b/run-9/checkpoint-2000/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70462f89ef937a1a86b5f8cab0925039614416b5adeac1118b8269d0bb3e4722 +size 4728 diff --git a/run-9/checkpoint-2250/config.json b/run-9/checkpoint-2250/config.json new file mode 100644 index 0000000000000000000000000000000000000000..1c3899aaf4604cb81deca05d01babb8d08484ab6 --- /dev/null +++ b/run-9/checkpoint-2250/config.json @@ -0,0 +1,41 @@ +{ + "_name_or_path": "bert-base-cased", + "architectures": [ + "BertForSequenceClassification" + ], + "attention_probs_dropout_prob": 0.1, + "classifier_dropout": null, + "gradient_checkpointing": false, + "hidden_act": "gelu", + "hidden_dropout_prob": 0.1, + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1", + "2": "LABEL_2", + "3": "LABEL_3", + "4": "LABEL_4" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1, + "LABEL_2": 2, + "LABEL_3": 3, + "LABEL_4": 4 + }, + "layer_norm_eps": 1e-12, + "max_position_embeddings": 512, + "model_type": "bert", + "num_attention_heads": 12, + "num_hidden_layers": 12, + "pad_token_id": 0, + "position_embedding_type": "absolute", + "problem_type": "single_label_classification", + "torch_dtype": "float32", + "transformers_version": "4.36.0.dev0", + "type_vocab_size": 2, + "use_cache": true, + "vocab_size": 28996 +} diff --git a/run-9/checkpoint-2250/model.safetensors b/run-9/checkpoint-2250/model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3e8a129f2f0fd32b0b233d578a79df2870cfe2e5 --- /dev/null +++ b/run-9/checkpoint-2250/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:eb46a77a57c38c8c96b5a287b1dffc3d50221a70734933d6f7694c8491803332 +size 433279996 diff --git a/run-9/checkpoint-2250/optimizer.pt b/run-9/checkpoint-2250/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..e27f641dbddf8d26518ab482d166445f73c68882 --- /dev/null +++ b/run-9/checkpoint-2250/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7ae503be0b0058dcf49c05d5d025b31e43c09f4e36203012a122a6fed87c23d8 +size 866681082 diff --git a/run-9/checkpoint-2250/rng_state.pth b/run-9/checkpoint-2250/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..d7642df94958e9a26c811832ab6a75986dfa6876 --- /dev/null +++ b/run-9/checkpoint-2250/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7f90add1f686600af2c1d5c6844b41f65af21e9e1beb1e004c45df7efb0892f3 +size 14244 diff --git a/run-9/checkpoint-2250/scheduler.pt b/run-9/checkpoint-2250/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..0e48b8af1d86d47e88e026a6caf55653e4a42da2 --- /dev/null +++ b/run-9/checkpoint-2250/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3bb98d4bf3e7fcd5cb78f5063ca1871a7884fd8be89f2162e95b6f04a78ddba9 +size 1064 diff --git a/run-9/checkpoint-2250/trainer_state.json b/run-9/checkpoint-2250/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5b442b3a2c88bc3fd10d77b0fed695eee7e5e494 --- /dev/null +++ b/run-9/checkpoint-2250/trainer_state.json @@ -0,0 +1,645 @@ +{ + "best_metric": 0.8505154639175257, + "best_model_checkpoint": "bert_trainer/run-9/checkpoint-2250", + "epoch": 2.899484536082474, + "eval_steps": 250, + "global_step": 2250, + "is_hyper_param_search": true, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.03, + "learning_rate": 9.145788393269186e-07, + "loss": 1.4915, + "step": 25 + }, + { + "epoch": 0.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.3598, + "step": 50 + }, + { + "epoch": 0.1, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.236, + "step": 75 + }, + { + "epoch": 0.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.1509, + "step": 100 + }, + { + "epoch": 0.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0855, + "step": 125 + }, + { + "epoch": 0.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0437, + "step": 150 + }, + { + "epoch": 0.23, + "learning_rate": 1.8291576786538372e-06, + "loss": 1.0172, + "step": 175 + }, + { + "epoch": 0.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9849, + "step": 200 + }, + { + "epoch": 0.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9064, + "step": 225 + }, + { + "epoch": 0.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9487, + "step": 250 + }, + { + "epoch": 0.32, + "eval_accuracy": 0.6591494845360825, + "eval_loss": 0.8960067629814148, + "eval_runtime": 122.5176, + "eval_samples_per_second": 25.335, + "eval_steps_per_second": 3.167, + "step": 250 + }, + { + "epoch": 0.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8996, + "step": 275 + }, + { + "epoch": 0.39, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.9016, + "step": 300 + }, + { + "epoch": 0.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8801, + "step": 325 + }, + { + "epoch": 0.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.8536, + "step": 350 + }, + { + "epoch": 0.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7811, + "step": 375 + }, + { + "epoch": 0.52, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7948, + "step": 400 + }, + { + "epoch": 0.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7839, + "step": 425 + }, + { + "epoch": 0.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7311, + "step": 450 + }, + { + "epoch": 0.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7656, + "step": 475 + }, + { + "epoch": 0.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7055, + "step": 500 + }, + { + "epoch": 0.64, + "eval_accuracy": 0.7625644329896907, + "eval_loss": 0.6912322640419006, + "eval_runtime": 122.6001, + "eval_samples_per_second": 25.318, + "eval_steps_per_second": 3.165, + "step": 500 + }, + { + "epoch": 0.68, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.7169, + "step": 525 + }, + { + "epoch": 0.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6942, + "step": 550 + }, + { + "epoch": 0.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6771, + "step": 575 + }, + { + "epoch": 0.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6848, + "step": 600 + }, + { + "epoch": 0.81, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6452, + "step": 625 + }, + { + "epoch": 0.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5975, + "step": 650 + }, + { + "epoch": 0.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6137, + "step": 675 + }, + { + "epoch": 0.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6439, + "step": 700 + }, + { + "epoch": 0.93, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.583, + "step": 725 + }, + { + "epoch": 0.97, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5757, + "step": 750 + }, + { + "epoch": 0.97, + "eval_accuracy": 0.7976804123711341, + "eval_loss": 0.6034093499183655, + "eval_runtime": 122.5716, + "eval_samples_per_second": 25.324, + "eval_steps_per_second": 3.165, + "step": 750 + }, + { + "epoch": 1.0, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5678, + "step": 775 + }, + { + "epoch": 1.03, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5788, + "step": 800 + }, + { + "epoch": 1.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.6069, + "step": 825 + }, + { + "epoch": 1.1, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5188, + "step": 850 + }, + { + "epoch": 1.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.541, + "step": 875 + }, + { + "epoch": 1.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5249, + "step": 900 + }, + { + "epoch": 1.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5842, + "step": 925 + }, + { + "epoch": 1.22, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5603, + "step": 950 + }, + { + "epoch": 1.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5493, + "step": 975 + }, + { + "epoch": 1.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5698, + "step": 1000 + }, + { + "epoch": 1.29, + "eval_accuracy": 0.8115335051546392, + "eval_loss": 0.5344901084899902, + "eval_runtime": 122.5922, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1000 + }, + { + "epoch": 1.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5672, + "step": 1025 + }, + { + "epoch": 1.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5462, + "step": 1050 + }, + { + "epoch": 1.39, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5508, + "step": 1075 + }, + { + "epoch": 1.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4896, + "step": 1100 + }, + { + "epoch": 1.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4862, + "step": 1125 + }, + { + "epoch": 1.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4929, + "step": 1150 + }, + { + "epoch": 1.51, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5232, + "step": 1175 + }, + { + "epoch": 1.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5364, + "step": 1200 + }, + { + "epoch": 1.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5632, + "step": 1225 + }, + { + "epoch": 1.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5132, + "step": 1250 + }, + { + "epoch": 1.61, + "eval_accuracy": 0.8273195876288659, + "eval_loss": 0.48882216215133667, + "eval_runtime": 122.5903, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1250 + }, + { + "epoch": 1.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.576, + "step": 1275 + }, + { + "epoch": 1.68, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4969, + "step": 1300 + }, + { + "epoch": 1.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4696, + "step": 1325 + }, + { + "epoch": 1.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4845, + "step": 1350 + }, + { + "epoch": 1.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4698, + "step": 1375 + }, + { + "epoch": 1.8, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4927, + "step": 1400 + }, + { + "epoch": 1.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5179, + "step": 1425 + }, + { + "epoch": 1.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4551, + "step": 1450 + }, + { + "epoch": 1.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4904, + "step": 1475 + }, + { + "epoch": 1.93, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4827, + "step": 1500 + }, + { + "epoch": 1.93, + "eval_accuracy": 0.8308634020618557, + "eval_loss": 0.4661047160625458, + "eval_runtime": 122.592, + "eval_samples_per_second": 25.32, + "eval_steps_per_second": 3.165, + "step": 1500 + }, + { + "epoch": 1.97, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4411, + "step": 1525 + }, + { + "epoch": 2.0, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4854, + "step": 1550 + }, + { + "epoch": 2.03, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.5067, + "step": 1575 + }, + { + "epoch": 2.06, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4561, + "step": 1600 + }, + { + "epoch": 2.09, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3969, + "step": 1625 + }, + { + "epoch": 2.13, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4659, + "step": 1650 + }, + { + "epoch": 2.16, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4459, + "step": 1675 + }, + { + "epoch": 2.19, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4026, + "step": 1700 + }, + { + "epoch": 2.22, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4394, + "step": 1725 + }, + { + "epoch": 2.26, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.415, + "step": 1750 + }, + { + "epoch": 2.26, + "eval_accuracy": 0.8392396907216495, + "eval_loss": 0.44272318482398987, + "eval_runtime": 122.5862, + "eval_samples_per_second": 25.321, + "eval_steps_per_second": 3.165, + "step": 1750 + }, + { + "epoch": 2.29, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4331, + "step": 1775 + }, + { + "epoch": 2.32, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3842, + "step": 1800 + }, + { + "epoch": 2.35, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3963, + "step": 1825 + }, + { + "epoch": 2.38, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3876, + "step": 1850 + }, + { + "epoch": 2.42, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3826, + "step": 1875 + }, + { + "epoch": 2.45, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4407, + "step": 1900 + }, + { + "epoch": 2.48, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4261, + "step": 1925 + }, + { + "epoch": 2.51, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.394, + "step": 1950 + }, + { + "epoch": 2.55, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4411, + "step": 1975 + }, + { + "epoch": 2.58, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3936, + "step": 2000 + }, + { + "epoch": 2.58, + "eval_accuracy": 0.8456829896907216, + "eval_loss": 0.43213754892349243, + "eval_runtime": 122.5974, + "eval_samples_per_second": 25.319, + "eval_steps_per_second": 3.165, + "step": 2000 + }, + { + "epoch": 2.61, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4434, + "step": 2025 + }, + { + "epoch": 2.64, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4225, + "step": 2050 + }, + { + "epoch": 2.67, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3864, + "step": 2075 + }, + { + "epoch": 2.71, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4286, + "step": 2100 + }, + { + "epoch": 2.74, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4143, + "step": 2125 + }, + { + "epoch": 2.77, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3637, + "step": 2150 + }, + { + "epoch": 2.8, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4172, + "step": 2175 + }, + { + "epoch": 2.84, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3794, + "step": 2200 + }, + { + "epoch": 2.87, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.3987, + "step": 2225 + }, + { + "epoch": 2.9, + "learning_rate": 1.8291576786538372e-06, + "loss": 0.4932, + "step": 2250 + }, + { + "epoch": 2.9, + "eval_accuracy": 0.8505154639175257, + "eval_loss": 0.42465415596961975, + "eval_runtime": 122.5883, + "eval_samples_per_second": 25.321, + "eval_steps_per_second": 3.165, + "step": 2250 + } + ], + "logging_steps": 25, + "max_steps": 3000, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 250, + "total_flos": 9466990765854720.0, + "trial_name": null, + "trial_params": { + "learning_rate": 1.8291576786538372e-06, + "per_device_eval_batch_size": 8, + "per_device_train_batch_size": 16 + } +} diff --git a/run-9/checkpoint-2250/training_args.bin b/run-9/checkpoint-2250/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..d01748e8cc129c4b09069f528a297f98c941f37e --- /dev/null +++ b/run-9/checkpoint-2250/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70462f89ef937a1a86b5f8cab0925039614416b5adeac1118b8269d0bb3e4722 +size 4728 diff --git a/runs/Dec25_09-34-21_ArtanisPC/events.out.tfevents.1703493273.ArtanisPC.507.14 b/runs/Dec25_09-34-21_ArtanisPC/events.out.tfevents.1703493273.ArtanisPC.507.14 new file mode 100644 index 0000000000000000000000000000000000000000..d06cfcb025e7b9dee841f30f27af5590ae052c4b --- /dev/null +++ b/runs/Dec25_09-34-21_ArtanisPC/events.out.tfevents.1703493273.ArtanisPC.507.14 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aa863999cbf0a0692ac89f72cdfba75c55aaf4dfa3bc8795378fa271f5eb23a5 +size 6060 diff --git a/runs/Dec25_09-37-20_ArtanisPC/events.out.tfevents.1703493442.ArtanisPC.507.15 b/runs/Dec25_09-37-20_ArtanisPC/events.out.tfevents.1703493442.ArtanisPC.507.15 new file mode 100644 index 0000000000000000000000000000000000000000..38f7ac5b1394e6101e58e0f089f61c8f198ee0e8 --- /dev/null +++ b/runs/Dec25_09-37-20_ArtanisPC/events.out.tfevents.1703493442.ArtanisPC.507.15 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c6365e47e7a964d1ba040201cad21bfb29f63d3d7e7005d8973cd149518ad371 +size 4489 diff --git a/runs/Dec25_09-37-31_ArtanisPC/events.out.tfevents.1703493459.ArtanisPC.507.16 b/runs/Dec25_09-37-31_ArtanisPC/events.out.tfevents.1703493459.ArtanisPC.507.16 new file mode 100644 index 0000000000000000000000000000000000000000..ca3331cacb2028dd2f904d67338a05f4fe7891db --- /dev/null +++ b/runs/Dec25_09-37-31_ArtanisPC/events.out.tfevents.1703493459.ArtanisPC.507.16 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6419aa6f7aed4852e6fc6918966178a73e33bf32a727286f9067b58f8f0d1f15 +size 7953 diff --git a/runs/Dec25_09-39-44_ArtanisPC/events.out.tfevents.1703493592.ArtanisPC.507.17 b/runs/Dec25_09-39-44_ArtanisPC/events.out.tfevents.1703493592.ArtanisPC.507.17 new file mode 100644 index 0000000000000000000000000000000000000000..6d11e95f7ff44f0f05ca930ddbd6f61c20cd6896 --- /dev/null +++ b/runs/Dec25_09-39-44_ArtanisPC/events.out.tfevents.1703493592.ArtanisPC.507.17 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b1e870f4da326da768f87c93442dcd25392d5304a66b5e50c3d2ab20fe785c85 +size 7324 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703496003.ArtanisPC.507.18 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703496003.ArtanisPC.507.18 new file mode 100644 index 0000000000000000000000000000000000000000..89d9000addf5c086c625787c447ff4128bff468e --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703496003.ArtanisPC.507.18 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:be4647903afabf224835280a16b928b5a049a89429755bffdaaf0e705d26e610 +size 27558 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703497105.ArtanisPC.507.19 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703497105.ArtanisPC.507.19 new file mode 100644 index 0000000000000000000000000000000000000000..dd436176a207b232c25136d428b768fdf336e845 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703497105.ArtanisPC.507.19 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a1db979601960139b7005d2a945e6ba8c3f96fcc0751d228e50dd470a478ebc6 +size 27558 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703498188.ArtanisPC.507.20 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703498188.ArtanisPC.507.20 new file mode 100644 index 0000000000000000000000000000000000000000..53b4aef2fd31536dee8eb2e0dbb3eced302830a0 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703498188.ArtanisPC.507.20 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40b69a51b8faf8632ee16f32c043a206a5a10e2f2d4d4ee6bd48b94caeb9c970 +size 27559 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703498954.ArtanisPC.507.21 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703498954.ArtanisPC.507.21 new file mode 100644 index 0000000000000000000000000000000000000000..2c015fe13736f6378daa0149b642d4deaee71351 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703498954.ArtanisPC.507.21 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:009658267dac2c96b000746bc4c3ddd40a1a27d5ce4323c9d25b5a3c8b4972d9 +size 27559 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703499720.ArtanisPC.507.22 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703499720.ArtanisPC.507.22 new file mode 100644 index 0000000000000000000000000000000000000000..9a647b90c4883289b9d919eccb3b65df096a77bd --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703499720.ArtanisPC.507.22 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aa2310aeefecb3999998b0482c67d230a6625976f7aeed1f458233d6e95ee43f +size 27558 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703500799.ArtanisPC.507.23 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703500799.ArtanisPC.507.23 new file mode 100644 index 0000000000000000000000000000000000000000..e8444c02fee234fa533761f56c67735d31669fd6 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703500799.ArtanisPC.507.23 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7b8483e756dd2b0015d2af86ee405474b7b06659848f2a6de0e07c8ca5c51e72 +size 27558 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703501563.ArtanisPC.507.24 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703501563.ArtanisPC.507.24 new file mode 100644 index 0000000000000000000000000000000000000000..da58afddfc4957c07fe317c39603985cbb6c10af --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703501563.ArtanisPC.507.24 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8acc946abdd3994c2c1c1eaccbd211688ed1a375ea91798c017621b63a37b479 +size 27561 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703509610.ArtanisPC.507.25 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703509610.ArtanisPC.507.25 new file mode 100644 index 0000000000000000000000000000000000000000..05e4bc5b3623b987825a0af5d060193396ebc4ec --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703509610.ArtanisPC.507.25 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:070db139e49a1c5f661de241bd31e6e453941c1ad95996faec0b3ccdd09f7530 +size 6381 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703510367.ArtanisPC.507.26 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703510367.ArtanisPC.507.26 new file mode 100644 index 0000000000000000000000000000000000000000..42598eb0176e183ef0979313f906c3ea70621167 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703510367.ArtanisPC.507.26 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6b31d6f0ac4a77c40db807537eae3546f7d4b44f1813169447633e0806c0bafa +size 6382 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703510459.ArtanisPC.507.27 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703510459.ArtanisPC.507.27 new file mode 100644 index 0000000000000000000000000000000000000000..f4623af3eb463ba8358b1092e96e0d4ea4d69eba --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703510459.ArtanisPC.507.27 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1305693f59568093043807faacf79763407d39cb960e6ededde8e240f8496768 +size 49203 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703526087.ArtanisPC.507.28 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703526087.ArtanisPC.507.28 new file mode 100644 index 0000000000000000000000000000000000000000..c3d8085dc42e0df94c212401722c5171155ceec1 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703526087.ArtanisPC.507.28 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4e58b4ecbae955485a0c5bf21f482849d884b5427202e8ebd6df3df44eef1a49 +size 27560 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703534696.ArtanisPC.507.29 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703534696.ArtanisPC.507.29 new file mode 100644 index 0000000000000000000000000000000000000000..a0e674a31c54621a3b3a45b3a2045571db853fe7 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703534696.ArtanisPC.507.29 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c7f2b8e60071bf6b5b6233a3596ec53ec6b57408791ed086206dfd51e611e1b8 +size 27559 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703535781.ArtanisPC.507.30 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703535781.ArtanisPC.507.30 new file mode 100644 index 0000000000000000000000000000000000000000..b96a83496b4928d55361fbbf70f4b43464141b26 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703535781.ArtanisPC.507.30 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0800a0bfcf9d9ab09485a7e9ffc17e871017eaa43c0821e4cdddb7b58607f8b3 +size 27560 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703536867.ArtanisPC.507.31 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703536867.ArtanisPC.507.31 new file mode 100644 index 0000000000000000000000000000000000000000..7a39829cd001ffbc01bc1b008ebdeebd6a514955 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703536867.ArtanisPC.507.31 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ef1965518ef1d530291d877aa75bb4b48aeb7aaac04ee219d2c9f53ef00b88ca +size 27560 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703545693.ArtanisPC.507.32 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703545693.ArtanisPC.507.32 new file mode 100644 index 0000000000000000000000000000000000000000..a52d9bbe0a0001f3fc9aba906f5134303f4bf927 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703545693.ArtanisPC.507.32 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c562058a31a0bc63268bc9513f70d3f008c21454e0269dc3a86969cf71aa705a +size 15847 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549538.ArtanisPC.507.33 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549538.ArtanisPC.507.33 new file mode 100644 index 0000000000000000000000000000000000000000..bbc4b9a4f96c94ef3c239cf33be7d466eb0c2a1d --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549538.ArtanisPC.507.33 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70d4cddd7b37481768c916fc2b70316a5659b8f5cae21370f7a336476ee89eab +size 6381 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549629.ArtanisPC.507.34 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549629.ArtanisPC.507.34 new file mode 100644 index 0000000000000000000000000000000000000000..a523a555dfaccfc1eac7dba7ad9620afdbd422b1 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549629.ArtanisPC.507.34 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c2f105231b83f58ab6a0201c269b0488d70e7cf3534facbd5bbae5520377d87a +size 6381 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549718.ArtanisPC.507.35 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549718.ArtanisPC.507.35 new file mode 100644 index 0000000000000000000000000000000000000000..d4850b0f0a8ff597e8724e0bcbfaaa12999c9716 --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549718.ArtanisPC.507.35 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ee2fa3ea1ef4031237daed8530c86c6432a60472cabe747d1d7e48735b21a6f +size 6381 diff --git a/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549781.ArtanisPC.507.36 b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549781.ArtanisPC.507.36 new file mode 100644 index 0000000000000000000000000000000000000000..62492b261391889bb2a751cb3ac77ca5a9978e5e --- /dev/null +++ b/runs/Dec25_10-19-57_ArtanisPC/events.out.tfevents.1703549781.ArtanisPC.507.36 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42726df16ef685e792103fbca9d3131234fe35f4b1fb474e3e6bd7e7ee71ef1d +size 6381 diff --git a/training_args.bin b/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..3e199042dd22f2119217ad3739574886d8683746 --- /dev/null +++ b/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f6ba6115481ac0d03baaa980ba32ca8fce3208b8d5ad2bcc99c60e691a88223f +size 4728