MikeGreen2710 commited on
Commit
f8c8ccd
·
verified ·
1 Parent(s): df2eb81

Upload folder using huggingface_hub

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. .gitattributes +2 -0
  2. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/config.json +40 -0
  3. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/model.safetensors +3 -0
  4. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/optimizer.pt +3 -0
  5. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/rng_state.pth +3 -0
  6. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/scheduler.pt +3 -0
  7. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/tokenizer.json +0 -0
  8. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/tokenizer_config.json +20 -0
  9. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/trainer_state.json +1243 -0
  10. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/training_args.bin +3 -0
  11. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/config.json +40 -0
  12. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/model.safetensors +3 -0
  13. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/optimizer.pt +3 -0
  14. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/rng_state.pth +3 -0
  15. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/scheduler.pt +3 -0
  16. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/tokenizer.json +0 -0
  17. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/tokenizer_config.json +20 -0
  18. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/trainer_state.json +1258 -0
  19. Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/training_args.bin +3 -0
  20. MikeGreen2710__mlm_listing_checkpoint-32442/.ipynb_checkpoints/pretrain_metadata-checkpoint.json +10 -0
  21. MikeGreen2710__mlm_listing_checkpoint-32442/added_tokens.json +3 -0
  22. MikeGreen2710__mlm_listing_checkpoint-32442/bpe.codes +0 -0
  23. MikeGreen2710__mlm_listing_checkpoint-32442/config.json +31 -0
  24. MikeGreen2710__mlm_listing_checkpoint-32442/model.safetensors +3 -0
  25. MikeGreen2710__mlm_listing_checkpoint-32442/pretrain_metadata.json +10 -0
  26. MikeGreen2710__mlm_listing_checkpoint-32442/tokenizer_config.json +56 -0
  27. MikeGreen2710__mlm_listing_checkpoint-32442/training_args.bin +3 -0
  28. MikeGreen2710__mlm_listing_checkpoint-32442/vocab.txt +0 -0
  29. NlpHUST__electra-base-vn/config.json +33 -0
  30. NlpHUST__electra-base-vn/model.safetensors +3 -0
  31. NlpHUST__electra-base-vn/pretrain_metadata.json +10 -0
  32. NlpHUST__electra-base-vn/tokenizer.json +0 -0
  33. NlpHUST__electra-base-vn/tokenizer_config.json +15 -0
  34. NlpHUST__electra-base-vn/training_args.bin +3 -0
  35. _token_cache/Fsoft-AIC__videberta-base/eval_00000_of_00004.arrow +3 -0
  36. _token_cache/Fsoft-AIC__videberta-base/eval_00001_of_00004.arrow +3 -0
  37. _token_cache/Fsoft-AIC__videberta-base/eval_00002_of_00004.arrow +3 -0
  38. _token_cache/Fsoft-AIC__videberta-base/eval_00003_of_00004.arrow +3 -0
  39. _token_cache/Fsoft-AIC__videberta-base/train_00000_of_00004.arrow +3 -0
  40. _token_cache/Fsoft-AIC__videberta-base/train_00001_of_00004.arrow +3 -0
  41. _token_cache/Fsoft-AIC__videberta-base/train_00002_of_00004.arrow +3 -0
  42. _token_cache/Fsoft-AIC__videberta-base/train_00003_of_00004.arrow +3 -0
  43. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00000_of_00004.arrow +3 -0
  44. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00001_of_00004.arrow +3 -0
  45. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00002_of_00004.arrow +3 -0
  46. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00003_of_00004.arrow +3 -0
  47. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00000_of_00004.arrow +3 -0
  48. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00001_of_00004.arrow +3 -0
  49. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00002_of_00004.arrow +3 -0
  50. _token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00003_of_00004.arrow +3 -0
.gitattributes CHANGED
@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ google__rembert/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
+ microsoft__mdeberta-v3-base/tokenizer.json filter=lfs diff=lfs merge=lfs -text
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForMaskedLM"
4
+ ],
5
+ "attention_head_size": 64,
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": null,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-07,
16
+ "legacy": true,
17
+ "max_position_embeddings": 512,
18
+ "max_relative_positions": -1,
19
+ "model_type": "deberta-v2",
20
+ "norm_rel_ebd": "layer_norm",
21
+ "num_attention_heads": 12,
22
+ "num_hidden_layers": 12,
23
+ "pad_token_id": 0,
24
+ "pooler_dropout": 0.0,
25
+ "pooler_hidden_act": "gelu",
26
+ "pooler_hidden_size": 768,
27
+ "pos_att_type": [
28
+ "p2c",
29
+ "c2p"
30
+ ],
31
+ "position_biased_input": false,
32
+ "position_buckets": 256,
33
+ "relative_attention": true,
34
+ "share_att_key": true,
35
+ "tie_word_embeddings": true,
36
+ "transformers_version": "5.8.0",
37
+ "type_vocab_size": 0,
38
+ "use_cache": false,
39
+ "vocab_size": 128000
40
+ }
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:070c9d7f3520493081364e54b85776f3d7d8fd7ac9583edbbeee4b025086bfad
3
+ size 737924256
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4e9ad0eebad48967268ce4b39fc82006ffa1527ed08d5c8cd3a01d9016f1f3b9
3
+ size 1475968826
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:721493c653967e8fc0da471342b9b45a6ce9f6c41020cb8b85b0ea842275517a
3
+ size 14244
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0cb0652c550c0be0b49edd64a3f0322b69604984347ddcb0305da463120b06b0
3
+ size 1064
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/tokenizer_config.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "backend": "tokenizers",
4
+ "bos_token": "[CLS]",
5
+ "cls_token": "[CLS]",
6
+ "do_lower_case": false,
7
+ "eos_token": "[SEP]",
8
+ "is_local": false,
9
+ "local_files_only": false,
10
+ "mask_token": "[MASK]",
11
+ "model_max_length": 1000000000000000019884624838656,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "sp_model_kwargs": {},
15
+ "split_by_punct": false,
16
+ "tokenizer_class": "DebertaV2Tokenizer",
17
+ "unk_id": 3,
18
+ "unk_token": "[UNK]",
19
+ "vocab_type": "spm"
20
+ }
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/trainer_state.json ADDED
@@ -0,0 +1,1243 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 40000,
3
+ "best_metric": 1.487270712852478,
4
+ "best_model_checkpoint": "pretrained_checkpoints/Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000",
5
+ "epoch": 0.08848970201092848,
6
+ "eval_steps": 500,
7
+ "global_step": 40000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.001106121275136606,
14
+ "grad_norm": 9.475790977478027,
15
+ "learning_rate": 1.9960000000000002e-05,
16
+ "loss": 10.73539453125,
17
+ "step": 500
18
+ },
19
+ {
20
+ "epoch": 0.001106121275136606,
21
+ "eval_loss": 6.908179759979248,
22
+ "eval_runtime": 65.5198,
23
+ "eval_samples_per_second": 152.626,
24
+ "eval_steps_per_second": 9.539,
25
+ "step": 500
26
+ },
27
+ {
28
+ "epoch": 0.002212242550273212,
29
+ "grad_norm": 4.896268367767334,
30
+ "learning_rate": 1.9999950750763816e-05,
31
+ "loss": 6.3172548828125,
32
+ "step": 1000
33
+ },
34
+ {
35
+ "epoch": 0.002212242550273212,
36
+ "eval_loss": 5.584421634674072,
37
+ "eval_runtime": 65.633,
38
+ "eval_samples_per_second": 152.362,
39
+ "eval_steps_per_second": 9.523,
40
+ "step": 1000
41
+ },
42
+ {
43
+ "epoch": 0.003318363825409818,
44
+ "grad_norm": 5.7100324630737305,
45
+ "learning_rate": 1.999980260856137e-05,
46
+ "loss": 5.51156884765625,
47
+ "step": 1500
48
+ },
49
+ {
50
+ "epoch": 0.003318363825409818,
51
+ "eval_loss": 5.097376823425293,
52
+ "eval_runtime": 65.5025,
53
+ "eval_samples_per_second": 152.666,
54
+ "eval_steps_per_second": 9.542,
55
+ "step": 1500
56
+ },
57
+ {
58
+ "epoch": 0.004424485100546424,
59
+ "grad_norm": 5.015883922576904,
60
+ "learning_rate": 1.9999555574659926e-05,
61
+ "loss": 5.04186083984375,
62
+ "step": 2000
63
+ },
64
+ {
65
+ "epoch": 0.004424485100546424,
66
+ "eval_loss": 4.640530109405518,
67
+ "eval_runtime": 65.8074,
68
+ "eval_samples_per_second": 151.959,
69
+ "eval_steps_per_second": 9.497,
70
+ "step": 2000
71
+ },
72
+ {
73
+ "epoch": 0.00553060637568303,
74
+ "grad_norm": 5.8804450035095215,
75
+ "learning_rate": 1.9999209651502484e-05,
76
+ "loss": 4.6854267578125,
77
+ "step": 2500
78
+ },
79
+ {
80
+ "epoch": 0.00553060637568303,
81
+ "eval_loss": 4.30808162689209,
82
+ "eval_runtime": 65.7347,
83
+ "eval_samples_per_second": 152.127,
84
+ "eval_steps_per_second": 9.508,
85
+ "step": 2500
86
+ },
87
+ {
88
+ "epoch": 0.006636727650819636,
89
+ "grad_norm": 6.087777614593506,
90
+ "learning_rate": 1.999876484251e-05,
91
+ "loss": 4.3789228515625,
92
+ "step": 3000
93
+ },
94
+ {
95
+ "epoch": 0.006636727650819636,
96
+ "eval_loss": 4.010719299316406,
97
+ "eval_runtime": 65.6921,
98
+ "eval_samples_per_second": 152.225,
99
+ "eval_steps_per_second": 9.514,
100
+ "step": 3000
101
+ },
102
+ {
103
+ "epoch": 0.0077428489259562415,
104
+ "grad_norm": 5.5657639503479,
105
+ "learning_rate": 1.9998221152081356e-05,
106
+ "loss": 4.1345771484375,
107
+ "step": 3500
108
+ },
109
+ {
110
+ "epoch": 0.0077428489259562415,
111
+ "eval_loss": 3.785635232925415,
112
+ "eval_runtime": 66.3485,
113
+ "eval_samples_per_second": 150.719,
114
+ "eval_steps_per_second": 9.42,
115
+ "step": 3500
116
+ },
117
+ {
118
+ "epoch": 0.008848970201092848,
119
+ "grad_norm": 6.631436824798584,
120
+ "learning_rate": 1.999757858559331e-05,
121
+ "loss": 3.9143818359375,
122
+ "step": 4000
123
+ },
124
+ {
125
+ "epoch": 0.008848970201092848,
126
+ "eval_loss": 3.588374614715576,
127
+ "eval_runtime": 66.3332,
128
+ "eval_samples_per_second": 150.754,
129
+ "eval_steps_per_second": 9.422,
130
+ "step": 4000
131
+ },
132
+ {
133
+ "epoch": 0.009955091476229454,
134
+ "grad_norm": 5.396254062652588,
135
+ "learning_rate": 1.999683714940043e-05,
136
+ "loss": 3.759765869140625,
137
+ "step": 4500
138
+ },
139
+ {
140
+ "epoch": 0.009955091476229454,
141
+ "eval_loss": 3.429428815841675,
142
+ "eval_runtime": 65.5002,
143
+ "eval_samples_per_second": 152.671,
144
+ "eval_steps_per_second": 9.542,
145
+ "step": 4500
146
+ },
147
+ {
148
+ "epoch": 0.01106121275136606,
149
+ "grad_norm": 5.386684894561768,
150
+ "learning_rate": 1.999599685083505e-05,
151
+ "loss": 3.61756494140625,
152
+ "step": 5000
153
+ },
154
+ {
155
+ "epoch": 0.01106121275136606,
156
+ "eval_loss": 3.315566301345825,
157
+ "eval_runtime": 65.3359,
158
+ "eval_samples_per_second": 153.055,
159
+ "eval_steps_per_second": 9.566,
160
+ "step": 5000
161
+ },
162
+ {
163
+ "epoch": 0.012167334026502667,
164
+ "grad_norm": 6.260346412658691,
165
+ "learning_rate": 1.9995057698207195e-05,
166
+ "loss": 3.486438720703125,
167
+ "step": 5500
168
+ },
169
+ {
170
+ "epoch": 0.012167334026502667,
171
+ "eval_loss": 3.190394639968872,
172
+ "eval_runtime": 65.353,
173
+ "eval_samples_per_second": 153.015,
174
+ "eval_steps_per_second": 9.563,
175
+ "step": 5500
176
+ },
177
+ {
178
+ "epoch": 0.013273455301639273,
179
+ "grad_norm": 5.308413028717041,
180
+ "learning_rate": 1.9994019700804483e-05,
181
+ "loss": 3.372943115234375,
182
+ "step": 6000
183
+ },
184
+ {
185
+ "epoch": 0.013273455301639273,
186
+ "eval_loss": 3.07236647605896,
187
+ "eval_runtime": 65.1836,
188
+ "eval_samples_per_second": 153.413,
189
+ "eval_steps_per_second": 9.588,
190
+ "step": 6000
191
+ },
192
+ {
193
+ "epoch": 0.014379576576775877,
194
+ "grad_norm": 5.559189796447754,
195
+ "learning_rate": 1.9992882868892052e-05,
196
+ "loss": 3.33723486328125,
197
+ "step": 6500
198
+ },
199
+ {
200
+ "epoch": 0.014379576576775877,
201
+ "eval_loss": 2.9914042949676514,
202
+ "eval_runtime": 65.1138,
203
+ "eval_samples_per_second": 153.577,
204
+ "eval_steps_per_second": 9.599,
205
+ "step": 6500
206
+ },
207
+ {
208
+ "epoch": 0.015485697851912483,
209
+ "grad_norm": 5.7293925285339355,
210
+ "learning_rate": 1.9991647213712446e-05,
211
+ "loss": 3.1835166015625,
212
+ "step": 7000
213
+ },
214
+ {
215
+ "epoch": 0.015485697851912483,
216
+ "eval_loss": 2.9056553840637207,
217
+ "eval_runtime": 66.6383,
218
+ "eval_samples_per_second": 150.064,
219
+ "eval_steps_per_second": 9.379,
220
+ "step": 7000
221
+ },
222
+ {
223
+ "epoch": 0.01659181912704909,
224
+ "grad_norm": 5.745417594909668,
225
+ "learning_rate": 1.999031274748551e-05,
226
+ "loss": 3.09816748046875,
227
+ "step": 7500
228
+ },
229
+ {
230
+ "epoch": 0.01659181912704909,
231
+ "eval_loss": 2.8260159492492676,
232
+ "eval_runtime": 65.6949,
233
+ "eval_samples_per_second": 152.219,
234
+ "eval_steps_per_second": 9.514,
235
+ "step": 7500
236
+ },
237
+ {
238
+ "epoch": 0.017697940402185697,
239
+ "grad_norm": 5.706750869750977,
240
+ "learning_rate": 1.9988879483408266e-05,
241
+ "loss": 3.02596435546875,
242
+ "step": 8000
243
+ },
244
+ {
245
+ "epoch": 0.017697940402185697,
246
+ "eval_loss": 2.7651631832122803,
247
+ "eval_runtime": 65.8495,
248
+ "eval_samples_per_second": 151.862,
249
+ "eval_steps_per_second": 9.491,
250
+ "step": 8000
251
+ },
252
+ {
253
+ "epoch": 0.018804061677322303,
254
+ "grad_norm": 4.90167760848999,
255
+ "learning_rate": 1.998734743565479e-05,
256
+ "loss": 2.940542236328125,
257
+ "step": 8500
258
+ },
259
+ {
260
+ "epoch": 0.018804061677322303,
261
+ "eval_loss": 2.683983325958252,
262
+ "eval_runtime": 65.8236,
263
+ "eval_samples_per_second": 151.921,
264
+ "eval_steps_per_second": 9.495,
265
+ "step": 8500
266
+ },
267
+ {
268
+ "epoch": 0.01991018295245891,
269
+ "grad_norm": 6.079418182373047,
270
+ "learning_rate": 1.998571661937606e-05,
271
+ "loss": 2.8865009765625,
272
+ "step": 9000
273
+ },
274
+ {
275
+ "epoch": 0.01991018295245891,
276
+ "eval_loss": 2.624776840209961,
277
+ "eval_runtime": 65.9969,
278
+ "eval_samples_per_second": 151.522,
279
+ "eval_steps_per_second": 9.47,
280
+ "step": 9000
281
+ },
282
+ {
283
+ "epoch": 0.021016304227595515,
284
+ "grad_norm": 5.454369068145752,
285
+ "learning_rate": 1.9983987050699813e-05,
286
+ "loss": 2.817274169921875,
287
+ "step": 9500
288
+ },
289
+ {
290
+ "epoch": 0.021016304227595515,
291
+ "eval_loss": 2.580995559692383,
292
+ "eval_runtime": 65.6963,
293
+ "eval_samples_per_second": 152.216,
294
+ "eval_steps_per_second": 9.513,
295
+ "step": 9500
296
+ },
297
+ {
298
+ "epoch": 0.02212242550273212,
299
+ "grad_norm": 5.633095741271973,
300
+ "learning_rate": 1.9982158746730387e-05,
301
+ "loss": 2.784319091796875,
302
+ "step": 10000
303
+ },
304
+ {
305
+ "epoch": 0.02212242550273212,
306
+ "eval_loss": 2.502817153930664,
307
+ "eval_runtime": 65.4322,
308
+ "eval_samples_per_second": 152.83,
309
+ "eval_steps_per_second": 9.552,
310
+ "step": 10000
311
+ },
312
+ {
313
+ "epoch": 0.023228546777868727,
314
+ "grad_norm": 5.46868896484375,
315
+ "learning_rate": 1.9980231725548545e-05,
316
+ "loss": 2.702649658203125,
317
+ "step": 10500
318
+ },
319
+ {
320
+ "epoch": 0.023228546777868727,
321
+ "eval_loss": 2.465555191040039,
322
+ "eval_runtime": 65.0987,
323
+ "eval_samples_per_second": 153.613,
324
+ "eval_steps_per_second": 9.601,
325
+ "step": 10500
326
+ },
327
+ {
328
+ "epoch": 0.024334668053005333,
329
+ "grad_norm": 5.703943252563477,
330
+ "learning_rate": 1.9978206006211304e-05,
331
+ "loss": 2.6762646484375,
332
+ "step": 11000
333
+ },
334
+ {
335
+ "epoch": 0.024334668053005333,
336
+ "eval_loss": 2.410994529724121,
337
+ "eval_runtime": 65.8492,
338
+ "eval_samples_per_second": 151.862,
339
+ "eval_steps_per_second": 9.491,
340
+ "step": 11000
341
+ },
342
+ {
343
+ "epoch": 0.02544078932814194,
344
+ "grad_norm": 5.745393753051758,
345
+ "learning_rate": 1.9976081608751742e-05,
346
+ "loss": 2.61624267578125,
347
+ "step": 11500
348
+ },
349
+ {
350
+ "epoch": 0.02544078932814194,
351
+ "eval_loss": 2.377451181411743,
352
+ "eval_runtime": 65.697,
353
+ "eval_samples_per_second": 152.214,
354
+ "eval_steps_per_second": 9.513,
355
+ "step": 11500
356
+ },
357
+ {
358
+ "epoch": 0.026546910603278545,
359
+ "grad_norm": 5.889176845550537,
360
+ "learning_rate": 1.99738585541788e-05,
361
+ "loss": 2.5832724609375,
362
+ "step": 12000
363
+ },
364
+ {
365
+ "epoch": 0.026546910603278545,
366
+ "eval_loss": 2.334881544113159,
367
+ "eval_runtime": 65.862,
368
+ "eval_samples_per_second": 151.833,
369
+ "eval_steps_per_second": 9.49,
370
+ "step": 12000
371
+ },
372
+ {
373
+ "epoch": 0.027653031878415148,
374
+ "grad_norm": 5.409160614013672,
375
+ "learning_rate": 1.9971536864477078e-05,
376
+ "loss": 2.548913818359375,
377
+ "step": 12500
378
+ },
379
+ {
380
+ "epoch": 0.027653031878415148,
381
+ "eval_loss": 2.30452823638916,
382
+ "eval_runtime": 65.0769,
383
+ "eval_samples_per_second": 153.664,
384
+ "eval_steps_per_second": 9.604,
385
+ "step": 12500
386
+ },
387
+ {
388
+ "epoch": 0.028759153153551754,
389
+ "grad_norm": 5.37885046005249,
390
+ "learning_rate": 1.9969116562606614e-05,
391
+ "loss": 2.498342041015625,
392
+ "step": 13000
393
+ },
394
+ {
395
+ "epoch": 0.028759153153551754,
396
+ "eval_loss": 2.262269973754883,
397
+ "eval_runtime": 66.4547,
398
+ "eval_samples_per_second": 150.478,
399
+ "eval_steps_per_second": 9.405,
400
+ "step": 13000
401
+ },
402
+ {
403
+ "epoch": 0.02986527442868836,
404
+ "grad_norm": 5.803339004516602,
405
+ "learning_rate": 1.9966597672502653e-05,
406
+ "loss": 2.449419921875,
407
+ "step": 13500
408
+ },
409
+ {
410
+ "epoch": 0.02986527442868836,
411
+ "eval_loss": 2.2417187690734863,
412
+ "eval_runtime": 65.9915,
413
+ "eval_samples_per_second": 151.535,
414
+ "eval_steps_per_second": 9.471,
415
+ "step": 13500
416
+ },
417
+ {
418
+ "epoch": 0.030971395703824966,
419
+ "grad_norm": 5.598288059234619,
420
+ "learning_rate": 1.9963980219075425e-05,
421
+ "loss": 2.43294775390625,
422
+ "step": 14000
423
+ },
424
+ {
425
+ "epoch": 0.030971395703824966,
426
+ "eval_loss": 2.1951167583465576,
427
+ "eval_runtime": 66.3059,
428
+ "eval_samples_per_second": 150.816,
429
+ "eval_steps_per_second": 9.426,
430
+ "step": 14000
431
+ },
432
+ {
433
+ "epoch": 0.03207751697896157,
434
+ "grad_norm": 5.400110244750977,
435
+ "learning_rate": 1.9961264228209876e-05,
436
+ "loss": 2.380520263671875,
437
+ "step": 14500
438
+ },
439
+ {
440
+ "epoch": 0.03207751697896157,
441
+ "eval_loss": 2.1698226928710938,
442
+ "eval_runtime": 65.841,
443
+ "eval_samples_per_second": 151.881,
444
+ "eval_steps_per_second": 9.493,
445
+ "step": 14500
446
+ },
447
+ {
448
+ "epoch": 0.03318363825409818,
449
+ "grad_norm": 5.006521224975586,
450
+ "learning_rate": 1.995844972676544e-05,
451
+ "loss": 2.36803515625,
452
+ "step": 15000
453
+ },
454
+ {
455
+ "epoch": 0.03318363825409818,
456
+ "eval_loss": 2.1508238315582275,
457
+ "eval_runtime": 65.8184,
458
+ "eval_samples_per_second": 151.933,
459
+ "eval_steps_per_second": 9.496,
460
+ "step": 15000
461
+ },
462
+ {
463
+ "epoch": 0.034289759529234784,
464
+ "grad_norm": 22.403335571289062,
465
+ "learning_rate": 1.9955536742575737e-05,
466
+ "loss": 2.337472900390625,
467
+ "step": 15500
468
+ },
469
+ {
470
+ "epoch": 0.034289759529234784,
471
+ "eval_loss": 2.131364345550537,
472
+ "eval_runtime": 65.3739,
473
+ "eval_samples_per_second": 152.966,
474
+ "eval_steps_per_second": 9.56,
475
+ "step": 15500
476
+ },
477
+ {
478
+ "epoch": 0.035395880804371394,
479
+ "grad_norm": 4.748437881469727,
480
+ "learning_rate": 1.995252530444834e-05,
481
+ "loss": 2.32045849609375,
482
+ "step": 16000
483
+ },
484
+ {
485
+ "epoch": 0.035395880804371394,
486
+ "eval_loss": 2.0844030380249023,
487
+ "eval_runtime": 65.3283,
488
+ "eval_samples_per_second": 153.073,
489
+ "eval_steps_per_second": 9.567,
490
+ "step": 16000
491
+ },
492
+ {
493
+ "epoch": 0.036502002079507996,
494
+ "grad_norm": 4.933561325073242,
495
+ "learning_rate": 1.9949415442164463e-05,
496
+ "loss": 2.2753798828125,
497
+ "step": 16500
498
+ },
499
+ {
500
+ "epoch": 0.036502002079507996,
501
+ "eval_loss": 2.060131549835205,
502
+ "eval_runtime": 65.6122,
503
+ "eval_samples_per_second": 152.411,
504
+ "eval_steps_per_second": 9.526,
505
+ "step": 16500
506
+ },
507
+ {
508
+ "epoch": 0.037608123354644606,
509
+ "grad_norm": 5.674777507781982,
510
+ "learning_rate": 1.9946207186478655e-05,
511
+ "loss": 2.25116943359375,
512
+ "step": 17000
513
+ },
514
+ {
515
+ "epoch": 0.037608123354644606,
516
+ "eval_loss": 2.0405194759368896,
517
+ "eval_runtime": 65.3009,
518
+ "eval_samples_per_second": 153.137,
519
+ "eval_steps_per_second": 9.571,
520
+ "step": 17000
521
+ },
522
+ {
523
+ "epoch": 0.03871424462978121,
524
+ "grad_norm": 5.777343273162842,
525
+ "learning_rate": 1.9942900569118546e-05,
526
+ "loss": 2.23547802734375,
527
+ "step": 17500
528
+ },
529
+ {
530
+ "epoch": 0.03871424462978121,
531
+ "eval_loss": 2.0208609104156494,
532
+ "eval_runtime": 66.1739,
533
+ "eval_samples_per_second": 151.117,
534
+ "eval_steps_per_second": 9.445,
535
+ "step": 17500
536
+ },
537
+ {
538
+ "epoch": 0.03982036590491782,
539
+ "grad_norm": 5.607430458068848,
540
+ "learning_rate": 1.9939495622784472e-05,
541
+ "loss": 2.1993876953125,
542
+ "step": 18000
543
+ },
544
+ {
545
+ "epoch": 0.03982036590491782,
546
+ "eval_loss": 2.001434087753296,
547
+ "eval_runtime": 66.1661,
548
+ "eval_samples_per_second": 151.135,
549
+ "eval_steps_per_second": 9.446,
550
+ "step": 18000
551
+ },
552
+ {
553
+ "epoch": 0.04092648718005442,
554
+ "grad_norm": 5.273671627044678,
555
+ "learning_rate": 1.993599238114919e-05,
556
+ "loss": 2.180281982421875,
557
+ "step": 18500
558
+ },
559
+ {
560
+ "epoch": 0.04092648718005442,
561
+ "eval_loss": 1.983248233795166,
562
+ "eval_runtime": 65.6213,
563
+ "eval_samples_per_second": 152.39,
564
+ "eval_steps_per_second": 9.524,
565
+ "step": 18500
566
+ },
567
+ {
568
+ "epoch": 0.04203260845519103,
569
+ "grad_norm": 5.48894739151001,
570
+ "learning_rate": 1.993239087885754e-05,
571
+ "loss": 2.180351318359375,
572
+ "step": 19000
573
+ },
574
+ {
575
+ "epoch": 0.04203260845519103,
576
+ "eval_loss": 1.9536426067352295,
577
+ "eval_runtime": 65.1545,
578
+ "eval_samples_per_second": 153.481,
579
+ "eval_steps_per_second": 9.593,
580
+ "step": 19000
581
+ },
582
+ {
583
+ "epoch": 0.04313872973032763,
584
+ "grad_norm": 4.517572402954102,
585
+ "learning_rate": 1.992869115152609e-05,
586
+ "loss": 2.14364501953125,
587
+ "step": 19500
588
+ },
589
+ {
590
+ "epoch": 0.04313872973032763,
591
+ "eval_loss": 1.9281601905822754,
592
+ "eval_runtime": 65.6074,
593
+ "eval_samples_per_second": 152.422,
594
+ "eval_steps_per_second": 9.526,
595
+ "step": 19500
596
+ },
597
+ {
598
+ "epoch": 0.04424485100546424,
599
+ "grad_norm": 5.366357326507568,
600
+ "learning_rate": 1.9924893235742795e-05,
601
+ "loss": 2.124390380859375,
602
+ "step": 20000
603
+ },
604
+ {
605
+ "epoch": 0.04424485100546424,
606
+ "eval_loss": 1.9185084104537964,
607
+ "eval_runtime": 66.4777,
608
+ "eval_samples_per_second": 150.426,
609
+ "eval_steps_per_second": 9.402,
610
+ "step": 20000
611
+ },
612
+ {
613
+ "epoch": 0.045350972280600844,
614
+ "grad_norm": 5.40119743347168,
615
+ "learning_rate": 1.992099716906663e-05,
616
+ "loss": 2.11509521484375,
617
+ "step": 20500
618
+ },
619
+ {
620
+ "epoch": 0.045350972280600844,
621
+ "eval_loss": 1.8964039087295532,
622
+ "eval_runtime": 65.269,
623
+ "eval_samples_per_second": 153.212,
624
+ "eval_steps_per_second": 9.576,
625
+ "step": 20500
626
+ },
627
+ {
628
+ "epoch": 0.046457093555737454,
629
+ "grad_norm": 4.91980504989624,
630
+ "learning_rate": 1.9917002990027225e-05,
631
+ "loss": 2.080730224609375,
632
+ "step": 21000
633
+ },
634
+ {
635
+ "epoch": 0.046457093555737454,
636
+ "eval_loss": 1.8814513683319092,
637
+ "eval_runtime": 65.8396,
638
+ "eval_samples_per_second": 151.884,
639
+ "eval_steps_per_second": 9.493,
640
+ "step": 21000
641
+ },
642
+ {
643
+ "epoch": 0.04756321483087406,
644
+ "grad_norm": 5.756763458251953,
645
+ "learning_rate": 1.991291073812447e-05,
646
+ "loss": 2.062693359375,
647
+ "step": 21500
648
+ },
649
+ {
650
+ "epoch": 0.04756321483087406,
651
+ "eval_loss": 1.8653240203857422,
652
+ "eval_runtime": 65.2727,
653
+ "eval_samples_per_second": 153.203,
654
+ "eval_steps_per_second": 9.575,
655
+ "step": 21500
656
+ },
657
+ {
658
+ "epoch": 0.048669336106010666,
659
+ "grad_norm": 4.964697360992432,
660
+ "learning_rate": 1.990872045382814e-05,
661
+ "loss": 2.0461234130859376,
662
+ "step": 22000
663
+ },
664
+ {
665
+ "epoch": 0.048669336106010666,
666
+ "eval_loss": 1.8559273481369019,
667
+ "eval_runtime": 65.7552,
668
+ "eval_samples_per_second": 152.079,
669
+ "eval_steps_per_second": 9.505,
670
+ "step": 22000
671
+ },
672
+ {
673
+ "epoch": 0.04977545738114727,
674
+ "grad_norm": 4.809401988983154,
675
+ "learning_rate": 1.990443217857749e-05,
676
+ "loss": 2.030472412109375,
677
+ "step": 22500
678
+ },
679
+ {
680
+ "epoch": 0.04977545738114727,
681
+ "eval_loss": 1.8380959033966064,
682
+ "eval_runtime": 65.6745,
683
+ "eval_samples_per_second": 152.266,
684
+ "eval_steps_per_second": 9.517,
685
+ "step": 22500
686
+ },
687
+ {
688
+ "epoch": 0.05088157865628388,
689
+ "grad_norm": 5.332137584686279,
690
+ "learning_rate": 1.9900045954780833e-05,
691
+ "loss": 2.019200439453125,
692
+ "step": 23000
693
+ },
694
+ {
695
+ "epoch": 0.05088157865628388,
696
+ "eval_loss": 1.8243741989135742,
697
+ "eval_runtime": 66.808,
698
+ "eval_samples_per_second": 149.683,
699
+ "eval_steps_per_second": 9.355,
700
+ "step": 23000
701
+ },
702
+ {
703
+ "epoch": 0.05198769993142048,
704
+ "grad_norm": 5.7028913497924805,
705
+ "learning_rate": 1.989556182581514e-05,
706
+ "loss": 1.9847816162109375,
707
+ "step": 23500
708
+ },
709
+ {
710
+ "epoch": 0.05198769993142048,
711
+ "eval_loss": 1.8052804470062256,
712
+ "eval_runtime": 65.2434,
713
+ "eval_samples_per_second": 153.272,
714
+ "eval_steps_per_second": 9.58,
715
+ "step": 23500
716
+ },
717
+ {
718
+ "epoch": 0.05309382120655709,
719
+ "grad_norm": 4.981122970581055,
720
+ "learning_rate": 1.98909798360256e-05,
721
+ "loss": 1.9902779541015625,
722
+ "step": 24000
723
+ },
724
+ {
725
+ "epoch": 0.05309382120655709,
726
+ "eval_loss": 1.7762919664382935,
727
+ "eval_runtime": 65.1802,
728
+ "eval_samples_per_second": 153.421,
729
+ "eval_steps_per_second": 9.589,
730
+ "step": 24000
731
+ },
732
+ {
733
+ "epoch": 0.05419994248169369,
734
+ "grad_norm": 4.917308807373047,
735
+ "learning_rate": 1.9886300030725185e-05,
736
+ "loss": 1.9727127685546875,
737
+ "step": 24500
738
+ },
739
+ {
740
+ "epoch": 0.05419994248169369,
741
+ "eval_loss": 1.7766869068145752,
742
+ "eval_runtime": 65.0747,
743
+ "eval_samples_per_second": 153.67,
744
+ "eval_steps_per_second": 9.604,
745
+ "step": 24500
746
+ },
747
+ {
748
+ "epoch": 0.055306063756830295,
749
+ "grad_norm": 4.780125141143799,
750
+ "learning_rate": 1.9881522456194194e-05,
751
+ "loss": 1.948054443359375,
752
+ "step": 25000
753
+ },
754
+ {
755
+ "epoch": 0.055306063756830295,
756
+ "eval_loss": 1.7642755508422852,
757
+ "eval_runtime": 65.8137,
758
+ "eval_samples_per_second": 151.944,
759
+ "eval_steps_per_second": 9.497,
760
+ "step": 25000
761
+ },
762
+ {
763
+ "epoch": 0.056412185031966905,
764
+ "grad_norm": 5.44115686416626,
765
+ "learning_rate": 1.9876647159679813e-05,
766
+ "loss": 1.9313668212890625,
767
+ "step": 25500
768
+ },
769
+ {
770
+ "epoch": 0.056412185031966905,
771
+ "eval_loss": 1.7497310638427734,
772
+ "eval_runtime": 65.536,
773
+ "eval_samples_per_second": 152.588,
774
+ "eval_steps_per_second": 9.537,
775
+ "step": 25500
776
+ },
777
+ {
778
+ "epoch": 0.05751830630710351,
779
+ "grad_norm": 4.406560897827148,
780
+ "learning_rate": 1.9871674189395622e-05,
781
+ "loss": 1.933572021484375,
782
+ "step": 26000
783
+ },
784
+ {
785
+ "epoch": 0.05751830630710351,
786
+ "eval_loss": 1.7356730699539185,
787
+ "eval_runtime": 66.4858,
788
+ "eval_samples_per_second": 150.408,
789
+ "eval_steps_per_second": 9.401,
790
+ "step": 26000
791
+ },
792
+ {
793
+ "epoch": 0.05862442758224012,
794
+ "grad_norm": 6.296497344970703,
795
+ "learning_rate": 1.9866603594521142e-05,
796
+ "loss": 1.91761669921875,
797
+ "step": 26500
798
+ },
799
+ {
800
+ "epoch": 0.05862442758224012,
801
+ "eval_loss": 1.7373892068862915,
802
+ "eval_runtime": 65.2531,
803
+ "eval_samples_per_second": 153.25,
804
+ "eval_steps_per_second": 9.578,
805
+ "step": 26500
806
+ },
807
+ {
808
+ "epoch": 0.05973054885737672,
809
+ "grad_norm": 5.007937908172607,
810
+ "learning_rate": 1.9861435425201336e-05,
811
+ "loss": 1.898394287109375,
812
+ "step": 27000
813
+ },
814
+ {
815
+ "epoch": 0.05973054885737672,
816
+ "eval_loss": 1.7208389043807983,
817
+ "eval_runtime": 65.1399,
818
+ "eval_samples_per_second": 153.516,
819
+ "eval_steps_per_second": 9.595,
820
+ "step": 27000
821
+ },
822
+ {
823
+ "epoch": 0.06083667013251333,
824
+ "grad_norm": 4.655943393707275,
825
+ "learning_rate": 1.985616973254612e-05,
826
+ "loss": 1.9006209716796876,
827
+ "step": 27500
828
+ },
829
+ {
830
+ "epoch": 0.06083667013251333,
831
+ "eval_loss": 1.7028509378433228,
832
+ "eval_runtime": 66.0059,
833
+ "eval_samples_per_second": 151.502,
834
+ "eval_steps_per_second": 9.469,
835
+ "step": 27500
836
+ },
837
+ {
838
+ "epoch": 0.06194279140764993,
839
+ "grad_norm": 5.251052379608154,
840
+ "learning_rate": 1.985080656862985e-05,
841
+ "loss": 1.88404931640625,
842
+ "step": 28000
843
+ },
844
+ {
845
+ "epoch": 0.06194279140764993,
846
+ "eval_loss": 1.7043781280517578,
847
+ "eval_runtime": 65.8348,
848
+ "eval_samples_per_second": 151.895,
849
+ "eval_steps_per_second": 9.493,
850
+ "step": 28000
851
+ },
852
+ {
853
+ "epoch": 0.06304891268278653,
854
+ "grad_norm": 5.259983539581299,
855
+ "learning_rate": 1.984534598649081e-05,
856
+ "loss": 1.875679931640625,
857
+ "step": 28500
858
+ },
859
+ {
860
+ "epoch": 0.06304891268278653,
861
+ "eval_loss": 1.6936031579971313,
862
+ "eval_runtime": 65.104,
863
+ "eval_samples_per_second": 153.6,
864
+ "eval_steps_per_second": 9.6,
865
+ "step": 28500
866
+ },
867
+ {
868
+ "epoch": 0.06415503395792314,
869
+ "grad_norm": 4.902404308319092,
870
+ "learning_rate": 1.9839788040130693e-05,
871
+ "loss": 1.8586162109375,
872
+ "step": 29000
873
+ },
874
+ {
875
+ "epoch": 0.06415503395792314,
876
+ "eval_loss": 1.6735634803771973,
877
+ "eval_runtime": 65.6048,
878
+ "eval_samples_per_second": 152.428,
879
+ "eval_steps_per_second": 9.527,
880
+ "step": 29000
881
+ },
882
+ {
883
+ "epoch": 0.06526115523305975,
884
+ "grad_norm": 5.073776721954346,
885
+ "learning_rate": 1.9834132784514063e-05,
886
+ "loss": 1.83912939453125,
887
+ "step": 29500
888
+ },
889
+ {
890
+ "epoch": 0.06526115523305975,
891
+ "eval_loss": 1.6621925830841064,
892
+ "eval_runtime": 65.5527,
893
+ "eval_samples_per_second": 152.549,
894
+ "eval_steps_per_second": 9.534,
895
+ "step": 29500
896
+ },
897
+ {
898
+ "epoch": 0.06636727650819636,
899
+ "grad_norm": 5.1272969245910645,
900
+ "learning_rate": 1.9828380275567797e-05,
901
+ "loss": 1.842152099609375,
902
+ "step": 30000
903
+ },
904
+ {
905
+ "epoch": 0.06636727650819636,
906
+ "eval_loss": 1.6653783321380615,
907
+ "eval_runtime": 66.132,
908
+ "eval_samples_per_second": 151.213,
909
+ "eval_steps_per_second": 9.451,
910
+ "step": 30000
911
+ },
912
+ {
913
+ "epoch": 0.06747339778333296,
914
+ "grad_norm": 5.014630317687988,
915
+ "learning_rate": 1.9822530570180568e-05,
916
+ "loss": 1.8277916259765625,
917
+ "step": 30500
918
+ },
919
+ {
920
+ "epoch": 0.06747339778333296,
921
+ "eval_loss": 1.6496976613998413,
922
+ "eval_runtime": 65.7954,
923
+ "eval_samples_per_second": 151.986,
924
+ "eval_steps_per_second": 9.499,
925
+ "step": 30500
926
+ },
927
+ {
928
+ "epoch": 0.06857951905846957,
929
+ "grad_norm": 4.427914619445801,
930
+ "learning_rate": 1.9816583726202243e-05,
931
+ "loss": 1.8151114501953125,
932
+ "step": 31000
933
+ },
934
+ {
935
+ "epoch": 0.06857951905846957,
936
+ "eval_loss": 1.6335314512252808,
937
+ "eval_runtime": 65.8023,
938
+ "eval_samples_per_second": 151.97,
939
+ "eval_steps_per_second": 9.498,
940
+ "step": 31000
941
+ },
942
+ {
943
+ "epoch": 0.06968564033360618,
944
+ "grad_norm": 5.199036598205566,
945
+ "learning_rate": 1.9810539802443333e-05,
946
+ "loss": 1.8143702392578125,
947
+ "step": 31500
948
+ },
949
+ {
950
+ "epoch": 0.06968564033360618,
951
+ "eval_loss": 1.623861312866211,
952
+ "eval_runtime": 66.1814,
953
+ "eval_samples_per_second": 151.1,
954
+ "eval_steps_per_second": 9.444,
955
+ "step": 31500
956
+ },
957
+ {
958
+ "epoch": 0.07079176160874279,
959
+ "grad_norm": 4.4861226081848145,
960
+ "learning_rate": 1.980439885867441e-05,
961
+ "loss": 1.785080078125,
962
+ "step": 32000
963
+ },
964
+ {
965
+ "epoch": 0.07079176160874279,
966
+ "eval_loss": 1.61989164352417,
967
+ "eval_runtime": 65.8909,
968
+ "eval_samples_per_second": 151.766,
969
+ "eval_steps_per_second": 9.485,
970
+ "step": 32000
971
+ },
972
+ {
973
+ "epoch": 0.07189788288387938,
974
+ "grad_norm": 5.459568023681641,
975
+ "learning_rate": 1.9798160955625502e-05,
976
+ "loss": 1.790661865234375,
977
+ "step": 32500
978
+ },
979
+ {
980
+ "epoch": 0.07189788288387938,
981
+ "eval_loss": 1.5985878705978394,
982
+ "eval_runtime": 66.8491,
983
+ "eval_samples_per_second": 149.591,
984
+ "eval_steps_per_second": 9.349,
985
+ "step": 32500
986
+ },
987
+ {
988
+ "epoch": 0.07300400415901599,
989
+ "grad_norm": 5.195436954498291,
990
+ "learning_rate": 1.9791826154985515e-05,
991
+ "loss": 1.770203369140625,
992
+ "step": 33000
993
+ },
994
+ {
995
+ "epoch": 0.07300400415901599,
996
+ "eval_loss": 1.5977914333343506,
997
+ "eval_runtime": 69.3781,
998
+ "eval_samples_per_second": 144.138,
999
+ "eval_steps_per_second": 9.009,
1000
+ "step": 33000
1001
+ },
1002
+ {
1003
+ "epoch": 0.0741101254341526,
1004
+ "grad_norm": 4.659327983856201,
1005
+ "learning_rate": 1.978539451940161e-05,
1006
+ "loss": 1.756498291015625,
1007
+ "step": 33500
1008
+ },
1009
+ {
1010
+ "epoch": 0.0741101254341526,
1011
+ "eval_loss": 1.5864726305007935,
1012
+ "eval_runtime": 68.1458,
1013
+ "eval_samples_per_second": 146.744,
1014
+ "eval_steps_per_second": 9.172,
1015
+ "step": 33500
1016
+ },
1017
+ {
1018
+ "epoch": 0.07521624670928921,
1019
+ "grad_norm": 4.486781120300293,
1020
+ "learning_rate": 1.977886611247857e-05,
1021
+ "loss": 1.7513958740234374,
1022
+ "step": 34000
1023
+ },
1024
+ {
1025
+ "epoch": 0.07521624670928921,
1026
+ "eval_loss": 1.5759690999984741,
1027
+ "eval_runtime": 66.295,
1028
+ "eval_samples_per_second": 150.841,
1029
+ "eval_steps_per_second": 9.428,
1030
+ "step": 34000
1031
+ },
1032
+ {
1033
+ "epoch": 0.0763223679844258,
1034
+ "grad_norm": 4.723703861236572,
1035
+ "learning_rate": 1.97722409987782e-05,
1036
+ "loss": 1.7431859130859375,
1037
+ "step": 34500
1038
+ },
1039
+ {
1040
+ "epoch": 0.0763223679844258,
1041
+ "eval_loss": 1.5756099224090576,
1042
+ "eval_runtime": 66.3119,
1043
+ "eval_samples_per_second": 150.803,
1044
+ "eval_steps_per_second": 9.425,
1045
+ "step": 34500
1046
+ },
1047
+ {
1048
+ "epoch": 0.07742848925956242,
1049
+ "grad_norm": 4.389305114746094,
1050
+ "learning_rate": 1.9765519243818665e-05,
1051
+ "loss": 1.732319580078125,
1052
+ "step": 35000
1053
+ },
1054
+ {
1055
+ "epoch": 0.07742848925956242,
1056
+ "eval_loss": 1.5581341981887817,
1057
+ "eval_runtime": 66.4353,
1058
+ "eval_samples_per_second": 150.522,
1059
+ "eval_steps_per_second": 9.408,
1060
+ "step": 35000
1061
+ },
1062
+ {
1063
+ "epoch": 0.07853461053469903,
1064
+ "grad_norm": 4.597053050994873,
1065
+ "learning_rate": 1.9758700914073858e-05,
1066
+ "loss": 1.7261806640625,
1067
+ "step": 35500
1068
+ },
1069
+ {
1070
+ "epoch": 0.07853461053469903,
1071
+ "eval_loss": 1.5474776029586792,
1072
+ "eval_runtime": 65.4425,
1073
+ "eval_samples_per_second": 152.806,
1074
+ "eval_steps_per_second": 9.55,
1075
+ "step": 35500
1076
+ },
1077
+ {
1078
+ "epoch": 0.07964073180983564,
1079
+ "grad_norm": 5.074342250823975,
1080
+ "learning_rate": 1.975178607697273e-05,
1081
+ "loss": 1.704677001953125,
1082
+ "step": 36000
1083
+ },
1084
+ {
1085
+ "epoch": 0.07964073180983564,
1086
+ "eval_loss": 1.5465320348739624,
1087
+ "eval_runtime": 67.0948,
1088
+ "eval_samples_per_second": 149.043,
1089
+ "eval_steps_per_second": 9.315,
1090
+ "step": 36000
1091
+ },
1092
+ {
1093
+ "epoch": 0.08074685308497223,
1094
+ "grad_norm": 4.983928680419922,
1095
+ "learning_rate": 1.974477480089863e-05,
1096
+ "loss": 1.7111588134765625,
1097
+ "step": 36500
1098
+ },
1099
+ {
1100
+ "epoch": 0.08074685308497223,
1101
+ "eval_loss": 1.5471775531768799,
1102
+ "eval_runtime": 66.0681,
1103
+ "eval_samples_per_second": 151.359,
1104
+ "eval_steps_per_second": 9.46,
1105
+ "step": 36500
1106
+ },
1107
+ {
1108
+ "epoch": 0.08185297436010884,
1109
+ "grad_norm": 4.309070587158203,
1110
+ "learning_rate": 1.9737667155188625e-05,
1111
+ "loss": 1.700852783203125,
1112
+ "step": 37000
1113
+ },
1114
+ {
1115
+ "epoch": 0.08185297436010884,
1116
+ "eval_loss": 1.5260053873062134,
1117
+ "eval_runtime": 65.5968,
1118
+ "eval_samples_per_second": 152.446,
1119
+ "eval_steps_per_second": 9.528,
1120
+ "step": 37000
1121
+ },
1122
+ {
1123
+ "epoch": 0.08295909563524545,
1124
+ "grad_norm": 5.114826679229736,
1125
+ "learning_rate": 1.9730463210132817e-05,
1126
+ "loss": 1.699755615234375,
1127
+ "step": 37500
1128
+ },
1129
+ {
1130
+ "epoch": 0.08295909563524545,
1131
+ "eval_loss": 1.5352414846420288,
1132
+ "eval_runtime": 65.7743,
1133
+ "eval_samples_per_second": 152.035,
1134
+ "eval_steps_per_second": 9.502,
1135
+ "step": 37500
1136
+ },
1137
+ {
1138
+ "epoch": 0.08406521691038206,
1139
+ "grad_norm": 4.944478988647461,
1140
+ "learning_rate": 1.9723163036973652e-05,
1141
+ "loss": 1.6774451904296874,
1142
+ "step": 38000
1143
+ },
1144
+ {
1145
+ "epoch": 0.08406521691038206,
1146
+ "eval_loss": 1.5184470415115356,
1147
+ "eval_runtime": 66.7501,
1148
+ "eval_samples_per_second": 149.813,
1149
+ "eval_steps_per_second": 9.363,
1150
+ "step": 38000
1151
+ },
1152
+ {
1153
+ "epoch": 0.08517133818551866,
1154
+ "grad_norm": 4.7983012199401855,
1155
+ "learning_rate": 1.971576670790521e-05,
1156
+ "loss": 1.6922623291015626,
1157
+ "step": 38500
1158
+ },
1159
+ {
1160
+ "epoch": 0.08517133818551866,
1161
+ "eval_loss": 1.5099477767944336,
1162
+ "eval_runtime": 65.8114,
1163
+ "eval_samples_per_second": 151.949,
1164
+ "eval_steps_per_second": 9.497,
1165
+ "step": 38500
1166
+ },
1167
+ {
1168
+ "epoch": 0.08627745946065526,
1169
+ "grad_norm": 4.645780563354492,
1170
+ "learning_rate": 1.9708274296072487e-05,
1171
+ "loss": 1.6959698486328125,
1172
+ "step": 39000
1173
+ },
1174
+ {
1175
+ "epoch": 0.08627745946065526,
1176
+ "eval_loss": 1.5127439498901367,
1177
+ "eval_runtime": 66.0848,
1178
+ "eval_samples_per_second": 151.321,
1179
+ "eval_steps_per_second": 9.458,
1180
+ "step": 39000
1181
+ },
1182
+ {
1183
+ "epoch": 0.08738358073579187,
1184
+ "grad_norm": 5.602351188659668,
1185
+ "learning_rate": 1.9700685875570678e-05,
1186
+ "loss": 1.668989501953125,
1187
+ "step": 39500
1188
+ },
1189
+ {
1190
+ "epoch": 0.08738358073579187,
1191
+ "eval_loss": 1.5060431957244873,
1192
+ "eval_runtime": 65.3814,
1193
+ "eval_samples_per_second": 152.949,
1194
+ "eval_steps_per_second": 9.559,
1195
+ "step": 39500
1196
+ },
1197
+ {
1198
+ "epoch": 0.08848970201092848,
1199
+ "grad_norm": 5.003055572509766,
1200
+ "learning_rate": 1.9693001521444445e-05,
1201
+ "loss": 1.657955810546875,
1202
+ "step": 40000
1203
+ },
1204
+ {
1205
+ "epoch": 0.08848970201092848,
1206
+ "eval_loss": 1.487270712852478,
1207
+ "eval_runtime": 65.5877,
1208
+ "eval_samples_per_second": 152.468,
1209
+ "eval_steps_per_second": 9.529,
1210
+ "step": 40000
1211
+ }
1212
+ ],
1213
+ "logging_steps": 500,
1214
+ "max_steps": 500000,
1215
+ "num_input_tokens_seen": 0,
1216
+ "num_train_epochs": 2,
1217
+ "save_steps": 500,
1218
+ "stateful_callbacks": {
1219
+ "EarlyStoppingCallback": {
1220
+ "args": {
1221
+ "early_stopping_patience": 8,
1222
+ "early_stopping_threshold": 0.0
1223
+ },
1224
+ "attributes": {
1225
+ "early_stopping_patience_counter": 0
1226
+ }
1227
+ },
1228
+ "TrainerControl": {
1229
+ "args": {
1230
+ "should_epoch_stop": false,
1231
+ "should_evaluate": false,
1232
+ "should_log": false,
1233
+ "should_save": true,
1234
+ "should_training_stop": false
1235
+ },
1236
+ "attributes": {}
1237
+ }
1238
+ },
1239
+ "total_flos": 8.427905821534618e+16,
1240
+ "train_batch_size": 16,
1241
+ "trial_name": null,
1242
+ "trial_params": null
1243
+ }
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9389243dbf7fcc95a280d47b0331a96e11d3aead152fe1769d52dee590c11663
3
+ size 4856
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "DebertaV2ForMaskedLM"
4
+ ],
5
+ "attention_head_size": 64,
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": null,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-07,
16
+ "legacy": true,
17
+ "max_position_embeddings": 512,
18
+ "max_relative_positions": -1,
19
+ "model_type": "deberta-v2",
20
+ "norm_rel_ebd": "layer_norm",
21
+ "num_attention_heads": 12,
22
+ "num_hidden_layers": 12,
23
+ "pad_token_id": 0,
24
+ "pooler_dropout": 0.0,
25
+ "pooler_hidden_act": "gelu",
26
+ "pooler_hidden_size": 768,
27
+ "pos_att_type": [
28
+ "p2c",
29
+ "c2p"
30
+ ],
31
+ "position_biased_input": false,
32
+ "position_buckets": 256,
33
+ "relative_attention": true,
34
+ "share_att_key": true,
35
+ "tie_word_embeddings": true,
36
+ "transformers_version": "5.8.0",
37
+ "type_vocab_size": 0,
38
+ "use_cache": false,
39
+ "vocab_size": 128000
40
+ }
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8eb2fc2e2e898e4a42afc350807290880f01c2b0419e9c2fe925d36a74ff8f4c
3
+ size 737924256
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:78a1f7ae16bf601e00e41817747d0978f0547f51f226ae2d0b81f704425d2947
3
+ size 1475968826
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e18608d76e6397648d03ad3b0131032df8eb868d101074c7d3933facf0a43f3f
3
+ size 14244
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f340e6813a4405eaaf5974d413910f5327bdd12720dba397540c5fa202d5a632
3
+ size 1064
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/tokenizer_config.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "backend": "tokenizers",
4
+ "bos_token": "[CLS]",
5
+ "cls_token": "[CLS]",
6
+ "do_lower_case": false,
7
+ "eos_token": "[SEP]",
8
+ "is_local": false,
9
+ "local_files_only": false,
10
+ "mask_token": "[MASK]",
11
+ "model_max_length": 1000000000000000019884624838656,
12
+ "pad_token": "[PAD]",
13
+ "sep_token": "[SEP]",
14
+ "sp_model_kwargs": {},
15
+ "split_by_punct": false,
16
+ "tokenizer_class": "DebertaV2Tokenizer",
17
+ "unk_id": 3,
18
+ "unk_token": "[UNK]",
19
+ "vocab_type": "spm"
20
+ }
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/trainer_state.json ADDED
@@ -0,0 +1,1258 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 40000,
3
+ "best_metric": 1.487270712852478,
4
+ "best_model_checkpoint": "pretrained_checkpoints/Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40000",
5
+ "epoch": 0.08959582328606508,
6
+ "eval_steps": 500,
7
+ "global_step": 40500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.001106121275136606,
14
+ "grad_norm": 9.475790977478027,
15
+ "learning_rate": 1.9960000000000002e-05,
16
+ "loss": 10.73539453125,
17
+ "step": 500
18
+ },
19
+ {
20
+ "epoch": 0.001106121275136606,
21
+ "eval_loss": 6.908179759979248,
22
+ "eval_runtime": 65.5198,
23
+ "eval_samples_per_second": 152.626,
24
+ "eval_steps_per_second": 9.539,
25
+ "step": 500
26
+ },
27
+ {
28
+ "epoch": 0.002212242550273212,
29
+ "grad_norm": 4.896268367767334,
30
+ "learning_rate": 1.9999950750763816e-05,
31
+ "loss": 6.3172548828125,
32
+ "step": 1000
33
+ },
34
+ {
35
+ "epoch": 0.002212242550273212,
36
+ "eval_loss": 5.584421634674072,
37
+ "eval_runtime": 65.633,
38
+ "eval_samples_per_second": 152.362,
39
+ "eval_steps_per_second": 9.523,
40
+ "step": 1000
41
+ },
42
+ {
43
+ "epoch": 0.003318363825409818,
44
+ "grad_norm": 5.7100324630737305,
45
+ "learning_rate": 1.999980260856137e-05,
46
+ "loss": 5.51156884765625,
47
+ "step": 1500
48
+ },
49
+ {
50
+ "epoch": 0.003318363825409818,
51
+ "eval_loss": 5.097376823425293,
52
+ "eval_runtime": 65.5025,
53
+ "eval_samples_per_second": 152.666,
54
+ "eval_steps_per_second": 9.542,
55
+ "step": 1500
56
+ },
57
+ {
58
+ "epoch": 0.004424485100546424,
59
+ "grad_norm": 5.015883922576904,
60
+ "learning_rate": 1.9999555574659926e-05,
61
+ "loss": 5.04186083984375,
62
+ "step": 2000
63
+ },
64
+ {
65
+ "epoch": 0.004424485100546424,
66
+ "eval_loss": 4.640530109405518,
67
+ "eval_runtime": 65.8074,
68
+ "eval_samples_per_second": 151.959,
69
+ "eval_steps_per_second": 9.497,
70
+ "step": 2000
71
+ },
72
+ {
73
+ "epoch": 0.00553060637568303,
74
+ "grad_norm": 5.8804450035095215,
75
+ "learning_rate": 1.9999209651502484e-05,
76
+ "loss": 4.6854267578125,
77
+ "step": 2500
78
+ },
79
+ {
80
+ "epoch": 0.00553060637568303,
81
+ "eval_loss": 4.30808162689209,
82
+ "eval_runtime": 65.7347,
83
+ "eval_samples_per_second": 152.127,
84
+ "eval_steps_per_second": 9.508,
85
+ "step": 2500
86
+ },
87
+ {
88
+ "epoch": 0.006636727650819636,
89
+ "grad_norm": 6.087777614593506,
90
+ "learning_rate": 1.999876484251e-05,
91
+ "loss": 4.3789228515625,
92
+ "step": 3000
93
+ },
94
+ {
95
+ "epoch": 0.006636727650819636,
96
+ "eval_loss": 4.010719299316406,
97
+ "eval_runtime": 65.6921,
98
+ "eval_samples_per_second": 152.225,
99
+ "eval_steps_per_second": 9.514,
100
+ "step": 3000
101
+ },
102
+ {
103
+ "epoch": 0.0077428489259562415,
104
+ "grad_norm": 5.5657639503479,
105
+ "learning_rate": 1.9998221152081356e-05,
106
+ "loss": 4.1345771484375,
107
+ "step": 3500
108
+ },
109
+ {
110
+ "epoch": 0.0077428489259562415,
111
+ "eval_loss": 3.785635232925415,
112
+ "eval_runtime": 66.3485,
113
+ "eval_samples_per_second": 150.719,
114
+ "eval_steps_per_second": 9.42,
115
+ "step": 3500
116
+ },
117
+ {
118
+ "epoch": 0.008848970201092848,
119
+ "grad_norm": 6.631436824798584,
120
+ "learning_rate": 1.999757858559331e-05,
121
+ "loss": 3.9143818359375,
122
+ "step": 4000
123
+ },
124
+ {
125
+ "epoch": 0.008848970201092848,
126
+ "eval_loss": 3.588374614715576,
127
+ "eval_runtime": 66.3332,
128
+ "eval_samples_per_second": 150.754,
129
+ "eval_steps_per_second": 9.422,
130
+ "step": 4000
131
+ },
132
+ {
133
+ "epoch": 0.009955091476229454,
134
+ "grad_norm": 5.396254062652588,
135
+ "learning_rate": 1.999683714940043e-05,
136
+ "loss": 3.759765869140625,
137
+ "step": 4500
138
+ },
139
+ {
140
+ "epoch": 0.009955091476229454,
141
+ "eval_loss": 3.429428815841675,
142
+ "eval_runtime": 65.5002,
143
+ "eval_samples_per_second": 152.671,
144
+ "eval_steps_per_second": 9.542,
145
+ "step": 4500
146
+ },
147
+ {
148
+ "epoch": 0.01106121275136606,
149
+ "grad_norm": 5.386684894561768,
150
+ "learning_rate": 1.999599685083505e-05,
151
+ "loss": 3.61756494140625,
152
+ "step": 5000
153
+ },
154
+ {
155
+ "epoch": 0.01106121275136606,
156
+ "eval_loss": 3.315566301345825,
157
+ "eval_runtime": 65.3359,
158
+ "eval_samples_per_second": 153.055,
159
+ "eval_steps_per_second": 9.566,
160
+ "step": 5000
161
+ },
162
+ {
163
+ "epoch": 0.012167334026502667,
164
+ "grad_norm": 6.260346412658691,
165
+ "learning_rate": 1.9995057698207195e-05,
166
+ "loss": 3.486438720703125,
167
+ "step": 5500
168
+ },
169
+ {
170
+ "epoch": 0.012167334026502667,
171
+ "eval_loss": 3.190394639968872,
172
+ "eval_runtime": 65.353,
173
+ "eval_samples_per_second": 153.015,
174
+ "eval_steps_per_second": 9.563,
175
+ "step": 5500
176
+ },
177
+ {
178
+ "epoch": 0.013273455301639273,
179
+ "grad_norm": 5.308413028717041,
180
+ "learning_rate": 1.9994019700804483e-05,
181
+ "loss": 3.372943115234375,
182
+ "step": 6000
183
+ },
184
+ {
185
+ "epoch": 0.013273455301639273,
186
+ "eval_loss": 3.07236647605896,
187
+ "eval_runtime": 65.1836,
188
+ "eval_samples_per_second": 153.413,
189
+ "eval_steps_per_second": 9.588,
190
+ "step": 6000
191
+ },
192
+ {
193
+ "epoch": 0.014379576576775877,
194
+ "grad_norm": 5.559189796447754,
195
+ "learning_rate": 1.9992882868892052e-05,
196
+ "loss": 3.33723486328125,
197
+ "step": 6500
198
+ },
199
+ {
200
+ "epoch": 0.014379576576775877,
201
+ "eval_loss": 2.9914042949676514,
202
+ "eval_runtime": 65.1138,
203
+ "eval_samples_per_second": 153.577,
204
+ "eval_steps_per_second": 9.599,
205
+ "step": 6500
206
+ },
207
+ {
208
+ "epoch": 0.015485697851912483,
209
+ "grad_norm": 5.7293925285339355,
210
+ "learning_rate": 1.9991647213712446e-05,
211
+ "loss": 3.1835166015625,
212
+ "step": 7000
213
+ },
214
+ {
215
+ "epoch": 0.015485697851912483,
216
+ "eval_loss": 2.9056553840637207,
217
+ "eval_runtime": 66.6383,
218
+ "eval_samples_per_second": 150.064,
219
+ "eval_steps_per_second": 9.379,
220
+ "step": 7000
221
+ },
222
+ {
223
+ "epoch": 0.01659181912704909,
224
+ "grad_norm": 5.745417594909668,
225
+ "learning_rate": 1.999031274748551e-05,
226
+ "loss": 3.09816748046875,
227
+ "step": 7500
228
+ },
229
+ {
230
+ "epoch": 0.01659181912704909,
231
+ "eval_loss": 2.8260159492492676,
232
+ "eval_runtime": 65.6949,
233
+ "eval_samples_per_second": 152.219,
234
+ "eval_steps_per_second": 9.514,
235
+ "step": 7500
236
+ },
237
+ {
238
+ "epoch": 0.017697940402185697,
239
+ "grad_norm": 5.706750869750977,
240
+ "learning_rate": 1.9988879483408266e-05,
241
+ "loss": 3.02596435546875,
242
+ "step": 8000
243
+ },
244
+ {
245
+ "epoch": 0.017697940402185697,
246
+ "eval_loss": 2.7651631832122803,
247
+ "eval_runtime": 65.8495,
248
+ "eval_samples_per_second": 151.862,
249
+ "eval_steps_per_second": 9.491,
250
+ "step": 8000
251
+ },
252
+ {
253
+ "epoch": 0.018804061677322303,
254
+ "grad_norm": 4.90167760848999,
255
+ "learning_rate": 1.998734743565479e-05,
256
+ "loss": 2.940542236328125,
257
+ "step": 8500
258
+ },
259
+ {
260
+ "epoch": 0.018804061677322303,
261
+ "eval_loss": 2.683983325958252,
262
+ "eval_runtime": 65.8236,
263
+ "eval_samples_per_second": 151.921,
264
+ "eval_steps_per_second": 9.495,
265
+ "step": 8500
266
+ },
267
+ {
268
+ "epoch": 0.01991018295245891,
269
+ "grad_norm": 6.079418182373047,
270
+ "learning_rate": 1.998571661937606e-05,
271
+ "loss": 2.8865009765625,
272
+ "step": 9000
273
+ },
274
+ {
275
+ "epoch": 0.01991018295245891,
276
+ "eval_loss": 2.624776840209961,
277
+ "eval_runtime": 65.9969,
278
+ "eval_samples_per_second": 151.522,
279
+ "eval_steps_per_second": 9.47,
280
+ "step": 9000
281
+ },
282
+ {
283
+ "epoch": 0.021016304227595515,
284
+ "grad_norm": 5.454369068145752,
285
+ "learning_rate": 1.9983987050699813e-05,
286
+ "loss": 2.817274169921875,
287
+ "step": 9500
288
+ },
289
+ {
290
+ "epoch": 0.021016304227595515,
291
+ "eval_loss": 2.580995559692383,
292
+ "eval_runtime": 65.6963,
293
+ "eval_samples_per_second": 152.216,
294
+ "eval_steps_per_second": 9.513,
295
+ "step": 9500
296
+ },
297
+ {
298
+ "epoch": 0.02212242550273212,
299
+ "grad_norm": 5.633095741271973,
300
+ "learning_rate": 1.9982158746730387e-05,
301
+ "loss": 2.784319091796875,
302
+ "step": 10000
303
+ },
304
+ {
305
+ "epoch": 0.02212242550273212,
306
+ "eval_loss": 2.502817153930664,
307
+ "eval_runtime": 65.4322,
308
+ "eval_samples_per_second": 152.83,
309
+ "eval_steps_per_second": 9.552,
310
+ "step": 10000
311
+ },
312
+ {
313
+ "epoch": 0.023228546777868727,
314
+ "grad_norm": 5.46868896484375,
315
+ "learning_rate": 1.9980231725548545e-05,
316
+ "loss": 2.702649658203125,
317
+ "step": 10500
318
+ },
319
+ {
320
+ "epoch": 0.023228546777868727,
321
+ "eval_loss": 2.465555191040039,
322
+ "eval_runtime": 65.0987,
323
+ "eval_samples_per_second": 153.613,
324
+ "eval_steps_per_second": 9.601,
325
+ "step": 10500
326
+ },
327
+ {
328
+ "epoch": 0.024334668053005333,
329
+ "grad_norm": 5.703943252563477,
330
+ "learning_rate": 1.9978206006211304e-05,
331
+ "loss": 2.6762646484375,
332
+ "step": 11000
333
+ },
334
+ {
335
+ "epoch": 0.024334668053005333,
336
+ "eval_loss": 2.410994529724121,
337
+ "eval_runtime": 65.8492,
338
+ "eval_samples_per_second": 151.862,
339
+ "eval_steps_per_second": 9.491,
340
+ "step": 11000
341
+ },
342
+ {
343
+ "epoch": 0.02544078932814194,
344
+ "grad_norm": 5.745393753051758,
345
+ "learning_rate": 1.9976081608751742e-05,
346
+ "loss": 2.61624267578125,
347
+ "step": 11500
348
+ },
349
+ {
350
+ "epoch": 0.02544078932814194,
351
+ "eval_loss": 2.377451181411743,
352
+ "eval_runtime": 65.697,
353
+ "eval_samples_per_second": 152.214,
354
+ "eval_steps_per_second": 9.513,
355
+ "step": 11500
356
+ },
357
+ {
358
+ "epoch": 0.026546910603278545,
359
+ "grad_norm": 5.889176845550537,
360
+ "learning_rate": 1.99738585541788e-05,
361
+ "loss": 2.5832724609375,
362
+ "step": 12000
363
+ },
364
+ {
365
+ "epoch": 0.026546910603278545,
366
+ "eval_loss": 2.334881544113159,
367
+ "eval_runtime": 65.862,
368
+ "eval_samples_per_second": 151.833,
369
+ "eval_steps_per_second": 9.49,
370
+ "step": 12000
371
+ },
372
+ {
373
+ "epoch": 0.027653031878415148,
374
+ "grad_norm": 5.409160614013672,
375
+ "learning_rate": 1.9971536864477078e-05,
376
+ "loss": 2.548913818359375,
377
+ "step": 12500
378
+ },
379
+ {
380
+ "epoch": 0.027653031878415148,
381
+ "eval_loss": 2.30452823638916,
382
+ "eval_runtime": 65.0769,
383
+ "eval_samples_per_second": 153.664,
384
+ "eval_steps_per_second": 9.604,
385
+ "step": 12500
386
+ },
387
+ {
388
+ "epoch": 0.028759153153551754,
389
+ "grad_norm": 5.37885046005249,
390
+ "learning_rate": 1.9969116562606614e-05,
391
+ "loss": 2.498342041015625,
392
+ "step": 13000
393
+ },
394
+ {
395
+ "epoch": 0.028759153153551754,
396
+ "eval_loss": 2.262269973754883,
397
+ "eval_runtime": 66.4547,
398
+ "eval_samples_per_second": 150.478,
399
+ "eval_steps_per_second": 9.405,
400
+ "step": 13000
401
+ },
402
+ {
403
+ "epoch": 0.02986527442868836,
404
+ "grad_norm": 5.803339004516602,
405
+ "learning_rate": 1.9966597672502653e-05,
406
+ "loss": 2.449419921875,
407
+ "step": 13500
408
+ },
409
+ {
410
+ "epoch": 0.02986527442868836,
411
+ "eval_loss": 2.2417187690734863,
412
+ "eval_runtime": 65.9915,
413
+ "eval_samples_per_second": 151.535,
414
+ "eval_steps_per_second": 9.471,
415
+ "step": 13500
416
+ },
417
+ {
418
+ "epoch": 0.030971395703824966,
419
+ "grad_norm": 5.598288059234619,
420
+ "learning_rate": 1.9963980219075425e-05,
421
+ "loss": 2.43294775390625,
422
+ "step": 14000
423
+ },
424
+ {
425
+ "epoch": 0.030971395703824966,
426
+ "eval_loss": 2.1951167583465576,
427
+ "eval_runtime": 66.3059,
428
+ "eval_samples_per_second": 150.816,
429
+ "eval_steps_per_second": 9.426,
430
+ "step": 14000
431
+ },
432
+ {
433
+ "epoch": 0.03207751697896157,
434
+ "grad_norm": 5.400110244750977,
435
+ "learning_rate": 1.9961264228209876e-05,
436
+ "loss": 2.380520263671875,
437
+ "step": 14500
438
+ },
439
+ {
440
+ "epoch": 0.03207751697896157,
441
+ "eval_loss": 2.1698226928710938,
442
+ "eval_runtime": 65.841,
443
+ "eval_samples_per_second": 151.881,
444
+ "eval_steps_per_second": 9.493,
445
+ "step": 14500
446
+ },
447
+ {
448
+ "epoch": 0.03318363825409818,
449
+ "grad_norm": 5.006521224975586,
450
+ "learning_rate": 1.995844972676544e-05,
451
+ "loss": 2.36803515625,
452
+ "step": 15000
453
+ },
454
+ {
455
+ "epoch": 0.03318363825409818,
456
+ "eval_loss": 2.1508238315582275,
457
+ "eval_runtime": 65.8184,
458
+ "eval_samples_per_second": 151.933,
459
+ "eval_steps_per_second": 9.496,
460
+ "step": 15000
461
+ },
462
+ {
463
+ "epoch": 0.034289759529234784,
464
+ "grad_norm": 22.403335571289062,
465
+ "learning_rate": 1.9955536742575737e-05,
466
+ "loss": 2.337472900390625,
467
+ "step": 15500
468
+ },
469
+ {
470
+ "epoch": 0.034289759529234784,
471
+ "eval_loss": 2.131364345550537,
472
+ "eval_runtime": 65.3739,
473
+ "eval_samples_per_second": 152.966,
474
+ "eval_steps_per_second": 9.56,
475
+ "step": 15500
476
+ },
477
+ {
478
+ "epoch": 0.035395880804371394,
479
+ "grad_norm": 4.748437881469727,
480
+ "learning_rate": 1.995252530444834e-05,
481
+ "loss": 2.32045849609375,
482
+ "step": 16000
483
+ },
484
+ {
485
+ "epoch": 0.035395880804371394,
486
+ "eval_loss": 2.0844030380249023,
487
+ "eval_runtime": 65.3283,
488
+ "eval_samples_per_second": 153.073,
489
+ "eval_steps_per_second": 9.567,
490
+ "step": 16000
491
+ },
492
+ {
493
+ "epoch": 0.036502002079507996,
494
+ "grad_norm": 4.933561325073242,
495
+ "learning_rate": 1.9949415442164463e-05,
496
+ "loss": 2.2753798828125,
497
+ "step": 16500
498
+ },
499
+ {
500
+ "epoch": 0.036502002079507996,
501
+ "eval_loss": 2.060131549835205,
502
+ "eval_runtime": 65.6122,
503
+ "eval_samples_per_second": 152.411,
504
+ "eval_steps_per_second": 9.526,
505
+ "step": 16500
506
+ },
507
+ {
508
+ "epoch": 0.037608123354644606,
509
+ "grad_norm": 5.674777507781982,
510
+ "learning_rate": 1.9946207186478655e-05,
511
+ "loss": 2.25116943359375,
512
+ "step": 17000
513
+ },
514
+ {
515
+ "epoch": 0.037608123354644606,
516
+ "eval_loss": 2.0405194759368896,
517
+ "eval_runtime": 65.3009,
518
+ "eval_samples_per_second": 153.137,
519
+ "eval_steps_per_second": 9.571,
520
+ "step": 17000
521
+ },
522
+ {
523
+ "epoch": 0.03871424462978121,
524
+ "grad_norm": 5.777343273162842,
525
+ "learning_rate": 1.9942900569118546e-05,
526
+ "loss": 2.23547802734375,
527
+ "step": 17500
528
+ },
529
+ {
530
+ "epoch": 0.03871424462978121,
531
+ "eval_loss": 2.0208609104156494,
532
+ "eval_runtime": 66.1739,
533
+ "eval_samples_per_second": 151.117,
534
+ "eval_steps_per_second": 9.445,
535
+ "step": 17500
536
+ },
537
+ {
538
+ "epoch": 0.03982036590491782,
539
+ "grad_norm": 5.607430458068848,
540
+ "learning_rate": 1.9939495622784472e-05,
541
+ "loss": 2.1993876953125,
542
+ "step": 18000
543
+ },
544
+ {
545
+ "epoch": 0.03982036590491782,
546
+ "eval_loss": 2.001434087753296,
547
+ "eval_runtime": 66.1661,
548
+ "eval_samples_per_second": 151.135,
549
+ "eval_steps_per_second": 9.446,
550
+ "step": 18000
551
+ },
552
+ {
553
+ "epoch": 0.04092648718005442,
554
+ "grad_norm": 5.273671627044678,
555
+ "learning_rate": 1.993599238114919e-05,
556
+ "loss": 2.180281982421875,
557
+ "step": 18500
558
+ },
559
+ {
560
+ "epoch": 0.04092648718005442,
561
+ "eval_loss": 1.983248233795166,
562
+ "eval_runtime": 65.6213,
563
+ "eval_samples_per_second": 152.39,
564
+ "eval_steps_per_second": 9.524,
565
+ "step": 18500
566
+ },
567
+ {
568
+ "epoch": 0.04203260845519103,
569
+ "grad_norm": 5.48894739151001,
570
+ "learning_rate": 1.993239087885754e-05,
571
+ "loss": 2.180351318359375,
572
+ "step": 19000
573
+ },
574
+ {
575
+ "epoch": 0.04203260845519103,
576
+ "eval_loss": 1.9536426067352295,
577
+ "eval_runtime": 65.1545,
578
+ "eval_samples_per_second": 153.481,
579
+ "eval_steps_per_second": 9.593,
580
+ "step": 19000
581
+ },
582
+ {
583
+ "epoch": 0.04313872973032763,
584
+ "grad_norm": 4.517572402954102,
585
+ "learning_rate": 1.992869115152609e-05,
586
+ "loss": 2.14364501953125,
587
+ "step": 19500
588
+ },
589
+ {
590
+ "epoch": 0.04313872973032763,
591
+ "eval_loss": 1.9281601905822754,
592
+ "eval_runtime": 65.6074,
593
+ "eval_samples_per_second": 152.422,
594
+ "eval_steps_per_second": 9.526,
595
+ "step": 19500
596
+ },
597
+ {
598
+ "epoch": 0.04424485100546424,
599
+ "grad_norm": 5.366357326507568,
600
+ "learning_rate": 1.9924893235742795e-05,
601
+ "loss": 2.124390380859375,
602
+ "step": 20000
603
+ },
604
+ {
605
+ "epoch": 0.04424485100546424,
606
+ "eval_loss": 1.9185084104537964,
607
+ "eval_runtime": 66.4777,
608
+ "eval_samples_per_second": 150.426,
609
+ "eval_steps_per_second": 9.402,
610
+ "step": 20000
611
+ },
612
+ {
613
+ "epoch": 0.045350972280600844,
614
+ "grad_norm": 5.40119743347168,
615
+ "learning_rate": 1.992099716906663e-05,
616
+ "loss": 2.11509521484375,
617
+ "step": 20500
618
+ },
619
+ {
620
+ "epoch": 0.045350972280600844,
621
+ "eval_loss": 1.8964039087295532,
622
+ "eval_runtime": 65.269,
623
+ "eval_samples_per_second": 153.212,
624
+ "eval_steps_per_second": 9.576,
625
+ "step": 20500
626
+ },
627
+ {
628
+ "epoch": 0.046457093555737454,
629
+ "grad_norm": 4.91980504989624,
630
+ "learning_rate": 1.9917002990027225e-05,
631
+ "loss": 2.080730224609375,
632
+ "step": 21000
633
+ },
634
+ {
635
+ "epoch": 0.046457093555737454,
636
+ "eval_loss": 1.8814513683319092,
637
+ "eval_runtime": 65.8396,
638
+ "eval_samples_per_second": 151.884,
639
+ "eval_steps_per_second": 9.493,
640
+ "step": 21000
641
+ },
642
+ {
643
+ "epoch": 0.04756321483087406,
644
+ "grad_norm": 5.756763458251953,
645
+ "learning_rate": 1.991291073812447e-05,
646
+ "loss": 2.062693359375,
647
+ "step": 21500
648
+ },
649
+ {
650
+ "epoch": 0.04756321483087406,
651
+ "eval_loss": 1.8653240203857422,
652
+ "eval_runtime": 65.2727,
653
+ "eval_samples_per_second": 153.203,
654
+ "eval_steps_per_second": 9.575,
655
+ "step": 21500
656
+ },
657
+ {
658
+ "epoch": 0.048669336106010666,
659
+ "grad_norm": 4.964697360992432,
660
+ "learning_rate": 1.990872045382814e-05,
661
+ "loss": 2.0461234130859376,
662
+ "step": 22000
663
+ },
664
+ {
665
+ "epoch": 0.048669336106010666,
666
+ "eval_loss": 1.8559273481369019,
667
+ "eval_runtime": 65.7552,
668
+ "eval_samples_per_second": 152.079,
669
+ "eval_steps_per_second": 9.505,
670
+ "step": 22000
671
+ },
672
+ {
673
+ "epoch": 0.04977545738114727,
674
+ "grad_norm": 4.809401988983154,
675
+ "learning_rate": 1.990443217857749e-05,
676
+ "loss": 2.030472412109375,
677
+ "step": 22500
678
+ },
679
+ {
680
+ "epoch": 0.04977545738114727,
681
+ "eval_loss": 1.8380959033966064,
682
+ "eval_runtime": 65.6745,
683
+ "eval_samples_per_second": 152.266,
684
+ "eval_steps_per_second": 9.517,
685
+ "step": 22500
686
+ },
687
+ {
688
+ "epoch": 0.05088157865628388,
689
+ "grad_norm": 5.332137584686279,
690
+ "learning_rate": 1.9900045954780833e-05,
691
+ "loss": 2.019200439453125,
692
+ "step": 23000
693
+ },
694
+ {
695
+ "epoch": 0.05088157865628388,
696
+ "eval_loss": 1.8243741989135742,
697
+ "eval_runtime": 66.808,
698
+ "eval_samples_per_second": 149.683,
699
+ "eval_steps_per_second": 9.355,
700
+ "step": 23000
701
+ },
702
+ {
703
+ "epoch": 0.05198769993142048,
704
+ "grad_norm": 5.7028913497924805,
705
+ "learning_rate": 1.989556182581514e-05,
706
+ "loss": 1.9847816162109375,
707
+ "step": 23500
708
+ },
709
+ {
710
+ "epoch": 0.05198769993142048,
711
+ "eval_loss": 1.8052804470062256,
712
+ "eval_runtime": 65.2434,
713
+ "eval_samples_per_second": 153.272,
714
+ "eval_steps_per_second": 9.58,
715
+ "step": 23500
716
+ },
717
+ {
718
+ "epoch": 0.05309382120655709,
719
+ "grad_norm": 4.981122970581055,
720
+ "learning_rate": 1.98909798360256e-05,
721
+ "loss": 1.9902779541015625,
722
+ "step": 24000
723
+ },
724
+ {
725
+ "epoch": 0.05309382120655709,
726
+ "eval_loss": 1.7762919664382935,
727
+ "eval_runtime": 65.1802,
728
+ "eval_samples_per_second": 153.421,
729
+ "eval_steps_per_second": 9.589,
730
+ "step": 24000
731
+ },
732
+ {
733
+ "epoch": 0.05419994248169369,
734
+ "grad_norm": 4.917308807373047,
735
+ "learning_rate": 1.9886300030725185e-05,
736
+ "loss": 1.9727127685546875,
737
+ "step": 24500
738
+ },
739
+ {
740
+ "epoch": 0.05419994248169369,
741
+ "eval_loss": 1.7766869068145752,
742
+ "eval_runtime": 65.0747,
743
+ "eval_samples_per_second": 153.67,
744
+ "eval_steps_per_second": 9.604,
745
+ "step": 24500
746
+ },
747
+ {
748
+ "epoch": 0.055306063756830295,
749
+ "grad_norm": 4.780125141143799,
750
+ "learning_rate": 1.9881522456194194e-05,
751
+ "loss": 1.948054443359375,
752
+ "step": 25000
753
+ },
754
+ {
755
+ "epoch": 0.055306063756830295,
756
+ "eval_loss": 1.7642755508422852,
757
+ "eval_runtime": 65.8137,
758
+ "eval_samples_per_second": 151.944,
759
+ "eval_steps_per_second": 9.497,
760
+ "step": 25000
761
+ },
762
+ {
763
+ "epoch": 0.056412185031966905,
764
+ "grad_norm": 5.44115686416626,
765
+ "learning_rate": 1.9876647159679813e-05,
766
+ "loss": 1.9313668212890625,
767
+ "step": 25500
768
+ },
769
+ {
770
+ "epoch": 0.056412185031966905,
771
+ "eval_loss": 1.7497310638427734,
772
+ "eval_runtime": 65.536,
773
+ "eval_samples_per_second": 152.588,
774
+ "eval_steps_per_second": 9.537,
775
+ "step": 25500
776
+ },
777
+ {
778
+ "epoch": 0.05751830630710351,
779
+ "grad_norm": 4.406560897827148,
780
+ "learning_rate": 1.9871674189395622e-05,
781
+ "loss": 1.933572021484375,
782
+ "step": 26000
783
+ },
784
+ {
785
+ "epoch": 0.05751830630710351,
786
+ "eval_loss": 1.7356730699539185,
787
+ "eval_runtime": 66.4858,
788
+ "eval_samples_per_second": 150.408,
789
+ "eval_steps_per_second": 9.401,
790
+ "step": 26000
791
+ },
792
+ {
793
+ "epoch": 0.05862442758224012,
794
+ "grad_norm": 6.296497344970703,
795
+ "learning_rate": 1.9866603594521142e-05,
796
+ "loss": 1.91761669921875,
797
+ "step": 26500
798
+ },
799
+ {
800
+ "epoch": 0.05862442758224012,
801
+ "eval_loss": 1.7373892068862915,
802
+ "eval_runtime": 65.2531,
803
+ "eval_samples_per_second": 153.25,
804
+ "eval_steps_per_second": 9.578,
805
+ "step": 26500
806
+ },
807
+ {
808
+ "epoch": 0.05973054885737672,
809
+ "grad_norm": 5.007937908172607,
810
+ "learning_rate": 1.9861435425201336e-05,
811
+ "loss": 1.898394287109375,
812
+ "step": 27000
813
+ },
814
+ {
815
+ "epoch": 0.05973054885737672,
816
+ "eval_loss": 1.7208389043807983,
817
+ "eval_runtime": 65.1399,
818
+ "eval_samples_per_second": 153.516,
819
+ "eval_steps_per_second": 9.595,
820
+ "step": 27000
821
+ },
822
+ {
823
+ "epoch": 0.06083667013251333,
824
+ "grad_norm": 4.655943393707275,
825
+ "learning_rate": 1.985616973254612e-05,
826
+ "loss": 1.9006209716796876,
827
+ "step": 27500
828
+ },
829
+ {
830
+ "epoch": 0.06083667013251333,
831
+ "eval_loss": 1.7028509378433228,
832
+ "eval_runtime": 66.0059,
833
+ "eval_samples_per_second": 151.502,
834
+ "eval_steps_per_second": 9.469,
835
+ "step": 27500
836
+ },
837
+ {
838
+ "epoch": 0.06194279140764993,
839
+ "grad_norm": 5.251052379608154,
840
+ "learning_rate": 1.985080656862985e-05,
841
+ "loss": 1.88404931640625,
842
+ "step": 28000
843
+ },
844
+ {
845
+ "epoch": 0.06194279140764993,
846
+ "eval_loss": 1.7043781280517578,
847
+ "eval_runtime": 65.8348,
848
+ "eval_samples_per_second": 151.895,
849
+ "eval_steps_per_second": 9.493,
850
+ "step": 28000
851
+ },
852
+ {
853
+ "epoch": 0.06304891268278653,
854
+ "grad_norm": 5.259983539581299,
855
+ "learning_rate": 1.984534598649081e-05,
856
+ "loss": 1.875679931640625,
857
+ "step": 28500
858
+ },
859
+ {
860
+ "epoch": 0.06304891268278653,
861
+ "eval_loss": 1.6936031579971313,
862
+ "eval_runtime": 65.104,
863
+ "eval_samples_per_second": 153.6,
864
+ "eval_steps_per_second": 9.6,
865
+ "step": 28500
866
+ },
867
+ {
868
+ "epoch": 0.06415503395792314,
869
+ "grad_norm": 4.902404308319092,
870
+ "learning_rate": 1.9839788040130693e-05,
871
+ "loss": 1.8586162109375,
872
+ "step": 29000
873
+ },
874
+ {
875
+ "epoch": 0.06415503395792314,
876
+ "eval_loss": 1.6735634803771973,
877
+ "eval_runtime": 65.6048,
878
+ "eval_samples_per_second": 152.428,
879
+ "eval_steps_per_second": 9.527,
880
+ "step": 29000
881
+ },
882
+ {
883
+ "epoch": 0.06526115523305975,
884
+ "grad_norm": 5.073776721954346,
885
+ "learning_rate": 1.9834132784514063e-05,
886
+ "loss": 1.83912939453125,
887
+ "step": 29500
888
+ },
889
+ {
890
+ "epoch": 0.06526115523305975,
891
+ "eval_loss": 1.6621925830841064,
892
+ "eval_runtime": 65.5527,
893
+ "eval_samples_per_second": 152.549,
894
+ "eval_steps_per_second": 9.534,
895
+ "step": 29500
896
+ },
897
+ {
898
+ "epoch": 0.06636727650819636,
899
+ "grad_norm": 5.1272969245910645,
900
+ "learning_rate": 1.9828380275567797e-05,
901
+ "loss": 1.842152099609375,
902
+ "step": 30000
903
+ },
904
+ {
905
+ "epoch": 0.06636727650819636,
906
+ "eval_loss": 1.6653783321380615,
907
+ "eval_runtime": 66.132,
908
+ "eval_samples_per_second": 151.213,
909
+ "eval_steps_per_second": 9.451,
910
+ "step": 30000
911
+ },
912
+ {
913
+ "epoch": 0.06747339778333296,
914
+ "grad_norm": 5.014630317687988,
915
+ "learning_rate": 1.9822530570180568e-05,
916
+ "loss": 1.8277916259765625,
917
+ "step": 30500
918
+ },
919
+ {
920
+ "epoch": 0.06747339778333296,
921
+ "eval_loss": 1.6496976613998413,
922
+ "eval_runtime": 65.7954,
923
+ "eval_samples_per_second": 151.986,
924
+ "eval_steps_per_second": 9.499,
925
+ "step": 30500
926
+ },
927
+ {
928
+ "epoch": 0.06857951905846957,
929
+ "grad_norm": 4.427914619445801,
930
+ "learning_rate": 1.9816583726202243e-05,
931
+ "loss": 1.8151114501953125,
932
+ "step": 31000
933
+ },
934
+ {
935
+ "epoch": 0.06857951905846957,
936
+ "eval_loss": 1.6335314512252808,
937
+ "eval_runtime": 65.8023,
938
+ "eval_samples_per_second": 151.97,
939
+ "eval_steps_per_second": 9.498,
940
+ "step": 31000
941
+ },
942
+ {
943
+ "epoch": 0.06968564033360618,
944
+ "grad_norm": 5.199036598205566,
945
+ "learning_rate": 1.9810539802443333e-05,
946
+ "loss": 1.8143702392578125,
947
+ "step": 31500
948
+ },
949
+ {
950
+ "epoch": 0.06968564033360618,
951
+ "eval_loss": 1.623861312866211,
952
+ "eval_runtime": 66.1814,
953
+ "eval_samples_per_second": 151.1,
954
+ "eval_steps_per_second": 9.444,
955
+ "step": 31500
956
+ },
957
+ {
958
+ "epoch": 0.07079176160874279,
959
+ "grad_norm": 4.4861226081848145,
960
+ "learning_rate": 1.980439885867441e-05,
961
+ "loss": 1.785080078125,
962
+ "step": 32000
963
+ },
964
+ {
965
+ "epoch": 0.07079176160874279,
966
+ "eval_loss": 1.61989164352417,
967
+ "eval_runtime": 65.8909,
968
+ "eval_samples_per_second": 151.766,
969
+ "eval_steps_per_second": 9.485,
970
+ "step": 32000
971
+ },
972
+ {
973
+ "epoch": 0.07189788288387938,
974
+ "grad_norm": 5.459568023681641,
975
+ "learning_rate": 1.9798160955625502e-05,
976
+ "loss": 1.790661865234375,
977
+ "step": 32500
978
+ },
979
+ {
980
+ "epoch": 0.07189788288387938,
981
+ "eval_loss": 1.5985878705978394,
982
+ "eval_runtime": 66.8491,
983
+ "eval_samples_per_second": 149.591,
984
+ "eval_steps_per_second": 9.349,
985
+ "step": 32500
986
+ },
987
+ {
988
+ "epoch": 0.07300400415901599,
989
+ "grad_norm": 5.195436954498291,
990
+ "learning_rate": 1.9791826154985515e-05,
991
+ "loss": 1.770203369140625,
992
+ "step": 33000
993
+ },
994
+ {
995
+ "epoch": 0.07300400415901599,
996
+ "eval_loss": 1.5977914333343506,
997
+ "eval_runtime": 69.3781,
998
+ "eval_samples_per_second": 144.138,
999
+ "eval_steps_per_second": 9.009,
1000
+ "step": 33000
1001
+ },
1002
+ {
1003
+ "epoch": 0.0741101254341526,
1004
+ "grad_norm": 4.659327983856201,
1005
+ "learning_rate": 1.978539451940161e-05,
1006
+ "loss": 1.756498291015625,
1007
+ "step": 33500
1008
+ },
1009
+ {
1010
+ "epoch": 0.0741101254341526,
1011
+ "eval_loss": 1.5864726305007935,
1012
+ "eval_runtime": 68.1458,
1013
+ "eval_samples_per_second": 146.744,
1014
+ "eval_steps_per_second": 9.172,
1015
+ "step": 33500
1016
+ },
1017
+ {
1018
+ "epoch": 0.07521624670928921,
1019
+ "grad_norm": 4.486781120300293,
1020
+ "learning_rate": 1.977886611247857e-05,
1021
+ "loss": 1.7513958740234374,
1022
+ "step": 34000
1023
+ },
1024
+ {
1025
+ "epoch": 0.07521624670928921,
1026
+ "eval_loss": 1.5759690999984741,
1027
+ "eval_runtime": 66.295,
1028
+ "eval_samples_per_second": 150.841,
1029
+ "eval_steps_per_second": 9.428,
1030
+ "step": 34000
1031
+ },
1032
+ {
1033
+ "epoch": 0.0763223679844258,
1034
+ "grad_norm": 4.723703861236572,
1035
+ "learning_rate": 1.97722409987782e-05,
1036
+ "loss": 1.7431859130859375,
1037
+ "step": 34500
1038
+ },
1039
+ {
1040
+ "epoch": 0.0763223679844258,
1041
+ "eval_loss": 1.5756099224090576,
1042
+ "eval_runtime": 66.3119,
1043
+ "eval_samples_per_second": 150.803,
1044
+ "eval_steps_per_second": 9.425,
1045
+ "step": 34500
1046
+ },
1047
+ {
1048
+ "epoch": 0.07742848925956242,
1049
+ "grad_norm": 4.389305114746094,
1050
+ "learning_rate": 1.9765519243818665e-05,
1051
+ "loss": 1.732319580078125,
1052
+ "step": 35000
1053
+ },
1054
+ {
1055
+ "epoch": 0.07742848925956242,
1056
+ "eval_loss": 1.5581341981887817,
1057
+ "eval_runtime": 66.4353,
1058
+ "eval_samples_per_second": 150.522,
1059
+ "eval_steps_per_second": 9.408,
1060
+ "step": 35000
1061
+ },
1062
+ {
1063
+ "epoch": 0.07853461053469903,
1064
+ "grad_norm": 4.597053050994873,
1065
+ "learning_rate": 1.9758700914073858e-05,
1066
+ "loss": 1.7261806640625,
1067
+ "step": 35500
1068
+ },
1069
+ {
1070
+ "epoch": 0.07853461053469903,
1071
+ "eval_loss": 1.5474776029586792,
1072
+ "eval_runtime": 65.4425,
1073
+ "eval_samples_per_second": 152.806,
1074
+ "eval_steps_per_second": 9.55,
1075
+ "step": 35500
1076
+ },
1077
+ {
1078
+ "epoch": 0.07964073180983564,
1079
+ "grad_norm": 5.074342250823975,
1080
+ "learning_rate": 1.975178607697273e-05,
1081
+ "loss": 1.704677001953125,
1082
+ "step": 36000
1083
+ },
1084
+ {
1085
+ "epoch": 0.07964073180983564,
1086
+ "eval_loss": 1.5465320348739624,
1087
+ "eval_runtime": 67.0948,
1088
+ "eval_samples_per_second": 149.043,
1089
+ "eval_steps_per_second": 9.315,
1090
+ "step": 36000
1091
+ },
1092
+ {
1093
+ "epoch": 0.08074685308497223,
1094
+ "grad_norm": 4.983928680419922,
1095
+ "learning_rate": 1.974477480089863e-05,
1096
+ "loss": 1.7111588134765625,
1097
+ "step": 36500
1098
+ },
1099
+ {
1100
+ "epoch": 0.08074685308497223,
1101
+ "eval_loss": 1.5471775531768799,
1102
+ "eval_runtime": 66.0681,
1103
+ "eval_samples_per_second": 151.359,
1104
+ "eval_steps_per_second": 9.46,
1105
+ "step": 36500
1106
+ },
1107
+ {
1108
+ "epoch": 0.08185297436010884,
1109
+ "grad_norm": 4.309070587158203,
1110
+ "learning_rate": 1.9737667155188625e-05,
1111
+ "loss": 1.700852783203125,
1112
+ "step": 37000
1113
+ },
1114
+ {
1115
+ "epoch": 0.08185297436010884,
1116
+ "eval_loss": 1.5260053873062134,
1117
+ "eval_runtime": 65.5968,
1118
+ "eval_samples_per_second": 152.446,
1119
+ "eval_steps_per_second": 9.528,
1120
+ "step": 37000
1121
+ },
1122
+ {
1123
+ "epoch": 0.08295909563524545,
1124
+ "grad_norm": 5.114826679229736,
1125
+ "learning_rate": 1.9730463210132817e-05,
1126
+ "loss": 1.699755615234375,
1127
+ "step": 37500
1128
+ },
1129
+ {
1130
+ "epoch": 0.08295909563524545,
1131
+ "eval_loss": 1.5352414846420288,
1132
+ "eval_runtime": 65.7743,
1133
+ "eval_samples_per_second": 152.035,
1134
+ "eval_steps_per_second": 9.502,
1135
+ "step": 37500
1136
+ },
1137
+ {
1138
+ "epoch": 0.08406521691038206,
1139
+ "grad_norm": 4.944478988647461,
1140
+ "learning_rate": 1.9723163036973652e-05,
1141
+ "loss": 1.6774451904296874,
1142
+ "step": 38000
1143
+ },
1144
+ {
1145
+ "epoch": 0.08406521691038206,
1146
+ "eval_loss": 1.5184470415115356,
1147
+ "eval_runtime": 66.7501,
1148
+ "eval_samples_per_second": 149.813,
1149
+ "eval_steps_per_second": 9.363,
1150
+ "step": 38000
1151
+ },
1152
+ {
1153
+ "epoch": 0.08517133818551866,
1154
+ "grad_norm": 4.7983012199401855,
1155
+ "learning_rate": 1.971576670790521e-05,
1156
+ "loss": 1.6922623291015626,
1157
+ "step": 38500
1158
+ },
1159
+ {
1160
+ "epoch": 0.08517133818551866,
1161
+ "eval_loss": 1.5099477767944336,
1162
+ "eval_runtime": 65.8114,
1163
+ "eval_samples_per_second": 151.949,
1164
+ "eval_steps_per_second": 9.497,
1165
+ "step": 38500
1166
+ },
1167
+ {
1168
+ "epoch": 0.08627745946065526,
1169
+ "grad_norm": 4.645780563354492,
1170
+ "learning_rate": 1.9708274296072487e-05,
1171
+ "loss": 1.6959698486328125,
1172
+ "step": 39000
1173
+ },
1174
+ {
1175
+ "epoch": 0.08627745946065526,
1176
+ "eval_loss": 1.5127439498901367,
1177
+ "eval_runtime": 66.0848,
1178
+ "eval_samples_per_second": 151.321,
1179
+ "eval_steps_per_second": 9.458,
1180
+ "step": 39000
1181
+ },
1182
+ {
1183
+ "epoch": 0.08738358073579187,
1184
+ "grad_norm": 5.602351188659668,
1185
+ "learning_rate": 1.9700685875570678e-05,
1186
+ "loss": 1.668989501953125,
1187
+ "step": 39500
1188
+ },
1189
+ {
1190
+ "epoch": 0.08738358073579187,
1191
+ "eval_loss": 1.5060431957244873,
1192
+ "eval_runtime": 65.3814,
1193
+ "eval_samples_per_second": 152.949,
1194
+ "eval_steps_per_second": 9.559,
1195
+ "step": 39500
1196
+ },
1197
+ {
1198
+ "epoch": 0.08848970201092848,
1199
+ "grad_norm": 5.003055572509766,
1200
+ "learning_rate": 1.9693001521444445e-05,
1201
+ "loss": 1.657955810546875,
1202
+ "step": 40000
1203
+ },
1204
+ {
1205
+ "epoch": 0.08848970201092848,
1206
+ "eval_loss": 1.487270712852478,
1207
+ "eval_runtime": 65.5877,
1208
+ "eval_samples_per_second": 152.468,
1209
+ "eval_steps_per_second": 9.529,
1210
+ "step": 40000
1211
+ },
1212
+ {
1213
+ "epoch": 0.08959582328606508,
1214
+ "grad_norm": 4.99888801574707,
1215
+ "learning_rate": 1.968522130968717e-05,
1216
+ "loss": 1.64573046875,
1217
+ "step": 40500
1218
+ },
1219
+ {
1220
+ "epoch": 0.08959582328606508,
1221
+ "eval_loss": 1.4930541515350342,
1222
+ "eval_runtime": 65.6676,
1223
+ "eval_samples_per_second": 152.282,
1224
+ "eval_steps_per_second": 9.518,
1225
+ "step": 40500
1226
+ }
1227
+ ],
1228
+ "logging_steps": 500,
1229
+ "max_steps": 500000,
1230
+ "num_input_tokens_seen": 0,
1231
+ "num_train_epochs": 2,
1232
+ "save_steps": 500,
1233
+ "stateful_callbacks": {
1234
+ "EarlyStoppingCallback": {
1235
+ "args": {
1236
+ "early_stopping_patience": 8,
1237
+ "early_stopping_threshold": 0.0
1238
+ },
1239
+ "attributes": {
1240
+ "early_stopping_patience_counter": 1
1241
+ }
1242
+ },
1243
+ "TrainerControl": {
1244
+ "args": {
1245
+ "should_epoch_stop": false,
1246
+ "should_evaluate": false,
1247
+ "should_log": false,
1248
+ "should_save": true,
1249
+ "should_training_stop": false
1250
+ },
1251
+ "attributes": {}
1252
+ }
1253
+ },
1254
+ "total_flos": 8.533239420483994e+16,
1255
+ "train_batch_size": 16,
1256
+ "trial_name": null,
1257
+ "trial_params": null
1258
+ }
Fsoft-AIC__videberta-base/tmp_checkpoints/checkpoint-40500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9389243dbf7fcc95a280d47b0331a96e11d3aead152fe1769d52dee590c11663
3
+ size 4856
MikeGreen2710__mlm_listing_checkpoint-32442/.ipynb_checkpoints/pretrain_metadata-checkpoint.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "MikeGreen2710/mlm_listing_checkpoint-32442",
3
+ "perplexity": 1.9174,
4
+ "eval_loss": 0.650966,
5
+ "mlm_probability": 0.15,
6
+ "whole_word_masking": true,
7
+ "max_steps": 5000,
8
+ "learning_rate": 3e-05,
9
+ "pretrained_at": "2026-05-13 06:20:15"
10
+ }
MikeGreen2710__mlm_listing_checkpoint-32442/added_tokens.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ {
2
+ "<mask>": 64000
3
+ }
MikeGreen2710__mlm_listing_checkpoint-32442/bpe.codes ADDED
The diff for this file is too large to render. See raw diff
 
MikeGreen2710__mlm_listing_checkpoint-32442/config.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "RobertaForMaskedLM"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": 0,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "eos_token_id": 2,
11
+ "gradient_checkpointing": false,
12
+ "hidden_act": "gelu",
13
+ "hidden_dropout_prob": 0.1,
14
+ "hidden_size": 1024,
15
+ "initializer_range": 0.02,
16
+ "intermediate_size": 4096,
17
+ "is_decoder": false,
18
+ "layer_norm_eps": 1e-05,
19
+ "max_position_embeddings": 258,
20
+ "model_type": "roberta",
21
+ "num_attention_heads": 16,
22
+ "num_hidden_layers": 24,
23
+ "pad_token_id": 1,
24
+ "position_embedding_type": "absolute",
25
+ "tie_word_embeddings": true,
26
+ "tokenizer_class": "PhobertTokenizer",
27
+ "transformers_version": "5.8.0",
28
+ "type_vocab_size": 1,
29
+ "use_cache": false,
30
+ "vocab_size": 64001
31
+ }
MikeGreen2710__mlm_listing_checkpoint-32442/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:664d6c4a64e34c2e08d4b546c1be507f324cebea98898fa222e4e31366d46095
3
+ size 1476965596
MikeGreen2710__mlm_listing_checkpoint-32442/pretrain_metadata.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "MikeGreen2710/mlm_listing_checkpoint-32442",
3
+ "perplexity": 2.0284,
4
+ "eval_loss": 0.707233,
5
+ "mlm_probability": 0.15,
6
+ "whole_word_masking": true,
7
+ "max_steps": 50000,
8
+ "learning_rate": 3e-05,
9
+ "pretrained_at": "2026-05-13 19:02:03"
10
+ }
MikeGreen2710__mlm_listing_checkpoint-32442/tokenizer_config.json ADDED
@@ -0,0 +1,56 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "0": {
4
+ "content": "<s>",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false,
9
+ "special": true
10
+ },
11
+ "1": {
12
+ "content": "<pad>",
13
+ "lstrip": false,
14
+ "normalized": false,
15
+ "rstrip": false,
16
+ "single_word": false,
17
+ "special": true
18
+ },
19
+ "2": {
20
+ "content": "</s>",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ },
27
+ "3": {
28
+ "content": "<unk>",
29
+ "lstrip": false,
30
+ "normalized": false,
31
+ "rstrip": false,
32
+ "single_word": false,
33
+ "special": true
34
+ },
35
+ "64000": {
36
+ "content": "<mask>",
37
+ "lstrip": false,
38
+ "normalized": false,
39
+ "rstrip": false,
40
+ "single_word": false,
41
+ "special": true
42
+ }
43
+ },
44
+ "backend": "custom",
45
+ "bos_token": "<s>",
46
+ "cls_token": "<s>",
47
+ "eos_token": "</s>",
48
+ "is_local": false,
49
+ "local_files_only": false,
50
+ "mask_token": "<mask>",
51
+ "model_max_length": 1000000000000000019884624838656,
52
+ "pad_token": "<pad>",
53
+ "sep_token": "</s>",
54
+ "tokenizer_class": "PhobertTokenizer",
55
+ "unk_token": "<unk>"
56
+ }
MikeGreen2710__mlm_listing_checkpoint-32442/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6f9fa4324e5417e89ec813d9d9171a12eb8d25e3b665944e9730560f35c08884
3
+ size 4920
MikeGreen2710__mlm_listing_checkpoint-32442/vocab.txt ADDED
The diff for this file is too large to render. See raw diff
 
NlpHUST__electra-base-vn/config.json ADDED
@@ -0,0 +1,33 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "ElectraForMaskedLM"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": null,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "embedding_size": 768,
11
+ "eos_token_id": null,
12
+ "hidden_act": "gelu",
13
+ "hidden_dropout_prob": 0.1,
14
+ "hidden_size": 768,
15
+ "initializer_range": 0.02,
16
+ "intermediate_size": 3072,
17
+ "is_decoder": false,
18
+ "layer_norm_eps": 1e-12,
19
+ "max_position_embeddings": 512,
20
+ "model_type": "electra",
21
+ "num_attention_heads": 12,
22
+ "num_hidden_layers": 12,
23
+ "pad_token_id": 0,
24
+ "summary_activation": "gelu",
25
+ "summary_last_dropout": 0.1,
26
+ "summary_type": "first",
27
+ "summary_use_proj": true,
28
+ "tie_word_embeddings": true,
29
+ "transformers_version": "5.8.0",
30
+ "type_vocab_size": 2,
31
+ "use_cache": false,
32
+ "vocab_size": 62000
33
+ }
NlpHUST__electra-base-vn/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cdd00acb0b5670e7ee2ac7a97155f93cf7ce2df1325392910007381a2ec5267b
3
+ size 534907816
NlpHUST__electra-base-vn/pretrain_metadata.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "NlpHUST/electra-base-vn",
3
+ "perplexity": 2.6595,
4
+ "eval_loss": 0.978123,
5
+ "mlm_probability": 0.15,
6
+ "whole_word_masking": false,
7
+ "max_steps": 10000,
8
+ "learning_rate": 3e-05,
9
+ "pretrained_at": "2026-05-13 09:15:05"
10
+ }
NlpHUST__electra-base-vn/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
NlpHUST__electra-base-vn/tokenizer_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_lower_case": false,
5
+ "is_local": false,
6
+ "local_files_only": false,
7
+ "mask_token": "[MASK]",
8
+ "model_max_length": 1000000000000000019884624838656,
9
+ "pad_token": "[PAD]",
10
+ "sep_token": "[SEP]",
11
+ "strip_accents": null,
12
+ "tokenize_chinese_chars": true,
13
+ "tokenizer_class": "BertTokenizer",
14
+ "unk_token": "[UNK]"
15
+ }
NlpHUST__electra-base-vn/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b95480b17f3ee9440639b86b2c7a4160484820261a32594f42b92c7a9b31ffb5
3
+ size 4856
_token_cache/Fsoft-AIC__videberta-base/eval_00000_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c5551e9a29f4d9be27a7183a8e27b70b77594bddf5c28f60550a966d28d7ee7b
3
+ size 3538072
_token_cache/Fsoft-AIC__videberta-base/eval_00001_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5b35dea59161f0e52570d2cc8170494b34130d0ce80f3f00d2ed5e37d80d7bd6
3
+ size 3537112
_token_cache/Fsoft-AIC__videberta-base/eval_00002_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2282074482bfbb965be84811b072218c19ddb03326b9d567ebb2c2253f9b0234
3
+ size 3564808
_token_cache/Fsoft-AIC__videberta-base/eval_00003_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:540e11fec437057a753a24004f2ae85e314c0127e6a6f2560caf7f7bfde6896f
3
+ size 3534408
_token_cache/Fsoft-AIC__videberta-base/train_00000_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:89e6c89958861d0b04471cd044947b047a7f50fd5150c90f6334ba5a308fc63e
3
+ size 2555708896
_token_cache/Fsoft-AIC__videberta-base/train_00001_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0f245751553ddc10728b112d5fc4ec18adeceaf93138129321ce1af70f3768e4
3
+ size 2555645216
_token_cache/Fsoft-AIC__videberta-base/train_00002_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a82d5ed6a860b5b80d8e7d761f13ee9b5753a1a9999c0e9b8d23f61bcfc05406
3
+ size 2555377912
_token_cache/Fsoft-AIC__videberta-base/train_00003_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6838ada7d35c7a8520dd6ebc5cd8d4f5f465e59bb30478ced945d63768b887b9
3
+ size 2555366824
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00000_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8170f8d7867840ff774d8ff94ac2957b5347a85e01f35404627f86402c434801
3
+ size 3066304
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00001_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:45224462a27b10378e25bdadd83eae043404c1ba866cf2864cb337ef56d554ca
3
+ size 3060016
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00002_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3d1ac4b1cacdff6556e880e6ddfcd14215855c25e7fed753e968eb082f184bec
3
+ size 3083960
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/eval_00003_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fe9f6d27f59c19ddd343b4f9fab71c80035a657136623c74c97504ef14cc19a8
3
+ size 3065840
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00000_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:720ba049e07e3134c7bd2932a3f28b6a64bde4a2d9697360d845750580d70f3f
3
+ size 2214489696
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00001_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:247c6c4a97b7210fab17a54d01a7c02d64ab1aaf089ea604dc32e494af408c0c
3
+ size 2214392736
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00002_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:64b6bca22e05d7e000bb24d43ee64e37cb0dbe57a2d74d396e1bcc7e038af557
3
+ size 2214139712
_token_cache/MikeGreen2710__mlm_listing_checkpoint-32442/train_00003_of_00004.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b5672caedbfd758c43a24b0c4befdfee8caee64f3e68e28d6aff7b0aae079c35
3
+ size 2214349480