Najmia commited on
Commit
181683c
·
verified ·
1 Parent(s): e1e4656

Upload folder using huggingface_hub

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. checkpoint-1120/config.json +27 -0
  2. checkpoint-1120/model.safetensors +3 -0
  3. checkpoint-1120/optimizer.pt +3 -0
  4. checkpoint-1120/rng_state.pth +3 -0
  5. checkpoint-1120/scheduler.pt +3 -0
  6. checkpoint-1120/special_tokens_map.json +20 -0
  7. checkpoint-1120/tokenizer.json +0 -0
  8. checkpoint-1120/tokenizer_config.json +85 -0
  9. checkpoint-1120/trainer_state.json +132 -0
  10. checkpoint-1120/training_args.bin +3 -0
  11. checkpoint-1280/config.json +27 -0
  12. checkpoint-1280/model.safetensors +3 -0
  13. checkpoint-1280/optimizer.pt +3 -0
  14. checkpoint-1280/rng_state.pth +3 -0
  15. checkpoint-1280/scheduler.pt +3 -0
  16. checkpoint-1280/special_tokens_map.json +20 -0
  17. checkpoint-1280/tokenizer.json +0 -0
  18. checkpoint-1280/tokenizer_config.json +85 -0
  19. checkpoint-1280/trainer_state.json +144 -0
  20. checkpoint-1280/training_args.bin +3 -0
  21. checkpoint-1440/config.json +27 -0
  22. checkpoint-1440/model.safetensors +3 -0
  23. checkpoint-1440/optimizer.pt +3 -0
  24. checkpoint-1440/rng_state.pth +3 -0
  25. checkpoint-1440/scheduler.pt +3 -0
  26. checkpoint-1440/special_tokens_map.json +20 -0
  27. checkpoint-1440/tokenizer.json +0 -0
  28. checkpoint-1440/tokenizer_config.json +85 -0
  29. checkpoint-1440/trainer_state.json +156 -0
  30. checkpoint-1440/training_args.bin +3 -0
  31. checkpoint-160/config.json +27 -0
  32. checkpoint-160/model.safetensors +3 -0
  33. checkpoint-160/optimizer.pt +3 -0
  34. checkpoint-160/rng_state.pth +3 -0
  35. checkpoint-160/scheduler.pt +3 -0
  36. checkpoint-160/special_tokens_map.json +20 -0
  37. checkpoint-160/tokenizer.json +0 -0
  38. checkpoint-160/tokenizer_config.json +85 -0
  39. checkpoint-160/trainer_state.json +46 -0
  40. checkpoint-160/training_args.bin +3 -0
  41. checkpoint-1600/config.json +27 -0
  42. checkpoint-1600/model.safetensors +3 -0
  43. checkpoint-1600/optimizer.pt +3 -0
  44. checkpoint-1600/rng_state.pth +3 -0
  45. checkpoint-1600/scheduler.pt +3 -0
  46. checkpoint-1600/special_tokens_map.json +20 -0
  47. checkpoint-1600/tokenizer.json +0 -0
  48. checkpoint-1600/tokenizer_config.json +85 -0
  49. checkpoint-1600/trainer_state.json +175 -0
  50. checkpoint-1600/training_args.bin +3 -0
checkpoint-1120/config.json ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "CamembertForTokenClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": 5,
7
+ "classifier_dropout": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": 6,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-05,
16
+ "max_position_embeddings": 514,
17
+ "model_type": "camembert",
18
+ "num_attention_heads": 12,
19
+ "num_hidden_layers": 12,
20
+ "output_past": true,
21
+ "pad_token_id": 1,
22
+ "position_embedding_type": "absolute",
23
+ "transformers_version": "4.56.0",
24
+ "type_vocab_size": 1,
25
+ "use_cache": true,
26
+ "vocab_size": 32005
27
+ }
checkpoint-1120/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e574d584dd3515aece160571c734e41003e45026c74838b78e204de014d8285c
3
+ size 440155504
checkpoint-1120/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e89659df903bbb12da5957c8c423d24470d80d15f073d526b0177566b9fa8b28
3
+ size 37797981
checkpoint-1120/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2fdd5d2b639ff014856c62207b0882142494fbc441ddd42d96d74c222499d53b
3
+ size 14455
checkpoint-1120/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2845f52e03293268f4597461a96c770a2325c6644c66445023f817268cb63ca0
3
+ size 1465
checkpoint-1120/special_tokens_map.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<s>NOTUSED",
4
+ "</s>NOTUSED",
5
+ "<unk>NOTUSED"
6
+ ],
7
+ "bos_token": "<s>",
8
+ "cls_token": "<s>",
9
+ "eos_token": "</s>",
10
+ "mask_token": {
11
+ "content": "<mask>",
12
+ "lstrip": true,
13
+ "normalized": false,
14
+ "rstrip": false,
15
+ "single_word": false
16
+ },
17
+ "pad_token": "<pad>",
18
+ "sep_token": "</s>",
19
+ "unk_token": "<unk>"
20
+ }
checkpoint-1120/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1120/tokenizer_config.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<s>NOTUSED",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<pad>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "2": {
21
+ "content": "</s>NOTUSED",
22
+ "lstrip": false,
23
+ "normalized": false,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "4": {
29
+ "content": "<unk>",
30
+ "lstrip": false,
31
+ "normalized": false,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "5": {
37
+ "content": "<s>",
38
+ "lstrip": false,
39
+ "normalized": false,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ },
44
+ "6": {
45
+ "content": "</s>",
46
+ "lstrip": false,
47
+ "normalized": false,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": true
51
+ },
52
+ "32004": {
53
+ "content": "<mask>",
54
+ "lstrip": true,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": true
59
+ },
60
+ "32005": {
61
+ "content": "<unk>NOTUSED",
62
+ "lstrip": false,
63
+ "normalized": false,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": true
67
+ }
68
+ },
69
+ "additional_special_tokens": [
70
+ "<s>NOTUSED",
71
+ "</s>NOTUSED",
72
+ "<unk>NOTUSED"
73
+ ],
74
+ "bos_token": "<s>",
75
+ "clean_up_tokenization_spaces": false,
76
+ "cls_token": "<s>",
77
+ "eos_token": "</s>",
78
+ "extra_special_tokens": {},
79
+ "mask_token": "<mask>",
80
+ "model_max_length": 512,
81
+ "pad_token": "<pad>",
82
+ "sep_token": "</s>",
83
+ "tokenizer_class": "CamembertTokenizer",
84
+ "unk_token": "<unk>"
85
+ }
checkpoint-1120/trainer_state.json ADDED
@@ -0,0 +1,132 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1120,
3
+ "best_metric": 0.03781137987971306,
4
+ "best_model_checkpoint": "camembert-ner-person/checkpoint-1120",
5
+ "epoch": 7.0,
6
+ "eval_steps": 500,
7
+ "global_step": 1120,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.9498368678629691,
15
+ "eval_f1": 0.0,
16
+ "eval_loss": 0.20437224209308624,
17
+ "eval_precision": 0.0,
18
+ "eval_recall": 0.0,
19
+ "eval_runtime": 13.8104,
20
+ "eval_samples_per_second": 46.125,
21
+ "eval_steps_per_second": 2.896,
22
+ "step": 160
23
+ },
24
+ {
25
+ "epoch": 2.0,
26
+ "eval_accuracy": 0.9498368678629691,
27
+ "eval_f1": 0.0,
28
+ "eval_loss": 0.1605844497680664,
29
+ "eval_precision": 0.0,
30
+ "eval_recall": 0.0,
31
+ "eval_runtime": 13.0615,
32
+ "eval_samples_per_second": 48.769,
33
+ "eval_steps_per_second": 3.062,
34
+ "step": 320
35
+ },
36
+ {
37
+ "epoch": 3.0,
38
+ "eval_accuracy": 0.9747824904839587,
39
+ "eval_f1": 0.0,
40
+ "eval_loss": 0.09763724356889725,
41
+ "eval_precision": 0.0,
42
+ "eval_recall": 0.0,
43
+ "eval_runtime": 13.0676,
44
+ "eval_samples_per_second": 48.747,
45
+ "eval_steps_per_second": 3.061,
46
+ "step": 480
47
+ },
48
+ {
49
+ "epoch": 3.125,
50
+ "grad_norm": 0.23452259600162506,
51
+ "learning_rate": 1.37625e-05,
52
+ "loss": 0.2127,
53
+ "step": 500
54
+ },
55
+ {
56
+ "epoch": 4.0,
57
+ "eval_accuracy": 0.990415986949429,
58
+ "eval_f1": 0.0,
59
+ "eval_loss": 0.0640617236495018,
60
+ "eval_precision": 0.0,
61
+ "eval_recall": 0.0,
62
+ "eval_runtime": 13.1316,
63
+ "eval_samples_per_second": 48.509,
64
+ "eval_steps_per_second": 3.046,
65
+ "step": 640
66
+ },
67
+ {
68
+ "epoch": 5.0,
69
+ "eval_accuracy": 0.992862969004894,
70
+ "eval_f1": 0.0,
71
+ "eval_loss": 0.049903176724910736,
72
+ "eval_precision": 0.0,
73
+ "eval_recall": 0.0,
74
+ "eval_runtime": 13.1176,
75
+ "eval_samples_per_second": 48.561,
76
+ "eval_steps_per_second": 3.049,
77
+ "step": 800
78
+ },
79
+ {
80
+ "epoch": 6.0,
81
+ "eval_accuracy": 0.993610657966286,
82
+ "eval_f1": 0.0,
83
+ "eval_loss": 0.042311444878578186,
84
+ "eval_precision": 0.0,
85
+ "eval_recall": 0.0,
86
+ "eval_runtime": 13.1626,
87
+ "eval_samples_per_second": 48.395,
88
+ "eval_steps_per_second": 3.039,
89
+ "step": 960
90
+ },
91
+ {
92
+ "epoch": 6.25,
93
+ "grad_norm": 0.11943812668323517,
94
+ "learning_rate": 7.5125000000000005e-06,
95
+ "loss": 0.0639,
96
+ "step": 1000
97
+ },
98
+ {
99
+ "epoch": 7.0,
100
+ "eval_accuracy": 0.9940864600326265,
101
+ "eval_f1": 0.0,
102
+ "eval_loss": 0.03781137987971306,
103
+ "eval_precision": 0.0,
104
+ "eval_recall": 0.0,
105
+ "eval_runtime": 13.0963,
106
+ "eval_samples_per_second": 48.64,
107
+ "eval_steps_per_second": 3.054,
108
+ "step": 1120
109
+ }
110
+ ],
111
+ "logging_steps": 500,
112
+ "max_steps": 1600,
113
+ "num_input_tokens_seen": 0,
114
+ "num_train_epochs": 10,
115
+ "save_steps": 500,
116
+ "stateful_callbacks": {
117
+ "TrainerControl": {
118
+ "args": {
119
+ "should_epoch_stop": false,
120
+ "should_evaluate": false,
121
+ "should_log": false,
122
+ "should_save": true,
123
+ "should_training_stop": false
124
+ },
125
+ "attributes": {}
126
+ }
127
+ },
128
+ "total_flos": 620357286728592.0,
129
+ "train_batch_size": 16,
130
+ "trial_name": null,
131
+ "trial_params": null
132
+ }
checkpoint-1120/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f796509c39601477a427a76b8ddb93a21384d4e299d46d46249e2a69f513c3a
3
+ size 5777
checkpoint-1280/config.json ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "CamembertForTokenClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": 5,
7
+ "classifier_dropout": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": 6,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-05,
16
+ "max_position_embeddings": 514,
17
+ "model_type": "camembert",
18
+ "num_attention_heads": 12,
19
+ "num_hidden_layers": 12,
20
+ "output_past": true,
21
+ "pad_token_id": 1,
22
+ "position_embedding_type": "absolute",
23
+ "transformers_version": "4.56.0",
24
+ "type_vocab_size": 1,
25
+ "use_cache": true,
26
+ "vocab_size": 32005
27
+ }
checkpoint-1280/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:746b9f0d8a219a3ae81ee52c90740b6d82f2e832f3988b3ddb1e09e638731750
3
+ size 440155504
checkpoint-1280/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5f84dc3ab26546f807a79b0e157576655cb6e22e7037521c94b420c91869e41a
3
+ size 37797981
checkpoint-1280/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e37ad0d01aff0baeb5436f0c07fe6992178c41ff8315f9bfd31779b255799e02
3
+ size 14455
checkpoint-1280/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b2beac0828006685a49e14e03a172acb587b2e2226941f6dc689ec40e8afbcd2
3
+ size 1465
checkpoint-1280/special_tokens_map.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<s>NOTUSED",
4
+ "</s>NOTUSED",
5
+ "<unk>NOTUSED"
6
+ ],
7
+ "bos_token": "<s>",
8
+ "cls_token": "<s>",
9
+ "eos_token": "</s>",
10
+ "mask_token": {
11
+ "content": "<mask>",
12
+ "lstrip": true,
13
+ "normalized": false,
14
+ "rstrip": false,
15
+ "single_word": false
16
+ },
17
+ "pad_token": "<pad>",
18
+ "sep_token": "</s>",
19
+ "unk_token": "<unk>"
20
+ }
checkpoint-1280/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1280/tokenizer_config.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<s>NOTUSED",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<pad>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "2": {
21
+ "content": "</s>NOTUSED",
22
+ "lstrip": false,
23
+ "normalized": false,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "4": {
29
+ "content": "<unk>",
30
+ "lstrip": false,
31
+ "normalized": false,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "5": {
37
+ "content": "<s>",
38
+ "lstrip": false,
39
+ "normalized": false,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ },
44
+ "6": {
45
+ "content": "</s>",
46
+ "lstrip": false,
47
+ "normalized": false,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": true
51
+ },
52
+ "32004": {
53
+ "content": "<mask>",
54
+ "lstrip": true,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": true
59
+ },
60
+ "32005": {
61
+ "content": "<unk>NOTUSED",
62
+ "lstrip": false,
63
+ "normalized": false,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": true
67
+ }
68
+ },
69
+ "additional_special_tokens": [
70
+ "<s>NOTUSED",
71
+ "</s>NOTUSED",
72
+ "<unk>NOTUSED"
73
+ ],
74
+ "bos_token": "<s>",
75
+ "clean_up_tokenization_spaces": false,
76
+ "cls_token": "<s>",
77
+ "eos_token": "</s>",
78
+ "extra_special_tokens": {},
79
+ "mask_token": "<mask>",
80
+ "model_max_length": 512,
81
+ "pad_token": "<pad>",
82
+ "sep_token": "</s>",
83
+ "tokenizer_class": "CamembertTokenizer",
84
+ "unk_token": "<unk>"
85
+ }
checkpoint-1280/trainer_state.json ADDED
@@ -0,0 +1,144 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1280,
3
+ "best_metric": 0.03513427451252937,
4
+ "best_model_checkpoint": "camembert-ner-person/checkpoint-1280",
5
+ "epoch": 8.0,
6
+ "eval_steps": 500,
7
+ "global_step": 1280,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.9498368678629691,
15
+ "eval_f1": 0.0,
16
+ "eval_loss": 0.20437224209308624,
17
+ "eval_precision": 0.0,
18
+ "eval_recall": 0.0,
19
+ "eval_runtime": 13.8104,
20
+ "eval_samples_per_second": 46.125,
21
+ "eval_steps_per_second": 2.896,
22
+ "step": 160
23
+ },
24
+ {
25
+ "epoch": 2.0,
26
+ "eval_accuracy": 0.9498368678629691,
27
+ "eval_f1": 0.0,
28
+ "eval_loss": 0.1605844497680664,
29
+ "eval_precision": 0.0,
30
+ "eval_recall": 0.0,
31
+ "eval_runtime": 13.0615,
32
+ "eval_samples_per_second": 48.769,
33
+ "eval_steps_per_second": 3.062,
34
+ "step": 320
35
+ },
36
+ {
37
+ "epoch": 3.0,
38
+ "eval_accuracy": 0.9747824904839587,
39
+ "eval_f1": 0.0,
40
+ "eval_loss": 0.09763724356889725,
41
+ "eval_precision": 0.0,
42
+ "eval_recall": 0.0,
43
+ "eval_runtime": 13.0676,
44
+ "eval_samples_per_second": 48.747,
45
+ "eval_steps_per_second": 3.061,
46
+ "step": 480
47
+ },
48
+ {
49
+ "epoch": 3.125,
50
+ "grad_norm": 0.23452259600162506,
51
+ "learning_rate": 1.37625e-05,
52
+ "loss": 0.2127,
53
+ "step": 500
54
+ },
55
+ {
56
+ "epoch": 4.0,
57
+ "eval_accuracy": 0.990415986949429,
58
+ "eval_f1": 0.0,
59
+ "eval_loss": 0.0640617236495018,
60
+ "eval_precision": 0.0,
61
+ "eval_recall": 0.0,
62
+ "eval_runtime": 13.1316,
63
+ "eval_samples_per_second": 48.509,
64
+ "eval_steps_per_second": 3.046,
65
+ "step": 640
66
+ },
67
+ {
68
+ "epoch": 5.0,
69
+ "eval_accuracy": 0.992862969004894,
70
+ "eval_f1": 0.0,
71
+ "eval_loss": 0.049903176724910736,
72
+ "eval_precision": 0.0,
73
+ "eval_recall": 0.0,
74
+ "eval_runtime": 13.1176,
75
+ "eval_samples_per_second": 48.561,
76
+ "eval_steps_per_second": 3.049,
77
+ "step": 800
78
+ },
79
+ {
80
+ "epoch": 6.0,
81
+ "eval_accuracy": 0.993610657966286,
82
+ "eval_f1": 0.0,
83
+ "eval_loss": 0.042311444878578186,
84
+ "eval_precision": 0.0,
85
+ "eval_recall": 0.0,
86
+ "eval_runtime": 13.1626,
87
+ "eval_samples_per_second": 48.395,
88
+ "eval_steps_per_second": 3.039,
89
+ "step": 960
90
+ },
91
+ {
92
+ "epoch": 6.25,
93
+ "grad_norm": 0.11943812668323517,
94
+ "learning_rate": 7.5125000000000005e-06,
95
+ "loss": 0.0639,
96
+ "step": 1000
97
+ },
98
+ {
99
+ "epoch": 7.0,
100
+ "eval_accuracy": 0.9940864600326265,
101
+ "eval_f1": 0.0,
102
+ "eval_loss": 0.03781137987971306,
103
+ "eval_precision": 0.0,
104
+ "eval_recall": 0.0,
105
+ "eval_runtime": 13.0963,
106
+ "eval_samples_per_second": 48.64,
107
+ "eval_steps_per_second": 3.054,
108
+ "step": 1120
109
+ },
110
+ {
111
+ "epoch": 8.0,
112
+ "eval_accuracy": 0.9943583469276781,
113
+ "eval_f1": 0.0,
114
+ "eval_loss": 0.03513427451252937,
115
+ "eval_precision": 0.0,
116
+ "eval_recall": 0.0,
117
+ "eval_runtime": 13.0526,
118
+ "eval_samples_per_second": 48.802,
119
+ "eval_steps_per_second": 3.065,
120
+ "step": 1280
121
+ }
122
+ ],
123
+ "logging_steps": 500,
124
+ "max_steps": 1600,
125
+ "num_input_tokens_seen": 0,
126
+ "num_train_epochs": 10,
127
+ "save_steps": 500,
128
+ "stateful_callbacks": {
129
+ "TrainerControl": {
130
+ "args": {
131
+ "should_epoch_stop": false,
132
+ "should_evaluate": false,
133
+ "should_log": false,
134
+ "should_save": true,
135
+ "should_training_stop": false
136
+ },
137
+ "attributes": {}
138
+ }
139
+ },
140
+ "total_flos": 707850872616912.0,
141
+ "train_batch_size": 16,
142
+ "trial_name": null,
143
+ "trial_params": null
144
+ }
checkpoint-1280/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f796509c39601477a427a76b8ddb93a21384d4e299d46d46249e2a69f513c3a
3
+ size 5777
checkpoint-1440/config.json ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "CamembertForTokenClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": 5,
7
+ "classifier_dropout": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": 6,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-05,
16
+ "max_position_embeddings": 514,
17
+ "model_type": "camembert",
18
+ "num_attention_heads": 12,
19
+ "num_hidden_layers": 12,
20
+ "output_past": true,
21
+ "pad_token_id": 1,
22
+ "position_embedding_type": "absolute",
23
+ "transformers_version": "4.56.0",
24
+ "type_vocab_size": 1,
25
+ "use_cache": true,
26
+ "vocab_size": 32005
27
+ }
checkpoint-1440/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:77118e424b49a7b155296d54794b944ef8e0a5746c443cf5359fd960511e352a
3
+ size 440155504
checkpoint-1440/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3aaadc6b00dc2921b7c41367e1105bb8f3efb5c9a6343f67c7eceb416cd65aac
3
+ size 37797981
checkpoint-1440/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:215afdcb5d98f1aec9cd033d9e3fc9e67a1963e355ba8b00422e51eda8e96fd0
3
+ size 14455
checkpoint-1440/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:263a4d02713fd8e60ca3b9a386deec63669862a94dffa04f278522e1e88ebc93
3
+ size 1465
checkpoint-1440/special_tokens_map.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<s>NOTUSED",
4
+ "</s>NOTUSED",
5
+ "<unk>NOTUSED"
6
+ ],
7
+ "bos_token": "<s>",
8
+ "cls_token": "<s>",
9
+ "eos_token": "</s>",
10
+ "mask_token": {
11
+ "content": "<mask>",
12
+ "lstrip": true,
13
+ "normalized": false,
14
+ "rstrip": false,
15
+ "single_word": false
16
+ },
17
+ "pad_token": "<pad>",
18
+ "sep_token": "</s>",
19
+ "unk_token": "<unk>"
20
+ }
checkpoint-1440/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1440/tokenizer_config.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<s>NOTUSED",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<pad>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "2": {
21
+ "content": "</s>NOTUSED",
22
+ "lstrip": false,
23
+ "normalized": false,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "4": {
29
+ "content": "<unk>",
30
+ "lstrip": false,
31
+ "normalized": false,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "5": {
37
+ "content": "<s>",
38
+ "lstrip": false,
39
+ "normalized": false,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ },
44
+ "6": {
45
+ "content": "</s>",
46
+ "lstrip": false,
47
+ "normalized": false,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": true
51
+ },
52
+ "32004": {
53
+ "content": "<mask>",
54
+ "lstrip": true,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": true
59
+ },
60
+ "32005": {
61
+ "content": "<unk>NOTUSED",
62
+ "lstrip": false,
63
+ "normalized": false,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": true
67
+ }
68
+ },
69
+ "additional_special_tokens": [
70
+ "<s>NOTUSED",
71
+ "</s>NOTUSED",
72
+ "<unk>NOTUSED"
73
+ ],
74
+ "bos_token": "<s>",
75
+ "clean_up_tokenization_spaces": false,
76
+ "cls_token": "<s>",
77
+ "eos_token": "</s>",
78
+ "extra_special_tokens": {},
79
+ "mask_token": "<mask>",
80
+ "model_max_length": 512,
81
+ "pad_token": "<pad>",
82
+ "sep_token": "</s>",
83
+ "tokenizer_class": "CamembertTokenizer",
84
+ "unk_token": "<unk>"
85
+ }
checkpoint-1440/trainer_state.json ADDED
@@ -0,0 +1,156 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1440,
3
+ "best_metric": 0.03366817161440849,
4
+ "best_model_checkpoint": "camembert-ner-person/checkpoint-1440",
5
+ "epoch": 9.0,
6
+ "eval_steps": 500,
7
+ "global_step": 1440,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.9498368678629691,
15
+ "eval_f1": 0.0,
16
+ "eval_loss": 0.20437224209308624,
17
+ "eval_precision": 0.0,
18
+ "eval_recall": 0.0,
19
+ "eval_runtime": 13.8104,
20
+ "eval_samples_per_second": 46.125,
21
+ "eval_steps_per_second": 2.896,
22
+ "step": 160
23
+ },
24
+ {
25
+ "epoch": 2.0,
26
+ "eval_accuracy": 0.9498368678629691,
27
+ "eval_f1": 0.0,
28
+ "eval_loss": 0.1605844497680664,
29
+ "eval_precision": 0.0,
30
+ "eval_recall": 0.0,
31
+ "eval_runtime": 13.0615,
32
+ "eval_samples_per_second": 48.769,
33
+ "eval_steps_per_second": 3.062,
34
+ "step": 320
35
+ },
36
+ {
37
+ "epoch": 3.0,
38
+ "eval_accuracy": 0.9747824904839587,
39
+ "eval_f1": 0.0,
40
+ "eval_loss": 0.09763724356889725,
41
+ "eval_precision": 0.0,
42
+ "eval_recall": 0.0,
43
+ "eval_runtime": 13.0676,
44
+ "eval_samples_per_second": 48.747,
45
+ "eval_steps_per_second": 3.061,
46
+ "step": 480
47
+ },
48
+ {
49
+ "epoch": 3.125,
50
+ "grad_norm": 0.23452259600162506,
51
+ "learning_rate": 1.37625e-05,
52
+ "loss": 0.2127,
53
+ "step": 500
54
+ },
55
+ {
56
+ "epoch": 4.0,
57
+ "eval_accuracy": 0.990415986949429,
58
+ "eval_f1": 0.0,
59
+ "eval_loss": 0.0640617236495018,
60
+ "eval_precision": 0.0,
61
+ "eval_recall": 0.0,
62
+ "eval_runtime": 13.1316,
63
+ "eval_samples_per_second": 48.509,
64
+ "eval_steps_per_second": 3.046,
65
+ "step": 640
66
+ },
67
+ {
68
+ "epoch": 5.0,
69
+ "eval_accuracy": 0.992862969004894,
70
+ "eval_f1": 0.0,
71
+ "eval_loss": 0.049903176724910736,
72
+ "eval_precision": 0.0,
73
+ "eval_recall": 0.0,
74
+ "eval_runtime": 13.1176,
75
+ "eval_samples_per_second": 48.561,
76
+ "eval_steps_per_second": 3.049,
77
+ "step": 800
78
+ },
79
+ {
80
+ "epoch": 6.0,
81
+ "eval_accuracy": 0.993610657966286,
82
+ "eval_f1": 0.0,
83
+ "eval_loss": 0.042311444878578186,
84
+ "eval_precision": 0.0,
85
+ "eval_recall": 0.0,
86
+ "eval_runtime": 13.1626,
87
+ "eval_samples_per_second": 48.395,
88
+ "eval_steps_per_second": 3.039,
89
+ "step": 960
90
+ },
91
+ {
92
+ "epoch": 6.25,
93
+ "grad_norm": 0.11943812668323517,
94
+ "learning_rate": 7.5125000000000005e-06,
95
+ "loss": 0.0639,
96
+ "step": 1000
97
+ },
98
+ {
99
+ "epoch": 7.0,
100
+ "eval_accuracy": 0.9940864600326265,
101
+ "eval_f1": 0.0,
102
+ "eval_loss": 0.03781137987971306,
103
+ "eval_precision": 0.0,
104
+ "eval_recall": 0.0,
105
+ "eval_runtime": 13.0963,
106
+ "eval_samples_per_second": 48.64,
107
+ "eval_steps_per_second": 3.054,
108
+ "step": 1120
109
+ },
110
+ {
111
+ "epoch": 8.0,
112
+ "eval_accuracy": 0.9943583469276781,
113
+ "eval_f1": 0.0,
114
+ "eval_loss": 0.03513427451252937,
115
+ "eval_precision": 0.0,
116
+ "eval_recall": 0.0,
117
+ "eval_runtime": 13.0526,
118
+ "eval_samples_per_second": 48.802,
119
+ "eval_steps_per_second": 3.065,
120
+ "step": 1280
121
+ },
122
+ {
123
+ "epoch": 9.0,
124
+ "eval_accuracy": 0.9944942903752039,
125
+ "eval_f1": 0.0,
126
+ "eval_loss": 0.03366817161440849,
127
+ "eval_precision": 0.0,
128
+ "eval_recall": 0.0,
129
+ "eval_runtime": 13.1019,
130
+ "eval_samples_per_second": 48.619,
131
+ "eval_steps_per_second": 3.053,
132
+ "step": 1440
133
+ }
134
+ ],
135
+ "logging_steps": 500,
136
+ "max_steps": 1600,
137
+ "num_input_tokens_seen": 0,
138
+ "num_train_epochs": 10,
139
+ "save_steps": 500,
140
+ "stateful_callbacks": {
141
+ "TrainerControl": {
142
+ "args": {
143
+ "should_epoch_stop": false,
144
+ "should_evaluate": false,
145
+ "should_log": false,
146
+ "should_save": true,
147
+ "should_training_stop": false
148
+ },
149
+ "attributes": {}
150
+ }
151
+ },
152
+ "total_flos": 796559080147872.0,
153
+ "train_batch_size": 16,
154
+ "trial_name": null,
155
+ "trial_params": null
156
+ }
checkpoint-1440/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f796509c39601477a427a76b8ddb93a21384d4e299d46d46249e2a69f513c3a
3
+ size 5777
checkpoint-160/config.json ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "CamembertForTokenClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": 5,
7
+ "classifier_dropout": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": 6,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-05,
16
+ "max_position_embeddings": 514,
17
+ "model_type": "camembert",
18
+ "num_attention_heads": 12,
19
+ "num_hidden_layers": 12,
20
+ "output_past": true,
21
+ "pad_token_id": 1,
22
+ "position_embedding_type": "absolute",
23
+ "transformers_version": "4.56.0",
24
+ "type_vocab_size": 1,
25
+ "use_cache": true,
26
+ "vocab_size": 32005
27
+ }
checkpoint-160/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4a872cc2efd8a75bd2adebf5f073790dcfb374a670bd3a47f562fe2bf05ac7c5
3
+ size 440155504
checkpoint-160/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2744d3faf7276177e881016467529b42d4b758f8a01e7ad21fb34c55802cdbba
3
+ size 37797981
checkpoint-160/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:324645a1162511d075863e4061000de09f17381859c53447d6b59c10e8d8bfef
3
+ size 14455
checkpoint-160/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:aafa7c067c2c9a0691ab6284ff38ebdb44ad42516329b20f4728777de614a4fe
3
+ size 1465
checkpoint-160/special_tokens_map.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<s>NOTUSED",
4
+ "</s>NOTUSED",
5
+ "<unk>NOTUSED"
6
+ ],
7
+ "bos_token": "<s>",
8
+ "cls_token": "<s>",
9
+ "eos_token": "</s>",
10
+ "mask_token": {
11
+ "content": "<mask>",
12
+ "lstrip": true,
13
+ "normalized": false,
14
+ "rstrip": false,
15
+ "single_word": false
16
+ },
17
+ "pad_token": "<pad>",
18
+ "sep_token": "</s>",
19
+ "unk_token": "<unk>"
20
+ }
checkpoint-160/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-160/tokenizer_config.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<s>NOTUSED",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<pad>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "2": {
21
+ "content": "</s>NOTUSED",
22
+ "lstrip": false,
23
+ "normalized": false,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "4": {
29
+ "content": "<unk>",
30
+ "lstrip": false,
31
+ "normalized": false,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "5": {
37
+ "content": "<s>",
38
+ "lstrip": false,
39
+ "normalized": false,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ },
44
+ "6": {
45
+ "content": "</s>",
46
+ "lstrip": false,
47
+ "normalized": false,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": true
51
+ },
52
+ "32004": {
53
+ "content": "<mask>",
54
+ "lstrip": true,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": true
59
+ },
60
+ "32005": {
61
+ "content": "<unk>NOTUSED",
62
+ "lstrip": false,
63
+ "normalized": false,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": true
67
+ }
68
+ },
69
+ "additional_special_tokens": [
70
+ "<s>NOTUSED",
71
+ "</s>NOTUSED",
72
+ "<unk>NOTUSED"
73
+ ],
74
+ "bos_token": "<s>",
75
+ "clean_up_tokenization_spaces": false,
76
+ "cls_token": "<s>",
77
+ "eos_token": "</s>",
78
+ "extra_special_tokens": {},
79
+ "mask_token": "<mask>",
80
+ "model_max_length": 512,
81
+ "pad_token": "<pad>",
82
+ "sep_token": "</s>",
83
+ "tokenizer_class": "CamembertTokenizer",
84
+ "unk_token": "<unk>"
85
+ }
checkpoint-160/trainer_state.json ADDED
@@ -0,0 +1,46 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 160,
3
+ "best_metric": 0.20437224209308624,
4
+ "best_model_checkpoint": "camembert-ner-person/checkpoint-160",
5
+ "epoch": 1.0,
6
+ "eval_steps": 500,
7
+ "global_step": 160,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.9498368678629691,
15
+ "eval_f1": 0.0,
16
+ "eval_loss": 0.20437224209308624,
17
+ "eval_precision": 0.0,
18
+ "eval_recall": 0.0,
19
+ "eval_runtime": 13.8104,
20
+ "eval_samples_per_second": 46.125,
21
+ "eval_steps_per_second": 2.896,
22
+ "step": 160
23
+ }
24
+ ],
25
+ "logging_steps": 500,
26
+ "max_steps": 1600,
27
+ "num_input_tokens_seen": 0,
28
+ "num_train_epochs": 10,
29
+ "save_steps": 500,
30
+ "stateful_callbacks": {
31
+ "TrainerControl": {
32
+ "args": {
33
+ "should_epoch_stop": false,
34
+ "should_evaluate": false,
35
+ "should_log": false,
36
+ "should_save": true,
37
+ "should_training_stop": false
38
+ },
39
+ "attributes": {}
40
+ }
41
+ },
42
+ "total_flos": 89263463139024.0,
43
+ "train_batch_size": 16,
44
+ "trial_name": null,
45
+ "trial_params": null
46
+ }
checkpoint-160/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f796509c39601477a427a76b8ddb93a21384d4e299d46d46249e2a69f513c3a
3
+ size 5777
checkpoint-1600/config.json ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "CamembertForTokenClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "bos_token_id": 5,
7
+ "classifier_dropout": null,
8
+ "dtype": "float32",
9
+ "eos_token_id": 6,
10
+ "hidden_act": "gelu",
11
+ "hidden_dropout_prob": 0.1,
12
+ "hidden_size": 768,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 3072,
15
+ "layer_norm_eps": 1e-05,
16
+ "max_position_embeddings": 514,
17
+ "model_type": "camembert",
18
+ "num_attention_heads": 12,
19
+ "num_hidden_layers": 12,
20
+ "output_past": true,
21
+ "pad_token_id": 1,
22
+ "position_embedding_type": "absolute",
23
+ "transformers_version": "4.56.0",
24
+ "type_vocab_size": 1,
25
+ "use_cache": true,
26
+ "vocab_size": 32005
27
+ }
checkpoint-1600/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b748c98bb24f3070c3382463283034592394c27d426816dfe7208ba83da84565
3
+ size 440155504
checkpoint-1600/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d1d484b7d116c4c2bf16dbe5fe872c8eba419edd1e9cf96f88637f1af60cf388
3
+ size 37797981
checkpoint-1600/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:337589c1454f52d524c27e975624a34624325dc09fde8ab544f76412d67b914b
3
+ size 14455
checkpoint-1600/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9fe52987da6cbdcd958711d4698defcc399373cb6c8a3a692929f32e589a6058
3
+ size 1465
checkpoint-1600/special_tokens_map.json ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<s>NOTUSED",
4
+ "</s>NOTUSED",
5
+ "<unk>NOTUSED"
6
+ ],
7
+ "bos_token": "<s>",
8
+ "cls_token": "<s>",
9
+ "eos_token": "</s>",
10
+ "mask_token": {
11
+ "content": "<mask>",
12
+ "lstrip": true,
13
+ "normalized": false,
14
+ "rstrip": false,
15
+ "single_word": false
16
+ },
17
+ "pad_token": "<pad>",
18
+ "sep_token": "</s>",
19
+ "unk_token": "<unk>"
20
+ }
checkpoint-1600/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1600/tokenizer_config.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "added_tokens_decoder": {
4
+ "0": {
5
+ "content": "<s>NOTUSED",
6
+ "lstrip": false,
7
+ "normalized": false,
8
+ "rstrip": false,
9
+ "single_word": false,
10
+ "special": true
11
+ },
12
+ "1": {
13
+ "content": "<pad>",
14
+ "lstrip": false,
15
+ "normalized": false,
16
+ "rstrip": false,
17
+ "single_word": false,
18
+ "special": true
19
+ },
20
+ "2": {
21
+ "content": "</s>NOTUSED",
22
+ "lstrip": false,
23
+ "normalized": false,
24
+ "rstrip": false,
25
+ "single_word": false,
26
+ "special": true
27
+ },
28
+ "4": {
29
+ "content": "<unk>",
30
+ "lstrip": false,
31
+ "normalized": false,
32
+ "rstrip": false,
33
+ "single_word": false,
34
+ "special": true
35
+ },
36
+ "5": {
37
+ "content": "<s>",
38
+ "lstrip": false,
39
+ "normalized": false,
40
+ "rstrip": false,
41
+ "single_word": false,
42
+ "special": true
43
+ },
44
+ "6": {
45
+ "content": "</s>",
46
+ "lstrip": false,
47
+ "normalized": false,
48
+ "rstrip": false,
49
+ "single_word": false,
50
+ "special": true
51
+ },
52
+ "32004": {
53
+ "content": "<mask>",
54
+ "lstrip": true,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false,
58
+ "special": true
59
+ },
60
+ "32005": {
61
+ "content": "<unk>NOTUSED",
62
+ "lstrip": false,
63
+ "normalized": false,
64
+ "rstrip": false,
65
+ "single_word": false,
66
+ "special": true
67
+ }
68
+ },
69
+ "additional_special_tokens": [
70
+ "<s>NOTUSED",
71
+ "</s>NOTUSED",
72
+ "<unk>NOTUSED"
73
+ ],
74
+ "bos_token": "<s>",
75
+ "clean_up_tokenization_spaces": false,
76
+ "cls_token": "<s>",
77
+ "eos_token": "</s>",
78
+ "extra_special_tokens": {},
79
+ "mask_token": "<mask>",
80
+ "model_max_length": 512,
81
+ "pad_token": "<pad>",
82
+ "sep_token": "</s>",
83
+ "tokenizer_class": "CamembertTokenizer",
84
+ "unk_token": "<unk>"
85
+ }
checkpoint-1600/trainer_state.json ADDED
@@ -0,0 +1,175 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1600,
3
+ "best_metric": 0.033178381621837616,
4
+ "best_model_checkpoint": "camembert-ner-person/checkpoint-1600",
5
+ "epoch": 10.0,
6
+ "eval_steps": 500,
7
+ "global_step": 1600,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.9498368678629691,
15
+ "eval_f1": 0.0,
16
+ "eval_loss": 0.20437224209308624,
17
+ "eval_precision": 0.0,
18
+ "eval_recall": 0.0,
19
+ "eval_runtime": 13.8104,
20
+ "eval_samples_per_second": 46.125,
21
+ "eval_steps_per_second": 2.896,
22
+ "step": 160
23
+ },
24
+ {
25
+ "epoch": 2.0,
26
+ "eval_accuracy": 0.9498368678629691,
27
+ "eval_f1": 0.0,
28
+ "eval_loss": 0.1605844497680664,
29
+ "eval_precision": 0.0,
30
+ "eval_recall": 0.0,
31
+ "eval_runtime": 13.0615,
32
+ "eval_samples_per_second": 48.769,
33
+ "eval_steps_per_second": 3.062,
34
+ "step": 320
35
+ },
36
+ {
37
+ "epoch": 3.0,
38
+ "eval_accuracy": 0.9747824904839587,
39
+ "eval_f1": 0.0,
40
+ "eval_loss": 0.09763724356889725,
41
+ "eval_precision": 0.0,
42
+ "eval_recall": 0.0,
43
+ "eval_runtime": 13.0676,
44
+ "eval_samples_per_second": 48.747,
45
+ "eval_steps_per_second": 3.061,
46
+ "step": 480
47
+ },
48
+ {
49
+ "epoch": 3.125,
50
+ "grad_norm": 0.23452259600162506,
51
+ "learning_rate": 1.37625e-05,
52
+ "loss": 0.2127,
53
+ "step": 500
54
+ },
55
+ {
56
+ "epoch": 4.0,
57
+ "eval_accuracy": 0.990415986949429,
58
+ "eval_f1": 0.0,
59
+ "eval_loss": 0.0640617236495018,
60
+ "eval_precision": 0.0,
61
+ "eval_recall": 0.0,
62
+ "eval_runtime": 13.1316,
63
+ "eval_samples_per_second": 48.509,
64
+ "eval_steps_per_second": 3.046,
65
+ "step": 640
66
+ },
67
+ {
68
+ "epoch": 5.0,
69
+ "eval_accuracy": 0.992862969004894,
70
+ "eval_f1": 0.0,
71
+ "eval_loss": 0.049903176724910736,
72
+ "eval_precision": 0.0,
73
+ "eval_recall": 0.0,
74
+ "eval_runtime": 13.1176,
75
+ "eval_samples_per_second": 48.561,
76
+ "eval_steps_per_second": 3.049,
77
+ "step": 800
78
+ },
79
+ {
80
+ "epoch": 6.0,
81
+ "eval_accuracy": 0.993610657966286,
82
+ "eval_f1": 0.0,
83
+ "eval_loss": 0.042311444878578186,
84
+ "eval_precision": 0.0,
85
+ "eval_recall": 0.0,
86
+ "eval_runtime": 13.1626,
87
+ "eval_samples_per_second": 48.395,
88
+ "eval_steps_per_second": 3.039,
89
+ "step": 960
90
+ },
91
+ {
92
+ "epoch": 6.25,
93
+ "grad_norm": 0.11943812668323517,
94
+ "learning_rate": 7.5125000000000005e-06,
95
+ "loss": 0.0639,
96
+ "step": 1000
97
+ },
98
+ {
99
+ "epoch": 7.0,
100
+ "eval_accuracy": 0.9940864600326265,
101
+ "eval_f1": 0.0,
102
+ "eval_loss": 0.03781137987971306,
103
+ "eval_precision": 0.0,
104
+ "eval_recall": 0.0,
105
+ "eval_runtime": 13.0963,
106
+ "eval_samples_per_second": 48.64,
107
+ "eval_steps_per_second": 3.054,
108
+ "step": 1120
109
+ },
110
+ {
111
+ "epoch": 8.0,
112
+ "eval_accuracy": 0.9943583469276781,
113
+ "eval_f1": 0.0,
114
+ "eval_loss": 0.03513427451252937,
115
+ "eval_precision": 0.0,
116
+ "eval_recall": 0.0,
117
+ "eval_runtime": 13.0526,
118
+ "eval_samples_per_second": 48.802,
119
+ "eval_steps_per_second": 3.065,
120
+ "step": 1280
121
+ },
122
+ {
123
+ "epoch": 9.0,
124
+ "eval_accuracy": 0.9944942903752039,
125
+ "eval_f1": 0.0,
126
+ "eval_loss": 0.03366817161440849,
127
+ "eval_precision": 0.0,
128
+ "eval_recall": 0.0,
129
+ "eval_runtime": 13.1019,
130
+ "eval_samples_per_second": 48.619,
131
+ "eval_steps_per_second": 3.053,
132
+ "step": 1440
133
+ },
134
+ {
135
+ "epoch": 9.375,
136
+ "grad_norm": 0.11723903566598892,
137
+ "learning_rate": 1.2625000000000002e-06,
138
+ "loss": 0.0387,
139
+ "step": 1500
140
+ },
141
+ {
142
+ "epoch": 10.0,
143
+ "eval_accuracy": 0.9944942903752039,
144
+ "eval_f1": 0.0,
145
+ "eval_loss": 0.033178381621837616,
146
+ "eval_precision": 0.0,
147
+ "eval_recall": 0.0,
148
+ "eval_runtime": 13.1921,
149
+ "eval_samples_per_second": 48.287,
150
+ "eval_steps_per_second": 3.032,
151
+ "step": 1600
152
+ }
153
+ ],
154
+ "logging_steps": 500,
155
+ "max_steps": 1600,
156
+ "num_input_tokens_seen": 0,
157
+ "num_train_epochs": 10,
158
+ "save_steps": 500,
159
+ "stateful_callbacks": {
160
+ "TrainerControl": {
161
+ "args": {
162
+ "should_epoch_stop": false,
163
+ "should_evaluate": false,
164
+ "should_log": false,
165
+ "should_save": true,
166
+ "should_training_stop": true
167
+ },
168
+ "attributes": {}
169
+ }
170
+ },
171
+ "total_flos": 884828390782752.0,
172
+ "train_batch_size": 16,
173
+ "trial_name": null,
174
+ "trial_params": null
175
+ }
checkpoint-1600/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f796509c39601477a427a76b8ddb93a21384d4e299d46d46249e2a69f513c3a
3
+ size 5777