OneFly7 commited on
Commit
ee776f0
·
verified ·
1 Parent(s): 1871e07

Upload CNN/DM BGE-M3 pointwise MSE sentence scorer

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
config.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_cross_attention": false,
3
+ "architectures": [
4
+ "XLMRobertaForSequenceClassification"
5
+ ],
6
+ "attention_probs_dropout_prob": 0.1,
7
+ "bos_token_id": 0,
8
+ "classifier_dropout": null,
9
+ "dtype": "float32",
10
+ "eos_token_id": 2,
11
+ "hidden_act": "gelu",
12
+ "hidden_dropout_prob": 0.1,
13
+ "hidden_size": 1024,
14
+ "id2label": {
15
+ "0": "LABEL_0"
16
+ },
17
+ "initializer_range": 0.02,
18
+ "intermediate_size": 4096,
19
+ "is_decoder": false,
20
+ "label2id": {
21
+ "LABEL_0": 0
22
+ },
23
+ "layer_norm_eps": 1e-05,
24
+ "max_position_embeddings": 8194,
25
+ "model_type": "xlm-roberta",
26
+ "num_attention_heads": 16,
27
+ "num_hidden_layers": 24,
28
+ "output_past": true,
29
+ "pad_token_id": 1,
30
+ "position_embedding_type": "absolute",
31
+ "problem_type": "regression",
32
+ "salience_article_balanced": false,
33
+ "salience_loss_type": "mse",
34
+ "salience_multihead_names": [],
35
+ "salience_score_aggregation": "scalar",
36
+ "salience_score_semantics": "model_balanced_salience_probability",
37
+ "salience_score_transform": "identity",
38
+ "tie_word_embeddings": true,
39
+ "transformers_version": "5.6.2",
40
+ "type_vocab_size": 1,
41
+ "use_cache": false,
42
+ "vocab_size": 250002
43
+ }
eval_metrics.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "eval_loss": 0.03421084210276604,
3
+ "eval_mse": 0.03421084379263475,
4
+ "eval_rmse": 0.18496173602298058,
5
+ "eval_mae": 0.13758335639960514,
6
+ "eval_pearson": 0.7992694624484324,
7
+ "eval_spearman": 0.7975893083370461,
8
+ "eval_article_spearman": 0.6913812102325307,
9
+ "eval_article_ndcg_at_3": 0.8912648201819963,
10
+ "eval_article_ndcg_at_5": 0.8810350116689233,
11
+ "eval_runtime": 136.7425,
12
+ "eval_samples_per_second": 49.677,
13
+ "eval_steps_per_second": 24.842,
14
+ "epoch": 2.3068926781013697
15
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b8e5fe49345d26bb119ee830a1bcd8177324d49a9ff536fdecf897e2b0f04a2a
3
+ size 2271071852
run_summary.md ADDED
@@ -0,0 +1,53 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # CNN/DailyMail Pointwise Sentence Scorer Run
2
+
3
+ - model_size: `base`
4
+ - model_name: `BAAI/bge-m3`
5
+ - resolved_model_name: `/lustre/fsmisc/dataset/HuggingFace_Models/BAAI/bge-m3`
6
+ - target_mode: `model_balanced`
7
+ - target_field: `salience_score_model_balanced`
8
+ - loss_type: `mse`
9
+ - score_transform: `identity`
10
+ - article_balanced: `False`
11
+ - multihead: `False`
12
+ - multihead_names: `[]`
13
+ - score_aggregation: `scalar`
14
+ - eval_loss_semantics: `mse`
15
+ - input_field: `model_input_text`
16
+ - train_file: `data/CNN_DM/representative_subset/salience_generation/recovery_f2_all6/sentence_scorer_data/modernbert_pointwise/train.jsonl`
17
+ - dev_file: `data/CNN_DM/representative_subset/salience_generation/recovery_f2_all6/sentence_scorer_data/modernbert_pointwise/dev.jsonl`
18
+ - train_rows: `59643`
19
+ - dev_rows: `6793`
20
+ - train_articles: `1000`
21
+ - dev_articles: `200`
22
+ - max_length: `4608`
23
+ - attn_implementation: `eager`
24
+ - learning_rate: `1e-05`
25
+ - weight_decay: `0.01`
26
+ - num_train_epochs: `3.0`
27
+ - warmup_ratio: `0.06`
28
+ - per_device_train_batch_size: `1`
29
+ - per_device_eval_batch_size: `2`
30
+ - gradient_accumulation_steps: `16`
31
+ - effective_train_batch_size: `16`
32
+ - eval_strategy: `steps`
33
+ - save_strategy: `steps`
34
+ - early_stopping_patience: `5`
35
+ - bf16: `True`
36
+ - fp16: `False`
37
+ - gradient_checkpointing: `True`
38
+
39
+ ## Eval Metrics
40
+
41
+ - epoch: `2.3068926781013697`
42
+ - eval_article_ndcg_at_3: `0.8912648201819963`
43
+ - eval_article_ndcg_at_5: `0.8810350116689233`
44
+ - eval_article_spearman: `0.6913812102325307`
45
+ - eval_loss: `0.03421084210276604`
46
+ - eval_mae: `0.13758335639960514`
47
+ - eval_mse: `0.03421084379263475`
48
+ - eval_pearson: `0.7992694624484324`
49
+ - eval_rmse: `0.18496173602298058`
50
+ - eval_runtime: `136.7425`
51
+ - eval_samples_per_second: `49.677`
52
+ - eval_spearman: `0.7975893083370461`
53
+ - eval_steps_per_second: `24.842`
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5df1f55d60c9705a501ab9a75550728625740741fe4be308dac4806c16b7d51d
3
+ size 17098085
tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": true,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<s>",
5
+ "clean_up_tokenization_spaces": true,
6
+ "cls_token": "<s>",
7
+ "eos_token": "</s>",
8
+ "is_local": true,
9
+ "local_files_only": true,
10
+ "mask_token": "<mask>",
11
+ "model_max_length": 8192,
12
+ "pad_token": "<pad>",
13
+ "sep_token": "</s>",
14
+ "sp_model_kwargs": {},
15
+ "tokenizer_class": "XLMRobertaTokenizer",
16
+ "unk_token": "<unk>"
17
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:045a81719ef84d308535e918ef0c3afa2e713598fd11c3ca3c3f81a28bf97708
3
+ size 5329