Criminal-Qwen3-Reranker-0.6B-Augmented

This is a Cross Encoder model finetuned from Qwen/Qwen3-Reranker-0.6B using the sentence-transformers library. It computes scores for pairs of texts, which can be used for text reranking and semantic search.

Model Details

Model Description

  • Model Type: Cross Encoder
  • Base model: Qwen/Qwen3-Reranker-0.6B
  • Maximum Sequence Length: 1024 tokens
  • Number of Output Labels: 1 label
  • Supported Modalities: Text, Message
  • Language: vi
  • License: apache-2.0

Model Sources

Full Model Architecture

CrossEncoder(
  (0): Transformer({'transformer_task': 'text-generation', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'logits'}, 'message': {'method': 'forward', 'method_output_name': 'logits', 'format': 'flat'}}, 'module_output_name': 'causal_logits', 'architecture': 'Qwen3ForCausalLM'})
  (1): LogitScore({'true_token_id': 9693, 'false_token_id': 2152, 'module_input_name': 'causal_logits'})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import CrossEncoder

# Download from the 🤗 Hub
model = CrossEncoder("istt-aiml-data/Criminal-Qwen3-Reranker-0.6B-Augmented-aio")
# Get scores for pairs of inputs
pairs = [
    ['A: Ê mấy bà, nay đi hội chợ quê thấy con bò vàng nhìn cưng xỉu. \nB: Ở đâu á? Cho xin cái địa chỉ đi, đang muốn dắt tụi nhỏ đi xem bò vàng thực tế. \nC: Khu bên Q7 đó, có cả mấy mô hình bò vàng bằng gốm nữa, nhìn art lắm.', 'Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng.'],
    ['A: Đăng bài về vụ giá xăng mà đám bò vàng vào táp ghê quá, mệt mỏi. \nB: Kệ tụi nó đi, cãi nhau vs mấy con bò vàng đó làm gì cho phí thời gian. \nC: M mới bị tụi nó report bay acc à? Để t ib bên dịch vụ xem lấy lại đc k.', 'Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.'],
    ['Mẹ ơi, thằng Bin nó cứ đòi đu càng cái xe đạp của bố để tập đi đó. Nhìn nó ngã mà tui vừa thương vừa phê quá! Chiều nay m cho nó đi đá bóng k?', 'Trong ngữ cảnh này, "đu càng" chỉ hành động bám, đu vào càng xe, càng máy bay hoặc khung gầm phương tiện cơ học.'],
    ['A: Tụi nó lại xả mấy cái tin bẩn trên mấy cái group kín rồi.\nB: À, mấy thằng đu càng đó hả? Lâu lâu lại trồi lên, chốt kèo là toàn lũ vớ vẩn thôi.\nC: Kệ đi, chừng nào bế hết thì thôi. Bọn đó k bao giờ chịu đc.', 'Trong ngữ cảnh này, "đu càng" chỉ từ lóng miệt thị ám chỉ những người di tản, tị nạn năm 1975 hoặc các thành phần lưu vong có tư tưởng chống đối chính quyền.'],
    ['Sắp tới Cali chơi cho phê. Nghe nói nắng nóng bên đó hợp đi biển vãi.', 'Trong ngữ cảnh này, "cali" chỉ tên gọi tắt của tiểu bang California thuộc Hoa Kỳ hoặc phong cách sống tại đây.'],
]
scores = model.predict(pairs)
print(scores)
# [ 5.625   6.6875  5.     -1.25   -3.875 ]

# Or rank different texts based on similarity to a single text
ranks = model.rank(
    'A: Ê mấy bà, nay đi hội chợ quê thấy con bò vàng nhìn cưng xỉu. \nB: Ở đâu á? Cho xin cái địa chỉ đi, đang muốn dắt tụi nhỏ đi xem bò vàng thực tế. \nC: Khu bên Q7 đó, có cả mấy mô hình bò vàng bằng gốm nữa, nhìn art lắm.',
    [
        'Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng.',
        'Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.',
        'Trong ngữ cảnh này, "đu càng" chỉ hành động bám, đu vào càng xe, càng máy bay hoặc khung gầm phương tiện cơ học.',
        'Trong ngữ cảnh này, "đu càng" chỉ từ lóng miệt thị ám chỉ những người di tản, tị nạn năm 1975 hoặc các thành phần lưu vong có tư tưởng chống đối chính quyền.',
        'Trong ngữ cảnh này, "cali" chỉ tên gọi tắt của tiểu bang California thuộc Hoa Kỳ hoặc phong cách sống tại đây.',
    ]
)
# [{'corpus_id': ..., 'score': ...}, {'corpus_id': ..., 'score': ...}, ...]

Evaluation

Metrics

Cross Encoder Reranking

Metric Value
map 0.8387
mrr@10 0.8387
ndcg@10 0.88

Training Details

Training Dataset

Unnamed Dataset

  • Size: 1,082 training samples
  • Columns: anchor, positive, and negative
  • Approximate statistics based on the first 100 samples:
    anchor positive negative
    type string string string
    modality text text text
    details
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
  • Samples:
    anchor positive negative
    A: Cái dây chuyền mặt con bò vàng này nhiêu tiền thế m?
    B: 2 chỉ đó, vàng 9999 luôn. Mua tặng bồ hả?
    A: Ừa, nó tuổi Sửu nên thích mấy đồ hình bò vàng lắm.
    Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
    Chốt cho e cái tượng bò vàng phong thủy để bàn làm việc nhé shop, nhìn hợp mệnh vãi. Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
    A: Ê, cuối tuần đi ăn kem ko? B: Oke, có quán kem bò vàng mới mở đó, thấy bảo vị ngọt phê lắm. C: Ngon thế hả? Chốt kèo luôn đi. A: Nghe nói kem có miếng thạch hình con bò vàng cute lắm. Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 10.0,
        "num_negatives": 4,
        "activation_fn": "torch.nn.modules.activation.Sigmoid"
    }
    

Evaluation Dataset

Unnamed Dataset

  • Size: 312 evaluation samples
  • Columns: anchor, positive, and negative
  • Approximate statistics based on the first 100 samples:
    anchor positive negative
    type string string string
    modality text text text
    details
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
  • Samples:
    anchor positive negative
    A: Ê mấy bà, nay đi hội chợ quê thấy con bò vàng nhìn cưng xỉu.
    B: Ở đâu á? Cho xin cái địa chỉ đi, đang muốn dắt tụi nhỏ đi xem bò vàng thực tế.
    C: Khu bên Q7 đó, có cả mấy mô hình bò vàng bằng gốm nữa, nhìn art lắm.
    Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
    A: Đăng bài về vụ giá xăng mà đám bò vàng vào táp ghê quá, mệt mỏi.
    B: Kệ tụi nó đi, cãi nhau vs mấy con bò vàng đó làm gì cho phí thời gian.
    C: M mới bị tụi nó report bay acc à? Để t ib bên dịch vụ xem lấy lại đc k.
    Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ. Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng.
    Mẹ ơi, thằng Bin nó cứ đòi đu càng cái xe đạp của bố để tập đi đó. Nhìn nó ngã mà tui vừa thương vừa phê quá! Chiều nay m cho nó đi đá bóng k? Trong ngữ cảnh này, "đu càng" chỉ hành động bám, đu vào càng xe, càng máy bay hoặc khung gầm phương tiện cơ học. Trong ngữ cảnh này, "đu càng" chỉ từ lóng miệt thị ám chỉ những người di tản, tị nạn năm 1975 hoặc các thành phần lưu vong có tư tưởng chống đối chính quyền.
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 10.0,
        "num_negatives": 4,
        "activation_fn": "torch.nn.modules.activation.Sigmoid"
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • num_train_epochs: 15
  • learning_rate: 1e-05
  • lr_scheduler_type: cosine
  • warmup_steps: 0.1
  • weight_decay: 0.01
  • gradient_accumulation_steps: 2
  • load_best_model_at_end: True

All Hyperparameters

Click to expand
  • per_device_train_batch_size: 8
  • num_train_epochs: 15
  • max_steps: -1
  • learning_rate: 1e-05
  • lr_scheduler_type: cosine
  • lr_scheduler_kwargs: None
  • warmup_steps: 0.1
  • optim: adamw_torch_fused
  • optim_args: None
  • weight_decay: 0.01
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • optim_target_modules: None
  • gradient_accumulation_steps: 2
  • average_tokens_across_devices: True
  • max_grad_norm: 1.0
  • label_smoothing_factor: 0.0
  • bf16: False
  • fp16: False
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • use_liger_kernel: False
  • liger_kernel_config: None
  • use_cache: False
  • neftune_noise_alpha: None
  • torch_empty_cache_steps: None
  • auto_find_batch_size: False
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • include_num_input_tokens_seen: no
  • log_level: passive
  • log_level_replica: warning
  • disable_tqdm: False
  • project: huggingface
  • trackio_space_id: None
  • trackio_bucket_id: None
  • trackio_static_space_id: None
  • per_device_eval_batch_size: 8
  • prediction_loss_only: True
  • eval_on_start: False
  • eval_do_concat_batches: True
  • eval_use_gather_object: False
  • eval_accumulation_steps: None
  • include_for_metrics: []
  • batch_eval_metrics: False
  • save_only_model: False
  • save_on_each_node: False
  • enable_jit_checkpoint: False
  • push_to_hub: False
  • hub_private_repo: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_always_push: False
  • hub_revision: None
  • load_best_model_at_end: True
  • ignore_data_skip: False
  • restore_callback_states_from_checkpoint: False
  • full_determinism: False
  • seed: 42
  • data_seed: None
  • use_cpu: False
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • dataloader_prefetch_factor: None
  • remove_unused_columns: True
  • label_names: None
  • train_sampling_strategy: random
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • ddp_static_graph: None
  • ddp_backend: None
  • ddp_timeout: 1800
  • fsdp: None
  • fsdp_config: None
  • deepspeed: None
  • debug: []
  • skip_memory_metrics: True
  • do_predict: False
  • resume_from_checkpoint: None
  • warmup_ratio: None
  • local_rank: -1
  • prompts: None
  • batch_sampler: batch_sampler
  • multi_dataset_batch_sampler: proportional
  • router_mapping: {}
  • learning_rate_mapping: {}

Training Logs

Epoch Step Training Loss Validation Loss slang_disambiguation_eval_ndcg@10
0.1471 10 1.2885 - -
0.2941 20 1.3123 - -
0.4412 30 1.1936 - -
0.5882 40 1.3744 - -
0.7353 50 1.3150 - -
0.8824 60 0.9366 - -
1.0 68 - 0.6831 0.8393
1.0294 70 0.8375 - -
1.1765 80 0.7410 - -
1.3235 90 0.6339 - -
1.4706 100 0.6186 - -
1.6176 110 0.5941 - -
1.7647 120 0.4560 - -
1.9118 130 0.5176 - -
2.0 136 - 0.5198 0.8673
2.0588 140 0.3715 - -
2.2059 150 0.2766 - -
2.3529 160 0.3782 - -
2.5 170 0.3015 - -
2.6471 180 0.2893 - -
2.7941 190 0.2577 - -
2.9412 200 0.3034 - -
3.0 204 - 0.5479 0.8714
3.0882 210 0.1728 - -
3.2353 220 0.1730 - -
3.3824 230 0.1379 - -
3.5294 240 0.1312 - -
3.6765 250 0.1851 - -
3.8235 260 0.1479 - -
3.9706 270 0.1593 - -
4.0 272 - 0.5572 0.8719
4.1176 280 0.0945 - -
4.2647 290 0.0842 - -
4.4118 300 0.0973 - -
4.5588 310 0.0805 - -
4.7059 320 0.0784 - -
4.8529 330 0.0732 - -
5.0 340 0.1549 0.6640 0.8719
5.1471 350 0.0856 - -
5.2941 360 0.0898 - -
5.4412 370 0.0810 - -
5.5882 380 0.0691 - -
5.7353 390 0.0964 - -
5.8824 400 0.0582 - -
6.0 408 - 0.7206 0.8759
6.0294 410 0.0405 - -
6.1765 420 0.0541 - -
6.3235 430 0.0501 - -
6.4706 440 0.0763 - -
6.6176 450 0.0851 - -
6.7647 460 0.0831 - -
6.9118 470 0.0780 - -
7.0 476 - 0.7664 0.8829
7.0588 480 0.0385 - -
7.2059 490 0.0672 - -
7.3529 500 0.0577 - -
7.5 510 0.0835 - -
7.6471 520 0.0374 - -
7.7941 530 0.0477 - -
7.9412 540 0.0859 - -
8.0 544 - 0.8614 0.8767
8.0882 550 0.1278 - -
8.2353 560 0.0559 - -
8.3824 570 0.0311 - -
8.5294 580 0.0641 - -
8.6765 590 0.0471 - -
8.8235 600 0.0284 - -
8.9706 610 0.0665 - -
9.0 612 - 0.8531 0.8818
9.1176 620 0.0352 - -
9.2647 630 0.0498 - -
9.4118 640 0.0528 - -
9.5588 650 0.0868 - -
9.7059 660 0.0782 - -
9.8529 670 0.0803 - -
10.0 680 0.0634 0.8906 0.8800
  • The bold row denotes the saved checkpoint.

Training Time

  • Training: 24.8 minutes

Framework Versions

  • Python: 3.12.13
  • Sentence Transformers: 5.7.0
  • Transformers: 5.13.1
  • PyTorch: 2.11.0+cu128
  • Accelerate: 1.14.0
  • Datasets: 5.0.1
  • Tokenizers: 0.22.2

Additional Resources

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}
Downloads last month
-
Safetensors
Model size
0.6B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for istt-aiml-data/Criminal-Qwen3-Reranker-0.6B-Augmented-aio

Finetuned
(31)
this model

Paper for istt-aiml-data/Criminal-Qwen3-Reranker-0.6B-Augmented-aio

Evaluation results