Criminal-Qwen3-Reranker-0.6B-Augmented

This is a Cross Encoder model finetuned from Qwen/Qwen3-Reranker-4B using the sentence-transformers library. It computes scores for pairs of texts, which can be used for text reranking and semantic search.

Model Details

Model Description

  • Model Type: Cross Encoder
  • Base model: Qwen/Qwen3-Reranker-4B
  • Maximum Sequence Length: 1024 tokens
  • Number of Output Labels: 1 label
  • Supported Modalities: Text, Message
  • Language: vi
  • License: apache-2.0

Model Sources

Full Model Architecture

CrossEncoder(
  (0): Transformer({'transformer_task': 'text-generation', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'logits'}, 'message': {'method': 'forward', 'method_output_name': 'logits', 'format': 'flat'}}, 'module_output_name': 'causal_logits', 'architecture': 'Qwen3ForCausalLM'})
  (1): LogitScore({'true_token_id': 9693, 'false_token_id': 2152, 'module_input_name': 'causal_logits'})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import CrossEncoder

# Download from the 🤗 Hub
model = CrossEncoder("istt-aiml-data/Criminal-Qwen3-Reranker-4B-Augmented-aio")
# Get scores for pairs of inputs
pairs = [
    ['A: Ê mấy bà, nay đi hội chợ quê thấy con bò vàng nhìn cưng xỉu. \nB: Ở đâu á? Cho xin cái địa chỉ đi, đang muốn dắt tụi nhỏ đi xem bò vàng thực tế. \nC: Khu bên Q7 đó, có cả mấy mô hình bò vàng bằng gốm nữa, nhìn art lắm.', 'Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng.'],
    ['A: Đăng bài về vụ giá xăng mà đám bò vàng vào táp ghê quá, mệt mỏi. \nB: Kệ tụi nó đi, cãi nhau vs mấy con bò vàng đó làm gì cho phí thời gian. \nC: M mới bị tụi nó report bay acc à? Để t ib bên dịch vụ xem lấy lại đc k.', 'Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.'],
    ['Mẹ ơi, thằng Bin nó cứ đòi đu càng cái xe đạp của bố để tập đi đó. Nhìn nó ngã mà tui vừa thương vừa phê quá! Chiều nay m cho nó đi đá bóng k?', 'Trong ngữ cảnh này, "đu càng" chỉ hành động bám, đu vào càng xe, càng máy bay hoặc khung gầm phương tiện cơ học.'],
    ['A: Tụi nó lại xả mấy cái tin bẩn trên mấy cái group kín rồi.\nB: À, mấy thằng đu càng đó hả? Lâu lâu lại trồi lên, chốt kèo là toàn lũ vớ vẩn thôi.\nC: Kệ đi, chừng nào bế hết thì thôi. Bọn đó k bao giờ chịu đc.', 'Trong ngữ cảnh này, "đu càng" chỉ từ lóng miệt thị ám chỉ những người di tản, tị nạn năm 1975 hoặc các thành phần lưu vong có tư tưởng chống đối chính quyền.'],
    ['Sắp tới Cali chơi cho phê. Nghe nói nắng nóng bên đó hợp đi biển vãi.', 'Trong ngữ cảnh này, "cali" chỉ tên gọi tắt của tiểu bang California thuộc Hoa Kỳ hoặc phong cách sống tại đây.'],
]
scores = model.predict(pairs)
print(scores)
# [ 1.6875  3.9375  2.5    -2.5     4.25  ]

# Or rank different texts based on similarity to a single text
ranks = model.rank(
    'A: Ê mấy bà, nay đi hội chợ quê thấy con bò vàng nhìn cưng xỉu. \nB: Ở đâu á? Cho xin cái địa chỉ đi, đang muốn dắt tụi nhỏ đi xem bò vàng thực tế. \nC: Khu bên Q7 đó, có cả mấy mô hình bò vàng bằng gốm nữa, nhìn art lắm.',
    [
        'Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng.',
        'Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.',
        'Trong ngữ cảnh này, "đu càng" chỉ hành động bám, đu vào càng xe, càng máy bay hoặc khung gầm phương tiện cơ học.',
        'Trong ngữ cảnh này, "đu càng" chỉ từ lóng miệt thị ám chỉ những người di tản, tị nạn năm 1975 hoặc các thành phần lưu vong có tư tưởng chống đối chính quyền.',
        'Trong ngữ cảnh này, "cali" chỉ tên gọi tắt của tiểu bang California thuộc Hoa Kỳ hoặc phong cách sống tại đây.',
    ]
)
# [{'corpus_id': ..., 'score': ...}, {'corpus_id': ..., 'score': ...}, ...]

Evaluation

Metrics

Cross Encoder Reranking

Metric Value
map 0.9676
mrr@10 0.9676
ndcg@10 0.976

Training Details

Training Dataset

Unnamed Dataset

  • Size: 475 training samples
  • Columns: anchor, positive, and negative
  • Approximate statistics based on the first 100 samples:
    anchor positive negative
    type string string string
    modality text text text
    details
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
  • Samples:
    anchor positive negative
    A: Cái dây chuyền mặt con bò vàng này nhiêu tiền thế m?
    B: 2 chỉ đó, vàng 9999 luôn. Mua tặng bồ hả?
    A: Ừa, nó tuổi Sửu nên thích mấy đồ hình bò vàng lắm.
    Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
    Chốt cho e cái tượng bò vàng phong thủy để bàn làm việc nhé shop, nhìn hợp mệnh vãi. Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
    A: Ê, cuối tuần đi ăn kem ko? B: Oke, có quán kem bò vàng mới mở đó, thấy bảo vị ngọt phê lắm. C: Ngon thế hả? Chốt kèo luôn đi. A: Nghe nói kem có miếng thạch hình con bò vàng cute lắm. Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 10.0,
        "num_negatives": 4,
        "activation_fn": "torch.nn.modules.activation.Sigmoid"
    }
    

Evaluation Dataset

Unnamed Dataset

  • Size: 192 evaluation samples
  • Columns: anchor, positive, and negative
  • Approximate statistics based on the first 100 samples:
    anchor positive negative
    type string string string
    modality text text text
    details
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
    • min: 73 tokens
    • mean: 73.0 tokens
    • max: 73 tokens
  • Samples:
    anchor positive negative
    A: Ê mấy bà, nay đi hội chợ quê thấy con bò vàng nhìn cưng xỉu.
    B: Ở đâu á? Cho xin cái địa chỉ đi, đang muốn dắt tụi nhỏ đi xem bò vàng thực tế.
    C: Khu bên Q7 đó, có cả mấy mô hình bò vàng bằng gốm nữa, nhìn art lắm.
    Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng. Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ.
    A: Đăng bài về vụ giá xăng mà đám bò vàng vào táp ghê quá, mệt mỏi.
    B: Kệ tụi nó đi, cãi nhau vs mấy con bò vàng đó làm gì cho phí thời gian.
    C: M mới bị tụi nó report bay acc à? Để t ib bên dịch vụ xem lấy lại đc k.
    Trong ngữ cảnh này, "bò vàng" chỉ cách gọi miệt thị người bị cho là mù quáng, thiếu tư duy độc lập khi ủng hộ chính quyền hoặc chế độ. Trong ngữ cảnh này, "bò vàng" chỉ con bò lông vàng hoặc sản phẩm, hoa văn hình bò có màu vàng hay làm bằng vàng.
    Mẹ ơi, thằng Bin nó cứ đòi đu càng cái xe đạp của bố để tập đi đó. Nhìn nó ngã mà tui vừa thương vừa phê quá! Chiều nay m cho nó đi đá bóng k? Trong ngữ cảnh này, "đu càng" chỉ hành động bám, đu vào càng xe, càng máy bay hoặc khung gầm phương tiện cơ học. Trong ngữ cảnh này, "đu càng" chỉ từ lóng miệt thị ám chỉ những người di tản, tị nạn năm 1975 hoặc các thành phần lưu vong có tư tưởng chống đối chính quyền.
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 10.0,
        "num_negatives": 4,
        "activation_fn": "torch.nn.modules.activation.Sigmoid"
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • per_device_train_batch_size: 4
  • num_train_epochs: 15
  • learning_rate: 1e-05
  • lr_scheduler_type: cosine
  • warmup_steps: 0.1
  • weight_decay: 0.01
  • gradient_accumulation_steps: 2
  • load_best_model_at_end: True

All Hyperparameters

Click to expand
  • per_device_train_batch_size: 4
  • num_train_epochs: 15
  • max_steps: -1
  • learning_rate: 1e-05
  • lr_scheduler_type: cosine
  • lr_scheduler_kwargs: None
  • warmup_steps: 0.1
  • optim: adamw_torch_fused
  • optim_args: None
  • weight_decay: 0.01
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • optim_target_modules: None
  • gradient_accumulation_steps: 2
  • average_tokens_across_devices: True
  • max_grad_norm: 1.0
  • label_smoothing_factor: 0.0
  • bf16: False
  • fp16: False
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • use_liger_kernel: False
  • liger_kernel_config: None
  • use_cache: False
  • neftune_noise_alpha: None
  • torch_empty_cache_steps: None
  • auto_find_batch_size: False
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • include_num_input_tokens_seen: no
  • log_level: passive
  • log_level_replica: warning
  • disable_tqdm: False
  • project: huggingface
  • trackio_space_id: None
  • trackio_bucket_id: None
  • trackio_static_space_id: None
  • per_device_eval_batch_size: 8
  • prediction_loss_only: True
  • eval_on_start: False
  • eval_do_concat_batches: True
  • eval_use_gather_object: False
  • eval_accumulation_steps: None
  • include_for_metrics: []
  • batch_eval_metrics: False
  • save_only_model: False
  • save_on_each_node: False
  • enable_jit_checkpoint: False
  • push_to_hub: False
  • hub_private_repo: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_always_push: False
  • hub_revision: None
  • load_best_model_at_end: True
  • ignore_data_skip: False
  • restore_callback_states_from_checkpoint: False
  • full_determinism: False
  • seed: 42
  • data_seed: None
  • use_cpu: False
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • dataloader_prefetch_factor: None
  • remove_unused_columns: True
  • label_names: None
  • train_sampling_strategy: random
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • ddp_static_graph: None
  • ddp_backend: None
  • ddp_timeout: 1800
  • fsdp: None
  • fsdp_config: None
  • deepspeed: None
  • debug: []
  • skip_memory_metrics: True
  • do_predict: False
  • resume_from_checkpoint: None
  • warmup_ratio: None
  • local_rank: -1
  • prompts: None
  • batch_sampler: batch_sampler
  • multi_dataset_batch_sampler: proportional
  • router_mapping: {}
  • learning_rate_mapping: {}

Training Logs

Epoch Step Training Loss Validation Loss slang_disambiguation_eval_ndcg@10
0.1681 10 0.7158 - -
0.3361 20 0.6339 - -
0.5042 30 0.7516 - -
0.6723 40 0.6781 - -
0.8403 50 0.9181 - -
1.0 60 0.9466 0.5593 0.9423
1.1681 70 0.9400 - -
1.3361 80 0.5255 - -
1.5042 90 0.7084 - -
1.6723 100 0.4869 - -
1.8403 110 0.6798 - -
2.0 120 0.4678 0.3464 0.9484
2.1681 130 0.4452 - -
2.3361 140 0.3730 - -
2.5042 150 0.3712 - -
2.6723 160 0.4369 - -
2.8403 170 0.3413 - -
3.0 180 0.2660 0.2782 0.9611
3.1681 190 0.3421 - -
3.3361 200 0.1832 - -
3.5042 210 0.3721 - -
3.6723 220 0.1472 - -
3.8403 230 0.2239 - -
4.0 240 0.2254 0.2571 0.9683
4.1681 250 0.1223 - -
4.3361 260 0.3304 - -
4.5042 270 0.1754 - -
4.6723 280 0.1350 - -
4.8403 290 0.1373 - -
5.0 300 0.1708 0.2572 0.9743
5.1681 310 0.0887 - -
5.3361 320 0.2150 - -
5.5042 330 0.0645 - -
5.6723 340 0.1448 - -
5.8403 350 0.0507 - -
6.0 360 0.0836 0.3126 0.976
6.1681 370 0.0492 - -
6.3361 380 0.1002 - -
6.5042 390 0.0657 - -
6.6723 400 0.0703 - -
6.8403 410 0.1049 - -
7.0 420 0.0771 0.2878 0.9760
7.1681 430 0.0518 - -
7.3361 440 0.0737 - -
7.5042 450 0.1036 - -
7.6723 460 0.1590 - -
7.8403 470 0.0771 - -
8.0 480 0.0677 0.2621 0.9760
8.1681 490 0.0613 - -
8.3361 500 0.0467 - -
8.5042 510 0.0617 - -
8.6723 520 0.1052 - -
8.8403 530 0.0391 - -
9.0 540 0.0215 0.2965 0.9760
  • The bold row denotes the saved checkpoint.

Training Time

  • Training: 37.9 minutes

Framework Versions

  • Python: 3.12.13
  • Sentence Transformers: 5.7.0
  • Transformers: 5.13.1
  • PyTorch: 2.11.0+cu128
  • Accelerate: 1.14.0
  • Datasets: 5.0.1
  • Tokenizers: 0.22.2

Additional Resources

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for istt-aiml-data/Criminal-Qwen3-Reranker-4B-Augmented-aio

Finetuned
(12)
this model

Paper for istt-aiml-data/Criminal-Qwen3-Reranker-4B-Augmented-aio

Evaluation results