AlucardV's picture
Add new SentenceTransformer model
cf0f8e7 verified
|
Raw
History Blame Contribute Delete
21.2 kB
metadata
tags:
  - sentence-transformers
  - sentence-similarity
  - feature-extraction
  - generated_from_trainer
  - dataset_size:20000
  - loss:TripletLoss
base_model: sentence-transformers/all-MiniLM-L6-v2
widget:
  - source_sentence: >-
      Ната́лья Миха́йловна Семени́хина (16 февраля 1970, Харьков) — российская
      журналистка и телеведущая.
    sentences:
      - >-
        В первую очередь нарратор (рассказчик) является обладателем информации о
        концовке, и именно благодаря этой способности он существенно отличается
        от другого участника рассказа - его 'героя', который, находясь в центре
        событий, не осведомлен об этом.
      - >-
        Российская журналистка и телеведущая Ната́лья Миха́йловна Семени́хина
        родилась 16 февраля 1970 года в Харькове.
      - >-
        Ната́лья Миха́йловна Семени́хина не является журналисткой и телеведущей,
        она из другой профессии.
  - source_sentence: >-
      Наиболее известный продукт Zello — одноимённая интернет-рация (программа),
      которая разработана Алексеем Гавриловым, ныне техническим директором
      Zello.
    sentences:
      - >-
        Тина Канделаки и Василий Бровко были генеральными продюсерами, им же
        принадлежала уникальная концепция.
      - >-
        Малоизвестный продукт Zello — непопулярная интернет-рация, которая не
        вызвала интерес у пользователей.
      - >-
        Одноименная интернет-рация Zello, разработанная Алексеем Гавриловым,
        ныне техническим директором компании.
  - source_sentence: >-
      Дэмиен занял 4 место в индивидуальном соревновании среди участников со
      всего мира.
    sentences:
      - >-
        15 февраля 2018 года, в связи с политическим кризисом в стране,
        Хайлемариам Десалень заявил в своем телевизионном обращении о своей
        отставке с поста премьер-министра и председателя правящей коалиции в
        Эфиопии.
      - Дэмиен не смог попасть в топ-3 в индивидуальном соревновании.
      - >-
        4 место в индивидуальном соревновании среди участников со всего мира
        занял Дэмиен.
  - source_sentence: >-
      Эта башня, которая обошлась $150 млн, была построена в 2006 году и вмещает
      около 2800 сотрудников, в ней 23 этажа и 12 парковочных уровней.
    sentences:
      - >-
        Проработанный мир был похвален обозревателями, особенно устройство Ада
        было хорошо продумано.
      - >-
        Эта башня, построенная в 2006 году за $150 млн, предназначена для
        проживания около 2800 сотрудников, в ней 23 этажа и 12 уровней для
        парковки.
      - >-
        Эта башня была построена бесплатно в 1990 году и пустует, ни одного
        сотрудника, ни одного этажа и ни одного парковочного уровня в ней нет.
  - source_sentence: >-
      В это время ядро из русского ретраншемента разбило носилки Карла XII, но
      сам король не пострадал.
    sentences:
      - В составе Подпорожского района с 1954 года.
      - >-
        В это время носилки Карла XII не подверглись никаким повреждениям, хотя
        ядро из русского ретраншемента было близко.
      - >-
        В это время носилки Карла XII были разбиты ядром из русского
        ретраншемента, но сам король остался цел.
pipeline_tag: sentence-similarity
library_name: sentence-transformers

SentenceTransformer based on sentence-transformers/all-MiniLM-L6-v2

This is a sentence-transformers model finetuned from sentence-transformers/all-MiniLM-L6-v2. It maps sentences & paragraphs to a 384-dimensional dense vector space and can be used for retrieval.

Model Details

Model Description

  • Model Type: Sentence Transformer
  • Base model: sentence-transformers/all-MiniLM-L6-v2
  • Maximum Sequence Length: 256 tokens
  • Output Dimensionality: 384 dimensions
  • Similarity Function: Cosine Similarity
  • Supported Modality: Text

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
  (1): Pooling({'embedding_dimension': 384, 'pooling_mode': 'mean', 'include_prompt': True})
  (2): Normalize({})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("AlucardV/finetuned_model_ver2")
# Run inference
sentences = [
    'В это время ядро из русского ретраншемента разбило носилки Карла XII, но сам король не пострадал.',
    'В это время носилки Карла XII были разбиты ядром из русского ретраншемента, но сам король остался цел.',
    'В это время носилки Карла XII не подверглись никаким повреждениям, хотя ядро из русского ретраншемента было близко.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 384]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[ 1.0000, -0.9995,  0.9999],
#         [-0.9995,  1.0000, -0.9995],
#         [ 0.9999, -0.9995,  1.0000]])

Training Details

Training Dataset

Unnamed Dataset

  • Size: 20,000 training samples
  • Columns: sentence_0, sentence_1, and sentence_2
  • Approximate statistics based on the first 100 samples:
    sentence_0 sentence_1 sentence_2
    type string string string
    modality text text text
    details
    • min: 31 tokens
    • mean: 112.28 tokens
    • max: 256 tokens
    • min: 31 tokens
    • mean: 104.71 tokens
    • max: 256 tokens
    • min: 31 tokens
    • mean: 97.02 tokens
    • max: 256 tokens
  • Samples:
    sentence_0 sentence_1 sentence_2
    После окончания Московского среднего технического училища (1918) работал электромехаником в Московском практическом электротехническом институте и одновременно учился там же (окончил в 1921 г. со званием инженера по электрооборудованию фабрик и заводов). Работая электромехаником в Московском практическом электротехническом институте, после окончания Московского среднего технического училища (1918), он одновременно учился там же и успешно закончил в 1921 году, получив звание инженера по электрооборудованию фабрик и заводов. Не окончив Московское среднее техническое училище в 1918 году, он не стал электромехаником в Московском практическом электротехническом институте и не учился там же, не закончив обучение в 1921 году со званием инженера по электрооборудованию фабрик и заводов.
    В течение своей жизни Шарлотта неоднократно отказывалась от замужества, иногда воспринимая брачные предложения серьёзно, иногда относясь к ним с юмором. Шарлотта неоднократно отклоняла сватовство в течение своей жизни, то серьезно воспринимая брачные предложения, то с улыбкой. В течение своей жизни Шарлотта всегда радовалась предложениям о замужестве, не принимая их всерьёз, чаще всего смеясь.
    В 1978 году окончил Уфимский государственный институт искусств (ныне — Уфимская государственная академия искусств имени Загира Исмагилова) по специальности «сольное пение», класс заслуженного деятеля искусств России и Башкортостана, профессора М. Г. Муртазиной. В 1978 году закончил Уфимский государственный институт искусств (ныне — Уфимская государственная академия искусств имени Загира Исмагилова) по направлению «сольное пение», класса заслуженной артистки России и Башкортостана, профессора Е. П. Ибрагимова. Не закончил обучение в Уфимском государственном институте искусств, не получив диплома по специальности «сольное пение».
  • Loss: TripletLoss with these parameters:
    {
        "distance_metric": "TripletDistanceMetric.EUCLIDEAN",
        "triplet_margin": 5
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • per_device_train_batch_size: 32
  • per_device_eval_batch_size: 32
  • multi_dataset_batch_sampler: round_robin

All Hyperparameters

Click to expand
  • per_device_train_batch_size: 32
  • num_train_epochs: 3
  • max_steps: -1
  • learning_rate: 5e-05
  • lr_scheduler_type: linear
  • lr_scheduler_kwargs: None
  • warmup_steps: 0
  • optim: adamw_torch
  • optim_args: None
  • weight_decay: 0.0
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • optim_target_modules: None
  • gradient_accumulation_steps: 1
  • average_tokens_across_devices: True
  • max_grad_norm: 1
  • label_smoothing_factor: 0.0
  • bf16: False
  • fp16: False
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • use_liger_kernel: False
  • liger_kernel_config: None
  • use_cache: False
  • neftune_noise_alpha: None
  • torch_empty_cache_steps: None
  • auto_find_batch_size: False
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • include_num_input_tokens_seen: no
  • log_level: passive
  • log_level_replica: warning
  • disable_tqdm: False
  • project: huggingface
  • trackio_space_id: None
  • trackio_bucket_id: None
  • trackio_static_space_id: None
  • per_device_eval_batch_size: 32
  • prediction_loss_only: True
  • eval_on_start: False
  • eval_do_concat_batches: True
  • eval_use_gather_object: False
  • eval_accumulation_steps: None
  • include_for_metrics: []
  • batch_eval_metrics: False
  • save_only_model: False
  • save_on_each_node: False
  • enable_jit_checkpoint: False
  • push_to_hub: False
  • hub_private_repo: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_always_push: False
  • hub_revision: None
  • load_best_model_at_end: False
  • ignore_data_skip: False
  • restore_callback_states_from_checkpoint: False
  • full_determinism: False
  • seed: 42
  • data_seed: None
  • use_cpu: False
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • dataloader_prefetch_factor: None
  • remove_unused_columns: True
  • label_names: None
  • train_sampling_strategy: random
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • ddp_static_graph: None
  • ddp_backend: None
  • ddp_timeout: 1800
  • fsdp: None
  • fsdp_config: None
  • deepspeed: None
  • debug: []
  • skip_memory_metrics: True
  • do_predict: False
  • resume_from_checkpoint: None
  • warmup_ratio: None
  • local_rank: -1
  • prompts: None
  • batch_sampler: batch_sampler
  • multi_dataset_batch_sampler: round_robin
  • router_mapping: {}
  • learning_rate_mapping: {}

Training Logs

Epoch Step Training Loss
0.8 500 4.1612
1.6 1000 3.9547
2.4 1500 3.9096

Training Time

  • Training: 24.6 minutes

Framework Versions

  • Python: 3.12.8
  • Sentence Transformers: 5.6.0
  • Transformers: 5.13.1
  • PyTorch: 2.6.0+cu124
  • Accelerate: 1.14.0
  • Datasets: 5.0.0
  • Tokenizers: 0.22.2

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}

TripletLoss

@misc{hermans2017defense,
    title={In Defense of the Triplet Loss for Person Re-Identification},
    author={Alexander Hermans and Lucas Beyer and Bastian Leibe},
    year={2017},
    eprint={1703.07737},
    archivePrefix={arXiv},
    primaryClass={cs.CV}
}