AlucardV's picture
Add new SentenceTransformer model
cf0f8e7 verified
|
Raw
History Blame Contribute Delete
21.2 kB
---
tags:
- sentence-transformers
- sentence-similarity
- feature-extraction
- generated_from_trainer
- dataset_size:20000
- loss:TripletLoss
base_model: sentence-transformers/all-MiniLM-L6-v2
widget:
- source_sentence: Ната́лья Миха́йловна Семени́хина (16 февраля 1970, Харьков) российская
журналистка и телеведущая.
sentences:
- В первую очередь нарратор (рассказчик) является обладателем информации о концовке,
и именно благодаря этой способности он существенно отличается от другого участника
рассказа - его 'героя', который, находясь в центре событий, не осведомлен об этом.
- Российская журналистка и телеведущая Ната́лья Миха́йловна Семени́хина родилась
16 февраля 1970 года в Харькове.
- Ната́лья Миха́йловна Семени́хина не является журналисткой и телеведущей, она из
другой профессии.
- source_sentence: Наиболее известный продукт Zello одноимённая интернет-рация (программа),
которая разработана Алексеем Гавриловым, ныне техническим директором Zello.
sentences:
- Тина Канделаки и Василий Бровко были генеральными продюсерами, им же принадлежала
уникальная концепция.
- Малоизвестный продукт Zello непопулярная интернет-рация, которая не вызвала
интерес у пользователей.
- Одноименная интернет-рация Zello, разработанная Алексеем Гавриловым, ныне техническим
директором компании.
- source_sentence: Дэмиен занял 4 место в индивидуальном соревновании среди участников
со всего мира.
sentences:
- 15 февраля 2018 года, в связи с политическим кризисом в стране, Хайлемариам Десалень
заявил в своем телевизионном обращении о своей отставке с поста премьер-министра
и председателя правящей коалиции в Эфиопии.
- Дэмиен не смог попасть в топ-3 в индивидуальном соревновании.
- 4 место в индивидуальном соревновании среди участников со всего мира занял Дэмиен.
- source_sentence: Эта башня, которая обошлась $150 млн, была построена в 2006 году
и вмещает около 2800 сотрудников, в ней 23 этажа и 12 парковочных уровней.
sentences:
- Проработанный мир был похвален обозревателями, особенно устройство Ада было хорошо
продумано.
- Эта башня, построенная в 2006 году за $150 млн, предназначена для проживания около
2800 сотрудников, в ней 23 этажа и 12 уровней для парковки.
- Эта башня была построена бесплатно в 1990 году и пустует, ни одного сотрудника,
ни одного этажа и ни одного парковочного уровня в ней нет.
- source_sentence: В это время ядро из русского ретраншемента разбило носилки Карла
XII, но сам король не пострадал.
sentences:
- В составе Подпорожского района с 1954 года.
- В это время носилки Карла XII не подверглись никаким повреждениям, хотя ядро из
русского ретраншемента было близко.
- В это время носилки Карла XII были разбиты ядром из русского ретраншемента, но
сам король остался цел.
pipeline_tag: sentence-similarity
library_name: sentence-transformers
---
# SentenceTransformer based on sentence-transformers/all-MiniLM-L6-v2
This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [sentence-transformers/all-MiniLM-L6-v2](https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2). It maps sentences & paragraphs to a 384-dimensional dense vector space and can be used for retrieval.
## Model Details
### Model Description
- **Model Type:** Sentence Transformer
- **Base model:** [sentence-transformers/all-MiniLM-L6-v2](https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2) <!-- at revision 1110a243fdf4706b3f48f1d95db1a4f5529b4d41 -->
- **Maximum Sequence Length:** 256 tokens
- **Output Dimensionality:** 384 dimensions
- **Similarity Function:** Cosine Similarity
- **Supported Modality:** Text
<!-- - **Training Dataset:** Unknown -->
<!-- - **Language:** Unknown -->
<!-- - **License:** Unknown -->
### Model Sources
- **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
- **Repository:** [Sentence Transformers on GitHub](https://github.com/huggingface/sentence-transformers)
- **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
### Full Model Architecture
```
SentenceTransformer(
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
(1): Pooling({'embedding_dimension': 384, 'pooling_mode': 'mean', 'include_prompt': True})
(2): Normalize({})
)
```
## Usage
### Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
```bash
pip install -U sentence-transformers
```
Then you can load this model and run inference.
```python
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("AlucardV/finetuned_model_ver2")
# Run inference
sentences = [
'В это время ядро из русского ретраншемента разбило носилки Карла XII, но сам король не пострадал.',
'В это время носилки Карла XII были разбиты ядром из русского ретраншемента, но сам король остался цел.',
'В это время носилки Карла XII не подверглись никаким повреждениям, хотя ядро из русского ретраншемента было близко.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 384]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[ 1.0000, -0.9995, 0.9999],
# [-0.9995, 1.0000, -0.9995],
# [ 0.9999, -0.9995, 1.0000]])
```
<!--
### Direct Usage (Transformers)
<details><summary>Click to see the direct usage in Transformers</summary>
</details>
-->
<!--
### Downstream Usage (Sentence Transformers)
You can finetune this model on your own dataset.
<details><summary>Click to expand</summary>
</details>
-->
<!--
### Out-of-Scope Use
*List how the model may foreseeably be misused and address what users ought not to do with the model.*
-->
<!--
## Bias, Risks and Limitations
*What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model.*
-->
<!--
### Recommendations
*What are recommendations with respect to the foreseeable issues? For example, filtering explicit content.*
-->
## Training Details
### Training Dataset
#### Unnamed Dataset
* Size: 20,000 training samples
* Columns: <code>sentence_0</code>, <code>sentence_1</code>, and <code>sentence_2</code>
* Approximate statistics based on the first 100 samples:
| | sentence_0 | sentence_1 | sentence_2 |
|:---------|:-------------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|
| type | string | string | string |
| modality | text | text | text |
| details | <ul><li>min: 31 tokens</li><li>mean: 112.28 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>min: 31 tokens</li><li>mean: 104.71 tokens</li><li>max: 256 tokens</li></ul> | <ul><li>min: 31 tokens</li><li>mean: 97.02 tokens</li><li>max: 256 tokens</li></ul> |
* Samples:
| sentence_0 | sentence_1 | sentence_2 |
|:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| <code>После окончания Московского среднего технического училища (1918) работал электромехаником в Московском практическом электротехническом институте и одновременно учился там же (окончил в 1921 г. со званием инженера по электрооборудованию фабрик и заводов).</code> | <code>Работая электромехаником в Московском практическом электротехническом институте, после окончания Московского среднего технического училища (1918), он одновременно учился там же и успешно закончил в 1921 году, получив звание инженера по электрооборудованию фабрик и заводов.</code> | <code>Не окончив Московское среднее техническое училище в 1918 году, он не стал электромехаником в Московском практическом электротехническом институте и не учился там же, не закончив обучение в 1921 году со званием инженера по электрооборудованию фабрик и заводов.</code> |
| <code>В течение своей жизни Шарлотта неоднократно отказывалась от замужества, иногда воспринимая брачные предложения серьёзно, иногда относясь к ним с юмором.</code> | <code>Шарлотта неоднократно отклоняла сватовство в течение своей жизни, то серьезно воспринимая брачные предложения, то с улыбкой.</code> | <code>В течение своей жизни Шарлотта всегда радовалась предложениям о замужестве, не принимая их всерьёз, чаще всего смеясь.</code> |
| <code>В 1978 году окончил Уфимский государственный институт искусств (ныне — Уфимская государственная академия искусств имени Загира Исмагилова) по специальности «сольное пение», класс заслуженного деятеля искусств России и Башкортостана, профессора М. Г. Муртазиной.</code> | <code>В 1978 году закончил Уфимский государственный институт искусств (ныне — Уфимская государственная академия искусств имени Загира Исмагилова) по направлению «сольное пение», класса заслуженной артистки России и Башкортостана, профессора Е. П. Ибрагимова.</code> | <code>Не закончил обучение в Уфимском государственном институте искусств, не получив диплома по специальности «сольное пение».</code> |
* Loss: [<code>TripletLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#tripletloss) with these parameters:
```json
{
"distance_metric": "TripletDistanceMetric.EUCLIDEAN",
"triplet_margin": 5
}
```
### Training Hyperparameters
#### Non-Default Hyperparameters
- `per_device_train_batch_size`: 32
- `per_device_eval_batch_size`: 32
- `multi_dataset_batch_sampler`: round_robin
#### All Hyperparameters
<details><summary>Click to expand</summary>
- `per_device_train_batch_size`: 32
- `num_train_epochs`: 3
- `max_steps`: -1
- `learning_rate`: 5e-05
- `lr_scheduler_type`: linear
- `lr_scheduler_kwargs`: None
- `warmup_steps`: 0
- `optim`: adamw_torch
- `optim_args`: None
- `weight_decay`: 0.0
- `adam_beta1`: 0.9
- `adam_beta2`: 0.999
- `adam_epsilon`: 1e-08
- `optim_target_modules`: None
- `gradient_accumulation_steps`: 1
- `average_tokens_across_devices`: True
- `max_grad_norm`: 1
- `label_smoothing_factor`: 0.0
- `bf16`: False
- `fp16`: False
- `bf16_full_eval`: False
- `fp16_full_eval`: False
- `tf32`: None
- `gradient_checkpointing`: False
- `gradient_checkpointing_kwargs`: None
- `torch_compile`: False
- `torch_compile_backend`: None
- `torch_compile_mode`: None
- `use_liger_kernel`: False
- `liger_kernel_config`: None
- `use_cache`: False
- `neftune_noise_alpha`: None
- `torch_empty_cache_steps`: None
- `auto_find_batch_size`: False
- `log_on_each_node`: True
- `logging_nan_inf_filter`: True
- `include_num_input_tokens_seen`: no
- `log_level`: passive
- `log_level_replica`: warning
- `disable_tqdm`: False
- `project`: huggingface
- `trackio_space_id`: None
- `trackio_bucket_id`: None
- `trackio_static_space_id`: None
- `per_device_eval_batch_size`: 32
- `prediction_loss_only`: True
- `eval_on_start`: False
- `eval_do_concat_batches`: True
- `eval_use_gather_object`: False
- `eval_accumulation_steps`: None
- `include_for_metrics`: []
- `batch_eval_metrics`: False
- `save_only_model`: False
- `save_on_each_node`: False
- `enable_jit_checkpoint`: False
- `push_to_hub`: False
- `hub_private_repo`: None
- `hub_model_id`: None
- `hub_strategy`: every_save
- `hub_always_push`: False
- `hub_revision`: None
- `load_best_model_at_end`: False
- `ignore_data_skip`: False
- `restore_callback_states_from_checkpoint`: False
- `full_determinism`: False
- `seed`: 42
- `data_seed`: None
- `use_cpu`: False
- `accelerator_config`: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
- `parallelism_config`: None
- `dataloader_drop_last`: False
- `dataloader_num_workers`: 0
- `dataloader_pin_memory`: True
- `dataloader_persistent_workers`: False
- `dataloader_prefetch_factor`: None
- `remove_unused_columns`: True
- `label_names`: None
- `train_sampling_strategy`: random
- `length_column_name`: length
- `ddp_find_unused_parameters`: None
- `ddp_bucket_cap_mb`: None
- `ddp_broadcast_buffers`: False
- `ddp_static_graph`: None
- `ddp_backend`: None
- `ddp_timeout`: 1800
- `fsdp`: None
- `fsdp_config`: None
- `deepspeed`: None
- `debug`: []
- `skip_memory_metrics`: True
- `do_predict`: False
- `resume_from_checkpoint`: None
- `warmup_ratio`: None
- `local_rank`: -1
- `prompts`: None
- `batch_sampler`: batch_sampler
- `multi_dataset_batch_sampler`: round_robin
- `router_mapping`: {}
- `learning_rate_mapping`: {}
</details>
### Training Logs
| Epoch | Step | Training Loss |
|:-----:|:----:|:-------------:|
| 0.8 | 500 | 4.1612 |
| 1.6 | 1000 | 3.9547 |
| 2.4 | 1500 | 3.9096 |
### Training Time
- **Training**: 24.6 minutes
### Framework Versions
- Python: 3.12.8
- Sentence Transformers: 5.6.0
- Transformers: 5.13.1
- PyTorch: 2.6.0+cu124
- Accelerate: 1.14.0
- Datasets: 5.0.0
- Tokenizers: 0.22.2
## Citation
### BibTeX
#### Sentence Transformers
```bibtex
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}
```
#### TripletLoss
```bibtex
@misc{hermans2017defense,
title={In Defense of the Triplet Loss for Person Re-Identification},
author={Alexander Hermans and Lucas Beyer and Bastian Leibe},
year={2017},
eprint={1703.07737},
archivePrefix={arXiv},
primaryClass={cs.CV}
}
```
<!--
## Glossary
*Clearly define terms in order to be accessible across audiences.*
-->
<!--
## Model Card Authors
*Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction.*
-->
<!--
## Model Card Contact
*Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors.*
-->