Upload 10 files

Browse files

Files changed (10) hide show

1_Pooling/config.json +7 -0
README.md +119 -0
config.json +27 -0
model.safetensors +3 -0
modules.json +20 -0
sentence_bert_config.json +4 -0
special_tokens_map.json +37 -0
tokenizer.json +0 -0
tokenizer_config.json +65 -0
vocab.txt +0 -0

1_Pooling/config.json ADDED Viewed

	@@ -0,0 +1,7 @@

+{
+  "word_embedding_dimension": 256,
+  "pooling_mode_cls_token": true,
+  "pooling_mode_mean_tokens": false,
+  "pooling_mode_max_tokens": false,
+  "pooling_mode_mean_sqrt_len_tokens": false
+}

README.md CHANGED Viewed

@@ -1,3 +1,122 @@
 ---
 license: mit
 ---

 ---
+language:
+- ru
+- en
+pipeline_tag: sentence-similarity
+tags:
+- russian
+- pretraining
+- embeddings
+- tiny
+- feature-extraction
+- sentence-similarity
+- sentence-transformers
+- transformers
+- mteb
+datasets:
+- IlyaGusev/gazeta
+- zloelias/lenta-ru
+- HuggingFaceFW/fineweb-2
+- HuggingFaceFW/fineweb
 license: mit
+base_model: sergeyzh/rubert-tiny-lite
 ---
+Быстрая модель BERT для тематической классификации/кластеризации текстов. Модель получена дистилляцией эмбеддингов русских и английских текстов [BERTA](https://huggingface.co/sergeyzh/BERTA) в [rubert-tiny-lite](https://huggingface.co/sergeyzh/rubert-tiny-lite). Качество работы на английских текстах не проверялось.
+Основные характеристики модели: размер ембеддинга - 256, длина контекста - 512, слоёв - 3.
+## Использование
+```Python
+from sentence_transformers import SentenceTransformer
+model = SentenceTransformer('sergeyzh/rubert-tiny-topic')
+sentences = ["привет мир", "hello world", "здравствуй вселенная"]
+embeddings = model.encode(sentences)
+print(model.similarity(embeddings, embeddings))
+```
+## Пример классификации по темам
+```Python
+from sentence_transformers import SentenceTransformer, util
+from datasets import load_dataset
+dataset = load_dataset("ai-forever/rubq-reranking", split="test")[:100]
+phrases = [s[0] for s in dataset['positive']]
+model = SentenceTransformer('sergeyzh/rubert-tiny-topic', device='cpu')
+embeddings = model.encode(phrases, convert_to_tensor=True, show_progress_bar=True)
+community = util.community_detection(embeddings, threshold = 0.75, min_community_size = 3, batch_size = 1024, show_progress_bar = True)
+for id, ind_list in enumerate(community):
+    for i in ind_list:
+        print(id, '#', phrases[i][:100], '...')
+    print('-' * 100)
+# 0 # Геркуле́совы столбы́ (лат. Columnae Herculis) — название, использовавшееся в Античности для обозначе ...
+# 0 # Кана́рские острова́ (исп. Las Islas Canarias) — архипелаг из семи островов вулканического происхожде ...
+# 0 # Большой каньон (Великий каньон, Гранд-Каньон; англ. Grand Canyon) — один из глубочайших каньонов в м ...
+# 0 # Вершина находится в Гималаях в хребте Махалангур-Химал, по которому проходит граница Непала и Тибетс ...
+# 0 # Пирене́йский полуо́стров (также Ибери́йский; исп. , порт. , галис. , астур. península Ibérica, баск. ...
+# 0 # Афо́н (греч. Άθως, в греческих источниках официально именуется Святая Гора, греч. Άγιο Όρος, «А́гио  ...
+# 0 # Каледония (лат. Caledonia) — древнее название северной части острова Великобритания, к северу от вал ...
+# ----------------------------------------------------------------------------------------------------
+# 1 # Нью-Йорк (англ. New York, произносится /nuː ˈjɔrk/, аббр. NY) — штат на северо-востоке США, на Атлан ...
+# 1 # Сент-Пи́терсберг (местное название St. Pete — Сент-Пит) — город в округе Пинелас штата Флорида, попу ...
+# 1 # Площадь территории Нигерии составляет 923 768 км2: по этому показателю страна занимает 14-е место в  ...
+# 1 # Тегусига́льпа (исп. Tegucigalpa) — столица (с 1880) и крупнейший город Гондураса. Население — 1 682  ...
+# 1 # Брянск — город в России, административный центр Брянской области; город областного значения, образуе ...
+# ----------------------------------------------------------------------------------------------------
+# 2 # Первая попытка исторического повествования в русской литературе встречается в повести Н. М. Карамзин ...
+# 2 # «Па́рус» («Белеет парус одинокой…») — стихотворение, написанное 18-летним Михаилом Лермонтовым в Пет ...
+# 2 # В противоположность героическим эпопея�� Гомера и средневековым эпопеям, а также поэме Данте, «Потеря ...
+# 2 # «Чёрный человек» — поэма Сергея Есенина. Впервые опубликована в № 1 журнала «Новый мир» за январь 19 ...
+# 2 # Охватывая широкие временные рамки (включая период Франции с 1815 до 1832 года и жестоко подавленное  ...
+# ----------------------------------------------------------------------------------------------------
+# 3 # Танец с саблями — музыкальное произведение Арама Хачатуряна, написанное для последнего действия бале ...
+# 3 # 1938 — «Ромео и Джульетта» — балет на музыку С. С. ПрокофьеваМюзикл «West Side Story» (мировая премь ...
+# 3 # Музыкальный ряд фильма, состоящий из симфонической и хоровой музыки, представляет собой полноценное  ...
+# 3 # В 1796 году Бетховен начинает терять слух. У него развивается тиннитус — воспаление внутреннего уха, ...
+# ----------------------------------------------------------------------------------------------------
+# 4 # «Хижина дяди Тома» (англ. Uncle Tom's Cabin) — роман Гарриет Бичер-Стоу 1852 года, направленный прот ...
+# 4 # «Спартак» (итал. Spartaco) — исторический роман итальянского писателя Рафаэлло Джованьоли, написанны ...
+# 4 # «Карлик Нос» (нем. Der Zwerg Nase) — одна из самых известных сказок немецкого писателя Вильгельма Га ...
+# ----------------------------------------------------------------------------------------------------
+# 5 # Зимний дворец (в 1918—1943 годах — Дворец Искусств) — главный императорский дворец России, расположе ...
+# 5 # Современное здание собора является четвёртым петербургским храмом в честь Исаакия Далматского, возве ...
+# 5 # Генуэ́зская кре́пость — средневековые укрепления в городе Феодосия (Крым), построенные Генуэзской ре ...
+# ----------------------------------------------------------------------------------------------------
+# 6 # Лимпо́по (в верхнем течении Кро́кодайл) — река в Южной Африке на территории ЮАР, Ботсваны, Зимбабве  ...
+# 6 # Уссу́ри (кит. 乌苏里江 — Усулицзян; маньчж. — «чёрная как сажа») — река в Приморском и Хабаровском краях ...
+# 6 # Находится на правом берегу Волгоградского водохранилища реки Волги напротив устья реки Саратовки и г ...
+# ----------------------------------------------------------------------------------------------------
+```
+## Метрики
+Оценки модели на задачах тематической классификации/кластеризации бенчмарка [MTEB](https://huggingface.co/spaces/mteb/leaderboard):
+|Model Name                      | Metric              | FRIDA     | [BERTA](https://huggingface.co/sergeyzh/BERTA)    | [rubert-tiny-topic](https://huggingface.co/sergeyzh/rubert-tiny-topic)   | multilingual-e5-large-instruct | bge-m3 |
+|:-------------------------------|:--------------------|----------:|----------:|--------------------:|---------------------:|----------------------:|
+|HeadlineClassification          | Accuracy            | **0.890** | **0.890** |        0.882        |        0.862         |         0.703         |
+|InappropriatenessClassification | Accuracy            | **0.783** |   0.748   |        0.702        |        0.655         |         0.599         |
+|RuSciBenchGRNTIClassification   | Accuracy            | **0.699** |   0.690   |        0.668        |        0.651         |         0.558         |
+|RuSciBenchGRNTIClusteringP2P    | V-measure           | **0.674** |   0.650   |        0.617        |        0.622         |         0.508         |
+|RuSciBenchOECDClassification    | Accuracy            |   0.546   | **0.548** |        0.523        |        0.502         |         0.426         |
+|RuSciBenchOECDClusteringP2P     | V-measure           | **0.566** |   0.556   |        0.512        |        0.528         |         0.432         |
+|SensitiveTopicsClassification   | Accuracy            |   0.398   | **0.399** |        0.360        |        0.323         |         0.262         |
+|Average                         | Average             | **0.651** |   0.640   |        0.609        |        0.592         |         0.498         |

config.json ADDED Viewed

	@@ -0,0 +1,27 @@

+{
+  "_name_or_path": "sergeyzh/rubert-tiny-topic",
+  "architectures": [
+    "BertModel"
+  ],
+  "attention_probs_dropout_prob": 0.1,
+  "classifier_dropout": null,
+  "dtype": "float32",
+  "emb_size": 256,
+  "gradient_checkpointing": false,
+  "hidden_act": "gelu",
+  "hidden_dropout_prob": 0.1,
+  "hidden_size": 256,
+  "initializer_range": 0.02,
+  "intermediate_size": 384,
+  "layer_norm_eps": 1e-12,
+  "max_position_embeddings": 512,
+  "model_type": "bert",
+  "num_attention_heads": 16,
+  "num_hidden_layers": 3,
+  "pad_token_id": 0,
+  "position_embedding_type": "absolute",
+  "transformers_version": "4.57.1",
+  "type_vocab_size": 2,
+  "use_cache": true,
+  "vocab_size": 83828
+}

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:37238144305ea448a38c334fd781f8ed0736aa33f13d4e044b15479c30441d02
+size 92174712

modules.json ADDED Viewed

	@@ -0,0 +1,20 @@

+[
+  {
+    "idx": 0,
+    "name": "0",
+    "path": "",
+    "type": "sentence_transformers.models.Transformer"
+  },
+  {
+    "idx": 1,
+    "name": "1",
+    "path": "1_Pooling",
+    "type": "sentence_transformers.models.Pooling"
+  },
+  {
+    "idx": 2,
+    "name": "2",
+    "path": "2_Normalize",
+    "type": "sentence_transformers.models.Normalize"
+  }
+]

sentence_bert_config.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+  "max_seq_length": 512,
+  "do_lower_case": false
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,37 @@

+{
+  "cls_token": {
+    "content": "[CLS]",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "mask_token": {
+    "content": "[MASK]",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "[PAD]",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "sep_token": {
+    "content": "[SEP]",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "[UNK]",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,65 @@

+{
+  "added_tokens_decoder": {
+    "0": {
+      "content": "[PAD]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "[UNK]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "[CLS]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "3": {
+      "content": "[SEP]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "4": {
+      "content": "[MASK]",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "[CLS]",
+  "do_basic_tokenize": true,
+  "do_lower_case": false,
+  "extra_special_tokens": {},
+  "mask_token": "[MASK]",
+  "max_length": 512,
+  "model_max_length": 2048,
+  "never_split": null,
+  "pad_to_multiple_of": null,
+  "pad_token": "[PAD]",
+  "pad_token_type_id": 0,
+  "padding_side": "right",
+  "sep_token": "[SEP]",
+  "stride": 0,
+  "strip_accents": null,
+  "tokenize_chinese_chars": true,
+  "tokenizer_class": "BertTokenizer",
+  "truncation_side": "right",
+  "truncation_strategy": "longest_first",
+  "unk_token": "[UNK]"
+}

vocab.txt ADDED Viewed

The diff for this file is too large to render. See raw diff