Create README.md
Browse files
README.md
ADDED
|
@@ -0,0 +1,53 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
readme_content = """
|
| 2 |
+
---
|
| 3 |
+
license: mit
|
| 4 |
+
language:
|
| 5 |
+
- en
|
| 6 |
+
- ru
|
| 7 |
+
pipeline_tag: text-classification
|
| 8 |
+
tags:
|
| 9 |
+
- toxicity
|
| 10 |
+
- multi-label-classification
|
| 11 |
+
- multitask
|
| 12 |
+
- transformer
|
| 13 |
+
---
|
| 14 |
+
|
| 15 |
+
# Multi-Task Toxicity Classifier
|
| 16 |
+
|
| 17 |
+
## Описание
|
| 18 |
+
Модель для многозадачной (multi-task) классификации токсичности текста по трём классам:
|
| 19 |
+
- **Profanity** (ненормативная лексика, мат)
|
| 20 |
+
- **Threats** (угрозы)
|
| 21 |
+
- **Illegal acts** (запросы на нарушение закона)
|
| 22 |
+
|
| 23 |
+
Модель построена на базе лёгкого энкодера `cointegrated/rubert-tiny2` с тремя независимыми классификационными головами.
|
| 24 |
+
|
| 25 |
+
## Метрики на тестовой выборке
|
| 26 |
+
| Класс | Порог | Precision | Recall | F1 |
|
| 27 |
+
|-------|-------|-----------|--------|-----|
|
| 28 |
+
| profanity | 0.95 | 0.7657 | 0.8015 | 0.7832 |
|
| 29 |
+
| threat | 0.95 | 0.4267 | 0.9078 | 0.5805 |
|
| 30 |
+
| illegal | 0.95 | 0.5089 | 0.8824 | 0.6455 |
|
| 31 |
+
|
| 32 |
+
## Использование
|
| 33 |
+
Для загрузки модели используйте следующий код:
|
| 34 |
+
|
| 35 |
+
```python
|
| 36 |
+
import torch
|
| 37 |
+
from transformers import AutoTokenizer
|
| 38 |
+
from modeling import MultiTaskToxicityEncoder # файл из репозитория
|
| 39 |
+
|
| 40 |
+
# Загрузка токенизатора
|
| 41 |
+
tokenizer = AutoTokenizer.from_pretrained("NikolayRainWay/multitask-toxic-encoder")
|
| 42 |
+
|
| 43 |
+
# Загрузка модели (веса из репозитория)
|
| 44 |
+
model = MultiTaskToxicityEncoder()
|
| 45 |
+
model.load_state_dict(torch.load("pytorch_model.bin", map_location='cpu'))
|
| 46 |
+
model.eval()
|
| 47 |
+
|
| 48 |
+
Автор
|
| 49 |
+
NikolayRainWay (в рамках учебного курса по трансформерным энкодерам)
|
| 50 |
+
|
| 51 |
+
Датасет
|
| 52 |
+
Обучен на датасете NikolayRainWay/multitask-very-toxic-comments
|
| 53 |
+
"""
|