File size: 1,863 Bytes
f1b89b3 63b42a2 4218f04 63b42a2 f1b89b3 63b42a2 f1b89b3 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 |
---
license: mit
language:
- en
- ru
pipeline_tag: text-classification
tags:
- toxicity
- multi-label-classification
- multitask
- transformer
---
# Multi-Task Toxicity Classifier
## Описание
Модель для многозадачной (multi-task) классификации токсичности текста по трём классам:
- **Profanity** (ненормативная лексика, мат)
- **Threats** (угрозы)
- **Illegal acts** (запросы на нарушение закона)
Модель построена на базе лёгкого энкодера `cointegrated/rubert-tiny2` с тремя независимыми классификационными головами.
## Метрики на тестовой выборке
| Класс | Порог | Precision | Recall | F1 |
|-------|-------|-----------|--------|-----|
| profanity | 0.95 | 0.7657 | 0.8015 | 0.7832 |
| threat | 0.95 | 0.4267 | 0.9078 | 0.5805 |
| illegal | 0.95 | 0.5089 | 0.8824 | 0.6455 |
## Использование
Для загрузки модели используйте следующий код:
```python
import torch
from transformers import AutoTokenizer
from modeling import MultiTaskToxicityEncoder # файл из репозитория
# Загрузка токенизатора
tokenizer = AutoTokenizer.from_pretrained("NikolayRainWay/multitask-toxic-encoder")
# Загрузка модели (веса из репозитория)
model = MultiTaskToxicityEncoder()
model.load_state_dict(torch.load("pytorch_model.bin", map_location='cpu'))
model.eval()
```
Автор
---
NikolayRainWay (в рамках учебного курса по трансформерным энкодерам)
Датасет
Обучен на датасете NikolayRainWay/multitask-very-toxic-comments
Лицензия
MIT
|