|
|
| --- |
| license: mit |
| language: |
| - en |
| - ru |
| pipeline_tag: text-classification |
| tags: |
| - toxicity |
| - multi-label-classification |
| - multitask |
| - transformer |
| --- |
| |
| # Multi-Task Toxicity Classifier |
|
|
| ## Описание |
| Модель для многозадачной (multi-task) классификации токсичности текста по трём классам: |
| - **Profanity** (ненормативная лексика, мат) |
| - **Threats** (угрозы) |
| - **Illegal acts** (запросы на нарушение закона) |
|
|
| Модель построена на базе лёгкого энкодера `cointegrated/rubert-tiny2` с тремя независимыми классификационными головами. |
|
|
| ## Метрики на тестовой выборке |
| | Класс | Порог | Precision | Recall | F1 | |
| |-------|-------|-----------|--------|-----| |
| | profanity | 0.95 | 0.7657 | 0.8015 | 0.7832 | |
| | threat | 0.95 | 0.4267 | 0.9078 | 0.5805 | |
| | illegal | 0.95 | 0.5089 | 0.8824 | 0.6455 | |
|
|
| ## Использование |
| Для загрузки модели используйте следующий код: |
|
|
| ```python |
| import torch |
| from transformers import AutoTokenizer |
| from modeling import MultiTaskToxicityEncoder # файл из репозитория |
| |
| # Загрузка токенизатора |
| tokenizer = AutoTokenizer.from_pretrained("NikolayRainWay/multitask-toxic-encoder") |
| |
| # Загрузка модели (веса из репозитория) |
| model = MultiTaskToxicityEncoder() |
| model.load_state_dict(torch.load("pytorch_model.bin", map_location='cpu')) |
| model.eval() |
| ``` |
| Автор |
| --- |
| NikolayRainWay (в рамках учебного курса по трансформерным энкодерам) |
|
|
| Датасет |
| Обучен на датасете NikolayRainWay/multitask-very-toxic-comments |
|
|
| Лицензия |
| MIT |
|
|