NikolayRainWay's picture
Добавлен Model Card с метриками и примером использования
4218f04 verified
|
Raw
History Blame Contribute Delete
1.86 kB
metadata
license: mit
language:
  - en
  - ru
pipeline_tag: text-classification
tags:
  - toxicity
  - multi-label-classification
  - multitask
  - transformer

Multi-Task Toxicity Classifier

Описание

Модель для многозадачной (multi-task) классификации токсичности текста по трём классам:

  • Profanity (ненормативная лексика, мат)
  • Threats (угрозы)
  • Illegal acts (запросы на нарушение закона)

Модель построена на базе лёгкого энкодера cointegrated/rubert-tiny2 с тремя независимыми классификационными головами.

Метрики на тестовой выборке

Класс Порог Precision Recall F1
profanity 0.95 0.7657 0.8015 0.7832
threat 0.95 0.4267 0.9078 0.5805
illegal 0.95 0.5089 0.8824 0.6455

Использование

Для загрузки модели используйте следующий код:

import torch
from transformers import AutoTokenizer
from modeling import MultiTaskToxicityEncoder  # файл из репозитория

# Загрузка токенизатора
tokenizer = AutoTokenizer.from_pretrained("NikolayRainWay/multitask-toxic-encoder")

# Загрузка модели (веса из репозитория)
model = MultiTaskToxicityEncoder()
model.load_state_dict(torch.load("pytorch_model.bin", map_location='cpu'))
model.eval()

Автор

NikolayRainWay (в рамках учебного курса по трансформерным энкодерам)

Датасет Обучен на датасете NikolayRainWay/multitask-very-toxic-comments

Лицензия MIT