File size: 1,824 Bytes
3f232a7 9ddb1b6 3f232a7 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 | ---
language:
- ru
license: mit
pipeline_tag: image-classification
tags:
- vision
- image-classification
- pytorch
- vit
- e-commerce
metrics:
- accuracy
model-index:
- name: Product_Image_Classification
results:
- task:
type: image-classification
metrics:
- type: accuracy
value: 0.9448
---
# Product Image Classification
Классификатор изображений товаров (смартфоны, ноутбуки, телевизоры, часы, наушники) на базе **Vision Transformer (ViT)**.
Модель обучена на датасете изображений, собранных с узбекских маркетплейсов (*asaxiy.uz*, *texnomart.uz*, *olcha.uz*).
## Описание и характеристики
* **Базовая архитектура:** `google/vit-base-patch16-224-in21k`
* **Категории (5 классов):** `headphones`, `laptop`, `smartphone`, `tv`, `watch`
* **Размер входного изображения:** 224x224 RGB
## Качество модели (Evaluation)
Оценка производилась на тестовой выборке (`dataset_prepared/test`, 163 изображения):
| Категория | Precision | Recall | F1-Score | Support |
| :--- | :---: | :---: | :---: | :---: |
| **headphones** | 0.9091 | 0.9091 | 0.9091 | 33 |
| **laptop** | 0.9655 | 0.9032 | 0.9333 | 31 |
| **smartphone** | 0.8684 | 1.0000 | 0.9296 | 33 |
| **tv** | 1.0000 | 0.9697 | 0.9846 | 33 |
| **watch** | 1.0000 | 0.9394 | 0.9688 | 33 |
| **Accuracy** | | | **0.9448** | **163** |
## Быстрый старт (Quickstart)
Для использования модели понадобятся библиотеки `transformers`, `torch` и `pillow`:
```bash
pip install transformers torch pillow |