File size: 1,824 Bytes
3f232a7
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
9ddb1b6
3f232a7
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
---
language:
- ru
license: mit
pipeline_tag: image-classification
tags:
- vision
- image-classification
- pytorch
- vit
- e-commerce
metrics:
- accuracy
model-index:
- name: Product_Image_Classification
  results:
  - task:
      type: image-classification
    metrics:
    - type: accuracy
      value: 0.9448
---

# Product Image Classification

Классификатор изображений товаров (смартфоны, ноутбуки, телевизоры, часы, наушники) на базе **Vision Transformer (ViT)**.

Модель обучена на датасете изображений, собранных с узбекских маркетплейсов (*asaxiy.uz*, *texnomart.uz*, *olcha.uz*).

## Описание и характеристики

* **Базовая архитектура:** `google/vit-base-patch16-224-in21k`
* **Категории (5 классов):** `headphones`, `laptop`, `smartphone`, `tv`, `watch`
* **Размер входного изображения:** 224x224 RGB

## Качество модели (Evaluation)

Оценка производилась на тестовой выборке (`dataset_prepared/test`, 163 изображения):

| Категория | Precision | Recall | F1-Score | Support |
| :--- | :---: | :---: | :---: | :---: |
| **headphones** | 0.9091 | 0.9091 | 0.9091 | 33 |
| **laptop** | 0.9655 | 0.9032 | 0.9333 | 31 |
| **smartphone** | 0.8684 | 1.0000 | 0.9296 | 33 |
| **tv** | 1.0000 | 0.9697 | 0.9846 | 33 |
| **watch** | 1.0000 | 0.9394 | 0.9688 | 33 |
| **Accuracy** | | | **0.9448** | **163** |

## Быстрый старт (Quickstart)

Для использования модели понадобятся библиотеки `transformers`, `torch` и `pillow`:

```bash
pip install transformers torch pillow