NurzatS's picture
Update README.md
9ddb1b6 verified
|
Raw
History Blame Contribute Delete
1.82 kB
metadata
language:
  - ru
license: mit
pipeline_tag: image-classification
tags:
  - vision
  - image-classification
  - pytorch
  - vit
  - e-commerce
metrics:
  - accuracy
model-index:
  - name: Product_Image_Classification
    results:
      - task:
          type: image-classification
        metrics:
          - type: accuracy
            value: 0.9448

Product Image Classification

Классификатор изображений товаров (смартфоны, ноутбуки, телевизоры, часы, наушники) на базе Vision Transformer (ViT).

Модель обучена на датасете изображений, собранных с узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz).

Описание и характеристики

  • Базовая архитектура: google/vit-base-patch16-224-in21k
  • Категории (5 классов): headphones, laptop, smartphone, tv, watch
  • Размер входного изображения: 224x224 RGB

Качество модели (Evaluation)

Оценка производилась на тестовой выборке (dataset_prepared/test, 163 изображения):

Категория Precision Recall F1-Score Support
headphones 0.9091 0.9091 0.9091 33
laptop 0.9655 0.9032 0.9333 31
smartphone 0.8684 1.0000 0.9296 33
tv 1.0000 0.9697 0.9846 33
watch 1.0000 0.9394 0.9688 33
Accuracy 0.9448 163

Быстрый старт (Quickstart)

Для использования модели понадобятся библиотеки transformers, torch и pillow:

pip install transformers torch pillow