Product Image Classification

Классификатор изображений товаров (смартфоны, ноутбуки, телевизоры, часы, наушники) на базе Vision Transformer (ViT).

Модель обучена на датасете изображений, собранных с узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz).

Описание и характеристики

  • Базовая архитектура: google/vit-base-patch16-224-in21k
  • Категории (5 классов): headphones, laptop, smartphone, tv, watch
  • Размер входного изображения: 224x224 RGB

Качество модели (Evaluation)

Оценка производилась на тестовой выборке (dataset_prepared/test, 163 изображения):

Категория Precision Recall F1-Score Support
headphones 0.9091 0.9091 0.9091 33
laptop 0.9655 0.9032 0.9333 31
smartphone 0.8684 1.0000 0.9296 33
tv 1.0000 0.9697 0.9846 33
watch 1.0000 0.9394 0.9688 33
Accuracy 0.9448 163

Быстрый старт (Quickstart)

Для использования модели понадобятся библиотеки transformers, torch и pillow:

pip install transformers torch pillow
Downloads last month
41
Safetensors
Model size
85.8M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Evaluation results