🔤 Confia Captcha OCR Predictor (PT-BR)

Modelo oficial de OCR da Confia Company para leitura e reconhecimento óptico de textos curtos e desafios visuais alfanuméricos de 5 caracteres em imagens de baixa resolução ($150 \times 50$ px).


📊 Model Card Summary & Métricas de Desempenho

Métrica Resultado Medido Descrição
Precisão Geral Estimada ~94% – 98% Taxa de acerto para a sequência completa de 5 caracteres em testes de referência
Precisão por Caractere > 99% Acurácia individual por posição de caractere
Tempo de Inferência (CPU) < 5 ms Execução leve e eficiente sem necessidade de GPU
Tamanho do Modelo ~7.6 MB ~1.2 milhões de parâmetros treinados em PyTorch

🖼️ Exemplos de Inferência (Imagem ➔ Texto Previsto)

Imagem de Entrada Texto Previsto (predict.py) Status
Sample 1 5jtpe
Sample 2 dlmrs
Sample 3 rltrd

🧠 Arquitetura do Modelo

O modelo utiliza uma arquitetura convolucional customizada Positional Slot-Head CNN, otimizada para o reconhecimento de glifos finos com espaçamento regular:

  1. Backbone Convolucional Preservador de Recursos:
    • 3 blocos convolucionais com BatchNorm2d e ativações ReLU.
    • Subamostragem controlada (MaxPool2d) para preservar a integridade espacial de traços finos.
  2. Grade de Recursos Espaciais ($6 \times 20$):
    • O mapa de características final é projetado espacialmente para cobrir a área útil da imagem.
  3. 5 Positional Slot Heads:
    • 5 cabeças de classificação independentes analisam janelas espaciais específicas de ~30 pixels de largura, realizando a identificação paralela dos 5 caracteres.

📦 Estrutura do Repositório

confia-captcha-ocr-pt/
├── README.md              # Model Card oficial com documentação e métricas
├── config.json            # Configurações da arquitetura e metadados do modelo
├── modeling_captcha.py    # Definição das classes PyTorch e rotinas de inferência
├── predict.py             # Script CLI de inferência standalone
├── model.pt               # Pesos do modelo treinado (PyTorch state_dict)
├── pytorch_model.bin      # Cópia compatível com padrão Hugging Face
├── sample_1.png           # Amostra de teste 1 (5jtpe)
├── sample_2.png           # Amostra de teste 2 (dlmrs)
├── sample_3.png           # Amostra de teste 3 (rltrd)
└── requirements.txt       # Dependências mínimas (torch, torchvision, Pillow, numpy)

🚀 Como Usar

1. Linha de Comando (CLI)

# Instalar dependências
pip install -r requirements.txt

# Prever resposta de uma imagem
python predict.py sample_1.png

# Ou via stdin
echo sample_2.png | python predict.py

2. Em Código Python

import torch
from modeling_captcha import load_model, predict_captcha, DEFAULT_ALPHABET

# Selecionar dispositivo (CPU ou CUDA)
device = "cuda" if torch.cuda.is_available() else "cpu"

# Carregar o modelo
model = load_model("model.pt", alphabet=DEFAULT_ALPHABET, device=device)

# Realizar a leitura na imagem
resultado = predict_captcha(model, "sample_1.png", alphabet=DEFAULT_ALPHABET, device=device)

print(f"Texto Detectado: {resultado}")

🗄️ Dataset & Avaliação

  • Dataset de Referência: Amostras alfanuméricas de 5 caracteres com rotulagem e validação automatizada de integridade (~800 amostras).
  • Alfabeto Suportado (32 caracteres): 23456789abcdefghijklmnopqrstuvwxyz

🏢 Sobre a Confia Company

Modelo desenvolvido pela Confia Company para pesquisas em visão computacional, reconhecimento óptico de caracteres (OCR) e testes de acessibilidade visual em plataformas web.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support