🔤 Confia Captcha OCR Predictor (PT-BR)
Modelo oficial de OCR da Confia Company para leitura e reconhecimento óptico de textos curtos e desafios visuais alfanuméricos de 5 caracteres em imagens de baixa resolução ($150 \times 50$ px).
📊 Model Card Summary & Métricas de Desempenho
| Métrica | Resultado Medido | Descrição |
|---|---|---|
| Precisão Geral Estimada | ~94% – 98% | Taxa de acerto para a sequência completa de 5 caracteres em testes de referência |
| Precisão por Caractere | > 99% | Acurácia individual por posição de caractere |
| Tempo de Inferência (CPU) | < 5 ms | Execução leve e eficiente sem necessidade de GPU |
| Tamanho do Modelo | ~7.6 MB | ~1.2 milhões de parâmetros treinados em PyTorch |
🖼️ Exemplos de Inferência (Imagem ➔ Texto Previsto)
🧠 Arquitetura do Modelo
O modelo utiliza uma arquitetura convolucional customizada Positional Slot-Head CNN, otimizada para o reconhecimento de glifos finos com espaçamento regular:
- Backbone Convolucional Preservador de Recursos:
- 3 blocos convolucionais com
BatchNorm2de ativaçõesReLU. - Subamostragem controlada (
MaxPool2d) para preservar a integridade espacial de traços finos.
- 3 blocos convolucionais com
- Grade de Recursos Espaciais ($6 \times 20$):
- O mapa de características final é projetado espacialmente para cobrir a área útil da imagem.
- 5 Positional Slot Heads:
- 5 cabeças de classificação independentes analisam janelas espaciais específicas de ~30 pixels de largura, realizando a identificação paralela dos 5 caracteres.
📦 Estrutura do Repositório
confia-captcha-ocr-pt/
├── README.md # Model Card oficial com documentação e métricas
├── config.json # Configurações da arquitetura e metadados do modelo
├── modeling_captcha.py # Definição das classes PyTorch e rotinas de inferência
├── predict.py # Script CLI de inferência standalone
├── model.pt # Pesos do modelo treinado (PyTorch state_dict)
├── pytorch_model.bin # Cópia compatível com padrão Hugging Face
├── sample_1.png # Amostra de teste 1 (5jtpe)
├── sample_2.png # Amostra de teste 2 (dlmrs)
├── sample_3.png # Amostra de teste 3 (rltrd)
└── requirements.txt # Dependências mínimas (torch, torchvision, Pillow, numpy)
🚀 Como Usar
1. Linha de Comando (CLI)
# Instalar dependências
pip install -r requirements.txt
# Prever resposta de uma imagem
python predict.py sample_1.png
# Ou via stdin
echo sample_2.png | python predict.py
2. Em Código Python
import torch
from modeling_captcha import load_model, predict_captcha, DEFAULT_ALPHABET
# Selecionar dispositivo (CPU ou CUDA)
device = "cuda" if torch.cuda.is_available() else "cpu"
# Carregar o modelo
model = load_model("model.pt", alphabet=DEFAULT_ALPHABET, device=device)
# Realizar a leitura na imagem
resultado = predict_captcha(model, "sample_1.png", alphabet=DEFAULT_ALPHABET, device=device)
print(f"Texto Detectado: {resultado}")
🗄️ Dataset & Avaliação
- Dataset de Referência: Amostras alfanuméricas de 5 caracteres com rotulagem e validação automatizada de integridade (~800 amostras).
- Alfabeto Suportado (32 caracteres):
23456789abcdefghijklmnopqrstuvwxyz
🏢 Sobre a Confia Company
Modelo desenvolvido pela Confia Company para pesquisas em visão computacional, reconhecimento óptico de caracteres (OCR) e testes de acessibilidade visual em plataformas web.
- Downloads last month
- -


