yzk/veda-ocr-ms
Viewer • Updated • 11.7k • 66
Fine-tuned TrOCR model for Sanskrit manuscript OCR (Optical Character Recognition).
This model extracts Sanskrit text from manuscript images. It outputs text in IAST (International Alphabet of Sanskrit Transliteration) format.
from transformers import TrOCRProcessor, VisionEncoderDecoderModel
from PIL import Image
# Load model
processor = TrOCRProcessor.from_pretrained("Piyush3142/trocr-sanskrit-ocr")
model = VisionEncoderDecoderModel.from_pretrained("Piyush3142/trocr-sanskrit-ocr")
# OCR inference
image = Image.open("sanskrit_manuscript.jpg").convert("RGB")
pixel_values = processor(image, return_tensors="pt").pixel_values
outputs = model.generate(pixel_values, max_length=256)
text = processor.batch_decode(outputs, skip_special_tokens=True)[0]
print(text) # IAST output
from indic_transliteration.sanscript import transliterate, IAST, DEVANAGARI
devanagari = transliterate(text, IAST, DEVANAGARI)
print(devanagari)
| Parameter | Value |
|---|---|
| Dataset | yzk/veda-ocr-ms |
| Train samples | 10,560 |
| Test samples | 1,174 |
| Epochs | 2 |
| Batch size | 4 |
| Learning rate | 2e-5 |
| CER | ~68% |
| WER | ~80% |
MIT