goro azuma
gorogg
AI & ML interests
None yet
Organizations
None yet
voice
music
image
OCR
-
unum-cloud/uform-gen2-qwen-500m
Image-to-Text • 1B • Updated • 350 • 86 -
Salesforce/blip-image-captioning-large
Image-to-Text • 0.5B • Updated • 484k • 1.49k -
microsoft/trocr-base-handwritten
Image-to-Text • 0.3B • Updated • 193k • 512 -
nlpconnect/vit-gpt2-image-captioning
Image-to-Text • Updated • 108k • 934
programming
listening
-
nvidia/canary-1b
Automatic Speech Recognition • Updated • 2.71k • 459 -
distil-whisper/distil-large-v2
Automatic Speech Recognition • 0.8B • Updated • 8.92k • 516 -
speechbrain/lang-id-voxlingua107-ecapa
Audio Classification • Updated • 138k • 160 -
speechbrain/emotion-recognition-wav2vec2-IEMOCAP
Audio Classification • Updated • 48.3k • 189
video
modeling
image Tool
vision
talk
text
listening
-
nvidia/canary-1b
Automatic Speech Recognition • Updated • 2.71k • 459 -
distil-whisper/distil-large-v2
Automatic Speech Recognition • 0.8B • Updated • 8.92k • 516 -
speechbrain/lang-id-voxlingua107-ecapa
Audio Classification • Updated • 138k • 160 -
speechbrain/emotion-recognition-wav2vec2-IEMOCAP
Audio Classification • Updated • 48.3k • 189
voice
video
music
modeling
image
image Tool
OCR
-
unum-cloud/uform-gen2-qwen-500m
Image-to-Text • 1B • Updated • 350 • 86 -
Salesforce/blip-image-captioning-large
Image-to-Text • 0.5B • Updated • 484k • 1.49k -
microsoft/trocr-base-handwritten
Image-to-Text • 0.3B • Updated • 193k • 512 -
nlpconnect/vit-gpt2-image-captioning
Image-to-Text • Updated • 108k • 934
vision
programming
talk