Benjamin Potzmann
Giymo11
·
AI & ML interests
Multimodal AI, LLMs, RAG
Organizations
None yet
Audio Only
-
nvidia/canary-qwen-2.5b
Automatic Speech Recognition • 3B • Updated • 26.1k • 454 -
nvidia/parakeet-tdt-0.6b-v3
Automatic Speech Recognition • 0.6B • Updated • 730k • • 1.07k -
zai-org/GLM-ASR-Nano-2512
Automatic Speech Recognition • 2B • Updated • 114k • 389 -
Qwen/Qwen2-Audio-7B
Audio-Text-to-Text • 8B • Updated • 45.8k • 176
Multimodal (Audio + Visual)
Multimodal (Audio)
Audio Only
-
nvidia/canary-qwen-2.5b
Automatic Speech Recognition • 3B • Updated • 26.1k • 454 -
nvidia/parakeet-tdt-0.6b-v3
Automatic Speech Recognition • 0.6B • Updated • 730k • • 1.07k -
zai-org/GLM-ASR-Nano-2512
Automatic Speech Recognition • 2B • Updated • 114k • 389 -
Qwen/Qwen2-Audio-7B
Audio-Text-to-Text • 8B • Updated • 45.8k • 176