Open models for real-time voice pipelines: VAD, diarization, streaming ASR, TTS, full-duplex speech, and talking-head animation.
-
pyannote/voice-activity-detection
Automatic Speech Recognition • Updated • 4.13M • 240 -
pyannote/speaker-diarization-3.1
Automatic Speech Recognition • Updated • 9.08M • 3.06k -
nvidia/parakeet-tdt-0.6b-v2
Automatic Speech Recognition • Updated • 579k • 1.53k -
nvidia/nemotron-3.5-asr-streaming-0.6b
Automatic Speech Recognition • 0.6B • Updated • 1.3M • • 1.04k