AI & ML interests
None defined yet.
Recent Activity
Papers
FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings
SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper
DiCoW (Diarization-Conditioned Whisper) is a collection of speaker-aware ASR models developed by BUT-FIT, extending OpenAI’s Whisper.
Resources for Open-ended Response Correctness Assessment for Audio Question Answering
-
ORCA: Open-ended Response Correctness Assessment for Audio Question Answering
Paper • 2512.09066 • Published -
BUT-FIT/orca-audio-qa-annotations
Viewer • Updated • 453k • 100 -
BUT-FIT/orca-olmo-2-1b-multinomial
Text Classification • Updated -
BUT-FIT/orca-llama-3.2-3b-it-multinomial
Text Classification • Updated
DiariZen is a speaker diarization toolkit driven by AudioZen and Pyannote 3.1.
This collection showcases DeCRED (Decoder-Centric Regularisation in Encoder-Decoder) for ASR.
-
BUT-FIT/DeCRED-base
Automatic Speech Recognition • 0.2B • Updated • 54 -
BUT-FIT/DeCRED-small
Automatic Speech Recognition • 39.8M • Updated • 25 • 1 -
BUT-FIT/ED-small
Automatic Speech Recognition • 38.5M • Updated • 26 -
BUT-FIT/ED-base
Automatic Speech Recognition • 0.2B • Updated • 22
Resources for Open-ended Response Correctness Assessment for Audio Question Answering
-
ORCA: Open-ended Response Correctness Assessment for Audio Question Answering
Paper • 2512.09066 • Published -
BUT-FIT/orca-audio-qa-annotations
Viewer • Updated • 453k • 100 -
BUT-FIT/orca-olmo-2-1b-multinomial
Text Classification • Updated -
BUT-FIT/orca-llama-3.2-3b-it-multinomial
Text Classification • Updated
DiCoW (Diarization-Conditioned Whisper) is a collection of speaker-aware ASR models developed by BUT-FIT, extending OpenAI’s Whisper.
DiariZen is a speaker diarization toolkit driven by AudioZen and Pyannote 3.1.
This collection showcases DeCRED (Decoder-Centric Regularisation in Encoder-Decoder) for ASR.
-
BUT-FIT/DeCRED-base
Automatic Speech Recognition • 0.2B • Updated • 54 -
BUT-FIT/DeCRED-small
Automatic Speech Recognition • 39.8M • Updated • 25 • 1 -
BUT-FIT/ED-small
Automatic Speech Recognition • 38.5M • Updated • 26 -
BUT-FIT/ED-base
Automatic Speech Recognition • 0.2B • Updated • 22