from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="stt-spanish",return_timestamps=True)
result=pipe ("spanish.wav", generate_kwargs={"task": "transcribe","language":"es"})["text"]
print (result)