s2s-backend / entrypoint.sh
dponcedeleonf's picture
entrypoint: prefijar STT a español (--language es)
88e14c5 verified
Raw
History Blame Contribute Delete
1.21 kB
#!/usr/bin/env bash
set -euo pipefail
if [ -z "${HF_TOKEN:-}" ]; then
echo "ERROR: HF_TOKEN no está definido. Configuralo en Space Settings -> Secrets."
exit 1
fi
# Réplica de la config del backend de smolagents/hf-realtime-voice:
# VAD: Silero (built-in, tiny, en GPU/CPU)
# STT: Parakeet TDT (NVIDIA), en la GPU del Space
# LLM: Gemma 4 31B en Cerebras, via HF Router (único servicio remoto)
# TTS: Qwen3-TTS 1.7B, backend PyTorch en la GPU del Space
#
# El backend --qwen3_tts_backend torch evita el wheel específico de CUDA de GGML,
# más simple para deploy en HF Spaces GPU. Si querés máxima velocidad de TTS
# después, se puede cambiar a ggml y matchear la versión de CUDA de la base image.
exec speech-to-speech \
--mode realtime \
--stt parakeet-tdt \
--llm_backend chat-completions \
--tts qwen3 \
--qwen3_tts_backend torch \
--model_name "google/gemma-4-31B-it:cerebras" \
--responses_api_base_url "https://router.huggingface.co/v1" \
--responses_api_api_key "$HF_TOKEN" \
--responses_api_reasoning_effort none \
--responses_api_stream \
--enable_live_transcription \
--language es \
--ws_host 0.0.0.0 \
--ws_port 8765