Spaces:
Sleeping
Sleeping
| set -euo pipefail | |
| if [ -z "${HF_TOKEN:-}" ]; then | |
| echo "ERROR: HF_TOKEN no está definido. Configuralo en Space Settings -> Secrets." | |
| exit 1 | |
| fi | |
| # Réplica de la config del backend de smolagents/hf-realtime-voice: | |
| # VAD: Silero (built-in, tiny, en GPU/CPU) | |
| # STT: Parakeet TDT (NVIDIA), en la GPU del Space | |
| # LLM: Gemma 4 31B en Cerebras, via HF Router (único servicio remoto) | |
| # TTS: Qwen3-TTS 1.7B, backend PyTorch en la GPU del Space | |
| # | |
| # El backend --qwen3_tts_backend torch evita el wheel específico de CUDA de GGML, | |
| # más simple para deploy en HF Spaces GPU. Si querés máxima velocidad de TTS | |
| # después, se puede cambiar a ggml y matchear la versión de CUDA de la base image. | |
| exec speech-to-speech \ | |
| --mode realtime \ | |
| --stt parakeet-tdt \ | |
| --llm_backend chat-completions \ | |
| --tts qwen3 \ | |
| --qwen3_tts_backend torch \ | |
| --model_name "google/gemma-4-31B-it:cerebras" \ | |
| --responses_api_base_url "https://router.huggingface.co/v1" \ | |
| --responses_api_api_key "$HF_TOKEN" \ | |
| --responses_api_reasoning_effort none \ | |
| --responses_api_stream \ | |
| --enable_live_transcription \ | |
| --language es \ | |
| --ws_host 0.0.0.0 \ | |
| --ws_port 8765 | |