#!/usr/bin/env bash set -euo pipefail if [ -z "${HF_TOKEN:-}" ]; then echo "ERROR: HF_TOKEN no está definido. Configuralo en Space Settings -> Secrets." exit 1 fi # Réplica de la config del backend de smolagents/hf-realtime-voice: # VAD: Silero (built-in, tiny, en GPU/CPU) # STT: Parakeet TDT (NVIDIA), en la GPU del Space # LLM: Gemma 4 31B en Cerebras, via HF Router (único servicio remoto) # TTS: Qwen3-TTS 1.7B, backend PyTorch en la GPU del Space # # El backend --qwen3_tts_backend torch evita el wheel específico de CUDA de GGML, # más simple para deploy en HF Spaces GPU. Si querés máxima velocidad de TTS # después, se puede cambiar a ggml y matchear la versión de CUDA de la base image. exec speech-to-speech \ --mode realtime \ --stt parakeet-tdt \ --llm_backend chat-completions \ --tts qwen3 \ --qwen3_tts_backend torch \ --model_name "google/gemma-4-31B-it:cerebras" \ --responses_api_base_url "https://router.huggingface.co/v1" \ --responses_api_api_key "$HF_TOKEN" \ --responses_api_reasoning_effort none \ --responses_api_stream \ --enable_live_transcription \ --language es \ --ws_host 0.0.0.0 \ --ws_port 8765