Lyon_chatbox / cascade.yaml
Jacid23's picture
Rebrand app as Lyon Chatbox
dfedf76
Raw
History Blame Contribute Delete
5.75 kB
# Cascade provider catalog: speech-to-text -> LLM -> text-to-speech
# API keys belong in .env or real environment variables.
#
# This file defines available providers. Gradio setup chooses which providers
# to use; CLI/headless mode may still use the provider keys below as defaults.
asr:
provider: parakeet_mlx_progressive
cloud_providers:
whisper_openai:
module: whisper_openai
class: WhisperOpenAIASR
streaming: false
requires: [OPENAI_API_KEY]
hardware: null
description: "OpenAI Whisper API - high quality cloud batch ASR"
model: whisper-1
cost_per_second: 0.0001
deepgram:
module: deepgram
class: DeepgramASR
streaming: true
requires: [DEEPGRAM_API_KEY]
hardware: null
description: "Deepgram Nova - real-time cloud streaming ASR"
model: nova-2
language: en
openai_realtime_asr:
module: openai_realtime_asr
class: OpenAIRealtimeASR
streaming: true
requires: [OPENAI_API_KEY]
hardware: null
description: "OpenAI Realtime - GPT-4o streaming transcription via WebSocket"
model: gpt-4o-transcribe
language: en
prompt: ""
use_server_vad: true
local_providers:
parakeet_mlx_progressive:
module: parakeet_mlx_progressive
class: ParakeetMLXProgressiveASR
streaming: true
requires: []
hardware: apple_silicon
import_check: mlx_audio
install_extra: cascade_parakeet_progressive
description: "Parakeet MLX progressive - live transcription with sentence-aware sliding window"
model: mlx-community/parakeet-tdt-0.6b-v3
precision: float16
max_window_size: 15.0
sentence_buffer: 2.0
voxtral_mlx:
module: voxtral_mlx
class: VoxtralMLXASR
streaming: true
requires: []
hardware: apple_silicon
import_check: mlx_audio
install_extra: cascade_voxtral_mlx
description: "Voxtral Mini 4B Realtime - multilingual local ASR via MLX"
model: mlx-community/Voxtral-Mini-4B-Realtime-6bit
language: en
max_tokens: 256
transcription_delay_ms: 480
parakeet_nemo_progressive:
module: parakeet_nemo_progressive
class: ParakeetNeMoProgressiveASR
streaming: true
requires: []
hardware: cuda
import_check: nemo.collections
install_extra: cascade_nemotron
description: "Parakeet TDT via NeMo - progressive ASR with sliding window (CUDA)"
model: nvidia/parakeet-tdt-0.6b-v2
max_window_size: 15.0
sentence_buffer: 2.0
nemotron:
module: nemotron
class: NemotronASR
streaming: true
requires: []
hardware: cuda
import_check: nemo.collections
install_extra: cascade_nemotron
description: "NVIDIA Nemotron - cache-aware streaming ASR"
model: nvidia/nemotron-speech-streaming-en-0.6b
chunk_size_ms: 560
llm:
provider: gemini-2.5-flash-lite
temperature: 1.0
cloud_providers:
gpt-5.2-chat:
module: openai
class: OpenAILLM
requires: [OPENAI_API_KEY]
description: "OpenAI GPT 5.2 Chat"
model: gpt-5.2-chat-latest
input_cost_per_1m: 1.75
output_cost_per_1m: 14.00
gpt-4o-mini:
module: openai
class: OpenAILLM
requires: [OPENAI_API_KEY]
description: "OpenAI GPT models"
model: gpt-4o-mini
input_cost_per_1m: 0.15
output_cost_per_1m: 0.60
gemini-2.5-flash-lite:
module: gemini
class: GeminiLLM
requires: [GEMINI_API_KEY]
description: "Google Gemini models"
model: gemini-2.5-flash-lite
input_cost_per_1m: 0.075
output_cost_per_1m: 0.30
gemini-3.1-flash-lite:
module: gemini
class: GeminiLLM
requires: [GEMINI_API_KEY]
description: "Google Gemini 3.1 Flash Lite - fastest, most cost-efficient Gemini 3 model"
model: gemini-3.1-flash-lite-preview
input_cost_per_1m: 0.25
output_cost_per_1m: 1.50
local_providers:
local_openai_compatible:
module: openai
class: OpenAILLM
requires: []
description: "Local OpenAI-compatible server (LM Studio, Ollama, vLLM, llama.cpp)"
base_url: ""
api_key: ""
model: ""
input_cost_per_1m: 0.0
output_cost_per_1m: 0.0
tts:
provider: kokoro
trim_silence: true
cloud_providers:
tts_openai:
module: openai
class: OpenAITTS
requires: [OPENAI_API_KEY]
description: "OpenAI TTS API"
voice: alloy
model: tts-1
cost_per_1m_chars: 15.0
elevenlabs:
module: elevenlabs
class: ElevenLabsTTS
requires: [ELEVENLABS_API_KEY]
description: "ElevenLabs TTS API"
voice_id: pNInz6obpgDQGcFmaJgB
model: eleven_flash_v2_5
cost_per_1m_chars: 30.0
gradium:
module: gradium
class: GradiumTTS
requires: [GRADIUM_API_KEY]
import_check: gradium
install_extra: cascade_gradium
description: "Gradium TTS - low-latency streaming voice AI"
voice_id: YTpq7expH9539ERJ
model: default
cost_per_1m_chars: 0.0
local_providers:
local_openai_compatible_tts:
module: openai
class: OpenAITTS
requires: []
description: "Local OpenAI-compatible TTS server"
base_url: ""
api_key: ""
voice: ""
model: ""
response_format: pcm
cost_per_1m_chars: 0.0
kokoro:
module: kokoro
class: KokoroTTS
requires: []
hardware: null
import_check: kokoro
install_extra: cascade_kokoro
description: "Kokoro local TTS - works on any PyTorch platform"
voice: am_adam
transcript_analysis:
gliner_model: urchade/gliner_small-v2.1