--- title: Lead vs Backing Vocals - Speed Test emoji: 🎤 colorFrom: purple colorTo: blue sdk: gradio sdk_version: "5.34.0" app_file: app.py pinned: false --- # Test: Lead vs Backing Vocals (etap 2 pipeline'u) Testowa przestrzeń do sprawdzenia szybkości i jakości separacji lead/backing vocals, jako drugi etap po Twoim istniejącym `htdemucs_6s` (worker.py). ## Jak testować 1. Wyeksportuj z aktualnego stems extractora sam stem `vocals.wav` (dokładnie to, co produkuje `load_and_process_stems` w Twoim `worker.py`). 2. Wgraj go tutaj. 3. Wybierz model i kliknij "Uruchom separację". 4. Sprawdź RTF (real-time factor) i jakość wyniku (lead vs backing). ## Ważne: CPU vs GPU - Domyślnie ta przestrzeń jest skonfigurowana pod **CPU** (`audio-separator[cpu]`, `onnxruntime`). - Jeśli chcesz przetestować realny scenariusz produkcyjny na GPU (tak jak może działać Twój serwer), zmień w `requirements.txt`: - `audio-separator[cpu]` → `audio-separator[gpu]` - `onnxruntime` → `onnxruntime-gpu` i wybierz w ustawieniach Space sprzęt z GPU (np. T4). ## Modele w teście - `mel_band_roformer_karaoke_aufr33_viperx_sdr_10.1956.ckpt` - najlepsza jakość, cięższy model (Mel-Band Roformer). - `UVR_MDXNET_KARA_2.onnx` - starsza architektura MDX-Net, zwykle szybszy, ale ma cap częstotliwości (dźwięk lekko matowy). Modele pobierają się automatycznie przy pierwszym użyciu (biblioteka `audio-separator`) i są cache'owane w `/tmp/audio-separator-models`. ## Co dalej Jeśli wyniki (czas + jakość) Cię zadowolą, dopinamy to jako **drugi krok w `worker.py`**: po `load_and_process_stems` (gdy `mode` obejmuje wokal), dorzucamy wywołanie tego samego modelu na stemie `vocals`, zapisując dodatkowo `lead_vocals` i `backing_vocals` do wyniku joba.