| --- |
| title: Lead vs Backing Vocals - Speed Test |
| emoji: 🎤 |
| colorFrom: purple |
| colorTo: blue |
| sdk: gradio |
| sdk_version: "5.34.0" |
| app_file: app.py |
| pinned: false |
| --- |
| |
| # Test: Lead vs Backing Vocals (etap 2 pipeline'u) |
|
|
| Testowa przestrzeń do sprawdzenia szybkości i jakości separacji lead/backing vocals, |
| jako drugi etap po Twoim istniejącym `htdemucs_6s` (worker.py). |
|
|
| ## Jak testować |
|
|
| 1. Wyeksportuj z aktualnego stems extractora sam stem `vocals.wav` (dokładnie to, co produkuje `load_and_process_stems` w Twoim `worker.py`). |
| 2. Wgraj go tutaj. |
| 3. Wybierz model i kliknij "Uruchom separację". |
| 4. Sprawdź RTF (real-time factor) i jakość wyniku (lead vs backing). |
|
|
| ## Ważne: CPU vs GPU |
|
|
| - Domyślnie ta przestrzeń jest skonfigurowana pod **CPU** (`audio-separator[cpu]`, `onnxruntime`). |
| - Jeśli chcesz przetestować realny scenariusz produkcyjny na GPU (tak jak może działać Twój serwer), |
| zmień w `requirements.txt`: |
| - `audio-separator[cpu]` → `audio-separator[gpu]` |
| - `onnxruntime` → `onnxruntime-gpu` |
| i wybierz w ustawieniach Space sprzęt z GPU (np. T4). |
|
|
| ## Modele w teście |
|
|
| - `mel_band_roformer_karaoke_aufr33_viperx_sdr_10.1956.ckpt` - najlepsza jakość, cięższy model (Mel-Band Roformer). |
| - `UVR_MDXNET_KARA_2.onnx` - starsza architektura MDX-Net, zwykle szybszy, ale ma cap częstotliwości (dźwięk lekko matowy). |
|
|
| Modele pobierają się automatycznie przy pierwszym użyciu (biblioteka `audio-separator`) i są cache'owane w `/tmp/audio-separator-models`. |
|
|
| ## Co dalej |
|
|
| Jeśli wyniki (czas + jakość) Cię zadowolą, dopinamy to jako **drugi krok w `worker.py`**: |
| po `load_and_process_stems` (gdy `mode` obejmuje wokal), dorzucamy wywołanie tego samego modelu |
| na stemie `vocals`, zapisując dodatkowo `lead_vocals` i `backing_vocals` do wyniku joba. |