Acapellas's picture
Update README.md
bca8c18 verified
|
Raw
History Blame Contribute Delete
1.79 kB
---
title: Lead vs Backing Vocals - Speed Test
emoji: 🎤
colorFrom: purple
colorTo: blue
sdk: gradio
sdk_version: "5.34.0"
app_file: app.py
pinned: false
---
# Test: Lead vs Backing Vocals (etap 2 pipeline'u)
Testowa przestrzeń do sprawdzenia szybkości i jakości separacji lead/backing vocals,
jako drugi etap po Twoim istniejącym `htdemucs_6s` (worker.py).
## Jak testować
1. Wyeksportuj z aktualnego stems extractora sam stem `vocals.wav` (dokładnie to, co produkuje `load_and_process_stems` w Twoim `worker.py`).
2. Wgraj go tutaj.
3. Wybierz model i kliknij "Uruchom separację".
4. Sprawdź RTF (real-time factor) i jakość wyniku (lead vs backing).
## Ważne: CPU vs GPU
- Domyślnie ta przestrzeń jest skonfigurowana pod **CPU** (`audio-separator[cpu]`, `onnxruntime`).
- Jeśli chcesz przetestować realny scenariusz produkcyjny na GPU (tak jak może działać Twój serwer),
zmień w `requirements.txt`:
- `audio-separator[cpu]``audio-separator[gpu]`
- `onnxruntime``onnxruntime-gpu`
i wybierz w ustawieniach Space sprzęt z GPU (np. T4).
## Modele w teście
- `mel_band_roformer_karaoke_aufr33_viperx_sdr_10.1956.ckpt` - najlepsza jakość, cięższy model (Mel-Band Roformer).
- `UVR_MDXNET_KARA_2.onnx` - starsza architektura MDX-Net, zwykle szybszy, ale ma cap częstotliwości (dźwięk lekko matowy).
Modele pobierają się automatycznie przy pierwszym użyciu (biblioteka `audio-separator`) i są cache'owane w `/tmp/audio-separator-models`.
## Co dalej
Jeśli wyniki (czas + jakość) Cię zadowolą, dopinamy to jako **drugi krok w `worker.py`**:
po `load_and_process_stems` (gdy `mode` obejmuje wokal), dorzucamy wywołanie tego samego modelu
na stemie `vocals`, zapisując dodatkowo `lead_vocals` i `backing_vocals` do wyniku joba.