Acapellas's picture
Update README.md
bca8c18 verified
|
Raw
History Blame Contribute Delete
1.79 kB

A newer version of the Gradio SDK is available: 6.24.0

Upgrade
metadata
title: Lead vs Backing Vocals - Speed Test
emoji: 🎤
colorFrom: purple
colorTo: blue
sdk: gradio
sdk_version: 5.34.0
app_file: app.py
pinned: false

Test: Lead vs Backing Vocals (etap 2 pipeline'u)

Testowa przestrzeń do sprawdzenia szybkości i jakości separacji lead/backing vocals, jako drugi etap po Twoim istniejącym htdemucs_6s (worker.py).

Jak testować

  1. Wyeksportuj z aktualnego stems extractora sam stem vocals.wav (dokładnie to, co produkuje load_and_process_stems w Twoim worker.py).
  2. Wgraj go tutaj.
  3. Wybierz model i kliknij "Uruchom separację".
  4. Sprawdź RTF (real-time factor) i jakość wyniku (lead vs backing).

Ważne: CPU vs GPU

  • Domyślnie ta przestrzeń jest skonfigurowana pod CPU (audio-separator[cpu], onnxruntime).
  • Jeśli chcesz przetestować realny scenariusz produkcyjny na GPU (tak jak może działać Twój serwer), zmień w requirements.txt:
    • audio-separator[cpu]audio-separator[gpu]
    • onnxruntimeonnxruntime-gpu i wybierz w ustawieniach Space sprzęt z GPU (np. T4).

Modele w teście

  • mel_band_roformer_karaoke_aufr33_viperx_sdr_10.1956.ckpt - najlepsza jakość, cięższy model (Mel-Band Roformer).
  • UVR_MDXNET_KARA_2.onnx - starsza architektura MDX-Net, zwykle szybszy, ale ma cap częstotliwości (dźwięk lekko matowy).

Modele pobierają się automatycznie przy pierwszym użyciu (biblioteka audio-separator) i są cache'owane w /tmp/audio-separator-models.

Co dalej

Jeśli wyniki (czas + jakość) Cię zadowolą, dopinamy to jako drugi krok w worker.py: po load_and_process_stems (gdy mode obejmuje wokal), dorzucamy wywołanie tego samego modelu na stemie vocals, zapisując dodatkowo lead_vocals i backing_vocals do wyniku joba.