music3lab / configs /inversion-e3.yaml
coolpoodle's picture
code and training scripts
90884df verified
Raw
History Blame Contribute Delete
5.11 kB
schema_version: music3lab.inversion-e3-config.v1
experiment_label: external_audio_latent_inversion_no_oracle
model_revision: fbdf52fbaaca799592917417eb05f1899f1255ec
expected_base_id: 05c0cdd43a6374b6959cd561e8de4cd6a3327133f8763312d41b1d2b6549c53d
diffusers_revision: 90b4e34e79a86ec5e7f2437634fe95ecd2108796
external_source:
kind: opaque_user_audio
raw_file_sha256: f4e6269f3302d80c956a5b09c2c636324091b6642e370811e7fab126d521a6e5
raw_file_size: 31437094
container: wav
codec: pcm_s32le
source_sample_rate: 48000
source_channels: 2
source_frames: 3929624
retain_original_bytes: true
persist_human_metadata: false
canonicalization:
engine: ffmpeg
executable: /usr/bin/ffmpeg
executable_sha256: 36d94a605d612e4090d1b8aec889d0c0801c6eafb1593c90f5c0dfd2e2966a45
version_line: ffmpeg version 4.4.2-0ubuntu0.22.04.1 Copyright (c) 2000-2021 the FFmpeg developers
input_transport: retained_source_bytes_via_stdin
operation_order: resample_full_source_then_trim_output_frames
filtergraph: aresample=44100,atrim=start_sample=1719900:end_sample=1763932,asetpts=PTS-STARTPTS
output_encoding: stereo_interleaved_little_endian_float32
output_sample_rate: 44100
output_channels: 2
output_frames: 44032
output_start_frame: 1719900
output_end_frame: 1763932
interleaved_f32le_sha256: 22d81730b21386f516bbb586f3310acb7aaed75b157a52dca9f0c7c76ef4b3bd
channel_major_tensor_sha256: b08e725241d7e3158e1a286ba9279e903b1a6a2f3f6c749af276ff02be0017b1
deterministic_float_wav_sha256: 2645ff4f920bb559cd8e4898f91e06c0f43bbfda715ccab2f08da1477440f3b7
execution:
device: cuda
required_device_name_substring: H100
deterministic_algorithms: true
restart_seeds: [101, 103, 107, 109]
master_latent_dtype: float32
fp32_decoder_dtype: float32
exact_decoder_dtype: bfloat16
trajectory_stride_steps: 1
latent_channels: 128
latent_frames: 86
latent_initialization_mean: 0.07592402398586273
latent_initialization_std: 2.206683874130249
initial_batch_sha256: d907a81862d25e1bf3bbf54b78b801708f723ba6b654759bbee813c304aec2f1
initial_restart_sha256:
- 6832687067d4c42e6b2f634c5e1648d12418259064c1fc71acb792e1c2ebefad
- eaa511076d9185d4f95dfc6f3aa6feae56f2002ecb8606c338dc1e12ce26e700
- 73ef18c7dda783bb61f0cfe4a4e0d71a5e17f1bfdd9455de6054e77228c7fdbb
- bcd53046e276188aee1bf4af4bfd8dddaf07513f67eaa7893158d055ce1dc4e5
optimizer:
name: adam
beta1: 0.9
beta2: 0.999
epsilon: 0.00000001
weight_decay: 0.0
gradient_clip_norm: 1.0
warmup_steps: 20
schedule: linear_warmup_then_cosine_inclusive
loss:
definition_version: fixed-bf16-ruler-v1
stft_center: false
stft_fft_sizes: [256, 512, 1024, 2048]
stft_hop_sizes: [64, 128, 256, 512]
legacy_mrstft_epsilon: 0.0000001
envelope_windows: [63, 255, 1023]
time_denominator_epsilon: 0.00000001
complex_stft_denominator_epsilon: 0.00000001
mid_side_floor_fraction: 0.0001
relative_envelope_denominator_epsilon: 0.00000001
fp32_audio_weights_start:
time_nmse: 1.0
complex_stft_nmse: 0.25
legacy_mrstft: 0.5
mid_side_nmse: 0.1
relative_envelope: 0.1
fixed_selection_weights:
time_nmse: 2.0
complex_stft_nmse: 1.0
legacy_mrstft: 0.05
mid_side_nmse: 0.5
relative_envelope: 0.02
fp32_prior_start: 0.02
fp32_prior_end: 0.005
bf16_prior_start: 0.005
bf16_prior_end: 0.001
distribution_prior:
definition: population_moment_and_tail_v1
latent_mean: 0.07592402398586273
latent_std: 2.206683874130249
variance_epsilon: 0.00000001
tail_threshold: 6.0
tail_weight: 0.1
formula: prior=mean(z)^2+(sqrt(mean((z-mean(z))^2)+1e-8)-1)^2+0.1*mean(relu(abs(z)-6)^2)
oracle_distance_used: false
selection:
score: fixed_exact_bf16_audio_ruler
evaluate_every_optimizer_step: true
per_restart_best: true
stage_transition_uses_fp32_stage_best: true
restart_tie_rule: earliest_stage_then_step
final_tie_rule: lowest_restart_index
evaluator_computed_after_lock: true
prior_excluded: true
experiment:
experiment_id: P2-E3
kind: external_audio_inversion
initialization: four_independent_seeded_prior_draws
fp32_stage:
steps: 800
maximum_learning_rate: 0.03
minimum_learning_rate: 0.003
bf16_stage:
steps: 1200
maximum_learning_rate: 0.015
minimum_learning_rate: 0.0015
audio_only_thresholds:
minimum_objective_improvement_fraction: 0.20
minimum_median_objective_improvement_fraction: 0.40
maximum_waveform_mae: 0.06
minimum_correlation: 0.50
minimum_si_sdr_db: -1.0
high_fidelity_minimum_si_sdr_db: 20.0
high_fidelity_minimum_unscaled_snr_db: 18.0
high_fidelity_maximum_loudness_error_db: 0.5
high_fidelity_maximum_stereo_correlation_error: 0.05
publication:
root_mode: 493
experiment_directory_mode: 448
file_mode: 420
manifest_written_last: true
atomic_directory_rename: true
notes:
capability: continuous Flow-VAE latent inversion from external waveform; not WAV-to-RVQ encoding
latent_quality_claim_allowed: false
human_metadata_persisted: false
quality_claim_policy: audio-only feasibility and high-fidelity tiers are separate