| schema_version: music3lab.inversion-e3-config.v1 |
| experiment_label: external_audio_latent_inversion_no_oracle |
| model_revision: fbdf52fbaaca799592917417eb05f1899f1255ec |
| expected_base_id: 05c0cdd43a6374b6959cd561e8de4cd6a3327133f8763312d41b1d2b6549c53d |
| diffusers_revision: 90b4e34e79a86ec5e7f2437634fe95ecd2108796 |
| external_source: |
| kind: opaque_user_audio |
| raw_file_sha256: f4e6269f3302d80c956a5b09c2c636324091b6642e370811e7fab126d521a6e5 |
| raw_file_size: 31437094 |
| container: wav |
| codec: pcm_s32le |
| source_sample_rate: 48000 |
| source_channels: 2 |
| source_frames: 3929624 |
| retain_original_bytes: true |
| persist_human_metadata: false |
| canonicalization: |
| engine: ffmpeg |
| executable: /usr/bin/ffmpeg |
| executable_sha256: 36d94a605d612e4090d1b8aec889d0c0801c6eafb1593c90f5c0dfd2e2966a45 |
| version_line: ffmpeg version 4.4.2-0ubuntu0.22.04.1 Copyright (c) 2000-2021 the FFmpeg developers |
| input_transport: retained_source_bytes_via_stdin |
| operation_order: resample_full_source_then_trim_output_frames |
| filtergraph: aresample=44100,atrim=start_sample=1719900:end_sample=1763932,asetpts=PTS-STARTPTS |
| output_encoding: stereo_interleaved_little_endian_float32 |
| output_sample_rate: 44100 |
| output_channels: 2 |
| output_frames: 44032 |
| output_start_frame: 1719900 |
| output_end_frame: 1763932 |
| interleaved_f32le_sha256: 22d81730b21386f516bbb586f3310acb7aaed75b157a52dca9f0c7c76ef4b3bd |
| channel_major_tensor_sha256: b08e725241d7e3158e1a286ba9279e903b1a6a2f3f6c749af276ff02be0017b1 |
| deterministic_float_wav_sha256: 2645ff4f920bb559cd8e4898f91e06c0f43bbfda715ccab2f08da1477440f3b7 |
| execution: |
| device: cuda |
| required_device_name_substring: H100 |
| deterministic_algorithms: true |
| restart_seeds: [101, 103, 107, 109] |
| master_latent_dtype: float32 |
| fp32_decoder_dtype: float32 |
| exact_decoder_dtype: bfloat16 |
| trajectory_stride_steps: 1 |
| latent_channels: 128 |
| latent_frames: 86 |
| latent_initialization_mean: 0.07592402398586273 |
| latent_initialization_std: 2.206683874130249 |
| initial_batch_sha256: d907a81862d25e1bf3bbf54b78b801708f723ba6b654759bbee813c304aec2f1 |
| initial_restart_sha256: |
| - 6832687067d4c42e6b2f634c5e1648d12418259064c1fc71acb792e1c2ebefad |
| - eaa511076d9185d4f95dfc6f3aa6feae56f2002ecb8606c338dc1e12ce26e700 |
| - 73ef18c7dda783bb61f0cfe4a4e0d71a5e17f1bfdd9455de6054e77228c7fdbb |
| - bcd53046e276188aee1bf4af4bfd8dddaf07513f67eaa7893158d055ce1dc4e5 |
| optimizer: |
| name: adam |
| beta1: 0.9 |
| beta2: 0.999 |
| epsilon: 0.00000001 |
| weight_decay: 0.0 |
| gradient_clip_norm: 1.0 |
| warmup_steps: 20 |
| schedule: linear_warmup_then_cosine_inclusive |
| loss: |
| definition_version: fixed-bf16-ruler-v1 |
| stft_center: false |
| stft_fft_sizes: [256, 512, 1024, 2048] |
| stft_hop_sizes: [64, 128, 256, 512] |
| legacy_mrstft_epsilon: 0.0000001 |
| envelope_windows: [63, 255, 1023] |
| time_denominator_epsilon: 0.00000001 |
| complex_stft_denominator_epsilon: 0.00000001 |
| mid_side_floor_fraction: 0.0001 |
| relative_envelope_denominator_epsilon: 0.00000001 |
| fp32_audio_weights_start: |
| time_nmse: 1.0 |
| complex_stft_nmse: 0.25 |
| legacy_mrstft: 0.5 |
| mid_side_nmse: 0.1 |
| relative_envelope: 0.1 |
| fixed_selection_weights: |
| time_nmse: 2.0 |
| complex_stft_nmse: 1.0 |
| legacy_mrstft: 0.05 |
| mid_side_nmse: 0.5 |
| relative_envelope: 0.02 |
| fp32_prior_start: 0.02 |
| fp32_prior_end: 0.005 |
| bf16_prior_start: 0.005 |
| bf16_prior_end: 0.001 |
| distribution_prior: |
| definition: population_moment_and_tail_v1 |
| latent_mean: 0.07592402398586273 |
| latent_std: 2.206683874130249 |
| variance_epsilon: 0.00000001 |
| tail_threshold: 6.0 |
| tail_weight: 0.1 |
| formula: prior=mean(z)^2+(sqrt(mean((z-mean(z))^2)+1e-8)-1)^2+0.1*mean(relu(abs(z)-6)^2) |
| oracle_distance_used: false |
| selection: |
| score: fixed_exact_bf16_audio_ruler |
| evaluate_every_optimizer_step: true |
| per_restart_best: true |
| stage_transition_uses_fp32_stage_best: true |
| restart_tie_rule: earliest_stage_then_step |
| final_tie_rule: lowest_restart_index |
| evaluator_computed_after_lock: true |
| prior_excluded: true |
| experiment: |
| experiment_id: P2-E3 |
| kind: external_audio_inversion |
| initialization: four_independent_seeded_prior_draws |
| fp32_stage: |
| steps: 800 |
| maximum_learning_rate: 0.03 |
| minimum_learning_rate: 0.003 |
| bf16_stage: |
| steps: 1200 |
| maximum_learning_rate: 0.015 |
| minimum_learning_rate: 0.0015 |
| audio_only_thresholds: |
| minimum_objective_improvement_fraction: 0.20 |
| minimum_median_objective_improvement_fraction: 0.40 |
| maximum_waveform_mae: 0.06 |
| minimum_correlation: 0.50 |
| minimum_si_sdr_db: -1.0 |
| high_fidelity_minimum_si_sdr_db: 20.0 |
| high_fidelity_minimum_unscaled_snr_db: 18.0 |
| high_fidelity_maximum_loudness_error_db: 0.5 |
| high_fidelity_maximum_stereo_correlation_error: 0.05 |
| publication: |
| root_mode: 493 |
| experiment_directory_mode: 448 |
| file_mode: 420 |
| manifest_written_last: true |
| atomic_directory_rename: true |
| notes: |
| capability: continuous Flow-VAE latent inversion from external waveform; not WAV-to-RVQ encoding |
| latent_quality_claim_allowed: false |
| human_metadata_persisted: false |
| quality_claim_policy: audio-only feasibility and high-fidelity tiers are separate |
|
|