schema_version: music3lab.inversion-e3-config.v1 experiment_label: external_audio_latent_inversion_no_oracle model_revision: fbdf52fbaaca799592917417eb05f1899f1255ec expected_base_id: 05c0cdd43a6374b6959cd561e8de4cd6a3327133f8763312d41b1d2b6549c53d diffusers_revision: 90b4e34e79a86ec5e7f2437634fe95ecd2108796 external_source: kind: opaque_user_audio raw_file_sha256: f4e6269f3302d80c956a5b09c2c636324091b6642e370811e7fab126d521a6e5 raw_file_size: 31437094 container: wav codec: pcm_s32le source_sample_rate: 48000 source_channels: 2 source_frames: 3929624 retain_original_bytes: true persist_human_metadata: false canonicalization: engine: ffmpeg executable: /usr/bin/ffmpeg executable_sha256: 36d94a605d612e4090d1b8aec889d0c0801c6eafb1593c90f5c0dfd2e2966a45 version_line: ffmpeg version 4.4.2-0ubuntu0.22.04.1 Copyright (c) 2000-2021 the FFmpeg developers input_transport: retained_source_bytes_via_stdin operation_order: resample_full_source_then_trim_output_frames filtergraph: aresample=44100,atrim=start_sample=1719900:end_sample=1763932,asetpts=PTS-STARTPTS output_encoding: stereo_interleaved_little_endian_float32 output_sample_rate: 44100 output_channels: 2 output_frames: 44032 output_start_frame: 1719900 output_end_frame: 1763932 interleaved_f32le_sha256: 22d81730b21386f516bbb586f3310acb7aaed75b157a52dca9f0c7c76ef4b3bd channel_major_tensor_sha256: b08e725241d7e3158e1a286ba9279e903b1a6a2f3f6c749af276ff02be0017b1 deterministic_float_wav_sha256: 2645ff4f920bb559cd8e4898f91e06c0f43bbfda715ccab2f08da1477440f3b7 execution: device: cuda required_device_name_substring: H100 deterministic_algorithms: true restart_seeds: [101, 103, 107, 109] master_latent_dtype: float32 fp32_decoder_dtype: float32 exact_decoder_dtype: bfloat16 trajectory_stride_steps: 1 latent_channels: 128 latent_frames: 86 latent_initialization_mean: 0.07592402398586273 latent_initialization_std: 2.206683874130249 initial_batch_sha256: d907a81862d25e1bf3bbf54b78b801708f723ba6b654759bbee813c304aec2f1 initial_restart_sha256: - 6832687067d4c42e6b2f634c5e1648d12418259064c1fc71acb792e1c2ebefad - eaa511076d9185d4f95dfc6f3aa6feae56f2002ecb8606c338dc1e12ce26e700 - 73ef18c7dda783bb61f0cfe4a4e0d71a5e17f1bfdd9455de6054e77228c7fdbb - bcd53046e276188aee1bf4af4bfd8dddaf07513f67eaa7893158d055ce1dc4e5 optimizer: name: adam beta1: 0.9 beta2: 0.999 epsilon: 0.00000001 weight_decay: 0.0 gradient_clip_norm: 1.0 warmup_steps: 20 schedule: linear_warmup_then_cosine_inclusive loss: definition_version: fixed-bf16-ruler-v1 stft_center: false stft_fft_sizes: [256, 512, 1024, 2048] stft_hop_sizes: [64, 128, 256, 512] legacy_mrstft_epsilon: 0.0000001 envelope_windows: [63, 255, 1023] time_denominator_epsilon: 0.00000001 complex_stft_denominator_epsilon: 0.00000001 mid_side_floor_fraction: 0.0001 relative_envelope_denominator_epsilon: 0.00000001 fp32_audio_weights_start: time_nmse: 1.0 complex_stft_nmse: 0.25 legacy_mrstft: 0.5 mid_side_nmse: 0.1 relative_envelope: 0.1 fixed_selection_weights: time_nmse: 2.0 complex_stft_nmse: 1.0 legacy_mrstft: 0.05 mid_side_nmse: 0.5 relative_envelope: 0.02 fp32_prior_start: 0.02 fp32_prior_end: 0.005 bf16_prior_start: 0.005 bf16_prior_end: 0.001 distribution_prior: definition: population_moment_and_tail_v1 latent_mean: 0.07592402398586273 latent_std: 2.206683874130249 variance_epsilon: 0.00000001 tail_threshold: 6.0 tail_weight: 0.1 formula: prior=mean(z)^2+(sqrt(mean((z-mean(z))^2)+1e-8)-1)^2+0.1*mean(relu(abs(z)-6)^2) oracle_distance_used: false selection: score: fixed_exact_bf16_audio_ruler evaluate_every_optimizer_step: true per_restart_best: true stage_transition_uses_fp32_stage_best: true restart_tie_rule: earliest_stage_then_step final_tie_rule: lowest_restart_index evaluator_computed_after_lock: true prior_excluded: true experiment: experiment_id: P2-E3 kind: external_audio_inversion initialization: four_independent_seeded_prior_draws fp32_stage: steps: 800 maximum_learning_rate: 0.03 minimum_learning_rate: 0.003 bf16_stage: steps: 1200 maximum_learning_rate: 0.015 minimum_learning_rate: 0.0015 audio_only_thresholds: minimum_objective_improvement_fraction: 0.20 minimum_median_objective_improvement_fraction: 0.40 maximum_waveform_mae: 0.06 minimum_correlation: 0.50 minimum_si_sdr_db: -1.0 high_fidelity_minimum_si_sdr_db: 20.0 high_fidelity_minimum_unscaled_snr_db: 18.0 high_fidelity_maximum_loudness_error_db: 0.5 high_fidelity_maximum_stereo_correlation_error: 0.05 publication: root_mode: 493 experiment_directory_mode: 448 file_mode: 420 manifest_written_last: true atomic_directory_rename: true notes: capability: continuous Flow-VAE latent inversion from external waveform; not WAV-to-RVQ encoding latent_quality_claim_allowed: false human_metadata_persisted: false quality_claim_policy: audio-only feasibility and high-fidelity tiers are separate