{"_class_name": "AutoencoderKLLegacy", "_diffusers_version": "0.32.2", "causal_decoder": false, "causal_encoder": true, "ch": 128, "ch_mult": [1, 2, 2, 4, 4, 8], "embed_dim": 24, "in_channels": 3, "num_res_blocks": 2, "num_res_blocks_decoder": null, "out_ch": 3, "padding_mode": "reflect", "padding_mode_t": null, "pixel_norm_type": "imagenet", "scaling_factor": 1.0, "shift_factor": 0.0, "space_down": [2, 2, 2, 2, 1, 1], "space_up": [1, 2, 2, 2, 2, 1], "time_down": [1, 2, 2, 1, 1, 1], "time_up": null, "use_3d_conv": true, "use_t_isolated_gn": true, "use_vit_decoder": true, "vae_ratio": 16, "vae_ratio_t": 4, "vit_decoder_kwargs": {"dim_head": 64, "ffn_activation_fn": "silu", "ffn_use_gated": true, "heads": 32, "norm_affine": true, "norm_type": "rms_norm", "num_layers": 36, "qk_norm_affine": false, "qk_norm_type": "rms_norm", "rope_dim_ratio": 0.75, "rope_theta": 100.0}, "z_channels": 24, "zq_ch_decoder": null, "zq_ch_encoder": null}