{ "architectures": [ "MobileViTV2ForSemanticSegmentation" ], "aspp_dropout_prob": 0.1, "aspp_out_channels": 32, "atrous_rates": [ 6, 12, 18 ], "attn_dropout": 0.0, "base_attn_unit_dims": [ 16, 24, 32 ], "classifier_dropout_prob": 0.1, "conv_kernel_size": 3, "dtype": "float32", "expand_ratio": 2.0, "ffn_dropout": 0.0, "ffn_multiplier": 2, "hidden_act": "swish", "image_size": 64, "initializer_range": 0.02, "layer_norm_eps": 1e-05, "model_type": "mobilevitv2", "n_attn_blocks": [ 1, 1, 2 ], "num_channels": 3, "output_stride": 32, "patch_size": 2, "semantic_loss_ignore_index": 255, "transformers_version": "5.16.0.dev0", "width_multiplier": 0.25 }