{ "architectures": [ "Sam2VisionModel" ], "backbone_channel_list": [ 96, 48, 24, 12 ], "backbone_config": { "blocks_per_stage": [ 1, 2, 7, 2 ], "embed_dim_per_stage": [ 12, 24, 48, 96 ], "global_attention_blocks": [ 5, 7, 9 ], "hidden_act": "gelu", "hidden_size": 12, "image_size": 128, "initializer_range": 0.02, "layer_norm_eps": 1e-06, "mlp_ratio": 4.0, "model_type": "sam2_hiera_det_model", "num_attention_heads": 1, "num_attention_heads_per_stage": [ 1, 2, 4, 8 ], "num_channels": 3, "num_query_pool_stages": 3, "patch_kernel_size": 7, "patch_padding": 3, "patch_stride": 4, "query_stride": [ 2, 2 ], "window_positional_embedding_background_size": [ 7, 7 ], "window_size_per_stage": [ 8, 4, 14, 7 ] }, "backbone_feature_sizes": [ [ 32, 32 ], [ 16, 16 ], [ 8, 8 ] ], "dtype": "float32", "fpn_hidden_size": 32, "fpn_kernel_size": 1, "fpn_padding": 0, "fpn_stride": 1, "fpn_top_down_levels": [ 2, 3 ], "hidden_act": "gelu", "initializer_range": 0.02, "layer_norm_eps": 1e-06, "model_type": "sam2_vision_model", "num_feature_levels": 3, "transformers_version": "5.16.0.dev0" }