hf-transformers-bot's picture
Update tiny models for OmDetTurboForObjectDetection
771f716 verified
Raw
History Blame Contribute Delete
2.71 kB
{
"apply_layernorm_after_vision_backbone": false,
"architectures": [
"OmDetTurboForObjectDetection"
],
"backbone": null,
"backbone_config": {
"attention_probs_dropout_prob": 0.0,
"depths": [
1,
1,
1,
1
],
"drop_path_rate": 0.1,
"embed_dim": 8,
"encoder_stride": 32,
"hidden_act": "gelu",
"hidden_dropout_prob": 0.0,
"hidden_size": 64,
"image_size": 224,
"initializer_range": 0.02,
"layer_norm_eps": 1e-05,
"mlp_ratio": 4.0,
"model_type": "swin",
"num_channels": 3,
"num_heads": [
1,
1,
1,
1
],
"num_layers": 4,
"out_features": [
"stage2",
"stage3",
"stage4"
],
"out_indices": [
2,
3,
4
],
"patch_size": 4,
"qkv_bias": true,
"stage_names": [
"stem",
"stage1",
"stage2",
"stage3",
"stage4"
],
"use_absolute_embeddings": false,
"window_size": 7
},
"batch_norm_eps": 1e-05,
"cache_size": 100,
"class_distance_type": "cosine",
"class_embed_dim": 16,
"conv_norm_activation": "gelu",
"csp_activation": "silu",
"d_model": 8,
"decoder_activation": "relu",
"decoder_dim_feedforward": 32,
"decoder_dropout": 0.0,
"decoder_hidden_dim": 8,
"decoder_num_heads": 2,
"decoder_num_layers": 2,
"decoder_num_points": 4,
"disable_custom_kernels": false,
"dtype": "float32",
"encoder_attention_heads": 2,
"encoder_dim_feedforward": 32,
"encoder_dropout": 0.0,
"encoder_feedforward_activation": "relu",
"encoder_feedforward_dropout": 0.0,
"encoder_in_channels": [
16,
32,
64
],
"encoder_layers": 2,
"encoder_projection_indices": [
2
],
"eval_size": null,
"hidden_expansion": 1,
"image_size": 224,
"init_std": 0.02,
"is_encoder_decoder": true,
"layer_norm_eps": 1e-05,
"learn_initial_query": false,
"model_type": "omdet-turbo",
"num_feature_levels": 3,
"num_queries": 20,
"positional_encoding_temperature": 10000,
"task_encoder_hidden_dim": 32,
"text_config": {
"attention_dropout": 0.0,
"bos_token_id": 49406,
"eos_token_id": 49407,
"hidden_act": "quick_gelu",
"hidden_size": 16,
"initializer_factor": 1.0,
"initializer_range": 0.02,
"intermediate_size": 16,
"layer_norm_eps": 1e-05,
"max_position_embeddings": 200,
"model_type": "clip_text_model",
"num_attention_heads": 2,
"num_hidden_layers": 2,
"pad_token_id": 49407,
"projection_dim": 512,
"vocab_size": 49408
},
"text_projection_in_dim": 16,
"text_projection_out_dim": 16,
"transformers_version": "5.16.0.dev0",
"vision_features_channels": [
8,
8,
8
]
}