vit-gpt2-image-captioning-onnx-quantization

Browse files

Files changed (12) hide show

vit-gpt2-image-captioning-onnx-quantization/.gitattributes +35 -0
vit-gpt2-image-captioning-onnx-quantization/config.json +76 -0
vit-gpt2-image-captioning-onnx-quantization/gpt2_decoder_quantized.onnx +3 -0
vit-gpt2-image-captioning-onnx-quantization/merges.txt +0 -0
vit-gpt2-image-captioning-onnx-quantization/model_metadata.json +26 -0
vit-gpt2-image-captioning-onnx-quantization/preprocessor_config.json +23 -0
vit-gpt2-image-captioning-onnx-quantization/source.txt +1 -0
vit-gpt2-image-captioning-onnx-quantization/special_tokens_map.json +30 -0
vit-gpt2-image-captioning-onnx-quantization/tokenizer.json +0 -0
vit-gpt2-image-captioning-onnx-quantization/tokenizer_config.json +28 -0
vit-gpt2-image-captioning-onnx-quantization/vit_encoder_quantized.onnx +3 -0
vit-gpt2-image-captioning-onnx-quantization/vocab.json +0 -0

vit-gpt2-image-captioning-onnx-quantization/.gitattributes ADDED Viewed

	@@ -0,0 +1,35 @@

+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text

vit-gpt2-image-captioning-onnx-quantization/config.json ADDED Viewed

	@@ -0,0 +1,76 @@

+{
+  "architectures": [
+    "VisionEncoderDecoderModel"
+  ],
+  "bos_token_id": 50256,
+  "decoder": {
+    "activation_function": "gelu_new",
+    "add_cross_attention": true,
+    "architectures": [
+      "GPT2LMHeadModel"
+    ],
+    "attn_pdrop": 0.1,
+    "decoder_start_token_id": 50256,
+    "embd_pdrop": 0.1,
+    "initializer_range": 0.02,
+    "is_decoder": true,
+    "layer_norm_epsilon": 1e-05,
+    "model_type": "gpt2",
+    "n_ctx": 1024,
+    "n_embd": 768,
+    "n_head": 12,
+    "n_inner": null,
+    "n_layer": 12,
+    "n_positions": 1024,
+    "pad_token_id": 50256,
+    "reorder_and_upcast_attn": false,
+    "resid_pdrop": 0.1,
+    "scale_attn_by_inverse_layer_idx": false,
+    "scale_attn_weights": true,
+    "summary_activation": null,
+    "summary_first_dropout": 0.1,
+    "summary_proj_to_labels": true,
+    "summary_type": "cls_index",
+    "summary_use_proj": true,
+    "task_specific_params": {
+      "text-generation": {
+        "do_sample": true,
+        "max_length": 50
+      }
+    },
+    "torch_dtype": "float32",
+    "use_cache": true,
+    "vocab_size": 50257
+  },
+  "decoder_start_token_id": 50256,
+  "encoder": {
+    "architectures": [
+      "ViTModel"
+    ],
+    "attention_probs_dropout_prob": 0.0,
+    "encoder_stride": 16,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.0,
+    "hidden_size": 768,
+    "image_size": 224,
+    "initializer_range": 0.02,
+    "intermediate_size": 3072,
+    "layer_norm_eps": 1e-12,
+    "model_type": "vit",
+    "num_attention_heads": 12,
+    "num_channels": 3,
+    "num_hidden_layers": 12,
+    "patch_size": 16,
+    "pooler_act": "tanh",
+    "pooler_output_size": 768,
+    "qkv_bias": true,
+    "torch_dtype": "float32"
+  },
+  "eos_token_id": 50256,
+  "is_encoder_decoder": true,
+  "model_type": "vision-encoder-decoder",
+  "pad_token_id": 50256,
+  "tie_word_embeddings": false,
+  "torch_dtype": "float32",
+  "transformers_version": "4.53.3"
+}

vit-gpt2-image-captioning-onnx-quantization/gpt2_decoder_quantized.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:616aa1be0a8c40fb9277e53bdc1f168aee0189d6e982bd54883bac99ad13f79d
+size 193304270

vit-gpt2-image-captioning-onnx-quantization/merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

vit-gpt2-image-captioning-onnx-quantization/model_metadata.json ADDED Viewed

	@@ -0,0 +1,26 @@

+{
+  "model_name": "nlpconnect/vit-gpt2-image-captioning",
+  "quantized": true,
+  "input_size": [
+    224,
+    224
+  ],
+  "model_files": {
+    "encoder": "vit_encoder_quantized.onnx",
+    "decoder": "gpt2_decoder_quantized.onnx"
+  },
+  "tokenizer_files": [
+    "vocab.json",
+    "merges.txt",
+    "tokenizer_config.json"
+  ],
+  "feature_extractor_file": "preprocessor_config.json",
+  "special_tokens": {
+    "bos_token": "<|endoftext|>",
+    "eos_token": "<|endoftext|>",
+    "pad_token": "<|endoftext|>",
+    "bos_token_id": 50256,
+    "eos_token_id": 50256,
+    "pad_token_id": 50256
+  }
+}

vit-gpt2-image-captioning-onnx-quantization/preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "do_convert_rgb": null,
+  "do_normalize": true,
+  "do_rescale": true,
+  "do_resize": true,
+  "image_mean": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "image_processor_type": "ViTImageProcessor",
+  "image_std": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "resample": 2,
+  "rescale_factor": 0.00392156862745098,
+  "size": {
+    "height": 224,
+    "width": 224
+  }
+}

vit-gpt2-image-captioning-onnx-quantization/source.txt ADDED Viewed

	@@ -0,0 +1 @@


1	+ https://huggingface.co/YqqAH/vit-gpt2-image-captioning-onnx-quantization

vit-gpt2-image-captioning-onnx-quantization/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,30 @@

+{
+  "bos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

vit-gpt2-image-captioning-onnx-quantization/tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

vit-gpt2-image-captioning-onnx-quantization/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,28 @@

+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "50256": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "bos_token": "<|endoftext|>",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|endoftext|>",
+  "extra_special_tokens": {},
+  "max_length": 32,
+  "model_max_length": 1024,
+  "pad_to_multiple_of": null,
+  "pad_token": "<|endoftext|>",
+  "pad_token_type_id": 0,
+  "padding_side": "right",
+  "stride": 0,
+  "tokenizer_class": "GPT2Tokenizer",
+  "truncation_side": "right",
+  "truncation_strategy": "longest_first",
+  "unk_token": "<|endoftext|>"
+}

vit-gpt2-image-captioning-onnx-quantization/vit_encoder_quantized.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:203ee97ac191fe56697dd08ad9faa09fffe1480a1128523840ef80bbd288c87a
+size 87127104

vit-gpt2-image-captioning-onnx-quantization/vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff