IMvision12 commited on
Commit
12892df
·
0 Parent(s):

Super-squash branch 'main' using huggingface_hub

Browse files
Files changed (6) hide show
  1. .gitattributes +36 -0
  2. README.md +65 -0
  3. kf_config.json +45 -0
  4. kf_preprocessor.json +22 -0
  5. model.weights.h5 +3 -0
  6. tokenizer.json +3 -0
.gitattributes ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,65 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ pipeline_tag: image-text-to-text
3
+ license: apache-2.0
4
+ base_model: OpenGVLab/InternVL3_5-1B-HF
5
+ library_name: kerasformers
6
+ language:
7
+ - en
8
+ tags:
9
+ - keras
10
+ - kerasformers
11
+ - internvl
12
+ - internvl3-5
13
+ - multimodal
14
+ - vision
15
+ - image-text-to-text
16
+ - pytorch
17
+ - jax
18
+ - tf
19
+ ---
20
+
21
+ # Run InternVL3.5 with Keras 3: JAX, PyTorch, or TensorFlow
22
+
23
+ [![GitHub](https://img.shields.io/badge/GitHub-KerasFormers-181717?logo=github)](https://github.com/IMvision12/KerasFormers) [![Docs](https://img.shields.io/badge/Docs-InternVL-1f6feb)](https://imvision12.github.io/KerasFormers/internvl/) [![HuggingFace](https://img.shields.io/badge/HuggingFace-InternVL-ffd21e?logo=huggingface&logoColor=black)](https://huggingface.co/collections/kerasformers/internvl-6a8277076dbb163f53241dbd)
24
+
25
+ # kerasformers/internvl3.5-1b
26
+
27
+ Pure-**Keras 3** conversion of [`OpenGVLab/InternVL3_5-1B-HF`](https://huggingface.co/OpenGVLab/InternVL3_5-1B-HF) for [kerasformers](https://github.com/IMvision12/KerasFormers). One implementation runs unmodified on **TensorFlow / Torch / JAX**. This is a **InternVL3.5** checkpoint, served as **image + text -> text** via `InternVLProcessor`; weights are stored in **bfloat16**.
28
+
29
+ For model details, license, and usage terms, see the upstream [model card](https://huggingface.co/OpenGVLab/InternVL3_5-1B-HF).
30
+
31
+ Paper: [InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency (arXiv:2508.18265)](https://arxiv.org/abs/2508.18265) · [HF Papers](https://huggingface.co/papers/2508.18265)
32
+
33
+ Paper: [Qwen3 Technical Report (arXiv:2505.09388)](https://arxiv.org/abs/2505.09388) · [HF Papers](https://huggingface.co/papers/2505.09388)
34
+
35
+ Paper: [YaRN: Efficient Context Window Extension of Large Language Models (arXiv:2309.00071)](https://arxiv.org/abs/2309.00071) · [HF Papers](https://huggingface.co/papers/2309.00071)
36
+
37
+ ## ✨ Quick start
38
+
39
+ ```python
40
+ import os
41
+ os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
42
+
43
+ from PIL import Image
44
+ from kerasformers.models.internvl import InternVLConditionalGenerate, InternVLProcessor
45
+
46
+ model = InternVLConditionalGenerate.from_weights("kerasformers/internvl3.5-1b")
47
+ processor = InternVLProcessor.from_weights("kerasformers/internvl3.5-1b")
48
+
49
+ inputs = processor(conversation=[
50
+ {"role": "user", "content": [
51
+ {"type": "image", "image": Image.open("photo.jpg")},
52
+ {"type": "text", "text": "Describe this image in one sentence."},
53
+ ]}
54
+ ])
55
+ outputs = model.generate(**inputs, max_new_tokens=64)
56
+ print(processor.decode(outputs[0]))
57
+ ```
58
+
59
+ Load any InternVL variant the same way with `from_weights("kerasformers/<variant>")`. Browse them all in the [InternVL collection](https://huggingface.co/collections/kerasformers/internvl-6a8277076dbb163f53241dbd).
60
+
61
+ ## Special Thanks
62
+
63
+ A huge thank you to the OpenGVLab team for creating and releasing the InternVL models.
64
+
65
+ License: `apache-2.0` (per the upstream model card).
kf_config.json ADDED
@@ -0,0 +1,45 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "library_name": "kerasformers",
3
+ "kerasformers_version": "1.2.4",
4
+ "model_module": "kerasformers.models.internvl",
5
+ "model_class": "InternVLConditionalGenerate",
6
+ "variant": "internvl3.5-1b",
7
+ "weights": "model.weights.json",
8
+ "schema_version": 2,
9
+ "weight_dtype": "bfloat16",
10
+ "model_type": "internvl",
11
+ "text_config": {
12
+ "vocab_size": 151936,
13
+ "embed_dim": 1024,
14
+ "mlp_dim": 3072,
15
+ "num_layers": 28,
16
+ "num_heads": 16,
17
+ "num_kv_heads": 8,
18
+ "head_dim": 128,
19
+ "text_backbone": "qwen3",
20
+ "norm_eps": 1e-06,
21
+ "rope_theta": 1000000,
22
+ "tie_embeddings": false,
23
+ "num_experts": 0,
24
+ "num_experts_per_tok": 0,
25
+ "moe_mlp_dim": 0,
26
+ "norm_topk_prob": true,
27
+ "decoder_sparse_step": 1,
28
+ "mlp_only_layers": []
29
+ },
30
+ "vision_config": {
31
+ "embed_dim": 1024,
32
+ "mlp_dim": 4096,
33
+ "num_layers": 24,
34
+ "num_heads": 16,
35
+ "image_size": 448,
36
+ "patch_size": 14,
37
+ "attention_bias": true,
38
+ "qk_norm": false,
39
+ "norm_type": "layer_norm",
40
+ "norm_eps": 1e-06,
41
+ "layer_scale_init": 0.1
42
+ },
43
+ "downsample_ratio": 0.5,
44
+ "image_token_id": 151671
45
+ }
kf_preprocessor.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "library_name": "kerasformers",
3
+ "kerasformers_version": "1.2.4",
4
+ "preprocessor_module": "kerasformers.models.internvl",
5
+ "preprocessor_class": "InternVLImageProcessor",
6
+ "variant": "internvl3.5-1b",
7
+ "size": 448,
8
+ "min_patches": 1,
9
+ "max_patches": 12,
10
+ "crop_to_patches": true,
11
+ "use_thumbnail": true,
12
+ "image_mean": [
13
+ 0.485,
14
+ 0.456,
15
+ 0.406
16
+ ],
17
+ "image_std": [
18
+ 0.229,
19
+ 0.224,
20
+ 0.225
21
+ ]
22
+ }
model.weights.h5 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9f3749a350583e523a1cb9e7e8fa5b657b8cdf773362438c42d53067797326a3
3
+ size 2123460688
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7b9d18660f656ae5a87df2d5d6ed990e80f292d3473c1a35cae8259a5d28cd67
3
+ size 11424484