kth8 commited on Mar 25

Commit

c277e6c

verified ·

1 Parent(s): ee875cf

Upload folder using huggingface_hub

Browse files

Files changed (18) hide show

.gitattributes +1 -0
README.md +99 -0
added_tokens.json +3 -0
chat_template.jinja +47 -0
config.json +98 -0
generation_config.json +13 -0
model-00001-of-00002.safetensors +3 -0
model-00002-of-00002.safetensors +3 -0
model.safetensors.index.json +891 -0
preprocessor_config.json +29 -0
processor_config.json +4 -0
special_tokens_map.json +33 -0
tokenizer.json +3 -0
tokenizer.model +3 -0
tokenizer_config.json +0 -0
train/log.json +1190 -0
train/training_loss.png +0 -0
train/validation_loss.png +0 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,99 @@

+---
+license: gemma
+language:
+- en
+base_model: unsloth/gemma-3-4b-it
+datasets:
+- m-a-p/SuperGPQA
+pipeline_tag: text-generation
+library_name: transformers
+tags:
+- sft
+- trl
+- unsloth
+- google
+- gemma
+- gemma3
+- gemma3_text
+---
+![logo](https://storage.googleapis.com/gweb-developer-goog-blog-assets/images/gemma-3_2.original.png)
+A fine-tune of [unsloth/gemma-3-4b-it](https://huggingface.co/unsloth/gemma-3-4b-it) on the [m-a-p/SuperGPQA](https://huggingface.co/datasets/m-a-p/SuperGPQA) dataset.
+## Usage example
+Set temperature as 0.0 for best results.
+**System prompt**
+```
+You are a classifier. Categorize the following problem into discipline, field, and subfield in JSON format.
+```
+**User prompt**
+```
+Cotton and linen both readily catch fire. A batch of towels is composed of both cotton and linen, and is known to have caught fire. If it is known that the towels were ignited by a lit cigarette, which of the following arguments utilizes the most appropriate form of reasoning?
+```
+**Assistant response**
+```
+{"discipline": "Philosophy", "field": "Philosophy", "subfield": "Logic"}
+```
+# Possible output options
+Discipline
+```
+['Law', 'Economics', 'Engineering', 'History', 'Sociology', 'Agronomy', 'Management', 'Medicine', 'Philosophy', 'Military Science', 'Literature and Arts', 'Science', 'Education']
+```
+Field
+```
+['Astronomy', 'Mechanical Engineering', 'Management Science and Engineering', 'Law', 'Language and Literature', 'Electrical Engineering', 'Physics', 'Pharmacy', 'Biology', 'Art Studies', 'Sociology', 'Forestry', 'Textile Science and Engineering', 'Metallurgical Engineering', 'Food Science and Engineering', 'Education', 'Geography', 'Optical Engineering', 'Forestry Engineering', 'Clinical Medicine', 'Information and Communication Engineering', 'Public Administration', 'Stomatology', 'Materials Science and Engineering', 'Geophysics', 'Weapon Science and Technology', 'Electronic Science and Technology', 'Philosophy', 'Basic Medicine', 'Applied Economics', 'Physical Oceanography', 'Animal Husbandry', 'Petroleum and Natural Gas Engineering', 'Mechanics', 'Crop Science', 'Veterinary Medicine', 'Nuclear Science and Technology', 'Surveying and Mapping Science and Technology', 'Psychology', 'Transportation Engineering', 'Physical Education', 'Library, Information and Archival Management', 'Control Science and Engineering', 'History', 'Systems Science', 'Hydraulic Engineering', 'Theoretical Economics', 'Architecture', 'Agricultural Engineering', 'Mining Engineering', 'Atmospheric Science', 'Naval Architecture and Ocean Engineering', 'Geology', 'Mathematics', 'Public Health and Preventive Medicine', 'Chemistry', 'Chemical Engineering and Technology', 'Journalism and Communication', 'Power Engineering and Engineering Thermophysics', 'Environmental Science and Engineering', 'Musicology', 'Political Science', 'Business Administration', 'Civil Engineering', 'Geological Resources and Geological Engineering', 'Instrument Science and Technology', 'Aeronautical and Astronautical Science and Technology', 'Computer Science and Technology', 'Military Science', 'Oceanography', 'Aquaculture', 'Traditional Chinese Medicine']
+```
+Subfield
+```
+['Particle and Nuclear Physics', 'Quantitative Economics', 'Criminal Law', 'Subatomic and Atomic Physics', 'Geometry and Topology', 'Library and Archival Science', 'Information Management Science', 'Ethics', 'Pharmacology', 'Sports Humanities and Sociology', 'Heat Transfer', 'Solid Earth Geophysics', 'Power Machinery and Engineering', 'Quantum Mechanics', 'Philosophy of Science and Technology', 'Military Chemistry and Pyrotechnics', 'Functions of Real Variables', 'Water conservancy and Hydropower Engineering', 'Dance Studies', 'Thermodynamics', 'Microbiology and Biochemical Pharmacy', 'Pharmaceutics', 'Harmony', 'Combinatorial Mathematics', 'Rigid Body Mechanics', 'Agricultural Mechanization Engineering', 'Drama and Opera Studies', 'Surgery', 'Antenna and Radio Communication', 'Classical Chinese Literature', 'Marine Chemistry', 'Textile Materials Science', 'Acoustics', 'Marine Biology', 'Veterinary Medicine', 'Russian Language and Literature', 'Data Structures', 'Otorhinolaryngology', 'Pathogen Biology', 'Labor Economics', 'Economic Statistics', 'Urban Infrastructure Engineering', 'Systems Science', 'Radiation Medicine', 'Land Resource Management and Administrative Management', 'Microbiology', 'Constitutional and Administrative Law', 'Mathematical Analysis', 'Pharmaceutical Analysis', 'Basic Stomatology', 'Theoretical Optics', 'Underwater Acoustics', 'Stellar and Interstellar Evolution', 'Physical Geography', 'Tourism Management and Technological Economics Management', 'Astrophysics', 'Meteorology', 'Mining and Safety Engineering', 'Music History, Education, and Technology', 'Design Arts', 'World History', 'Pattern Recognition', 'Solid State Physics', 'Philology and Bibliography', 'Marine Engineering', 'Aquaculture', 'Traditional Chinese Pharmacy', 'Textile Chemistry and Dyeing Engineering', 'Environmental Science', 'Management Science and Engineering', 'Materials Processing Engineering', 'Poromechanics and Reservoir Physics', 'Space physics', 'Transportation Planning and Management', 'French Language and Literature', 'Structural Geology', 'Laser Technology', 'Communication and Broadcasting', 'Computer Software and Theory', 'Organic Chemistry', 'Engineering Fluid Mechanics', 'Special Number Theory', 'Military Thought and History', 'Psychiatry and Mental Health', 'Urban Planning and Design', 'Food Biochemistry', 'Geochemistry', 'Semiconductor Physics', 'Electrical Theory and New Technologies', 'Forensic Medicine', 'Genetics', 'Atmospheric Physics and Atmospheric Environment', 'Theory of Curriculum and Instruction', 'Medicinal Chemistry', 'Databases', 'Pediatrics', 'Road and Railway Engineering', 'Fine Arts', 'Fluid Physics', 'Vehicle Operation Engineering', 'Ecology', 'Psychology', 'Human Anatomy and Histology-Embryology', 'Power Electronics and Electrical Drives', 'Nursing and Rehabilitation Medicine', 'Geriatric Medicine', 'Numerical Analysis', 'Demography and Anthropology', 'Pathology and Pathophysiology', 'Ship Mechanics and Design Principles', 'Immunology', 'Hydrogeology', 'Applied Optics', 'Political Economy', 'Solid Mechanics', 'Special Education', 'Public Finance', 'Contract Law', 'Preschool Education', 'Thermodynamics and Statistical Physics', 'Fundamental Mathematics', 'Musical Forms and Analysis', 'Journalism and News Practice', 'Computational Mathematics', 'Law and Social Governance', 'Microelectronics and Solid-State Electronics', 'Physical Chemistry', 'Business and Accounting Management', 'Political Science', 'Legal Theory and Legal History', 'Signal and Information Processing', 'Engineering Thermophysics', 'Instrument Science and Technology', 'Clinical Laboratory Diagnostics', 'Aeronautical and Astronautical Science and Technology', 'International Trade', 'Forest Engineering', 'Environmental and Resource Protection', 'Polymer Physics', 'Stochastic Processes', 'Cryptography', 'Modern and Contemporary Chinese Literature', 'Structural Engineering', 'Traditional Chinese Health Preservation', 'Formal Languages', 'Atomic and Molecular Physics', 'Pitch and Scales', 'Iron and Steel Metallurgy', 'Mineral Processing Engineering', 'Computer Architecture', 'Electromagnetic Field and Microwave Technology', 'Radiation Protection and Nuclear Technology Applications', 'Physiology', 'Polynomials and Series Expansions', 'Optical Fiber Communication', 'Circuits and Systems', 'Principles of Computer Organization', 'Mineralogy, Petrology, and Economic Geology', 'Theoretical Fluid Mechanics', 'Zoology', 'Dermatology and Venereology', 'Sports Science and Medicine', 'Imaging and Nuclear Medicine', 'Physical Oceanography', 'Environmental Engineering', 'Power Systems and Automation', 'Social Medicine and Health Management', 'Communication and Information Systems', 'Broadcasting and Television Art', 'Nutrition and Food Hygiene', 'Industrial Economics', 'Epidemiology and Health Statistics', 'Group Theory', 'Dynamic Meteorology', 'Human Geography', 'Computer Networks', 'Finance', 'Civil and Commercial Law', 'Ordinary Differential Equations', 'Solar System Science', 'Geodesy and Surveying Engineering', 'Radiochemistry', 'National and Defense Economics', 'Philosophical Aesthetics', 'Elements of Chemical Reaction Engineering', 'Obstetrics and Gynecology', 'Mass Transport and Separation Process in Chemical Engineering', 'Economic History', 'International Law', 'Polymer Chemistry and Physics', 'Digital Surveying and Remote Sensing Applications', 'Archaeology and Museology', 'Communication Principles', 'Nuclear Energy and Reactor Technology', 'Procedural Law', 'Geological Resources and Geological Engineering', 'Fuzzy Mathematics', 'Biophysics', 'Cell Biology', 'Literary Theory', 'Education Economics, Management and Social Security', 'Refrigeration and Cryogenic Engineering', 'Materials Physics and Chemistry', 'Thermal Energy Engineering', 'Historical Geography', 'Military Law', 'Anesthesiology', 'Functions of Complex Variables', 'Principles of Seismic Exploration', 'Oil and Gas Field Development and Storage & Transportation Engineering', 'Fluid Machinery and Engineering', 'Instrumentation and Performance', 'Biochemistry and Molecular Biology', 'Guidance, Navigation and Control', 'History and Theory of Journalism and Media Management', 'Neurology', 'Advanced Algebra', 'Internal Combustion Engineering', 'Religious Studies', 'Animal Nutrition and Feed Science', 'Military Command and Information Systems', 'Graph Theory', 'Wood Science and Technology', 'Advanced Programming Languages', 'Discrete Mathematics', 'Health Toxicology and Environmental Health', 'Linguistics and Applied Linguistics', 'Fundamentals of Dynamics and Control', 'Educational Technology and Principles', 'Theoretical Mechanics', 'Statistical Mechanics', 'Fluid Flow and Heat Transfer in Chemical Engineering', 'Analytical Chemistry', 'Film Studies', 'Operating Systems', 'Physical Education and Training', 'Manufacturing Automation', 'Probability and Statistics', 'Military Logistics and Equipment', 'Literary History', 'Crop Science', 'Ophthalmology', 'Botany', 'Information Management and Communication', 'Western Economics', 'Traditional Chinese Medicine Theory', 'Inorganic Chemistry', 'Non-ferrous Metallurgy', 'Internal Medicine', 'Control Theory and Control Engineering', 'Weapon Systems Science and Engineering', 'Landscape Plants and Ornamental Horticulture', 'Astronomical Observation and Technology', 'Composition', 'Electrochemistry', 'Cosmology', 'Architectural Design and Theory', 'Architectural History', 'Number Theory', 'Maternal, Child and Adolescent Health', 'Military Management', 'Operations Research and Cybernetics', 'Bridge and Tunnel Engineering', 'Social and Folklore Studies', 'Emergency Medicine', 'Optoelectronic Technology', 'Electrodynamics', 'Agricultural Environment and Soil-Water Engineering', 'High Voltage and Insulation Technology', 'Physical Chemistry of Metallurgical Process', 'Traffic Information Engineering and Control', 'Hydraulics and Hydrology', 'Food Processing and Storage Engineering', 'Cartography and Geographic Information Engineering', 'Chemical Transport Engineering', 'Animal Rearing and Breeding', 'Clinical Stomatology', 'Oncology', 'Paleontology and Stratigraphy', 'Forest Cultivation and Genetic Breeding', 'Relativity', 'Logic', 'Mechatronic Engineering', 'Geotechnical Engineering', 'Principles of Metallurgy']
+```
+## Model Details
+- Base Model: `unsloth/gemma-3-4b-it`
+- Parameter Count: 4,300,079,472
+- Precision: torch.bfloat16
+## Hardware
+- GPU: NVIDIA RTX PRO 6000 Blackwell Server Edition
+- Announced: Mar 17th, 2025
+- Release Date: Mar 18th, 2025
+- Memory Type: GDDR7
+- Bandwidth: 1.79 TB/s
+- Memory Size: 96 GB
+- Memory Bus: 512 bit
+- Shading Units: 24064
+- TDP: 600W
+## Training Settings
+### PEFT
+- Rank: 32
+- LoRA alpha: 64
+- Modules: q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj
+- Gradient checkpointing: unsloth
+### SFT
+- Epoch: 2
+- Batch size: 32
+- Gradient Accumulation steps: 1
+- Warmup ratio: 0.05
+- Learning rate: 0.0002
+- Optimizer: adamw_torch_fused
+- Learning rate scheduler: cosine
+## Training stats
+- Date: 2026-03-25T15:56:02.967852
+- Peak VRAM usage: 35.006 GB
+- Global step: 1576
+- Training runtime (seconds): 1672.5656
+- Average training loss: 0.08625343859876473
+- Final validation loss: 0.05241519212722778
+## Framework versions
+- Unsloth: 2026.3.11
+- TRL: 0.22.2
+- Transformers: 4.56.2
+- Pytorch: 2.10.0+cu128
+- Datasets: 4.8.4
+- Tokenizers: 0.22.2
+## License
+This model is released under the Gemma license. See the [Gemma Terms of Use](https://ai.google.dev/gemma/terms) and [Prohibited Use Policy](https://policies.google.com/terms/generative-ai/use-policy) regarding the use of Gemma-generated content.

added_tokens.json ADDED Viewed

	@@ -0,0 +1,3 @@

+{
+  "<image_soft_token>": 262144
+}

chat_template.jinja ADDED Viewed

	@@ -0,0 +1,47 @@

+{{ bos_token }}
+{%- if messages[0]['role'] == 'system' -%}
+    {%- if messages[0]['content'] is string -%}
+        {%- set first_user_prefix = messages[0]['content'] + '
+' -%}
+    {%- else -%}
+        {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
+' -%}
+    {%- endif -%}
+    {%- set loop_messages = messages[1:] -%}
+{%- else -%}
+    {%- set first_user_prefix = "" -%}
+    {%- set loop_messages = messages -%}
+{%- endif -%}
+{%- for message in loop_messages -%}
+    {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
+        {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
+    {%- endif -%}
+    {%- if (message['role'] == 'assistant') -%}
+        {%- set role = "model" -%}
+    {%- else -%}
+        {%- set role = message['role'] -%}
+    {%- endif -%}
+    {{ '<start_of_turn>' + role + '
+' + (first_user_prefix if loop.first else "") }}
+    {%- if message['content'] is string -%}
+        {{ message['content'] | trim }}
+    {%- elif message['content'] is iterable -%}
+        {%- for item in message['content'] -%}
+            {%- if item['type'] == 'image' -%}
+                {{ '<start_of_image>' }}
+            {%- elif item['type'] == 'text' -%}
+                {{ item['text'] | trim }}
+            {%- endif -%}
+        {%- endfor -%}
+    {%- else -%}
+        {{ raise_exception("Invalid content type") }}
+    {%- endif -%}
+    {{ '<end_of_turn>
+' }}
+{%- endfor -%}
+{%- if add_generation_prompt -%}
+    {{'<start_of_turn>model
+'}}
+{%- endif -%}

config.json ADDED Viewed

	@@ -0,0 +1,98 @@

+{
+  "architectures": [
+    "Gemma3ForConditionalGeneration"
+  ],
+  "boi_token_index": 255999,
+  "bos_token_id": 2,
+  "dtype": "bfloat16",
+  "eoi_token_index": 256000,
+  "eos_token_id": 106,
+  "image_token_index": 262144,
+  "initializer_range": 0.02,
+  "mm_tokens_per_image": 256,
+  "model_type": "gemma3",
+  "pad_token_id": 0,
+  "text_config": {
+    "_sliding_window_pattern": 6,
+    "attention_bias": false,
+    "attention_dropout": 0.0,
+    "attn_logit_softcapping": null,
+    "cache_implementation": "hybrid",
+    "dtype": "bfloat16",
+    "final_logit_softcapping": null,
+    "head_dim": 256,
+    "hidden_activation": "gelu_pytorch_tanh",
+    "hidden_size": 2560,
+    "initializer_range": 0.02,
+    "intermediate_size": 10240,
+    "layer_types": [
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "full_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "full_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "full_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "full_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "full_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention",
+      "sliding_attention"
+    ],
+    "max_position_embeddings": 131072,
+    "model_type": "gemma3_text",
+    "num_attention_heads": 8,
+    "num_hidden_layers": 34,
+    "num_key_value_heads": 4,
+    "query_pre_attn_scalar": 256,
+    "rms_norm_eps": 1e-06,
+    "rope_local_base_freq": 10000.0,
+    "rope_scaling": {
+      "factor": 8.0,
+      "rope_type": "linear"
+    },
+    "rope_theta": 1000000.0,
+    "sliding_window": 1024,
+    "use_cache": true,
+    "vocab_size": 262208
+  },
+  "transformers_version": "4.56.2",
+  "unsloth_fixed": true,
+  "vision_config": {
+    "attention_dropout": 0.0,
+    "dtype": "bfloat16",
+    "hidden_act": "gelu_pytorch_tanh",
+    "hidden_size": 1152,
+    "image_size": 896,
+    "intermediate_size": 4304,
+    "layer_norm_eps": 1e-06,
+    "model_type": "siglip_vision_model",
+    "num_attention_heads": 16,
+    "num_channels": 3,
+    "num_hidden_layers": 27,
+    "patch_size": 14,
+    "vision_use_head": false
+  }
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,13 @@

+{
+  "bos_token_id": 2,
+  "cache_implementation": "hybrid",
+  "do_sample": true,
+  "eos_token_id": [
+    1,
+    106
+  ],
+  "pad_token_id": 0,
+  "top_k": 64,
+  "top_p": 0.95,
+  "transformers_version": "4.56.2"
+}

model-00001-of-00002.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0f555ffe788e9b089acaf4e16db0595bd35f1cb3885b262379269e006ee28125
+size 4961251752

model-00002-of-00002.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:511293d3b0b55aef936a7099bc3116f6499ecbb0d75fbfe7207a56b57c6727e8
+size 3639026128

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,891 @@

+{
+  "metadata": {
+    "total_parameters": 4300079472,
+    "total_size": 8600158944
+  },
+  "weight_map": {
+    "language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.14.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.norm.weight": "model-00002-of-00002.safetensors",
+    "multi_modal_projector.mm_input_projection_weight": "model-00001-of-00002.safetensors",
+    "multi_modal_projector.mm_soft_emb_norm.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.embeddings.patch_embedding.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.embeddings.patch_embedding.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.embeddings.position_embedding.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.layer_norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.layer_norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.layer_norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.layer_norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.out_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.encoder.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.post_layernorm.bias": "model-00001-of-00002.safetensors",
+    "vision_tower.vision_model.post_layernorm.weight": "model-00001-of-00002.safetensors"
+  }
+}

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "do_convert_rgb": null,
+  "do_normalize": true,
+  "do_pan_and_scan": null,
+  "do_rescale": true,
+  "do_resize": true,
+  "image_mean": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "image_processor_type": "Gemma3ImageProcessor",
+  "image_seq_length": 256,
+  "image_std": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "pan_and_scan_max_num_crops": null,
+  "pan_and_scan_min_crop_size": null,
+  "pan_and_scan_min_ratio_to_activate": null,
+  "processor_class": "Gemma3Processor",
+  "resample": 2,
+  "rescale_factor": 0.00392156862745098,
+  "size": {
+    "height": 896,
+    "width": 896
+  }
+}

processor_config.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+  "image_seq_length": 256,
+  "processor_class": "Gemma3Processor"
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,33 @@

+{
+  "boi_token": "<start_of_image>",
+  "bos_token": {
+    "content": "<bos>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eoi_token": "<end_of_image>",
+  "eos_token": {
+    "content": "<end_of_turn>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "image_token": "<image_soft_token>",
+  "pad_token": {
+    "content": "<pad>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4667f2089529e8e7657cfb6d1c19910ae71ff5f28aa7ab2ff2763330affad795
+size 33384568

tokenizer.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1299c11d7cf632ef3b4e11937501358ada021bbdf7c47638d13c0ee982f2e79c
+size 4689074

tokenizer_config.json ADDED Viewed

The diff for this file is too large to render. See raw diff

train/log.json ADDED Viewed

	@@ -0,0 +1,1190 @@

+[
+  {
+    "loss": 3.3788,
+    "grad_norm": 11.409194946289062,
+    "learning_rate": 2.278481012658228e-05,
+    "epoch": 0.012690355329949238,
+    "step": 10
+  },
+  {
+    "loss": 0.76,
+    "grad_norm": 1.4753071069717407,
+    "learning_rate": 4.810126582278481e-05,
+    "epoch": 0.025380710659898477,
+    "step": 20
+  },
+  {
+    "loss": 0.437,
+    "grad_norm": 1.1694813966751099,
+    "learning_rate": 7.341772151898734e-05,
+    "epoch": 0.03807106598984772,
+    "step": 30
+  },
+  {
+    "loss": 0.2975,
+    "grad_norm": 0.9560868740081787,
+    "learning_rate": 9.873417721518988e-05,
+    "epoch": 0.050761421319796954,
+    "step": 40
+  },
+  {
+    "loss": 0.2341,
+    "grad_norm": 0.8371515274047852,
+    "learning_rate": 0.0001240506329113924,
+    "epoch": 0.06345177664974619,
+    "step": 50
+  },
+  {
+    "loss": 0.1901,
+    "grad_norm": 0.8791212439537048,
+    "learning_rate": 0.00014936708860759494,
+    "epoch": 0.07614213197969544,
+    "step": 60
+  },
+  {
+    "loss": 0.1457,
+    "grad_norm": 0.9426490068435669,
+    "learning_rate": 0.00017468354430379748,
+    "epoch": 0.08883248730964467,
+    "step": 70
+  },
+  {
+    "loss": 0.1305,
+    "grad_norm": 0.5485464334487915,
+    "learning_rate": 0.0002,
+    "epoch": 0.10152284263959391,
+    "step": 80
+  },
+  {
+    "loss": 0.1335,
+    "grad_norm": 0.6622463464736938,
+    "learning_rate": 0.0001999779803602204,
+    "epoch": 0.11421319796954314,
+    "step": 90
+  },
+  {
+    "loss": 0.1158,
+    "grad_norm": 0.44890421628952026,
+    "learning_rate": 0.00019991193113817244,
+    "epoch": 0.12690355329949238,
+    "step": 100
+  },
+  {
+    "loss": 0.1163,
+    "grad_norm": 0.5725594758987427,
+    "learning_rate": 0.00019980188142145754,
+    "epoch": 0.13959390862944163,
+    "step": 110
+  },
+  {
+    "loss": 0.106,
+    "grad_norm": 0.5902673006057739,
+    "learning_rate": 0.00019964787967517817,
+    "epoch": 0.15228426395939088,
+    "step": 120
+  },
+  {
+    "loss": 0.1054,
+    "grad_norm": 0.6607155799865723,
+    "learning_rate": 0.00019944999372059388,
+    "epoch": 0.1649746192893401,
+    "step": 130
+  },
+  {
+    "loss": 0.101,
+    "grad_norm": 0.40398097038269043,
+    "learning_rate": 0.00019920831070525342,
+    "epoch": 0.17766497461928935,
+    "step": 140
+  },
+  {
+    "loss": 0.0988,
+    "grad_norm": 0.57403963804245,
+    "learning_rate": 0.00019892293706461555,
+    "epoch": 0.19035532994923857,
+    "step": 150
+  },
+  {
+    "eval_loss": 0.0935325026512146,
+    "eval_runtime": 32.4248,
+    "eval_samples_per_second": 40.925,
+    "eval_steps_per_second": 10.239,
+    "epoch": 0.19923857868020303,
+    "step": 157
+  },
+  {
+    "loss": 0.0941,
+    "grad_norm": 0.5301930904388428,
+    "learning_rate": 0.00019859399847517567,
+    "epoch": 0.20304568527918782,
+    "step": 160
+  },
+  {
+    "loss": 0.0936,
+    "grad_norm": 0.48598968982696533,
+    "learning_rate": 0.0001982216397991188,
+    "epoch": 0.21573604060913706,
+    "step": 170
+  },
+  {
+    "loss": 0.1023,
+    "grad_norm": 0.44767457246780396,
+    "learning_rate": 0.0001978060250205232,
+    "epoch": 0.22842639593908629,
+    "step": 180
+  },
+  {
+    "loss": 0.0851,
+    "grad_norm": 0.3273641765117645,
+    "learning_rate": 0.0001973473371731431,
+    "epoch": 0.24111675126903553,
+    "step": 190
+  },
+  {
+    "loss": 0.0868,
+    "grad_norm": 0.40555259585380554,
+    "learning_rate": 0.00019684577825980192,
+    "epoch": 0.25380710659898476,
+    "step": 200
+  },
+  {
+    "loss": 0.0826,
+    "grad_norm": 0.5541171431541443,
+    "learning_rate": 0.0001963015691634317,
+    "epoch": 0.26649746192893403,
+    "step": 210
+  },
+  {
+    "loss": 0.0887,
+    "grad_norm": 0.3640384376049042,
+    "learning_rate": 0.00019571494954979775,
+    "epoch": 0.27918781725888325,
+    "step": 220
+  },
+  {
+    "loss": 0.0819,
+    "grad_norm": 0.4321247935295105,
+    "learning_rate": 0.00019508617776195167,
+    "epoch": 0.2918781725888325,
+    "step": 230
+  },
+  {
+    "loss": 0.0894,
+    "grad_norm": 0.3743847608566284,
+    "learning_rate": 0.00019441553070645887,
+    "epoch": 0.30456852791878175,
+    "step": 240
+  },
+  {
+    "loss": 0.0837,
+    "grad_norm": 0.3770402669906616,
+    "learning_rate": 0.000193703303731451,
+    "epoch": 0.31725888324873097,
+    "step": 250
+  },
+  {
+    "loss": 0.0829,
+    "grad_norm": 0.4180334210395813,
+    "learning_rate": 0.00019294981049655668,
+    "epoch": 0.3299492385786802,
+    "step": 260
+  },
+  {
+    "loss": 0.0784,
+    "grad_norm": 0.3179164528846741,
+    "learning_rate": 0.0001921553828347681,
+    "epoch": 0.3426395939086294,
+    "step": 270
+  },
+  {
+    "loss": 0.0758,
+    "grad_norm": 0.5002890825271606,
+    "learning_rate": 0.00019132037060630409,
+    "epoch": 0.3553299492385787,
+    "step": 280
+  },
+  {
+    "loss": 0.0829,
+    "grad_norm": 0.3461087644100189,
+    "learning_rate": 0.00019044514154453434,
+    "epoch": 0.3680203045685279,
+    "step": 290
+  },
+  {
+    "loss": 0.0787,
+    "grad_norm": 0.2676425278186798,
+    "learning_rate": 0.0001895300810940321,
+    "epoch": 0.38071065989847713,
+    "step": 300
+  },
+  {
+    "loss": 0.0712,
+    "grad_norm": 0.33775171637535095,
+    "learning_rate": 0.00018857559224082736,
+    "epoch": 0.3934010152284264,
+    "step": 310
+  },
+  {
+    "eval_loss": 0.07326696813106537,
+    "eval_runtime": 17.094,
+    "eval_samples_per_second": 77.629,
+    "eval_steps_per_second": 19.422,
+    "epoch": 0.39847715736040606,
+    "step": 314
+  },
+  {
+    "loss": 0.0791,
+    "grad_norm": 0.3021381199359894,
+    "learning_rate": 0.00018758209533493444,
+    "epoch": 0.40609137055837563,
+    "step": 320
+  },
+  {
+    "loss": 0.082,
+    "grad_norm": 0.37692010402679443,
+    "learning_rate": 0.00018655002790523328,
+    "epoch": 0.41878172588832485,
+    "step": 330
+  },
+  {
+    "loss": 0.0719,
+    "grad_norm": 0.28366342186927795,
+    "learning_rate": 0.00018547984446678437,
+    "epoch": 0.43147208121827413,
+    "step": 340
+  },
+  {
+    "loss": 0.073,
+    "grad_norm": 0.34057196974754333,
+    "learning_rate": 0.000184372016320664,
+    "epoch": 0.44416243654822335,
+    "step": 350
+  },
+  {
+    "loss": 0.0752,
+    "grad_norm": 0.3880268931388855,
+    "learning_rate": 0.00018322703134640654,
+    "epoch": 0.45685279187817257,
+    "step": 360
+  },
+  {
+    "loss": 0.0745,
+    "grad_norm": 0.3266892731189728,
+    "learning_rate": 0.00018204539378714561,
+    "epoch": 0.46954314720812185,
+    "step": 370
+  },
+  {
+    "loss": 0.0751,
+    "grad_norm": 0.4629153907299042,
+    "learning_rate": 0.00018082762402754936,
+    "epoch": 0.48223350253807107,
+    "step": 380
+  },
+  {
+    "loss": 0.0718,
+    "grad_norm": 0.32173433899879456,
+    "learning_rate": 0.0001795742583646466,
+    "epoch": 0.4949238578680203,
+    "step": 390
+  },
+  {
+    "loss": 0.0762,
+    "grad_norm": 0.2171572744846344,
+    "learning_rate": 0.0001782858487716455,
+    "epoch": 0.5076142131979695,
+    "step": 400
+  },
+  {
+    "loss": 0.0637,
+    "grad_norm": 0.3717902898788452,
+    "learning_rate": 0.00017696296265484862,
+    "epoch": 0.5203045685279187,
+    "step": 410
+  },
+  {
+    "loss": 0.0718,
+    "grad_norm": 0.35921749472618103,
+    "learning_rate": 0.00017560618260377116,
+    "epoch": 0.5329949238578681,
+    "step": 420
+  },
+  {
+    "loss": 0.0835,
+    "grad_norm": 0.6837925314903259,
+    "learning_rate": 0.00017421610613457282,
+    "epoch": 0.5456852791878173,
+    "step": 430
+  },
+  {
+    "loss": 0.0681,
+    "grad_norm": 0.5953752398490906,
+    "learning_rate": 0.00017279334542691596,
+    "epoch": 0.5583756345177665,
+    "step": 440
+  },
+  {
+    "loss": 0.0687,
+    "grad_norm": 0.37138229608535767,
+    "learning_rate": 0.0001713385270543661,
+    "epoch": 0.5710659898477157,
+    "step": 450
+  },
+  {
+    "loss": 0.0727,
+    "grad_norm": 0.32516786456108093,
+    "learning_rate": 0.00016985229170845339,
+    "epoch": 0.583756345177665,
+    "step": 460
+  },
+  {
+    "loss": 0.0671,
+    "grad_norm": 0.243973508477211,
+    "learning_rate": 0.0001683352939165167,
+    "epoch": 0.5964467005076142,
+    "step": 470
+  },
+  {
+    "eval_loss": 0.06693769991397858,
+    "eval_runtime": 17.9821,
+    "eval_samples_per_second": 73.796,
+    "eval_steps_per_second": 18.463,
+    "epoch": 0.5977157360406091,
+    "step": 471
+  },
+  {
+    "loss": 0.0677,
+    "grad_norm": 0.31646955013275146,
+    "learning_rate": 0.00016678820175345454,
+    "epoch": 0.6091370558375635,
+    "step": 480
+  },
+  {
+    "loss": 0.0669,
+    "grad_norm": 0.2572177052497864,
+    "learning_rate": 0.00016521169654750968,
+    "epoch": 0.6218274111675127,
+    "step": 490
+  },
+  {
+    "loss": 0.0629,
+    "grad_norm": 0.3096120059490204,
+    "learning_rate": 0.00016360647258021696,
+    "epoch": 0.6345177664974619,
+    "step": 500
+  },
+  {
+    "loss": 0.067,
+    "grad_norm": 0.38500720262527466,
+    "learning_rate": 0.00016197323678064697,
+    "epoch": 0.6472081218274112,
+    "step": 510
+  },
+  {
+    "loss": 0.0658,
+    "grad_norm": 0.305655837059021,
+    "learning_rate": 0.00016031270841407926,
+    "epoch": 0.6598984771573604,
+    "step": 520
+  },
+  {
+    "loss": 0.0657,
+    "grad_norm": 0.28903284668922424,
+    "learning_rate": 0.00015862561876524338,
+    "epoch": 0.6725888324873096,
+    "step": 530
+  },
+  {
+    "loss": 0.0705,
+    "grad_norm": 0.2519144117832184,
+    "learning_rate": 0.0001569127108162662,
+    "epoch": 0.6852791878172588,
+    "step": 540
+  },
+  {
+    "loss": 0.066,
+    "grad_norm": 0.3753609359264374,
+    "learning_rate": 0.000155174738919468,
+    "epoch": 0.6979695431472082,
+    "step": 550
+  },
+  {
+    "loss": 0.0617,
+    "grad_norm": 0.2516622841358185,
+    "learning_rate": 0.00015341246846515096,
+    "epoch": 0.7106598984771574,
+    "step": 560
+  },
+  {
+    "loss": 0.0645,
+    "grad_norm": 0.2647131383419037,
+    "learning_rate": 0.0001516266755445271,
+    "epoch": 0.7233502538071066,
+    "step": 570
+  },
+  {
+    "loss": 0.0704,
+    "grad_norm": 0.2562578320503235,
+    "learning_rate": 0.00014981814660793314,
+    "epoch": 0.7360406091370558,
+    "step": 580
+  },
+  {
+    "loss": 0.0619,
+    "grad_norm": 0.28712114691734314,
+    "learning_rate": 0.0001479876781184833,
+    "epoch": 0.748730964467005,
+    "step": 590
+  },
+  {
+    "loss": 0.0667,
+    "grad_norm": 0.4318583309650421,
+    "learning_rate": 0.00014613607620131294,
+    "epoch": 0.7614213197969543,
+    "step": 600
+  },
+  {
+    "loss": 0.0656,
+    "grad_norm": 0.244648277759552,
+    "learning_rate": 0.00014426415628856663,
+    "epoch": 0.7741116751269036,
+    "step": 610
+  },
+  {
+    "loss": 0.0654,
+    "grad_norm": 0.2788916230201721,
+    "learning_rate": 0.0001423727427602879,
+    "epoch": 0.7868020304568528,
+    "step": 620
+  },
+  {
+    "eval_loss": 0.06398890167474747,
+    "eval_runtime": 16.9269,
+    "eval_samples_per_second": 78.396,
+    "eval_steps_per_second": 19.614,
+    "epoch": 0.7969543147208121,
+    "step": 628
+  },
+  {
+    "loss": 0.0639,
+    "grad_norm": 0.27084484696388245,
+    "learning_rate": 0.0001404626685813681,
+    "epoch": 0.799492385786802,
+    "step": 630
+  },
+  {
+    "loss": 0.0633,
+    "grad_norm": 0.22166591882705688,
+    "learning_rate": 0.00013853477493471468,
+    "epoch": 0.8121827411167513,
+    "step": 640
+  },
+  {
+    "loss": 0.0678,
+    "grad_norm": 0.3302247226238251,
+    "learning_rate": 0.00013658991085080025,
+    "epoch": 0.8248730964467005,
+    "step": 650
+  },
+  {
+    "loss": 0.0611,
+    "grad_norm": 0.20853881537914276,
+    "learning_rate": 0.0001346289328337558,
+    "epoch": 0.8375634517766497,
+    "step": 660
+  },
+  {
+    "loss": 0.069,
+    "grad_norm": 0.289602667093277,
+    "learning_rate": 0.00013265270448417234,
+    "epoch": 0.850253807106599,
+    "step": 670
+  },
+  {
+    "loss": 0.0684,
+    "grad_norm": 0.29847583174705505,
+    "learning_rate": 0.00013066209611877746,
+    "epoch": 0.8629441624365483,
+    "step": 680
+  },
+  {
+    "loss": 0.065,
+    "grad_norm": 0.2784641981124878,
+    "learning_rate": 0.00012865798438715413,
+    "epoch": 0.8756345177664975,
+    "step": 690
+  },
+  {
+    "loss": 0.0643,
+    "grad_norm": 0.3407055139541626,
+    "learning_rate": 0.00012664125188567056,
+    "epoch": 0.8883248730964467,
+    "step": 700
+  },
+  {
+    "loss": 0.0554,
+    "grad_norm": 0.26968127489089966,
+    "learning_rate": 0.00012461278676879098,
+    "epoch": 0.9010152284263959,
+    "step": 710
+  },
+  {
+    "loss": 0.0589,
+    "grad_norm": 0.33379510045051575,
+    "learning_rate": 0.00012257348235793897,
+    "epoch": 0.9137055837563451,
+    "step": 720
+  },
+  {
+    "loss": 0.0618,
+    "grad_norm": 0.31307724118232727,
+    "learning_rate": 0.00012052423674808513,
+    "epoch": 0.9263959390862944,
+    "step": 730
+  },
+  {
+    "loss": 0.0601,
+    "grad_norm": 0.25731247663497925,
+    "learning_rate": 0.00011846595241223247,
+    "epoch": 0.9390862944162437,
+    "step": 740
+  },
+  {
+    "loss": 0.0594,
+    "grad_norm": 0.2567406892776489,
+    "learning_rate": 0.00011639953580397367,
+    "epoch": 0.9517766497461929,
+    "step": 750
+  },
+  {
+    "loss": 0.0565,
+    "grad_norm": 0.23296868801116943,
+    "learning_rate": 0.00011432589695829576,
+    "epoch": 0.9644670050761421,
+    "step": 760
+  },
+  {
+    "loss": 0.0555,
+    "grad_norm": 0.3060038685798645,
+    "learning_rate": 0.00011224594909080704,
+    "epoch": 0.9771573604060914,
+    "step": 770
+  },
+  {
+    "loss": 0.0631,
+    "grad_norm": 0.2723999619483948,
+    "learning_rate": 0.00011016060819556353,
+    "epoch": 0.9898477157360406,
+    "step": 780
+  },
+  {
+    "eval_loss": 0.061291106045246124,
+    "eval_runtime": 17.1028,
+    "eval_samples_per_second": 77.59,
+    "eval_steps_per_second": 19.412,
+    "epoch": 0.9961928934010152,
+    "step": 785
+  },
+  {
+    "loss": 0.0534,
+    "grad_norm": 0.16064001619815826,
+    "learning_rate": 0.0001080707926416719,
+    "epoch": 1.00253807106599,
+    "step": 790
+  },
+  {
+    "loss": 0.0334,
+    "grad_norm": 0.20523902773857117,
+    "learning_rate": 0.00010597742276884614,
+    "epoch": 1.015228426395939,
+    "step": 800
+  },
+  {
+    "loss": 0.0427,
+    "grad_norm": 0.7354957461357117,
+    "learning_rate": 0.00010388142048209676,
+    "epoch": 1.0279187817258884,
+    "step": 810
+  },
+  {
+    "loss": 0.0439,
+    "grad_norm": 0.2577076554298401,
+    "learning_rate": 0.00010178370884573046,
+    "epoch": 1.0406091370558375,
+    "step": 820
+  },
+  {
+    "loss": 0.0409,
+    "grad_norm": 0.2265569120645523,
+    "learning_rate": 9.968521167683905e-05,
+    "epoch": 1.0532994923857868,
+    "step": 830
+  },
+  {
+    "loss": 0.0439,
+    "grad_norm": 0.2545527517795563,
+    "learning_rate": 9.758685313845727e-05,
+    "epoch": 1.0659898477157361,
+    "step": 840
+  },
+  {
+    "loss": 0.0383,
+    "grad_norm": 0.26610293984413147,
+    "learning_rate": 9.548955733256803e-05,
+    "epoch": 1.0786802030456852,
+    "step": 850
+  },
+  {
+    "loss": 0.0364,
+    "grad_norm": 0.21268419921398163,
+    "learning_rate": 9.339424789313445e-05,
+    "epoch": 1.0913705583756346,
+    "step": 860
+  },
+  {
+    "loss": 0.0372,
+    "grad_norm": 0.21041473746299744,
+    "learning_rate": 9.13018475793382e-05,
+    "epoch": 1.1040609137055837,
+    "step": 870
+  },
+  {
+    "loss": 0.0373,
+    "grad_norm": 0.26829078793525696,
+    "learning_rate": 8.921327786920294e-05,
+    "epoch": 1.116751269035533,
+    "step": 880
+  },
+  {
+    "loss": 0.0418,
+    "grad_norm": 0.204258531332016,
+    "learning_rate": 8.712945855378218e-05,
+    "epoch": 1.1294416243654823,
+    "step": 890
+  },
+  {
+    "loss": 0.0422,
+    "grad_norm": 0.2305600494146347,
+    "learning_rate": 8.505130733208968e-05,
+    "epoch": 1.1421319796954315,
+    "step": 900
+  },
+  {
+    "loss": 0.0357,
+    "grad_norm": 0.2596801817417145,
+    "learning_rate": 8.297973940695163e-05,
+    "epoch": 1.1548223350253808,
+    "step": 910
+  },
+  {
+    "loss": 0.038,
+    "grad_norm": 0.18188877403736115,
+    "learning_rate": 8.091566708195786e-05,
+    "epoch": 1.16751269035533,
+    "step": 920
+  },
+  {
+    "loss": 0.0455,
+    "grad_norm": 0.20983943343162537,
+    "learning_rate": 7.885999935968982e-05,
+    "epoch": 1.1802030456852792,
+    "step": 930
+  },
+  {
+    "loss": 0.0359,
+    "grad_norm": 0.2372911423444748,
+    "learning_rate": 7.681364154140264e-05,
+    "epoch": 1.1928934010152283,
+    "step": 940
+  },
+  {
+    "eval_loss": 0.059098243713378906,
+    "eval_runtime": 17.109,
+    "eval_samples_per_second": 77.562,
+    "eval_steps_per_second": 19.405,
+    "epoch": 1.1954314720812182,
+    "step": 942
+  },
+  {
+    "loss": 0.0428,
+    "grad_norm": 0.27543288469314575,
+    "learning_rate": 7.47774948283366e-05,
+    "epoch": 1.2055837563451777,
+    "step": 950
+  },
+  {
+    "loss": 0.0348,
+    "grad_norm": 0.18737110495567322,
+    "learning_rate": 7.275245592483492e-05,
+    "epoch": 1.218274111675127,
+    "step": 960
+  },
+  {
+    "loss": 0.0352,
+    "grad_norm": 0.2559361457824707,
+    "learning_rate": 7.073941664344152e-05,
+    "epoch": 1.2309644670050761,
+    "step": 970
+  },
+  {
+    "loss": 0.0388,
+    "grad_norm": 0.42670491337776184,
+    "learning_rate": 6.873926351215312e-05,
+    "epoch": 1.2436548223350254,
+    "step": 980
+  },
+  {
+    "loss": 0.0337,
+    "grad_norm": 0.2960188090801239,
+    "learning_rate": 6.67528773839989e-05,
+    "epoch": 1.2563451776649746,
+    "step": 990
+  },
+  {
+    "loss": 0.0365,
+    "grad_norm": 0.2986871600151062,
+    "learning_rate": 6.478113304911886e-05,
+    "epoch": 1.2690355329949239,
+    "step": 1000
+  },
+  {
+    "loss": 0.0297,
+    "grad_norm": 0.16937416791915894,
+    "learning_rate": 6.282489884951295e-05,
+    "epoch": 1.281725888324873,
+    "step": 1010
+  },
+  {
+    "loss": 0.0361,
+    "grad_norm": 0.2391590029001236,
+    "learning_rate": 6.0885036296629064e-05,
+    "epoch": 1.2944162436548223,
+    "step": 1020
+  },
+  {
+    "loss": 0.0412,
+    "grad_norm": 0.19176563620567322,
+    "learning_rate": 5.896239969195994e-05,
+    "epoch": 1.3071065989847717,
+    "step": 1030
+  },
+  {
+    "loss": 0.0365,
+    "grad_norm": 0.2965978682041168,
+    "learning_rate": 5.7057835750814867e-05,
+    "epoch": 1.3197969543147208,
+    "step": 1040
+  },
+  {
+    "loss": 0.0361,
+    "grad_norm": 0.21555063128471375,
+    "learning_rate": 5.517218322943224e-05,
+    "epoch": 1.33248730964467,
+    "step": 1050
+  },
+  {
+    "loss": 0.0413,
+    "grad_norm": 0.2262893170118332,
+    "learning_rate": 5.3306272555597504e-05,
+    "epoch": 1.3451776649746192,
+    "step": 1060
+  },
+  {
+    "loss": 0.0345,
+    "grad_norm": 0.2707303464412689,
+    "learning_rate": 5.1460925462928546e-05,
+    "epoch": 1.3578680203045685,
+    "step": 1070
+  },
+  {
+    "loss": 0.0362,
+    "grad_norm": 0.2957584261894226,
+    "learning_rate": 4.96369546289904e-05,
+    "epoch": 1.3705583756345177,
+    "step": 1080
+  },
+  {
+    "loss": 0.0363,
+    "grad_norm": 0.1866385042667389,
+    "learning_rate": 4.783516331739769e-05,
+    "epoch": 1.383248730964467,
+    "step": 1090
+  },
+  {
+    "eval_loss": 0.05531047657132149,
+    "eval_runtime": 16.959,
+    "eval_samples_per_second": 78.247,
+    "eval_steps_per_second": 19.577,
+    "epoch": 1.3946700507614214,
+    "step": 1099
+  },
+  {
+    "loss": 0.0319,
+    "grad_norm": 0.22268152236938477,
+    "learning_rate": 4.605634502406321e-05,
+    "epoch": 1.3959390862944163,
+    "step": 1100
+  },
+  {
+    "loss": 0.0342,
+    "grad_norm": 0.21278133988380432,
+    "learning_rate": 4.430128312774804e-05,
+    "epoch": 1.4086294416243654,
+    "step": 1110
+  },
+  {
+    "loss": 0.0322,
+    "grad_norm": 0.14760063588619232,
+    "learning_rate": 4.2570750545067076e-05,
+    "epoch": 1.4213197969543148,
+    "step": 1120
+  },
+  {
+    "loss": 0.0284,
+    "grad_norm": 0.3166739046573639,
+    "learning_rate": 4.086550939010227e-05,
+    "epoch": 1.434010152284264,
+    "step": 1130
+  },
+  {
+    "loss": 0.0356,
+    "grad_norm": 0.2010166049003601,
+    "learning_rate": 3.9186310638773047e-05,
+    "epoch": 1.4467005076142132,
+    "step": 1140
+  },
+  {
+    "loss": 0.0301,
+    "grad_norm": 0.19362220168113708,
+    "learning_rate": 3.753389379811185e-05,
+    "epoch": 1.4593908629441623,
+    "step": 1150
+  },
+  {
+    "loss": 0.0338,
+    "grad_norm": 0.28356972336769104,
+    "learning_rate": 3.590898658059062e-05,
+    "epoch": 1.4720812182741116,
+    "step": 1160
+  },
+  {
+    "loss": 0.0288,
+    "grad_norm": 0.17887428402900696,
+    "learning_rate": 3.4312304583641484e-05,
+    "epoch": 1.484771573604061,
+    "step": 1170
+  },
+  {
+    "loss": 0.0305,
+    "grad_norm": 0.2543535828590393,
+    "learning_rate": 3.274455097451269e-05,
+    "epoch": 1.49746192893401,
+    "step": 1180
+  },
+  {
+    "loss": 0.0328,
+    "grad_norm": 0.2981983423233032,
+    "learning_rate": 3.1206416180598995e-05,
+    "epoch": 1.5101522842639594,
+    "step": 1190
+  },
+  {
+    "loss": 0.0332,
+    "grad_norm": 0.1954859048128128,
+    "learning_rate": 2.9698577585382282e-05,
+    "epoch": 1.5228426395939088,
+    "step": 1200
+  },
+  {
+    "loss": 0.034,
+    "grad_norm": 0.23467101156711578,
+    "learning_rate": 2.8221699230116793e-05,
+    "epoch": 1.5355329949238579,
+    "step": 1210
+  },
+  {
+    "loss": 0.0341,
+    "grad_norm": 0.3478970527648926,
+    "learning_rate": 2.67764315213902e-05,
+    "epoch": 1.548223350253807,
+    "step": 1220
+  },
+  {
+    "loss": 0.0313,
+    "grad_norm": 0.33957111835479736,
+    "learning_rate": 2.536341094468906e-05,
+    "epoch": 1.5609137055837563,
+    "step": 1230
+  },
+  {
+    "loss": 0.0312,
+    "grad_norm": 0.24164177477359772,
+    "learning_rate": 2.398325978409539e-05,
+    "epoch": 1.5736040609137056,
+    "step": 1240
+  },
+  {
+    "loss": 0.0334,
+    "grad_norm": 0.28212329745292664,
+    "learning_rate": 2.263658584823717e-05,
+    "epoch": 1.5862944162436547,
+    "step": 1250
+  },
+  {
+    "eval_loss": 0.05466178432106972,
+    "eval_runtime": 17.0245,
+    "eval_samples_per_second": 77.946,
+    "eval_steps_per_second": 19.501,
+    "epoch": 1.5939086294416245,
+    "step": 1256
+  },
+  {
+    "loss": 0.0286,
+    "grad_norm": 0.2603524923324585,
+    "learning_rate": 2.1323982202613735e-05,
+    "epoch": 1.598984771573604,
+    "step": 1260
+  },
+  {
+    "loss": 0.0344,
+    "grad_norm": 0.33075234293937683,
+    "learning_rate": 2.004602690841414e-05,
+    "epoch": 1.6116751269035534,
+    "step": 1270
+  },
+  {
+    "loss": 0.0313,
+    "grad_norm": 0.24539555609226227,
+    "learning_rate": 1.8803282767942954e-05,
+    "epoch": 1.6243654822335025,
+    "step": 1280
+  },
+  {
+    "loss": 0.0327,
+    "grad_norm": 0.276190847158432,
+    "learning_rate": 1.7596297076766455e-05,
+    "epoch": 1.6370558375634516,
+    "step": 1290
+  },
+  {
+    "loss": 0.0326,
+    "grad_norm": 0.26667162775993347,
+    "learning_rate": 1.6425601382687405e-05,
+    "epoch": 1.649746192893401,
+    "step": 1300
+  },
+  {
+    "loss": 0.0288,
+    "grad_norm": 0.24897831678390503,
+    "learning_rate": 1.5291711251655316e-05,
+    "epoch": 1.6624365482233503,
+    "step": 1310
+  },
+  {
+    "loss": 0.0347,
+    "grad_norm": 0.2757590115070343,
+    "learning_rate": 1.41951260407149e-05,
+    "epoch": 1.6751269035532994,
+    "step": 1320
+  },
+  {
+    "loss": 0.0304,
+    "grad_norm": 0.23218406736850739,
+    "learning_rate": 1.3136328678092746e-05,
+    "epoch": 1.6878172588832487,
+    "step": 1330
+  },
+  {
+    "loss": 0.0291,
+    "grad_norm": 0.1902792751789093,
+    "learning_rate": 1.2115785450519434e-05,
+    "epoch": 1.700507614213198,
+    "step": 1340
+  },
+  {
+    "loss": 0.0303,
+    "grad_norm": 0.22204793989658356,
+    "learning_rate": 1.1133945797879908e-05,
+    "epoch": 1.7131979695431472,
+    "step": 1350
+  },
+  {
+    "loss": 0.0339,
+    "grad_norm": 0.2328779548406601,
+    "learning_rate": 1.019124211528365e-05,
+    "epoch": 1.7258883248730963,
+    "step": 1360
+  },
+  {
+    "loss": 0.0309,
+    "grad_norm": 0.25525137782096863,
+    "learning_rate": 9.288089562640844e-06,
+    "epoch": 1.7385786802030458,
+    "step": 1370
+  },
+  {
+    "loss": 0.0356,
+    "grad_norm": 0.3121234178543091,
+    "learning_rate": 8.42488588182897e-06,
+    "epoch": 1.751269035532995,
+    "step": 1380
+  },
+  {
+    "loss": 0.0284,
+    "grad_norm": 0.24005341529846191,
+    "learning_rate": 7.602011221530236e-06,
+    "epoch": 1.763959390862944,
+    "step": 1390
+  },
+  {
+    "loss": 0.0284,
+    "grad_norm": 0.24579517543315887,
+    "learning_rate": 6.819827969816661e-06,
+    "epoch": 1.7766497461928934,
+    "step": 1400
+  },
+  {
+    "loss": 0.0318,
+    "grad_norm": 0.23291173577308655,
+    "learning_rate": 6.078680594557163e-06,
+    "epoch": 1.7893401015228427,
+    "step": 1410
+  },
+  {
+    "eval_loss": 0.052495069801807404,
+    "eval_runtime": 17.066,
+    "eval_samples_per_second": 77.757,
+    "eval_steps_per_second": 19.454,
+    "epoch": 1.7931472081218274,
+    "step": 1413
+  },
+  {
+    "loss": 0.0295,
+    "grad_norm": 0.3046872019767761,
+    "learning_rate": 5.378895491716285e-06,
+    "epoch": 1.8020304568527918,
+    "step": 1420
+  },
+  {
+    "loss": 0.0282,
+    "grad_norm": 0.22185243666172028,
+    "learning_rate": 4.720780841611738e-06,
+    "epoch": 1.8147208121827412,
+    "step": 1430
+  },
+  {
+    "loss": 0.0312,
+    "grad_norm": 0.2577577829360962,
+    "learning_rate": 4.104626473194151e-06,
+    "epoch": 1.8274111675126905,
+    "step": 1440
+  },
+  {
+    "loss": 0.0304,
+    "grad_norm": 0.24247616529464722,
+    "learning_rate": 3.5307037364083253e-06,
+    "epoch": 1.8401015228426396,
+    "step": 1450
+  },
+  {
+    "loss": 0.032,
+    "grad_norm": 0.27149948477745056,
+    "learning_rate": 2.9992653826927508e-06,
+    "epoch": 1.8527918781725887,
+    "step": 1460
+  },
+  {
+    "loss": 0.0339,
+    "grad_norm": 0.2559165358543396,
+    "learning_rate": 2.510545453669744e-06,
+    "epoch": 1.865482233502538,
+    "step": 1470
+  },
+  {
+    "loss": 0.0332,
+    "grad_norm": 0.31764110922813416,
+    "learning_rate": 2.06475917807506e-06,
+    "epoch": 1.8781725888324874,
+    "step": 1480
+  },
+  {
+    "loss": 0.0353,
+    "grad_norm": 0.2759544551372528,
+    "learning_rate": 1.662102876972882e-06,
+    "epoch": 1.8908629441624365,
+    "step": 1490
+  },
+  {
+    "loss": 0.0305,
+    "grad_norm": 0.30483853816986084,
+    "learning_rate": 1.3027538772973026e-06,
+    "epoch": 1.9035532994923858,
+    "step": 1500
+  },
+  {
+    "loss": 0.0314,
+    "grad_norm": 0.37820833921432495,
+    "learning_rate": 9.868704337588797e-07,
+    "epoch": 1.9162436548223352,
+    "step": 1510
+  },
+  {
+    "loss": 0.0254,
+    "grad_norm": 0.21511152386665344,
+    "learning_rate": 7.145916591504098e-07,
+    "epoch": 1.9289340101522843,
+    "step": 1520
+  },
+  {
+    "loss": 0.0352,
+    "grad_norm": 0.3472900092601776,
+    "learning_rate": 4.860374630826004e-07,
+    "epoch": 1.9416243654822334,
+    "step": 1530
+  },
+  {
+    "loss": 0.0298,
+    "grad_norm": 0.2823030948638916,
+    "learning_rate": 3.0130849917681114e-07,
+    "epoch": 1.9543147208121827,
+    "step": 1540
+  },
+  {
+    "loss": 0.0271,
+    "grad_norm": 0.20223551988601685,
+    "learning_rate": 1.604861207378794e-07,
+    "epoch": 1.967005076142132,
+    "step": 1550
+  },
+  {
+    "loss": 0.0338,
+    "grad_norm": 0.42550113797187805,
+    "learning_rate": 6.363234492674507e-08,
+    "epoch": 1.9796954314720812,
+    "step": 1560
+  },
+  {
+    "loss": 0.0304,
+    "grad_norm": 0.266984760761261,
+    "learning_rate": 1.0789825448476177e-08,
+    "epoch": 1.9923857868020305,
+    "step": 1570
+  },
+  {
+    "eval_loss": 0.05241519212722778,
+    "eval_runtime": 17.0444,
+    "eval_samples_per_second": 77.855,
+    "eval_steps_per_second": 19.479,
+    "epoch": 1.9923857868020305,
+    "step": 1570
+  },
+  {
+    "train_runtime": 1672.5656,
+    "train_samples_per_second": 30.136,
+    "train_steps_per_second": 0.942,
+    "total_flos": 3.237522241264963e+17,
+    "train_loss": 0.08625343859876473,
+    "epoch": 2.0,
+    "step": 1576
+  }
+]

train/training_loss.png ADDED Viewed

train/validation_loss.png ADDED Viewed