Upload 8 files

Browse files

Files changed (8) hide show

README.md +128 -3
config.json +39 -0
generation_config.json +6 -0
gitattributes +35 -0
model.safetensors +3 -0
special_tokens_map.json +34 -0
tokenizer.json +0 -0
tokenizer_config.json +0 -0

README.md CHANGED Viewed

@@ -1,3 +1,128 @@
----
-license: apache-2.0
----

+---
+library_name: transformers
+tags:
+- bitnet
+- falcon3
+base_model: tiiuae/Falcon3-3B-Base
+---
+![image/png](https://cdn-uploads.huggingface.co/production/uploads/62441d1d9fdefb55a0b7d12c/c-tosr0FvMlKuKQTojx_6.png)
+#  Table of Contents
+0. [TL;DR](#TL;DR)
+1. [Model Details](#model-details)
+2. [Training Details](#training-details)
+3. [Usage](#usage)
+4. [Evaluation](#evaluation)
+5. [Citation](#citation)
+# TL;DR
+# Model Details
+## Model Description
+- **Developed by:** [https://www.tii.ae](https://www.tii.ae)
+- **Model type:** Causal decoder-only
+- **Architecture:** Pure-transformer - 1.58bit version
+- **Language(s) (NLP):** Mainly English
+- **License:** TII Falcon License 2.0
+# Training details
+The model has been trained following the training strategies from the recent [1-bit LLM HF blogpost](https://huggingface.co/blog/1_58_llm_extreme_quantization) and [1-bit LLM paper](https://huggingface.co/papers/2402.17764).
+For more details about the training protocol of this model, please refer to the Falcon-3 technical report, section *Compression*.
+# Usage
+Currently to use this model you can either rely on Hugging Face transformers library or [BitNet](https://github.com/microsoft/BitNet) library. You can also play with the model using the [falcon-1.58bit playground](https://huggingface.co/spaces/tiiuae/falcon3-1.58bit-playground) (only for the 7B instruct version).
+## 🤗 transformers
+```python
+import torch
+from transformers import AutoModelForCausalLM, AutoTokenizer
+model_id = "tiiuae/Falcon3-3B-Base-1.58bit"
+model = AutoModelForCausalLM.from_pretrained(
+  model_id,
+  torch_dtype=torch.bfloat16,
+).to("cuda")
+# Perform text generation
+```
+## BitNet
+```
+git clone https://github.com/microsoft/BitNet && cd BitNet
+pip install -r requirements.txt
+python setup_env.py --hf-repo tiiuae/Falcon3-3B-Base-1.58bit -q i2_s
+python run_inference.py -m models/Falcon3-3B-Base-1.58bit/ggml-model-i2_s.gguf -p "Hi how are you doing today?" -cnv
+```
+# Evaluation
+We report in the following table our internal pipeline benchmarks:
+**Note evaluation results are normalized score from v2 leaderboard tasks - reported results of original models in the blogpost are raw scores**
+<table border="1" style="width: 100%; text-align: center; border-collapse: collapse;">
+    <colgroup>
+        <col style="width: 10%;">
+        <col style="width: 10%;">
+        <col style="background-color: rgba(80, 15, 213, 0.5); width: 7%;">
+    </colgroup>
+    <thead>
+        <tr>
+            <th>Benchmark</th>
+            <th>Llama3-8B-1.58-100B-tokens</th>
+            <th>Falcon3-3B-Instruct-1.58bit </th>
+        </tr>
+    </thead>
+    <tbody>
+        <tr>
+            <td>IFEval</td>
+            <td>17.91</td>
+            <td><b>27.49</b></td>
+        </tr>
+        <tr>
+            <td>MUSR</td>
+            <td><b>4.87</b></td>
+            <td>4.64</td>
+        </tr>
+        <tr>
+            <td>GPQA</td>
+            <td><b>1.83<b></td>
+            <td>0.00</td>
+        </tr>
+        <tr>
+            <td>BBH</td>
+            <td>5.36</td>
+            <td><b>2.97</b></td>
+        </tr>
+        <tr>
+            <td>MMLU-PRO</td>
+            <td><b>2.78<b></td>
+            <td><b>1.47</b></td>
+        </tr>
+        <tr>
+            <td>MATH</td>
+            <td>0.26</td>
+            <td><b>0.43</b></td>
+        </tr>
+        <tr>
+            <td>Average</td>
+            <td>5.5</td>
+            <td><b>6.17</b></td>
+        </tr>
+    </tbody>
+</table>
+# Citation
+Coming soon ..

config.json ADDED Viewed

	@@ -0,0 +1,39 @@

+{
+  "_name_or_path": "/home/ubuntu/hang/Checkpoints/Falcon3-3B-BITNET-FT-16BT/hf_bitnet",
+  "activation": "swiglu",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 11,
+  "eos_token_id": 11,
+  "head_dim": 256,
+  "hidden_act": "silu",
+  "hidden_size": 3072,
+  "initializer_range": 0.02,
+  "intermediate_size": 9216,
+  "is_bitnet_config": true,
+  "max_position_embeddings": 4096,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 12,
+  "num_hidden_layers": 22,
+  "num_key_value_heads": 4,
+  "parallel_attn": false,
+  "pretraining_tp": 1,
+  "quantization_config": {
+    "modules_to_not_convert": [
+      "lm_head"
+    ],
+    "quant_method": "bitnet"
+  },
+  "rms_norm_eps": 1e-06,
+  "rope_scaling": null,
+  "rope_theta": 1000042,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.46.0.dev0",
+  "use_cache": true,
+  "vocab_size": 131072
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,6 @@

+{
+  "_from_model_config": true,
+  "bos_token_id": 11,
+  "eos_token_id": 11,
+  "transformers_version": "4.46.0.dev0"
+}

gitattributes ADDED Viewed

	@@ -0,0 +1,35 @@

+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:567abdc18e43f0d68d103b170e91b51d09597481cf7691e59e55f430a2ac76d7
+size 2216482556

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,34 @@

+{
+  "additional_special_tokens": [
+    ">>TITLE<<",
+    ">>ABSTRACT<<",
+    ">>INTRODUCTION<<",
+    ">>SUMMARY<<",
+    ">>COMMENT<<",
+    ">>ANSWER<<",
+    ">>QUESTION<<",
+    ">>DOMAIN<<",
+    ">>EMAIL_ADDRESS<<",
+    ">>IP_ADDRESS<<",
+    "<|startoftext|>",
+    ">>IP_ADDRESS_0<<",
+    ">>IP_ADDRESS_1<<",
+    ">>IP_ADDRESS_2<<",
+    ">>IP_ADDRESS_3<<",
+    ">>IP_ADDRESS_4<<",
+    ">>IP_ADDRESS_5<<",
+    ">>IP_ADDRESS_6<<",
+    ">>IP_ADDRESS_7<<",
+    ">>IP_ADDRESS_8<<",
+    ">>IP_ADDRESS_9<<",
+    ">>PASSWORD<<",
+    ">>KEY<<"
+  ],
+  "eos_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

The diff for this file is too large to render. See raw diff