priyaganesh2050 commited on
Commit
74ca936
·
verified ·
1 Parent(s): 8773712

Mirror of prajjwal1/bert-tiny with attribution and usage docs

Browse files
Files changed (5) hide show
  1. .gitattributes +5 -32
  2. README.md +80 -0
  3. config.json +1 -0
  4. pytorch_model.bin +3 -0
  5. vocab.txt +0 -0
.gitattributes CHANGED
@@ -1,35 +1,8 @@
1
- *.7z filter=lfs diff=lfs merge=lfs -text
2
- *.arrow filter=lfs diff=lfs merge=lfs -text
3
  *.bin filter=lfs diff=lfs merge=lfs -text
4
- *.bz2 filter=lfs diff=lfs merge=lfs -text
5
- *.ckpt filter=lfs diff=lfs merge=lfs -text
6
- *.ftz filter=lfs diff=lfs merge=lfs -text
7
- *.gz filter=lfs diff=lfs merge=lfs -text
8
  *.h5 filter=lfs diff=lfs merge=lfs -text
9
- *.joblib filter=lfs diff=lfs merge=lfs -text
10
- *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
- *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
- *.model filter=lfs diff=lfs merge=lfs -text
13
- *.msgpack filter=lfs diff=lfs merge=lfs -text
14
- *.npy filter=lfs diff=lfs merge=lfs -text
15
- *.npz filter=lfs diff=lfs merge=lfs -text
16
- *.onnx filter=lfs diff=lfs merge=lfs -text
17
- *.ot filter=lfs diff=lfs merge=lfs -text
18
- *.parquet filter=lfs diff=lfs merge=lfs -text
19
- *.pb filter=lfs diff=lfs merge=lfs -text
20
- *.pickle filter=lfs diff=lfs merge=lfs -text
21
- *.pkl filter=lfs diff=lfs merge=lfs -text
22
- *.pt filter=lfs diff=lfs merge=lfs -text
23
- *.pth filter=lfs diff=lfs merge=lfs -text
24
- *.rar filter=lfs diff=lfs merge=lfs -text
25
- *.safetensors filter=lfs diff=lfs merge=lfs -text
26
- saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
- *.tar.* filter=lfs diff=lfs merge=lfs -text
28
- *.tar filter=lfs diff=lfs merge=lfs -text
29
  *.tflite filter=lfs diff=lfs merge=lfs -text
30
- *.tgz filter=lfs diff=lfs merge=lfs -text
31
- *.wasm filter=lfs diff=lfs merge=lfs -text
32
- *.xz filter=lfs diff=lfs merge=lfs -text
33
- *.zip filter=lfs diff=lfs merge=lfs -text
34
- *.zst filter=lfs diff=lfs merge=lfs -text
35
- *tfevents* filter=lfs diff=lfs merge=lfs -text
 
1
+ *.bin.* filter=lfs diff=lfs merge=lfs -text
2
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
3
  *.bin filter=lfs diff=lfs merge=lfs -text
 
 
 
 
4
  *.h5 filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
5
  *.tflite filter=lfs diff=lfs merge=lfs -text
6
+ *.tar.gz filter=lfs diff=lfs merge=lfs -text
7
+ *.ot filter=lfs diff=lfs merge=lfs -text
8
+ *.onnx filter=lfs diff=lfs merge=lfs -text
 
 
 
README.md ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ library_name: transformers
4
+ pipeline_tag: fill-mask
5
+ base_model: prajjwal1/bert-tiny
6
+ language:
7
+ - en
8
+ tags:
9
+ - bert
10
+ - tiny
11
+ - lightweight
12
+ - edge
13
+ - cpu
14
+ - text-embedding
15
+ ---
16
+
17
+ # bert-tiny (mirror)
18
+
19
+ A 2-layer, 128-hidden BERT — about **4.4M parameters / 17 MB**. Small enough to fine-tune on a
20
+ laptop CPU in minutes, which makes it the go-to model for smoke tests, CI pipelines, unit tests
21
+ for training code, and edge deployment.
22
+
23
+ > [!NOTE]
24
+ > **This is a mirror.** The weights and tokenizer files here are an unmodified copy of
25
+ > [`prajjwal1/bert-tiny`](https://huggingface.co/prajjwal1/bert-tiny), re-hosted on this profile for reproducibility and
26
+ > convenience. All credit for the original work belongs to its authors. The upstream license
27
+ > (`mit`) is preserved and applies to this copy. If you need the canonical version, please
28
+ > use the upstream repository.
29
+
30
+ ## Specs
31
+
32
+ | | |
33
+ |---|---|
34
+ | Layers | 2 |
35
+ | Hidden size | 128 |
36
+ | Attention heads | 2 |
37
+ | Parameters | ~4.4M |
38
+ | Vocab | 30,522 (uncased WordPiece) |
39
+ | Disk | ~17 MB |
40
+
41
+ ## Usage
42
+
43
+ ```python
44
+ from transformers import AutoTokenizer, AutoModel
45
+
46
+ tok = AutoTokenizer.from_pretrained("priyaganesh2050/bert-tiny")
47
+ model = AutoModel.from_pretrained("priyaganesh2050/bert-tiny")
48
+
49
+ out = model(**tok("A tiny BERT for fast experiments.", return_tensors="pt"))
50
+ print(out.last_hidden_state.shape) # torch.Size([1, 9, 128])
51
+ ```
52
+
53
+ Fine-tuning for classification:
54
+
55
+ ```python
56
+ from transformers import AutoModelForSequenceClassification
57
+
58
+ model = AutoModelForSequenceClassification.from_pretrained("priyaganesh2050/bert-tiny", num_labels=2)
59
+ ```
60
+
61
+ ## When to use this
62
+
63
+ - **Good for:** CI/CD tests of training loops, hyperparameter search, teaching, edge/mobile,
64
+ latency-critical baselines.
65
+ - **Not good for:** accuracy-sensitive production NLP. A 2-layer model gives up a lot of quality
66
+ versus `bert-base`. Use it as a baseline, then scale up.
67
+
68
+ ## Citation
69
+
70
+ The tiny BERT variants come from the well-read-students line of work:
71
+
72
+ ```bibtex
73
+ @misc{turc2019,
74
+ title = {Well-Read Students Learn Better: On the Importance of Pre-training Compact Models},
75
+ author = {Turc, Iulia and Chang, Ming-Wei and Lee, Kenton and Toutanova, Kristina},
76
+ year = {2019},
77
+ eprint = {1908.08962},
78
+ archivePrefix = {arXiv}
79
+ }
80
+ ```
config.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"hidden_size": 128, "hidden_act": "gelu", "initializer_range": 0.02, "vocab_size": 30522, "hidden_dropout_prob": 0.1, "num_attention_heads": 2, "type_vocab_size": 2, "max_position_embeddings": 512, "num_hidden_layers": 2, "intermediate_size": 512, "attention_probs_dropout_prob": 0.1}
pytorch_model.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dab2c2bddcfb48ea430ef63fd76d46d67d704487844d967256a50dd7d7fd0a66
3
+ size 17756393
vocab.txt ADDED
The diff for this file is too large to render. See raw diff