Text Generation
Safetensors
PyTorch
English
llama
Dalek70 commited on
Commit
34bff37
·
verified ·
1 Parent(s): 33c0762

Upload 5 files

Browse files
Files changed (5) hide show
  1. README.md +50 -0
  2. config.json +32 -0
  3. generation_config.json +10 -0
  4. tokenizer.json +0 -0
  5. tokenizer_config.json +12 -0
README.md CHANGED
@@ -1,3 +1,53 @@
1
  ---
2
  license: apache-2.0
 
 
 
 
 
 
 
3
  ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  ---
2
  license: apache-2.0
3
+ tags:
4
+ - llama
5
+ - text-generation
6
+ - pytorch
7
+ language:
8
+ - en
9
+ pipeline_tag: text-generation
10
  ---
11
+
12
+ # Vertex 0.1 (10M)
13
+
14
+ Small LLaMA-architecture causal language model, ~10.9M parameters.
15
+
16
+ ## Model Details
17
+
18
+ - **Architecture:** LlamaForCausalLM
19
+ - **Parameters:** ~10.9M
20
+ - **Hidden size:** 256
21
+ - **Layers:** 4
22
+ - **Attention heads:** 4 (2 KV heads, GQA)
23
+ - **Head dim:** 64
24
+ - **Intermediate size:** 640
25
+ - **Max position embeddings:** 1024
26
+ - **Vocab size:** 32000
27
+ - **Dtype:** float32
28
+
29
+ ## Training
30
+
31
+ - **Epochs:** 3
32
+ - **Global steps:** 3207
33
+ - **Batch size:** 8
34
+ - **Estimated tokens seen:** ~26M total (~8.8M tokens/epoch) — estimated from batch size × seq len × steps; not logged exactly by the trainer.
35
+ - **Training time:** ~1 Hour
36
+ - **Hardware:** M5 Pro 24gb Macbook
37
+
38
+ ## Usage
39
+
40
+ ```python
41
+ from transformers import AutoModelForCausalLM, AutoTokenizer
42
+
43
+ model = AutoModelForCausalLM.from_pretrained("path/or/repo-id")
44
+ tokenizer = AutoTokenizer.from_pretrained("path/or/repo-id")
45
+
46
+ inputs = tokenizer("Once upon a time", return_tensors="pt")
47
+ outputs = model.generate(**inputs, max_new_tokens=50)
48
+ print(tokenizer.decode(outputs[0], skip_special_tokens=True))
49
+ ```
50
+
51
+ ## Limitations
52
+
53
+ This is a very small model (~10.9M params) trained on a small dataset. Expect limited coherence, knowledge, and generalization compared to larger models. Intended for experimentation, education, and low-resource testing, not production use.
config.json ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 0,
8
+ "dtype": "float32",
9
+ "eos_token_id": 2,
10
+ "head_dim": 64,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 256,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 640,
15
+ "max_position_embeddings": 1024,
16
+ "mlp_bias": false,
17
+ "model_type": "llama",
18
+ "num_attention_heads": 4,
19
+ "num_hidden_layers": 4,
20
+ "num_key_value_heads": 2,
21
+ "pad_token_id": 1,
22
+ "pretraining_tp": 1,
23
+ "rms_norm_eps": 1e-06,
24
+ "rope_parameters": {
25
+ "rope_theta": 10000.0,
26
+ "rope_type": "default"
27
+ },
28
+ "tie_word_embeddings": true,
29
+ "transformers_version": "5.14.1",
30
+ "use_cache": false,
31
+ "vocab_size": 32000
32
+ }
generation_config.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 0,
4
+ "eos_token_id": 2,
5
+ "output_attentions": false,
6
+ "output_hidden_states": false,
7
+ "pad_token_id": 1,
8
+ "transformers_version": "5.14.1",
9
+ "use_cache": false
10
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "<s>",
4
+ "clean_up_tokenization_spaces": false,
5
+ "eos_token": "</s>",
6
+ "is_local": false,
7
+ "local_files_only": false,
8
+ "model_max_length": 5120,
9
+ "pad_token": "<pad>",
10
+ "tokenizer_class": "TokenizersBackend",
11
+ "unk_token": "<unk>"
12
+ }