FlameF0X commited on
Commit
674f2b6
·
verified ·
1 Parent(s): 7bc64f0

Upload folder using huggingface_hub

Browse files
README.md ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language: en
3
+ license: apache-2.0
4
+ tags:
5
+ - fwkv
6
+ - rosa
7
+ ---
8
+ # FWKV-56M + ROSA (chat)
9
+ Factorised tied weights, vectorized decayed-accumulator recurrence, RWKV-8 ROSA copy signal, chat-tuned on HuggingFaceH4/ultrachat_200k.
10
+ **Best val perplexity:** 67.78
config.json ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "accum_steps": 4,
3
+ "architectures": [
4
+ "FWKVLanguageModel"
5
+ ],
6
+ "batch_size": 8,
7
+ "ce_chunk": 512,
8
+ "d_emb": 128,
9
+ "d_model": 512,
10
+ "dataset_name": "HuggingFaceH4/ultrachat_200k",
11
+ "dtype": "float32",
12
+ "epochs": 2,
13
+ "ffn_mult": 4,
14
+ "grad_clip": 1.0,
15
+ "lr": 0.0003,
16
+ "max_train_examples": 20000,
17
+ "max_val_examples": 1000,
18
+ "model_type": "fwkv",
19
+ "n_layers": 14,
20
+ "seq_len": 1024,
21
+ "tie_word_embeddings": true,
22
+ "train_split": "train_sft",
23
+ "transformers_version": "5.0.0",
24
+ "val_split": "test_sft",
25
+ "vocab_size": 50259,
26
+ "wkv_floor": 0.1
27
+ }
generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "do_sample": true,
3
+ "eos_token_id": 50256,
4
+ "max_new_tokens": 150,
5
+ "pad_token_id": 50256,
6
+ "temperature": 0.8,
7
+ "top_k": 50,
8
+ "transformers_version": "5.0.0"
9
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6e8f6d2311298ada78470bf6054e0ba9046ebfb4b9bf0ad61b4b0de9eaeebaee
3
+ size 228050840
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "extra_special_tokens": [
8
+ "<|user|>",
9
+ "<|assistant|>"
10
+ ],
11
+ "is_local": false,
12
+ "model_max_length": 1024,
13
+ "pad_token": "<|endoftext|>",
14
+ "tokenizer_class": "GPT2Tokenizer",
15
+ "unk_token": "<|endoftext|>"
16
+ }