DalusX64 commited on
Commit
e5c2e7f
·
verified ·
1 Parent(s): a01a0b8

Upload 5 files

Browse files
Files changed (5) hide show
  1. config.json +14 -0
  2. metadata.json +31 -0
  3. model.pt +3 -0
  4. tokenizer.json +0 -0
  5. tokenizer_info.json +9 -0
config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "vocab_size": 24576,
3
+ "d_model": 512,
4
+ "d_state": 256,
5
+ "num_scales": 4,
6
+ "scale_min": 32,
7
+ "scale_factor": 4,
8
+ "rope_base": 10000.0,
9
+ "dropout": 0.05,
10
+ "use_input_gate": true,
11
+ "tie_embeddings": false,
12
+ "mlp_hidden": 2048,
13
+ "max_seq_len": 4096
14
+ }
metadata.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "dataset": "HuggingFaceFW/fineweb-edu (sample-10BT)",
3
+ "num_samples": 200000,
4
+ "epochs": 1,
5
+ "total_opt_steps": 3246,
6
+ "final_loss": 4.929484256505966,
7
+ "eval_loss": 4.898339782714844,
8
+ "perplexity": 134.0670144420039,
9
+ "batch_size": 4,
10
+ "grad_accum": 8,
11
+ "effective_batch": 32,
12
+ "max_seq_len": 2048,
13
+ "lr_max": 0.0005,
14
+ "lr_min": 5e-05,
15
+ "warmup_steps": 100,
16
+ "tokenizer": "BPE-24576-FineWeb",
17
+ "vocab_size": 24576,
18
+ "num_params": 66878464,
19
+ "d_model": 512,
20
+ "d_state": 256,
21
+ "num_scales": 4,
22
+ "scale_lengths": [
23
+ 32,
24
+ 128,
25
+ 512,
26
+ 2048
27
+ ],
28
+ "mlp_hidden": 2048,
29
+ "training_mode": "causal_lm_packing_fp16_grad_accum",
30
+ "training_time_s": 5868.622669219971
31
+ }
model.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0b76176b55e9dba0d7866cb35b768e259ba5430f7ebdead2b04ac60702251a63
3
+ size 267525795
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_info.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "type": "Byte-Level BPE",
3
+ "vocab_size": 24576,
4
+ "pad_id": 0,
5
+ "bos_id": 2,
6
+ "eos_id": 3,
7
+ "max_seq_len": 2048,
8
+ "trained_on": "FineWeb-Edu 60,000 muestras"
9
+ }