Bc-AI commited on
Commit
91bef21
·
1 Parent(s): 13ed2cd

checkpoint step=19638 val_loss=2.6220

Browse files
checkpoints/step_00019638/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7d7dc0678e80370bbf19a42566bdfbfb5dcf9f3258a3f3a6a209baa39ff590c7
3
+ size 20672645408
checkpoints/step_00019638/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b6a1ff5c563bcedbe904148afb89c0e0cfddba4e256dbbe221860a7437a68874
3
+ size 20579166227
checkpoints/step_00019638/training_meta.json ADDED
@@ -0,0 +1,48 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 19638,
3
+ "epoch": 0,
4
+ "total_tokens": 1286995968,
5
+ "val_loss": 2.6220367693901063,
6
+ "config": {
7
+ "vocab_size": 50304,
8
+ "d_model": 4096,
9
+ "n_layers": 56,
10
+ "n_heads": 32,
11
+ "n_kv_heads": 8,
12
+ "max_len": 2048,
13
+ "rope_theta": 5000000.0,
14
+ "ffn_hidden": 11008,
15
+ "use_moe": false,
16
+ "moe_experts": 8,
17
+ "moe_top_k": 2,
18
+ "moe_shared": 1,
19
+ "moe_hidden": 1408,
20
+ "moe_every": 4,
21
+ "moe_bias_speed": 0.001,
22
+ "use_qk_norm": true,
23
+ "use_structural_bias": true,
24
+ "n_struct_rel": 4,
25
+ "use_fim": true,
26
+ "fim_rate": 0.5,
27
+ "fim_pre_id": 50269,
28
+ "fim_suf_id": 50270,
29
+ "fim_mid_id": 50271,
30
+ "grad_checkpointing": true,
31
+ "lr": 0.0001,
32
+ "min_lr": 1e-05,
33
+ "weight_decay": 0.1,
34
+ "beta1": 0.9,
35
+ "beta2": 0.95,
36
+ "grad_clip": 1.0,
37
+ "warmup_tokens": 500000,
38
+ "target_total_tokens": 10000000000,
39
+ "micro_batch": 4,
40
+ "grad_accum": 8,
41
+ "log_every": 10,
42
+ "ckpt_every_steps": 200,
43
+ "eval_every_steps": 200,
44
+ "seed": 42,
45
+ "max_session_hours": 11.5
46
+ },
47
+ "timestamp": 1785469962.5254455
48
+ }