Dat1710 commited on
Commit
46f7360
·
verified ·
1 Parent(s): fadd970

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +59 -0
README.md ADDED
@@ -0,0 +1,59 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: google/gemma-4-E2B-it-qat-q4_0-unquantized
4
+ tags:
5
+ - dgmc
6
+ - piqa
7
+ - gemma
8
+ - physical-commonsense-reasoning
9
+ - pytorch
10
+ datasets:
11
+ - piqa
12
+ metrics:
13
+ - accuracy
14
+ - f1
15
+ ---
16
+
17
+ # Gemma + DGMC (Dual-Gated Memory Consolidation) — fine-tuned on PIQA
18
+
19
+ Adapter DGMC (Dual-Gated Memory Consolidation) huấn luyện trên bộ dữ liệu
20
+ [PIQA](https://huggingface.co/datasets/piqa), gắn thêm vào mô hình nền tảng
21
+ **đóng băng hoàn toàn** `google/gemma-4-E2B-it-qat-q4_0-unquantized`. Chỉ các tham số của module DGMC được
22
+ huấn luyện (`dgmc_params/1e6:.1f`M tham số).
23
+
24
+ ## Kết quả
25
+
26
+ | Model | Method | Trainable Params | Accuracy | F1 Macro |
27
+ |---|---|---|---|---|
28
+ | Gemma (Zero-Shot) | Next-token logit scoring | 0 | 75.73% | 0.7561 |
29
+ | Gemma + DGMC | DGMC fine-tuned (LM) | 28.3M | 77.20% | 0.7719 |
30
+
31
+ Cải thiện: **+1.47 điểm phần trăm** so với zero-shot.
32
+
33
+ ## Cấu hình DGMC
34
+
35
+ - `block_size`: 64
36
+ - `memory_dim`: 1536
37
+ - `decay_alpha`: 0.1
38
+
39
+ ## Cách sử dụng
40
+
41
+ Tải file `dgmc_piqa_weights.pt` rồi load lại vào module DGMC tương ứng với
42
+ kiến trúc trong notebook huấn luyện gốc:
43
+
44
+ ```python
45
+ import torch
46
+ ckpt = torch.load("dgmc_piqa_weights.pt", map_location="cpu")
47
+ dgmc.load_state_dict(ckpt["dgmc_state_dict"])
48
+ ```
49
+
50
+ Model nền tảng `google/gemma-4-E2B-it-qat-q4_0-unquantized` cần được tải riêng và giữ đóng băng (frozen);
51
+ adapter DGMC này chỉ bổ sung một module memory consolidation nhẹ, không thay
52
+ thế attention gốc của model.
53
+
54
+ ## Huấn luyện
55
+
56
+ - Epochs: 10
57
+ - Learning rate: 0.0002
58
+ - Gradient accumulation steps: 16
59
+ - Max sequence length: 256