Dat1710 commited on
Commit
ac62bb0
·
verified ·
1 Parent(s): eb4f1fb

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +60 -0
README.md ADDED
@@ -0,0 +1,60 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: google/gemma-4-E2B-it-qat-q4_0-unquantized
4
+ tags:
5
+ - dgmc
6
+ - social-i-qa
7
+ - gemma
8
+ - social-commonsense-reasoning
9
+ - pytorch
10
+ datasets:
11
+ - allenai/social_i_qa
12
+ metrics:
13
+ - accuracy
14
+ - f1
15
+ ---
16
+
17
+ # Gemma + DGMC (Dual-Gated Memory Consolidation) — fine-tuned on Social IQa
18
+
19
+ Adapter DGMC (Dual-Gated Memory Consolidation) huấn luyện trên bộ dữ liệu
20
+ [Social IQa](https://huggingface.co/datasets/allenai/social_i_qa), gắn thêm vào mô hình nền tảng
21
+ **đóng băng hoàn toàn** `google/gemma-4-E2B-it-qat-q4_0-unquantized`. Chỉ các tham số của module DGMC được
22
+ huấn luyện (28.3M tham số). Bài toán là trắc nghiệm xã hội
23
+ 3 lựa chọn (A/B/C) dựa trên `context` + `question`.
24
+
25
+ ## Kết quả
26
+
27
+ | Model | Method | Trainable Params | Accuracy | F1 Macro |
28
+ |---|---|---|---|---|
29
+ | Gemma (Zero-Shot) | Next-token logit scoring | 0 | 67.81% | 0.6777 |
30
+ | Gemma + DGMC | DGMC fine-tuned (LM) | 28.3M | 67.30% | 0.6730 |
31
+
32
+ Cải thiện: **-0.51 điểm phần trăm** so với zero-shot.
33
+
34
+ ## Cấu hình DGMC
35
+
36
+ - `block_size`: 64
37
+ - `memory_dim`: 1536
38
+ - `decay_alpha`: 0.1
39
+
40
+ ## Cách sử dụng
41
+
42
+ Tải file `dgmc_siqa_weights.pt` rồi load lại vào module DGMC tương ứng với
43
+ kiến trúc trong notebook huấn luyện gốc:
44
+
45
+ ```python
46
+ import torch
47
+ ckpt = torch.load("dgmc_siqa_weights.pt", map_location="cpu")
48
+ dgmc.load_state_dict(ckpt["dgmc_state_dict"])
49
+ ```
50
+
51
+ Model nền tảng `google/gemma-4-E2B-it-qat-q4_0-unquantized` cần được tải riêng và giữ đóng băng (frozen);
52
+ adapter DGMC này chỉ bổ sung một module memory consolidation nhẹ, không thay
53
+ thế attention gốc của model.
54
+
55
+ ## Huấn luyện
56
+
57
+ - Epochs: 10
58
+ - Learning rate: 0.0002
59
+ - Gradient accumulation steps: 16
60
+ - Max sequence length: 256