JTF2000 commited on
Commit
173b69a
·
verified ·
1 Parent(s): fe36803

Upload 2 files

Browse files
TSEncoder_orion_icl_fullv1.0.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:94bbbc334e931ee145d05542b9813267b8559dd6e959dd9764fb37c372e19e01
3
+ size 241293576
TSEncoder_orion_icl_model_hparamsv1.0.json ADDED
@@ -0,0 +1,78 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "adapter": {
3
+ "dropout": 0.1,
4
+ "hidden_dim": 1024,
5
+ "icl_dim": 512,
6
+ "tsencoder_dim": 512,
7
+ "mlp": {
8
+ "layer_types": [
9
+ "LayerNorm",
10
+ "Linear",
11
+ "GELU",
12
+ "Dropout",
13
+ "Linear"
14
+ ],
15
+ "linear_layers": [
16
+ {
17
+ "bias": true,
18
+ "in_features": 512,
19
+ "out_features": 1024
20
+ },
21
+ {
22
+ "bias": true,
23
+ "in_features": 1024,
24
+ "out_features": 512
25
+ }
26
+ ],
27
+ "num_layers": 5
28
+ },
29
+ "use_layernorm": true
30
+ },
31
+ "tsencoder": {
32
+ "batch_size": 512,
33
+ "ckpt": "checkpoints/CaukerImpro-data100k_emb512_100epochs.pt",
34
+ "hidden_dim": 512,
35
+ "tsencoder_dim": 512,
36
+ "seq_len": 512
37
+ },
38
+ "tsencoder_details": {
39
+ "modules": [
40
+ "ViTUnit",
41
+ "TokenGeneratorUnit"
42
+ ],
43
+ "tokgen_convs": 2,
44
+ "tokgen_scalar_encoder_groups": 2,
45
+ "transformer_layers": 6
46
+ },
47
+ "model": "_TSEncoderAdapterPlusOrionICL",
48
+ "orion": {
49
+ "ckpt": "/data0/fangjuntao2025/TIC-FS/code/checkpoints/ICL.ckpt",
50
+ "icl_predictor": {
51
+ "config": {
52
+ "dropout": 0.0,
53
+ "embed_dim": 128,
54
+ "ff_factor": 2,
55
+ "icl_nhead": 4,
56
+ "icl_num_blocks": 12,
57
+ "max_classes": 10,
58
+ "norm_first": true,
59
+ "perc_layers": 2,
60
+ "perc_num_latents": 32
61
+ },
62
+ "decoder": "Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n)",
63
+ "memory": {
64
+ "perc_num_latents": 32,
65
+ "read_layers": 2,
66
+ "write_layers": 2
67
+ },
68
+ "tf_icl_blocks": 12,
69
+ "y_encoder": "OneHotAndLinear(in_features=10, out_features=512, bias=True)"
70
+ }
71
+ },
72
+ "structure": {
73
+ "adapter": "TokenMLPAdapter(\n (net): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=1024, bias=True)\n (2): GELU(approximate='none')\n (3): Dropout(p=0.11824302592075059, inplace=False)\n (4): Linear(in_features=1024, out_features=512, bias=True)\n )\n)",
74
+ "icl_predictor": "ICLearning(\n (tf_icl): Encoder(\n (blocks): ModuleList(\n (0-11): 12 x MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n )\n )\n (ln): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (y_encoder): OneHotAndLinear(in_features=10, out_features=512, bias=True)\n (decoder): Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n )\n (memory): PerceiverMemory(\n (write_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n (read_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n )\n)",
75
+ "tsencoder_model": "TSEncoder8M(\n (tokgen_unit): TokenGeneratorUnit(\n (convs): ModuleList(\n (0-1): 2 x Convolution(\n (conv): Conv1d(1, 512, kernel_size=(17,), stride=(1,), padding=(8,))\n )\n )\n (layer_norms): ModuleList(\n (0-1): 2 x LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n )\n (scalar_encoders): ModuleList(\n (0-1): 2 x MultiScaledScalarEncoder(\n (encoders): ModuleList(\n (0-8): 9 x ScalarEncoder(\n (layer_norm): LayerNorm((32,), eps=1e-15, elementwise_affine=True)\n )\n )\n )\n )\n (linear_encoder): LinearEncoder(\n (linear): Linear(in_features=1088, out_features=512, bias=True)\n (layer_norm): LayerNorm((512,), eps=1e-15, elementwise_affine=True)\n )\n )\n (vit_unit): ViTUnit(\n (pos_encoder): PositionalEncoding(\n (dropout): Dropout(p=0.1, inplace=False)\n )\n (transformer): Transformer(\n (layers): ModuleList(\n (0-5): 6 x ModuleList(\n (0): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): Attention(\n (attend): Softmax(dim=-1)\n (dropout): Dropout(p=0.1, inplace=False)\n (to_qkv): Linear(in_features=512, out_features=3072, bias=False)\n (to_out): Sequential(\n (0): Linear(in_features=1024, out_features=512, bias=True)\n (1): Dropout(p=0.1, inplace=False)\n )\n )\n )\n (1): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): FeedForward(\n (net): Sequential(\n (0): Linear(in_features=512, out_features=512, bias=True)\n (1): GELU(approximate='none')\n (2): Dropout(p=0.1, inplace=False)\n (3): Linear(in_features=512, out_features=512, bias=True)\n (4): Dropout(p=0.1, inplace=False)\n )\n )\n )\n )\n )\n )\n )\n (prj): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=512, bias=True)\n )\n)",
76
+ "repr": "_TSEncoderAdapterPlusOrionICL(\n (tsencoder_model): TSEncoder8M(\n (tokgen_unit): TokenGeneratorUnit(\n (convs): ModuleList(\n (0-1): 2 x Convolution(\n (conv): Conv1d(1, 512, kernel_size=(17,), stride=(1,), padding=(8,))\n )\n )\n (layer_norms): ModuleList(\n (0-1): 2 x LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n )\n (scalar_encoders): ModuleList(\n (0-1): 2 x MultiScaledScalarEncoder(\n (encoders): ModuleList(\n (0-8): 9 x ScalarEncoder(\n (layer_norm): LayerNorm((32,), eps=1e-15, elementwise_affine=True)\n )\n )\n )\n )\n (linear_encoder): LinearEncoder(\n (linear): Linear(in_features=1088, out_features=512, bias=True)\n (layer_norm): LayerNorm((512,), eps=1e-15, elementwise_affine=True)\n )\n )\n (vit_unit): ViTUnit(\n (pos_encoder): PositionalEncoding(\n (dropout): Dropout(p=0.1, inplace=False)\n )\n (transformer): Transformer(\n (layers): ModuleList(\n (0-5): 6 x ModuleList(\n (0): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): Attention(\n (attend): Softmax(dim=-1)\n (dropout): Dropout(p=0.1, inplace=False)\n (to_qkv): Linear(in_features=512, out_features=3072, bias=False)\n (to_out): Sequential(\n (0): Linear(in_features=1024, out_features=512, bias=True)\n (1): Dropout(p=0.1, inplace=False)\n )\n )\n )\n (1): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): FeedForward(\n (net): Sequential(\n (0): Linear(in_features=512, out_features=512, bias=True)\n (1): GELU(approximate='none')\n (2): Dropout(p=0.1, inplace=False)\n (3): Linear(in_features=512, out_features=512, bias=True)\n (4): Dropout(p=0.1, inplace=False)\n )\n )\n )\n )\n )\n )\n )\n (prj): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=512, bias=True)\n )\n )\n (adapter): TokenMLPAdapter(\n (net): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=1024, bias=True)\n (2): GELU(approximate='none')\n (3): Dropout(p=0.11824302592075059, inplace=False)\n (4): Linear(in_features=1024, out_features=512, bias=True)\n )\n )\n (icl_predictor): ICLearning(\n (tf_icl): Encoder(\n (blocks): ModuleList(\n (0-11): 12 x MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n )\n )\n (ln): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (y_encoder): OneHotAndLinear(in_features=10, out_features=512, bias=True)\n (decoder): Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n )\n (memory): PerceiverMemory(\n (write_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n (read_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n )\n )\n)"
77
+ }
78
+ }