Upload 2 files
Browse files
TSEncoder_orion_icl_fullv1.0.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:94bbbc334e931ee145d05542b9813267b8559dd6e959dd9764fb37c372e19e01
|
| 3 |
+
size 241293576
|
TSEncoder_orion_icl_model_hparamsv1.0.json
ADDED
|
@@ -0,0 +1,78 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"adapter": {
|
| 3 |
+
"dropout": 0.1,
|
| 4 |
+
"hidden_dim": 1024,
|
| 5 |
+
"icl_dim": 512,
|
| 6 |
+
"tsencoder_dim": 512,
|
| 7 |
+
"mlp": {
|
| 8 |
+
"layer_types": [
|
| 9 |
+
"LayerNorm",
|
| 10 |
+
"Linear",
|
| 11 |
+
"GELU",
|
| 12 |
+
"Dropout",
|
| 13 |
+
"Linear"
|
| 14 |
+
],
|
| 15 |
+
"linear_layers": [
|
| 16 |
+
{
|
| 17 |
+
"bias": true,
|
| 18 |
+
"in_features": 512,
|
| 19 |
+
"out_features": 1024
|
| 20 |
+
},
|
| 21 |
+
{
|
| 22 |
+
"bias": true,
|
| 23 |
+
"in_features": 1024,
|
| 24 |
+
"out_features": 512
|
| 25 |
+
}
|
| 26 |
+
],
|
| 27 |
+
"num_layers": 5
|
| 28 |
+
},
|
| 29 |
+
"use_layernorm": true
|
| 30 |
+
},
|
| 31 |
+
"tsencoder": {
|
| 32 |
+
"batch_size": 512,
|
| 33 |
+
"ckpt": "checkpoints/CaukerImpro-data100k_emb512_100epochs.pt",
|
| 34 |
+
"hidden_dim": 512,
|
| 35 |
+
"tsencoder_dim": 512,
|
| 36 |
+
"seq_len": 512
|
| 37 |
+
},
|
| 38 |
+
"tsencoder_details": {
|
| 39 |
+
"modules": [
|
| 40 |
+
"ViTUnit",
|
| 41 |
+
"TokenGeneratorUnit"
|
| 42 |
+
],
|
| 43 |
+
"tokgen_convs": 2,
|
| 44 |
+
"tokgen_scalar_encoder_groups": 2,
|
| 45 |
+
"transformer_layers": 6
|
| 46 |
+
},
|
| 47 |
+
"model": "_TSEncoderAdapterPlusOrionICL",
|
| 48 |
+
"orion": {
|
| 49 |
+
"ckpt": "/data0/fangjuntao2025/TIC-FS/code/checkpoints/ICL.ckpt",
|
| 50 |
+
"icl_predictor": {
|
| 51 |
+
"config": {
|
| 52 |
+
"dropout": 0.0,
|
| 53 |
+
"embed_dim": 128,
|
| 54 |
+
"ff_factor": 2,
|
| 55 |
+
"icl_nhead": 4,
|
| 56 |
+
"icl_num_blocks": 12,
|
| 57 |
+
"max_classes": 10,
|
| 58 |
+
"norm_first": true,
|
| 59 |
+
"perc_layers": 2,
|
| 60 |
+
"perc_num_latents": 32
|
| 61 |
+
},
|
| 62 |
+
"decoder": "Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n)",
|
| 63 |
+
"memory": {
|
| 64 |
+
"perc_num_latents": 32,
|
| 65 |
+
"read_layers": 2,
|
| 66 |
+
"write_layers": 2
|
| 67 |
+
},
|
| 68 |
+
"tf_icl_blocks": 12,
|
| 69 |
+
"y_encoder": "OneHotAndLinear(in_features=10, out_features=512, bias=True)"
|
| 70 |
+
}
|
| 71 |
+
},
|
| 72 |
+
"structure": {
|
| 73 |
+
"adapter": "TokenMLPAdapter(\n (net): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=1024, bias=True)\n (2): GELU(approximate='none')\n (3): Dropout(p=0.11824302592075059, inplace=False)\n (4): Linear(in_features=1024, out_features=512, bias=True)\n )\n)",
|
| 74 |
+
"icl_predictor": "ICLearning(\n (tf_icl): Encoder(\n (blocks): ModuleList(\n (0-11): 12 x MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n )\n )\n (ln): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (y_encoder): OneHotAndLinear(in_features=10, out_features=512, bias=True)\n (decoder): Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n )\n (memory): PerceiverMemory(\n (write_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n (read_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n )\n)",
|
| 75 |
+
"tsencoder_model": "TSEncoder8M(\n (tokgen_unit): TokenGeneratorUnit(\n (convs): ModuleList(\n (0-1): 2 x Convolution(\n (conv): Conv1d(1, 512, kernel_size=(17,), stride=(1,), padding=(8,))\n )\n )\n (layer_norms): ModuleList(\n (0-1): 2 x LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n )\n (scalar_encoders): ModuleList(\n (0-1): 2 x MultiScaledScalarEncoder(\n (encoders): ModuleList(\n (0-8): 9 x ScalarEncoder(\n (layer_norm): LayerNorm((32,), eps=1e-15, elementwise_affine=True)\n )\n )\n )\n )\n (linear_encoder): LinearEncoder(\n (linear): Linear(in_features=1088, out_features=512, bias=True)\n (layer_norm): LayerNorm((512,), eps=1e-15, elementwise_affine=True)\n )\n )\n (vit_unit): ViTUnit(\n (pos_encoder): PositionalEncoding(\n (dropout): Dropout(p=0.1, inplace=False)\n )\n (transformer): Transformer(\n (layers): ModuleList(\n (0-5): 6 x ModuleList(\n (0): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): Attention(\n (attend): Softmax(dim=-1)\n (dropout): Dropout(p=0.1, inplace=False)\n (to_qkv): Linear(in_features=512, out_features=3072, bias=False)\n (to_out): Sequential(\n (0): Linear(in_features=1024, out_features=512, bias=True)\n (1): Dropout(p=0.1, inplace=False)\n )\n )\n )\n (1): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): FeedForward(\n (net): Sequential(\n (0): Linear(in_features=512, out_features=512, bias=True)\n (1): GELU(approximate='none')\n (2): Dropout(p=0.1, inplace=False)\n (3): Linear(in_features=512, out_features=512, bias=True)\n (4): Dropout(p=0.1, inplace=False)\n )\n )\n )\n )\n )\n )\n )\n (prj): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=512, bias=True)\n )\n)",
|
| 76 |
+
"repr": "_TSEncoderAdapterPlusOrionICL(\n (tsencoder_model): TSEncoder8M(\n (tokgen_unit): TokenGeneratorUnit(\n (convs): ModuleList(\n (0-1): 2 x Convolution(\n (conv): Conv1d(1, 512, kernel_size=(17,), stride=(1,), padding=(8,))\n )\n )\n (layer_norms): ModuleList(\n (0-1): 2 x LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n )\n (scalar_encoders): ModuleList(\n (0-1): 2 x MultiScaledScalarEncoder(\n (encoders): ModuleList(\n (0-8): 9 x ScalarEncoder(\n (layer_norm): LayerNorm((32,), eps=1e-15, elementwise_affine=True)\n )\n )\n )\n )\n (linear_encoder): LinearEncoder(\n (linear): Linear(in_features=1088, out_features=512, bias=True)\n (layer_norm): LayerNorm((512,), eps=1e-15, elementwise_affine=True)\n )\n )\n (vit_unit): ViTUnit(\n (pos_encoder): PositionalEncoding(\n (dropout): Dropout(p=0.1, inplace=False)\n )\n (transformer): Transformer(\n (layers): ModuleList(\n (0-5): 6 x ModuleList(\n (0): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): Attention(\n (attend): Softmax(dim=-1)\n (dropout): Dropout(p=0.1, inplace=False)\n (to_qkv): Linear(in_features=512, out_features=3072, bias=False)\n (to_out): Sequential(\n (0): Linear(in_features=1024, out_features=512, bias=True)\n (1): Dropout(p=0.1, inplace=False)\n )\n )\n )\n (1): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): FeedForward(\n (net): Sequential(\n (0): Linear(in_features=512, out_features=512, bias=True)\n (1): GELU(approximate='none')\n (2): Dropout(p=0.1, inplace=False)\n (3): Linear(in_features=512, out_features=512, bias=True)\n (4): Dropout(p=0.1, inplace=False)\n )\n )\n )\n )\n )\n )\n )\n (prj): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=512, bias=True)\n )\n )\n (adapter): TokenMLPAdapter(\n (net): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=1024, bias=True)\n (2): GELU(approximate='none')\n (3): Dropout(p=0.11824302592075059, inplace=False)\n (4): Linear(in_features=1024, out_features=512, bias=True)\n )\n )\n (icl_predictor): ICLearning(\n (tf_icl): Encoder(\n (blocks): ModuleList(\n (0-11): 12 x MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n )\n )\n (ln): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (y_encoder): OneHotAndLinear(in_features=10, out_features=512, bias=True)\n (decoder): Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n )\n (memory): PerceiverMemory(\n (write_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n (read_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n )\n )\n)"
|
| 77 |
+
}
|
| 78 |
+
}
|