TIC-FM / TSEncoder_orion_icl_model_hparams.json
Jwpqkh's picture
Upload TSEncoder_orion_icl_model_hparams.json
5f317e2 verified
Raw
History Blame
15.8 kB
{
"adapter": {
"dropout": 0.11824302592075059,
"hidden_dim": 1024,
"icl_dim": 512,
"tsencoder_dim": 512,
"mlp": {
"layer_types": [
"LayerNorm",
"Linear",
"GELU",
"Dropout",
"Linear"
],
"linear_layers": [
{
"bias": true,
"in_features": 512,
"out_features": 1024
},
{
"bias": true,
"in_features": 1024,
"out_features": 512
}
],
"num_layers": 5
},
"use_layernorm": true
},
"tsencoder": {
"batch_size": 512,
"ckpt": "/data0/fangjuntao2025/TIC-FS/code/checkpoints/CaukerImpro-data100k_emb512_100epochs.pt",
"hidden_dim": 512,
"tsencoder_dim": 512,
"seq_len": 512
},
"tsencoder_details": {
"modules": [
"ViTUnit",
"TokenGeneratorUnit"
],
"tokgen_convs": 2,
"tokgen_scalar_encoder_groups": 2,
"transformer_layers": 6
},
"model": "_TSEncoderAdapterPlusOrionICL",
"orion": {
"ckpt": "/data0/fangjuntao2025/TIC-FS/code/checkpoints/Orion-MSP-v1.0.ckpt",
"icl_predictor": {
"config": {
"dropout": 0.0,
"embed_dim": 128,
"ff_factor": 2,
"icl_nhead": 4,
"icl_num_blocks": 12,
"max_classes": 10,
"norm_first": true,
"perc_layers": 2,
"perc_num_latents": 32
},
"decoder": "Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n)",
"memory": {
"perc_num_latents": 32,
"read_layers": 2,
"write_layers": 2
},
"tf_icl_blocks": 12,
"y_encoder": "OneHotAndLinear(in_features=10, out_features=512, bias=True)"
}
},
"structure": {
"adapter": "TokenMLPAdapter(\n (net): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=1024, bias=True)\n (2): GELU(approximate='none')\n (3): Dropout(p=0.11824302592075059, inplace=False)\n (4): Linear(in_features=1024, out_features=512, bias=True)\n )\n)",
"icl_predictor": "ICLearning(\n (tf_icl): Encoder(\n (blocks): ModuleList(\n (0-11): 12 x MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n )\n )\n (ln): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (y_encoder): OneHotAndLinear(in_features=10, out_features=512, bias=True)\n (decoder): Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n )\n (memory): PerceiverMemory(\n (write_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n (read_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n )\n)",
"tsencoder_model": "TSEncoder8M(\n (tokgen_unit): TokenGeneratorUnit(\n (convs): ModuleList(\n (0-1): 2 x Convolution(\n (conv): Conv1d(1, 512, kernel_size=(17,), stride=(1,), padding=(8,))\n )\n )\n (layer_norms): ModuleList(\n (0-1): 2 x LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n )\n (scalar_encoders): ModuleList(\n (0-1): 2 x MultiScaledScalarEncoder(\n (encoders): ModuleList(\n (0-8): 9 x ScalarEncoder(\n (layer_norm): LayerNorm((32,), eps=1e-15, elementwise_affine=True)\n )\n )\n )\n )\n (linear_encoder): LinearEncoder(\n (linear): Linear(in_features=1088, out_features=512, bias=True)\n (layer_norm): LayerNorm((512,), eps=1e-15, elementwise_affine=True)\n )\n )\n (vit_unit): ViTUnit(\n (pos_encoder): PositionalEncoding(\n (dropout): Dropout(p=0.1, inplace=False)\n )\n (transformer): Transformer(\n (layers): ModuleList(\n (0-5): 6 x ModuleList(\n (0): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): Attention(\n (attend): Softmax(dim=-1)\n (dropout): Dropout(p=0.1, inplace=False)\n (to_qkv): Linear(in_features=512, out_features=3072, bias=False)\n (to_out): Sequential(\n (0): Linear(in_features=1024, out_features=512, bias=True)\n (1): Dropout(p=0.1, inplace=False)\n )\n )\n )\n (1): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): FeedForward(\n (net): Sequential(\n (0): Linear(in_features=512, out_features=512, bias=True)\n (1): GELU(approximate='none')\n (2): Dropout(p=0.1, inplace=False)\n (3): Linear(in_features=512, out_features=512, bias=True)\n (4): Dropout(p=0.1, inplace=False)\n )\n )\n )\n )\n )\n )\n )\n (prj): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=512, bias=True)\n )\n)",
"repr": "_TSEncoderAdapterPlusOrionICL(\n (tsencoder_model): TSEncoder8M(\n (tokgen_unit): TokenGeneratorUnit(\n (convs): ModuleList(\n (0-1): 2 x Convolution(\n (conv): Conv1d(1, 512, kernel_size=(17,), stride=(1,), padding=(8,))\n )\n )\n (layer_norms): ModuleList(\n (0-1): 2 x LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n )\n (scalar_encoders): ModuleList(\n (0-1): 2 x MultiScaledScalarEncoder(\n (encoders): ModuleList(\n (0-8): 9 x ScalarEncoder(\n (layer_norm): LayerNorm((32,), eps=1e-15, elementwise_affine=True)\n )\n )\n )\n )\n (linear_encoder): LinearEncoder(\n (linear): Linear(in_features=1088, out_features=512, bias=True)\n (layer_norm): LayerNorm((512,), eps=1e-15, elementwise_affine=True)\n )\n )\n (vit_unit): ViTUnit(\n (pos_encoder): PositionalEncoding(\n (dropout): Dropout(p=0.1, inplace=False)\n )\n (transformer): Transformer(\n (layers): ModuleList(\n (0-5): 6 x ModuleList(\n (0): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): Attention(\n (attend): Softmax(dim=-1)\n (dropout): Dropout(p=0.1, inplace=False)\n (to_qkv): Linear(in_features=512, out_features=3072, bias=False)\n (to_out): Sequential(\n (0): Linear(in_features=1024, out_features=512, bias=True)\n (1): Dropout(p=0.1, inplace=False)\n )\n )\n )\n (1): PreNorm(\n (norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (fn): FeedForward(\n (net): Sequential(\n (0): Linear(in_features=512, out_features=512, bias=True)\n (1): GELU(approximate='none')\n (2): Dropout(p=0.1, inplace=False)\n (3): Linear(in_features=512, out_features=512, bias=True)\n (4): Dropout(p=0.1, inplace=False)\n )\n )\n )\n )\n )\n )\n )\n (prj): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=512, bias=True)\n )\n )\n (adapter): TokenMLPAdapter(\n (net): Sequential(\n (0): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (1): Linear(in_features=512, out_features=1024, bias=True)\n (2): GELU(approximate='none')\n (3): Dropout(p=0.11824302592075059, inplace=False)\n (4): Linear(in_features=1024, out_features=512, bias=True)\n )\n )\n (icl_predictor): ICLearning(\n (tf_icl): Encoder(\n (blocks): ModuleList(\n (0-11): 12 x MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n )\n )\n (ln): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (y_encoder): OneHotAndLinear(in_features=10, out_features=512, bias=True)\n (decoder): Sequential(\n (0): Linear(in_features=512, out_features=1024, bias=True)\n (1): GELU(approximate='none')\n (2): Linear(in_features=1024, out_features=10, bias=True)\n )\n (memory): PerceiverMemory(\n (write_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n (read_layers): ModuleList(\n (0-1): 2 x CrossAttnBlock(\n (q_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (kv_norm): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (attn): MultiheadAttentionBlock(\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n (attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n )\n (ffn): TransformerEncoderLayer(\n (self_attn): MultiheadAttention(\n (out_proj): NonDynamicallyQuantizableLinear(in_features=512, out_features=512, bias=True)\n )\n (linear1): Linear(in_features=512, out_features=1024, bias=True)\n (dropout): Dropout(p=0.0, inplace=False)\n (linear2): Linear(in_features=1024, out_features=512, bias=True)\n (norm1): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (norm2): LayerNorm((512,), eps=1e-05, elementwise_affine=True)\n (dropout1): Dropout(p=0.0, inplace=False)\n (dropout2): Dropout(p=0.0, inplace=False)\n )\n )\n )\n )\n )\n)"
}
}