| { |
| "_target_": "model.torch.text_embedding_architecture.FoldingDiTwithLLM", |
| "hidden_size": 1152, |
| "num_heads": 16, |
| "atom_num_heads": 4, |
| "output_channels": 3, |
| "use_atom_mask": false, |
| "use_length_condition": true, |
| "esm_dropout_prob": 0.0, |
| "esm_model": "esm2_3B", |
| "llm_hidden_size": 5120, |
| "text_proj_mode": "mlp_deep", |
| "text_gate_mode": "scalar", |
| "text_embedding_diag_interval": 0, |
| "time_embedder": { |
| "_target_": "model.torch.layers.TimestepEmbedder", |
| "hidden_size": 1152 |
| }, |
| "aminoacid_pos_embedder": { |
| "_target_": "model.torch.pos_embed.AbsolutePositionEncoding", |
| "in_dim": 1, |
| "embed_dim": 1152, |
| "include_input": true |
| }, |
| "pos_embedder": { |
| "_target_": "model.torch.pos_embed.FourierPositionEncoding", |
| "in_dim": 3, |
| "include_input": true, |
| "min_freq_log2": 0, |
| "max_freq_log2": 12, |
| "num_freqs": 128, |
| "log_sampling": true |
| }, |
| "trunk": { |
| "_target_": "model.torch.blocks.HomogenTrunk", |
| "depth": 28, |
| "block": { |
| "_target_": "model.torch.blocks.DiTBlock", |
| "_partial_": true, |
| "hidden_size": 1152, |
| "mlp_ratio": 4.0, |
| "use_swiglu": true, |
| "self_attention_layer": { |
| "_target_": "model.torch.layers.EfficientSelfAttentionLayer", |
| "_partial_": true, |
| "hidden_size": 1152, |
| "num_heads": 16, |
| "qk_norm": true, |
| "pos_embedder": { |
| "_target_": "model.torch.pos_embed.AxialRotaryPositionEncoding", |
| "in_dim": 4, |
| "embed_dim": 1152, |
| "num_heads": 16, |
| "base": 100.0 |
| } |
| } |
| } |
| }, |
| "atom_hidden_size_enc": 256, |
| "atom_n_queries_enc": 32, |
| "atom_n_keys_enc": 128, |
| "atom_encoder_transformer": { |
| "_target_": "model.torch.blocks.HomogenTrunk", |
| "depth": 2, |
| "block": { |
| "_target_": "model.torch.blocks.DiTBlock", |
| "_partial_": true, |
| "hidden_size": 256, |
| "mlp_ratio": 4.0, |
| "use_swiglu": true, |
| "self_attention_layer": { |
| "_target_": "model.torch.layers.EfficientSelfAttentionLayer", |
| "_partial_": true, |
| "hidden_size": 256, |
| "num_heads": 4, |
| "qk_norm": true, |
| "pos_embedder": { |
| "_target_": "model.torch.pos_embed.AxialRotaryPositionEncoding", |
| "in_dim": 4, |
| "embed_dim": 256, |
| "num_heads": 4, |
| "base": 100.0 |
| } |
| } |
| } |
| }, |
| "atom_hidden_size_dec": 256, |
| "atom_n_queries_dec": 32, |
| "atom_n_keys_dec": 128, |
| "atom_decoder_transformer": { |
| "_target_": "model.torch.blocks.HomogenTrunk", |
| "depth": 2, |
| "block": { |
| "_target_": "model.torch.blocks.DiTBlock", |
| "_partial_": true, |
| "hidden_size": 256, |
| "mlp_ratio": 4.0, |
| "use_swiglu": true, |
| "self_attention_layer": { |
| "_target_": "model.torch.layers.EfficientSelfAttentionLayer", |
| "_partial_": true, |
| "hidden_size": 256, |
| "num_heads": 4, |
| "qk_norm": true, |
| "pos_embedder": { |
| "_target_": "model.torch.pos_embed.AxialRotaryPositionEncoding", |
| "in_dim": 4, |
| "embed_dim": 256, |
| "num_heads": 4, |
| "base": 100.0 |
| } |
| } |
| } |
| }, |
| "architecture": "foldingdit" |
| } |