File size: 1,596 Bytes
b108e4d
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
run:
  train_model: mult
  name: rp_mult_baseline_240726
  devices:
  - 0
  - 1
  - 2
  - 3
  precision: 32
  matmul_precision: medium
  dtype: float32
  epochs: 10
  dataset_size: 20000000
  compile: false
  gradient_clip_val: 1.0
  val_check_interval: 0.2
  limit_val_batches: 4
  strategy: ddp
  ckpt_dir: null
logging:
  comet: true
  project: lego_pdgid
config:
  dl_conf:
    lds_args:
      data: <dataset_path>
      frac: 1.0
      cutoff_mev: 10
      min_particles: 0
    bs: 4096
    num_workers: 16
  mm_conf:
    in_dim: 11
    cond_scalars:
    - Density
    - Z
    - A
    - Size
    dropout: 0.05
    h_dim: 128
    n_layers: 6
    n_heads: 6
    bs: 4096
    lr: 0.001
    weight_decay: 0.01
    warmup_steps: 0
    post_emb_norm: false
    use_abs_pos_emb: true
    train_inverse: false
    model_args:
      ff_swish: true
      ff_glu: true
      attn_qk_norm: true
      rotary_pos_emb: true
      use_adaptive_rmsnorm: true
      use_adaptive_layerscale: true
      residual_attn: true
    inv_model_args:
      ff_swish: true
      ff_glu: true
      attn_qk_norm: true
      rotary_pos_emb: true
      use_adaptive_rmsnorm: true
      use_adaptive_layerscale: true
      residual_attn: true
  opt_conf:
    opt: muon
    lr: 0.01
    momentum: 0.95
    nesterov: true
    ns_steps: 5
    weight_decay: 0.007
    weight_decouple: true
    adamw_lr: 0.003
    adamw_betas:
    - 0.9
    - 0.999
    adamw_wd: 0.01
    adamw_eps: 1.0e-08
    scheduler:
      cls: warmup_cosine
      warmup_frac: 0.1
      eta_min: 1.0e-06
      interval: step
  additional:
    notes: ''