File size: 1,596 Bytes
b108e4d | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 | run:
train_model: mult
name: rp_mult_baseline_240726
devices:
- 0
- 1
- 2
- 3
precision: 32
matmul_precision: medium
dtype: float32
epochs: 10
dataset_size: 20000000
compile: false
gradient_clip_val: 1.0
val_check_interval: 0.2
limit_val_batches: 4
strategy: ddp
ckpt_dir: null
logging:
comet: true
project: lego_pdgid
config:
dl_conf:
lds_args:
data: <dataset_path>
frac: 1.0
cutoff_mev: 10
min_particles: 0
bs: 4096
num_workers: 16
mm_conf:
in_dim: 11
cond_scalars:
- Density
- Z
- A
- Size
dropout: 0.05
h_dim: 128
n_layers: 6
n_heads: 6
bs: 4096
lr: 0.001
weight_decay: 0.01
warmup_steps: 0
post_emb_norm: false
use_abs_pos_emb: true
train_inverse: false
model_args:
ff_swish: true
ff_glu: true
attn_qk_norm: true
rotary_pos_emb: true
use_adaptive_rmsnorm: true
use_adaptive_layerscale: true
residual_attn: true
inv_model_args:
ff_swish: true
ff_glu: true
attn_qk_norm: true
rotary_pos_emb: true
use_adaptive_rmsnorm: true
use_adaptive_layerscale: true
residual_attn: true
opt_conf:
opt: muon
lr: 0.01
momentum: 0.95
nesterov: true
ns_steps: 5
weight_decay: 0.007
weight_decouple: true
adamw_lr: 0.003
adamw_betas:
- 0.9
- 0.999
adamw_wd: 0.01
adamw_eps: 1.0e-08
scheduler:
cls: warmup_cosine
warmup_frac: 0.1
eta_min: 1.0e-06
interval: step
additional:
notes: ''
|