File size: 2,860 Bytes
a244197
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
# ============================================================
# DMC 溶剂 XTB 训练配置
# 入门级示例:单 GPU,小数据集,参数最少
# ============================================================

# 实验名称(用于输出目录和模型文件命名)
name: DMC

# 实验描述
description: "DMC solvent XTB - 单 GPU 入门示例 (200 训练帧)"

# ============================================================
# train.py 参数
# 以下所有字段将被转换为 train.py 的命令行参数
# 例如 model: MACE -> --model=MACE
#      swa: true  -> --swa (布尔标志)
# ============================================================
train_args:
  # --- 模型配置 ---
  model: MACE                    # 模型类型

  # --- 数据配置 ---
  # 路径中的 ${ONESCIENCE_DATASETS_DIR} 默认指向仓库根目录,
  # 下载 ModelScope DMC 数据集到 ./data 后即可使用 可能需根据实际路径进行调整
  train_file: "${ONESCIENCE_DATASETS_DIR}/data/data/DMC/solvent_xtb_train_200.xyz"
  test_file: "${ONESCIENCE_DATASETS_DIR}/data/data/DMC/solvent_xtb_test.xyz"
  valid_fraction: 0.10           # 从训练集中划分 10% 作为验证集
  energy_key: energy_xtb         # XYZ 文件中能量字段名
  forces_key: forces_xtb         # XYZ 文件中力字段名
  E0s: average                   # 原子参考能量方式: average / isolated / 显式字典

  # --- 训练超参 ---
  seed: 123                      # 随机种子
  device: cuda                   # 设备: cuda / cpu
  r_max: 4.0                     # 截断半径 (Angstrom)
  batch_size: 10                 # 训练批大小
  max_num_epochs: 100            # 最大训练轮数
  eval_interval: 10              # 每 10 个 epoch 评估并打印一次

  # --- SWA (Stochastic Weight Averaging) ---
  swa: true                      # 启用 SWA

# ============================================================
# 启动配置(控制 python / torchrun / srun 的选择)
# ============================================================
launch:
  launcher: python               # 启动方式: python / torchrun (多节点时自动用 srun)
  num_nodes: 1                   # 节点数
  num_gpus: 8                    # 申请的 DCU 卡数

# ============================================================
# 环境配置
# ============================================================
env:
  conda_env: matchem                # conda 环境名
  modules:
    - sghpc-mpi-gcc/26.3         # 需要加载的 module

# ============================================================
# SLURM 配置(仅 --submit 模式使用)
# ============================================================
slurm:
  partition: hpctest01            # SLURM 分区
  time: "2:00:00"                # 作业时间限制
  cpus_per_task: 128              # CPU 核心数