File size: 1,856 Bytes
6701cbe | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 | _target_: onescience.datapipes.simplefold.train_datamodule.SimpleFoldTrainingDataModule
datasets:
# - _target_: onescience.datapipes.simplefold.train_datamodule.DatasetConfig
# data_name: rcsb_protein
# tokenized_dir: data/rcsb_protein_tokenized
# target_dir: data/rcsb_processed_targets
# manifest_path: data/rcsb_protein_tokenized/manifest.json
# cropper:
# _target_: onescience.datapipes.boltz_data_pipeline.crop.boltz.BoltzCropper
# min_neighborhood: 0
# max_neighborhood: 40
# filters:
# - _target_: onescience.datapipes.boltz_data_pipeline.filter.dynamic.resolution.ResolutionFilter
# resolution: 5.0
# - _target_: onescience.datapipes.boltz_data_pipeline.filter.dynamic.date.DateFilter
# date: "2020-05-01"
# ref: released
- _target_: onescience.datapipes.simplefold.train_datamodule.DatasetConfig
data_name: swissprot
tokenized_dir: ./datasets/tokenized
target_dir: ./datasets
manifest_path: ./datasets/manifest.json
record_list:
cropper:
_target_: onescience.datapipes.boltz_data_pipeline.crop.boltz.BoltzCropper
min_neighborhood: 0
max_neighborhood: 40
filters:
- _target_: onescience.datapipes.boltz_data_pipeline.filter.dynamic.size.SizeFilter
min_chains: 1
max_chains: 300
tokenizer:
_target_: onescience.datapipes.boltz_data_pipeline.tokenize.boltz_protein.BoltzTokenizer
featurizer:
_target_: onescience.datapipes.boltz_data_pipeline.feature.featurizer.BoltzFeaturizer
symmetries: data/symmetry.pkl
max_tokens: 256
max_atoms: 2304
pad_to_max_tokens: False
pad_to_max_atoms: False
batch_size: 8
num_workers: 1
pin_memory: True
return_train_symmetries: False
min_dist: 2.0
max_dist: 22.0
num_bins: 64
atoms_per_window_queries: 32
rotation_augment_ref_pos: False
rotation_augment_coords: True |