File size: 683 Bytes
90d94ec
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
import _bootstrap
import argparse
import pandas as pd
from tqdm import tqdm

from model.utils import split

def main():
    parser = argparse.ArgumentParser(description='Build a corpus file')
    parser.add_argument('--in_path', '-i', type=str, default='data/chembl24_bert_train.csv', help='input file')
    parser.add_argument('--out_path', '-o', type=str, default='data/chembl24_corpus.txt', help='output file')
    args = parser.parse_args()

    smiles = pd.read_csv(args.in_path)['first'].values
    with open(args.out_path, 'a') as f:
        for sm in tqdm(smiles):
            f.write(split(sm)+'\n')
    print('Built a corpus file!')

if __name__=='__main__':
    main()