Spaces:
No application file
No application file
File size: 478 Bytes
84d1b02 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 | import re
import nltk
from nltk.corpus import stopwords
from nltk.tokenize import word_tokenizer
nltk.download('punkt')
nltk.download('stopwords')
def preprocess_text(text):
text = text.lower()
text = re.sub(r'[^a-zA-Z\s]','',text)
tokens = word_tokenizer(text)
stop_Words = set(stopwords.words('english'))
tokens = [word for word in tokens if word not in stop_Words]
processed_text = ' '.join(tokens)
return processed_text
|