singhankur01 commited on
Commit
2ca1fd2
·
verified ·
1 Parent(s): 44e5786

Update utils/DocsLoader.py

Browse files
Files changed (1) hide show
  1. utils/DocsLoader.py +11 -9
utils/DocsLoader.py CHANGED
@@ -57,15 +57,17 @@ def load_and_chunk(url: str) -> list[Document]:
57
 
58
  else:
59
  raise HTTPException(400, f"Unsupported document type: {content_type}")
60
- # --- Step 1: Sentence split ---
61
- sentence_docs = []
62
- for doc in docs:
63
- sentences = nltk.sent_tokenize(doc.page_content)
64
- for sent in sentences:
65
- if sent.strip():
66
- sentence_docs.append(Document(page_content=sent, metadata=doc.metadata))
 
67
 
68
- splitter = RecursiveCharacterTextSplitter(chunk_size=440, chunk_overlap=80)
69
  # splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
70
  # return splitter.split_documents(docs)
71
- return splitter.split_documents(sentence_docs)
 
 
57
 
58
  else:
59
  raise HTTPException(400, f"Unsupported document type: {content_type}")
60
+ # # --- Step 1: Sentence split ---
61
+ # sentence_docs = []
62
+ # for doc in docs:
63
+ # sentences = nltk.sent_tokenize(doc.page_content)
64
+ # for sent in sentences:
65
+ # if sent.strip():
66
+ # sentence_docs.append(Document(page_content=sent, metadata=doc.metadata))
67
+ full_text = "\n".join([doc.page_content for doc in docs])
68
 
69
+ splitter = RecursiveCharacterTextSplitter(chunk_size=800, chunk_overlap=150)
70
  # splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
71
  # return splitter.split_documents(docs)
72
+ # return splitter.split_documents([Document(page_content=full_text)])
73
+ return splitter.create_documents([full_text])