Spaces:
Sleeping
Sleeping
Update utils/DocsLoader.py
Browse files- utils/DocsLoader.py +11 -9
utils/DocsLoader.py
CHANGED
|
@@ -57,15 +57,17 @@ def load_and_chunk(url: str) -> list[Document]:
|
|
| 57 |
|
| 58 |
else:
|
| 59 |
raise HTTPException(400, f"Unsupported document type: {content_type}")
|
| 60 |
-
# --- Step 1: Sentence split ---
|
| 61 |
-
sentence_docs = []
|
| 62 |
-
for doc in docs:
|
| 63 |
-
|
| 64 |
-
|
| 65 |
-
|
| 66 |
-
|
|
|
|
| 67 |
|
| 68 |
-
splitter = RecursiveCharacterTextSplitter(chunk_size=
|
| 69 |
# splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
|
| 70 |
# return splitter.split_documents(docs)
|
| 71 |
-
return splitter.split_documents(
|
|
|
|
|
|
| 57 |
|
| 58 |
else:
|
| 59 |
raise HTTPException(400, f"Unsupported document type: {content_type}")
|
| 60 |
+
# # --- Step 1: Sentence split ---
|
| 61 |
+
# sentence_docs = []
|
| 62 |
+
# for doc in docs:
|
| 63 |
+
# sentences = nltk.sent_tokenize(doc.page_content)
|
| 64 |
+
# for sent in sentences:
|
| 65 |
+
# if sent.strip():
|
| 66 |
+
# sentence_docs.append(Document(page_content=sent, metadata=doc.metadata))
|
| 67 |
+
full_text = "\n".join([doc.page_content for doc in docs])
|
| 68 |
|
| 69 |
+
splitter = RecursiveCharacterTextSplitter(chunk_size=800, chunk_overlap=150)
|
| 70 |
# splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
|
| 71 |
# return splitter.split_documents(docs)
|
| 72 |
+
# return splitter.split_documents([Document(page_content=full_text)])
|
| 73 |
+
return splitter.create_documents([full_text])
|