singhankur01 commited on
Commit
5c200a8
·
verified ·
1 Parent(s): fae83cb

Update utils/DocsLoader.py

Browse files
Files changed (1) hide show
  1. utils/DocsLoader.py +3 -3
utils/DocsLoader.py CHANGED
@@ -6,7 +6,7 @@ from fastapi import HTTPException
6
  # from langchain_community.document_loaders import PyPDFLoader, Docx2txtLoader
7
  from langchain_community.document_loaders import PyMuPDFLoader, Docx2txtLoader
8
  from langchain.text_splitter import RecursiveCharacterTextSplitter
9
- from langchain_text_splitters.sentence_transformers import SentenceTransformersTokenTextSplitter # give better results but slow can use later for project
10
  from langchain.schema import Document
11
 
12
  MODEL_DIR = os.path.join("/tmp", "e5-large-v2")
@@ -50,6 +50,6 @@ def load_and_chunk(url: str) -> list[Document]:
50
  else:
51
  raise HTTPException(400, f"Unsupported document type: {content_type}")
52
 
53
- # splitter = RecursiveCharacterTextSplitter(chunk_size=1000, chunk_overlap=120,separators=["\n\n", "\n", ".", " ", ""])
54
- splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
55
  return splitter.split_documents(docs)
 
6
  # from langchain_community.document_loaders import PyPDFLoader, Docx2txtLoader
7
  from langchain_community.document_loaders import PyMuPDFLoader, Docx2txtLoader
8
  from langchain.text_splitter import RecursiveCharacterTextSplitter
9
+ # from langchain_text_splitters.sentence_transformers import SentenceTransformersTokenTextSplitter # give better results but slow can use later for project
10
  from langchain.schema import Document
11
 
12
  MODEL_DIR = os.path.join("/tmp", "e5-large-v2")
 
50
  else:
51
  raise HTTPException(400, f"Unsupported document type: {content_type}")
52
 
53
+ splitter = RecursiveCharacterTextSplitter(chunk_size=600, chunk_overlap=80,separators=["\n\n", "\n", ".", " ", ""])
54
+ # splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
55
  return splitter.split_documents(docs)