singhankur01 commited on
Commit
629f039
·
verified ·
1 Parent(s): 6e0eba1

Update utils/DocsLoader.py

Browse files
Files changed (1) hide show
  1. utils/DocsLoader.py +4 -1
utils/DocsLoader.py CHANGED
@@ -6,8 +6,10 @@ from fastapi import HTTPException
6
  # from langchain_community.document_loaders import PyPDFLoader, Docx2txtLoader
7
  from langchain_community.document_loaders import PyMuPDFLoader, Docx2txtLoader
8
  from langchain.text_splitter import RecursiveCharacterTextSplitter
 
9
  from langchain.schema import Document
10
 
 
11
 
12
  def load_and_chunk(url: str) -> list[Document]:
13
  print(url)
@@ -48,5 +50,6 @@ def load_and_chunk(url: str) -> list[Document]:
48
  else:
49
  raise HTTPException(400, f"Unsupported document type: {content_type}")
50
 
51
- splitter = RecursiveCharacterTextSplitter(chunk_size=1000, chunk_overlap=100,separators=["\n\n", "\n", ".", " ", ""])
 
52
  return splitter.split_documents(docs)
 
6
  # from langchain_community.document_loaders import PyPDFLoader, Docx2txtLoader
7
  from langchain_community.document_loaders import PyMuPDFLoader, Docx2txtLoader
8
  from langchain.text_splitter import RecursiveCharacterTextSplitter
9
+ from langchain_text_splitters.sentence_transformers import SentenceTransformersTokenTextSplitter
10
  from langchain.schema import Document
11
 
12
+ MODEL_DIR = os.path.join("/tmp", "e5-large-v2")
13
 
14
  def load_and_chunk(url: str) -> list[Document]:
15
  print(url)
 
50
  else:
51
  raise HTTPException(400, f"Unsupported document type: {content_type}")
52
 
53
+ # splitter = RecursiveCharacterTextSplitter(chunk_size=1000, chunk_overlap=100,separators=["\n\n", "\n", ".", " ", ""])
54
+ splitter = SentenceTransformersTokenTextSplitter(model_name = MODEL_DIR,tokens_per_chunk=500, chunk_overlap=80)
55
  return splitter.split_documents(docs)