Spaces:
Sleeping
Sleeping
Update utils/DocsLoader.py
Browse files- utils/DocsLoader.py +3 -2
utils/DocsLoader.py
CHANGED
|
@@ -3,7 +3,8 @@ import tempfile
|
|
| 3 |
import requests
|
| 4 |
|
| 5 |
from fastapi import HTTPException
|
| 6 |
-
from langchain_community.document_loaders import PyPDFLoader, Docx2txtLoader
|
|
|
|
| 7 |
from langchain.text_splitter import RecursiveCharacterTextSplitter
|
| 8 |
from langchain.schema import Document
|
| 9 |
|
|
@@ -21,7 +22,7 @@ def load_and_chunk(url: str) -> list[Document]:
|
|
| 21 |
tmp.write(resp.content)
|
| 22 |
tmp_path = tmp.name
|
| 23 |
try:
|
| 24 |
-
loader =
|
| 25 |
docs = loader.load_and_split()
|
| 26 |
finally:
|
| 27 |
os.remove(tmp_path)
|
|
|
|
| 3 |
import requests
|
| 4 |
|
| 5 |
from fastapi import HTTPException
|
| 6 |
+
# from langchain_community.document_loaders import PyPDFLoader, Docx2txtLoader
|
| 7 |
+
from langchain_community.document_loaders import PyMuPDFLoader, Docx2txtLoader
|
| 8 |
from langchain.text_splitter import RecursiveCharacterTextSplitter
|
| 9 |
from langchain.schema import Document
|
| 10 |
|
|
|
|
| 22 |
tmp.write(resp.content)
|
| 23 |
tmp_path = tmp.name
|
| 24 |
try:
|
| 25 |
+
loader = PyMuPDFLoader(tmp_path)
|
| 26 |
docs = loader.load_and_split()
|
| 27 |
finally:
|
| 28 |
os.remove(tmp_path)
|