ragify / scripts /text_extract_test.py
lloydakresi's picture
wrote code for context gen, llm_gen, retrieval. working on pipeline
86f9adc
Raw
History Blame Contribute Delete
446 Bytes
import pdfplumber as pp
import os
from dotenv import load_dotenv
import chromadb
client = chromadb.Client()
collection = client.create_collection(name="doc_collection")
load_dotenv()
ENV = os.getenv("ENV", "local")
corpus_path = "../corpus/d2l-en.pdf"
with pp.open(corpus_path) as f:
for page in f.pages:
collection.add(
ids = [str(page.page_number)],
documents=[page.extract_text()]
)
break