speakdocker / extractor.py
subramaniansrc's picture
Update extractor.py
46d6688 verified
Raw
History Blame Contribute Delete
519 Bytes
from pptx import Presentation
from pypdf import PdfReader
def extract_ppt_text(file):
prs = Presentation(file)
text = ""
for slide in prs.slides:
for shape in slide.shapes:
if hasattr(shape, "text"):
text += shape.text + "\n"
return text
def extract_pdf_text(file):
reader = PdfReader(file)
text = ""
for page in reader.pages:
page_text = page.extract_text()
if page_text:
text += page_text + "\n"
return text