from pptx import Presentation from pypdf import PdfReader def extract_ppt_text(file): prs = Presentation(file) text = "" for slide in prs.slides: for shape in slide.shapes: if hasattr(shape, "text"): text += shape.text + "\n" return text def extract_pdf_text(file): reader = PdfReader(file) text = "" for page in reader.pages: page_text = page.extract_text() if page_text: text += page_text + "\n" return text