ZacBl commited on
Commit
ed055f6
·
verified ·
1 Parent(s): 071bde7

Update doc_preprocessing.py

Browse files
Files changed (1) hide show
  1. doc_preprocessing.py +1 -68
doc_preprocessing.py CHANGED
@@ -1,70 +1,3 @@
1
- # from pypdf import PdfReader
2
- # import docx
3
- # from transformers.pipelines import pipeline
4
- # import streamlit as st
5
-
6
- # def extract_text(file):
7
- # text = ""
8
- # if file.name.endswith(".pdf"):
9
- # try:
10
- # reader = PdfReader(file)
11
- # for page in reader.pages:
12
- # text += page.extract_text() + "\n"
13
- # except Exception as e:
14
- # st.error(f"Error reading PDF {file.name}: {e}")
15
- # return ""
16
- # elif file.name.endswith(".docx"):
17
- # try:
18
- # document = docx.Document(file)
19
- # for paragraph in document.paragraphs:
20
- # text += paragraph.text + "\n"
21
- # except Exception as e:
22
- # st.error(f"Error reading DOCX {file.name}: {e}")
23
- # return ""
24
- # return text
25
-
26
- # def chunk_text(text, chunk_size=500, overlap=50):
27
- # chunks = []
28
- # start = 0
29
- # while start < len(text):
30
- # end = start + chunk_size
31
- # chunk = text[start:end]
32
- # chunks.append(chunk)
33
- # start = end - overlap
34
- # return chunks
35
-
36
- # def get_embeddings(texts):
37
- # try:
38
- # embedding_model = pipeline(
39
- # 'document-question-answering',
40
- # "sentence-transformers/all-MiniLM-L6-v2"
41
- # ) # Example model
42
- # embeddings = embedding_model(texts)
43
- # return embeddings
44
- # except Exception as e:
45
- # st.error(f"Error generating embeddings: {e}")
46
- # return []
47
-
48
- # def process_files(files):
49
- # all_chunks = []
50
- # all_embeddings = []
51
- # chunks_metadata = []
52
-
53
- # for file in files:
54
- # text = extract_text(file)
55
- # if not text: # Skip files that failed to process
56
- # continue
57
- # chunks = chunk_text(text)
58
- # embeddings = get_embeddings(chunks)
59
- # if not embeddings: # Skip files that failed to embed
60
- # continue
61
-
62
- # all_chunks.extend(chunks)
63
- # all_embeddings.extend(embeddings)
64
- # for i, chunk in enumerate(chunks):
65
- # chunks_metadata.append({"file_name": file.name, "chunk_index": i})
66
- # print(f"Processed {len(files)} files, {len(all_chunks)} chunks generated.")
67
- # return all_chunks, all_embeddings, chunks_metadata
68
  import pypdf
69
  from docx import Document
70
  from transformers.pipelines import pipeline
@@ -131,7 +64,7 @@ def get_embeddings(texts)-> np.ndarray:
131
  # embeddings = embedding_model(texts)
132
 
133
 
134
- model = SentenceTransformer("sujet-ai/Marsilia-Embeddings-FR-Base")
135
  embeddings = model.encode(texts)
136
 
137
  print(f"Generated {len(embeddings)} embeddings.")
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  import pypdf
2
  from docx import Document
3
  from transformers.pipelines import pipeline
 
64
  # embeddings = embedding_model(texts)
65
 
66
 
67
+ model = SentenceTransformer("sujet-ai/Marsilia-Embeddings-FR-Base", trust_remote_code=True)
68
  embeddings = model.encode(texts)
69
 
70
  print(f"Generated {len(embeddings)} embeddings.")