JPBianchi commited on
Commit
ed17324
·
1 Parent(s): f1b9425
Files changed (2) hide show
  1. app/engine/chunk_embed.py +0 -30
  2. app/engine/llm.py +0 -0
app/engine/chunk_embed.py CHANGED
@@ -58,33 +58,3 @@ def chunk_vectorize(doc_content: dict = None,
58
  new_df.to_parquet(parquet_file, index=False)
59
 
60
  return
61
-
62
- # TODO
63
- # import unittest
64
- # from unitesting_utils import load_impact_theory_data
65
-
66
- # class TestSplitContents(unittest.TestCase):
67
- # '''
68
- # Unit test to ensure proper functionality of split_contents function
69
- # '''
70
-
71
- # def test_split_contents(self):
72
- # import tiktoken
73
- # from llama_index.text_splitter import SentenceSplitter
74
-
75
- # data = load_impact_theory_data()
76
-
77
- # subset = data[:3]
78
- # chunk_size = 256
79
- # chunk_overlap = 0
80
- # encoding = tiktoken.encoding_for_model('gpt-3.5-turbo-0613')
81
- # gpt35_txt_splitter = SentenceSplitter(chunk_size=chunk_size, tokenizer=encoding.encode, chunk_overlap=chunk_overlap)
82
- # results = split_contents(subset, gpt35_txt_splitter)
83
- # self.assertEqual(len(results), 3)
84
- # self.assertEqual(len(results[0]), 83)
85
- # self.assertEqual(len(results[1]), 178)
86
- # self.assertEqual(len(results[2]), 144)
87
- # self.assertTrue(isinstance(results, list))
88
- # self.assertTrue(isinstance(results[0], list))
89
- # self.assertTrue(isinstance(results[0][0], str))
90
- # unittest.TextTestRunner().run(unittest.TestLoader().loadTestsFromTestCase(TestSplitContents))
 
58
  new_df.to_parquet(parquet_file, index=False)
59
 
60
  return
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
app/engine/llm.py DELETED
File without changes