cleanup
Browse files- app/engine/chunk_embed.py +0 -30
- app/engine/llm.py +0 -0
app/engine/chunk_embed.py
CHANGED
|
@@ -58,33 +58,3 @@ def chunk_vectorize(doc_content: dict = None,
|
|
| 58 |
new_df.to_parquet(parquet_file, index=False)
|
| 59 |
|
| 60 |
return
|
| 61 |
-
|
| 62 |
-
# TODO
|
| 63 |
-
# import unittest
|
| 64 |
-
# from unitesting_utils import load_impact_theory_data
|
| 65 |
-
|
| 66 |
-
# class TestSplitContents(unittest.TestCase):
|
| 67 |
-
# '''
|
| 68 |
-
# Unit test to ensure proper functionality of split_contents function
|
| 69 |
-
# '''
|
| 70 |
-
|
| 71 |
-
# def test_split_contents(self):
|
| 72 |
-
# import tiktoken
|
| 73 |
-
# from llama_index.text_splitter import SentenceSplitter
|
| 74 |
-
|
| 75 |
-
# data = load_impact_theory_data()
|
| 76 |
-
|
| 77 |
-
# subset = data[:3]
|
| 78 |
-
# chunk_size = 256
|
| 79 |
-
# chunk_overlap = 0
|
| 80 |
-
# encoding = tiktoken.encoding_for_model('gpt-3.5-turbo-0613')
|
| 81 |
-
# gpt35_txt_splitter = SentenceSplitter(chunk_size=chunk_size, tokenizer=encoding.encode, chunk_overlap=chunk_overlap)
|
| 82 |
-
# results = split_contents(subset, gpt35_txt_splitter)
|
| 83 |
-
# self.assertEqual(len(results), 3)
|
| 84 |
-
# self.assertEqual(len(results[0]), 83)
|
| 85 |
-
# self.assertEqual(len(results[1]), 178)
|
| 86 |
-
# self.assertEqual(len(results[2]), 144)
|
| 87 |
-
# self.assertTrue(isinstance(results, list))
|
| 88 |
-
# self.assertTrue(isinstance(results[0], list))
|
| 89 |
-
# self.assertTrue(isinstance(results[0][0], str))
|
| 90 |
-
# unittest.TextTestRunner().run(unittest.TestLoader().loadTestsFromTestCase(TestSplitContents))
|
|
|
|
| 58 |
new_df.to_parquet(parquet_file, index=False)
|
| 59 |
|
| 60 |
return
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
app/engine/llm.py
DELETED
|
File without changes
|