File size: 2,436 Bytes
dbabef2
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
from __future__ import annotations

from sentence_transformers import (
    SentenceTransformer
)


class LegalEmbedder:

    def __init__(
        self,
        model_name: str =
        "BAAI/bge-large-en-v1.5"
    ):

        print(
            f"Loading embedding model: "
            f"{model_name}"
        )

        self.model = (
            SentenceTransformer(
                model_name
            )
        )

    # =====================================================
    # DOCUMENT EMBEDDINGS
    # =====================================================

    def embed(
        self,
        texts: list[str]
    ):

        return self.model.encode(
            texts,
            normalize_embeddings=True,
            convert_to_numpy=True,
            batch_size=16,
            show_progress_bar=True
        )

    # =====================================================
    # QUERY EMBEDDING
    # =====================================================

    def embed_query(
        self,
        query: str
    ):

        query = (
            "Represent this sentence "
            "for searching relevant "
            f"passages: {query}"
        )

        return self.model.encode(
            query,
            normalize_embeddings=True,
            convert_to_numpy=True
        )

    # =====================================================
    # VECTOR SIZE
    # =====================================================

    def vector_size(
        self
    ) -> int:

        return (
            self.model
            .get_sentence_embedding_dimension()
        )


# =========================================================
# TEST
# =========================================================

if __name__ == "__main__":

    embedder = (
        LegalEmbedder()
    )

    texts = [
        "Section 52. Facts of which Court shall take judicial notice.",
        "Article 21. Protection of life and personal liberty."
    ]

    vectors = (
        embedder.embed(
            texts
        )
    )

    print()

    print(
        "Vectors:",
        len(vectors)
    )

    print(
        "Dimension:",
        len(vectors[0])
    )

    query_vector = (
        embedder.embed_query(
            "facts judicially noticed by court"
        )
    )

    print(
        "Query Dimension:",
        len(query_vector)
    )

    print(
        "Model Dimension:",
        embedder.vector_size()
    )