ktcapraz commited on
Commit
e8795bd
·
verified ·
1 Parent(s): 6df85ad

Add new SentenceTransformer model

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
1_Pooling/config.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "word_embedding_dimension": 768,
3
+ "pooling_mode_cls_token": false,
4
+ "pooling_mode_mean_tokens": true,
5
+ "pooling_mode_max_tokens": false,
6
+ "pooling_mode_mean_sqrt_len_tokens": false,
7
+ "pooling_mode_weightedmean_tokens": false,
8
+ "pooling_mode_lasttoken": false,
9
+ "include_prompt": true
10
+ }
2_Dense/config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "in_features": 768,
3
+ "out_features": 3072,
4
+ "bias": false,
5
+ "activation_function": "torch.nn.modules.linear.Identity"
6
+ }
2_Dense/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:98ed1f659c9baefbf32fb9a0397363dc26ee290ecf1f8f6f28a28668bfb52b60
3
+ size 9437272
3_Dense/config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "in_features": 3072,
3
+ "out_features": 768,
4
+ "bias": false,
5
+ "activation_function": "torch.nn.modules.linear.Identity"
6
+ }
3_Dense/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:090e58e0f22cd17a732dbea86f0b9f0c826a8a69b82d8580654d57b017624d2f
3
+ size 9437272
README.md ADDED
@@ -0,0 +1,584 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ tags:
3
+ - sentence-transformers
4
+ - sentence-similarity
5
+ - feature-extraction
6
+ - dense
7
+ - generated_from_trainer
8
+ - dataset_size:74864
9
+ - loss:CachedMultipleNegativesRankingLoss
10
+ base_model: google/embeddinggemma-300m
11
+ widget:
12
+ - source_sentence: Was ist aus der früheren Division "Passive Sicherheitstechnik"
13
+ geworden?
14
+ sentences:
15
+ - Adania Shiblis Roman "Eine Nebensache" erschien im Original vor sieben Jahren
16
+ und auf Deutsch vor zwei Jahren.
17
+ - Der Bundesvorsitzende des Fahrgastverbandes Pro Bahn, Detlef Neuß, rät Reisenden,
18
+ ausreichend Getränke, Obst und Verpflegung mitzuführen, da Bordrestaurants nicht
19
+ immer garantiert geöffnet sein werden. Es wird auch empfohlen, Bücher oder Unterhaltungselektronik
20
+ sowie Spiele für Kinder mitzunehmen, um die Reisezeit angenehmer zu gestalten.
21
+ Die Bahn empfiehlt zudem dringend, Sitzplätze zu reservieren, da die Züge stark
22
+ gebucht sind, und rät, auf weniger ausgelastete Fahrten auszuweichen, falls möglich.
23
+ - Die frühere Division "Passive Sicherheitstechnik", die Airbags und Sicherheitsgurte
24
+ herstellt, wurde aus den Konzernstrukturen herausgelöst und firmiert eigenständig
25
+ als Tochter unter dem Namen ZF Lifetec. Für diesen Bereich sucht ZF einen Partner,
26
+ erwägt aber auch einen Börsengang.
27
+ - source_sentence: Wo befindet sich die Zentrale Anlaufstelle für Asylsuchende in
28
+ Sachsen-Anhalt?
29
+ sentences:
30
+ - Die klassische Exilopposition im Iran versucht, politische und gesellschaftliche
31
+ Relevanz zu beweisen, indem sie mediale Reichweite und Präsenz in sozialen Medien
32
+ nutzt. Einige Vertreter bemühen sich gezielt um Kontakte zu westlichen Staaten,
33
+ in der Hoffnung, durch außenpolitische Legitimation zu einer politischen Alternative
34
+ aufzusteigen.
35
+ - Die Zentrale Anlaufstelle für Asylsuchende in Sachsen-Anhalt befindet sich in
36
+ Halberstadt.
37
+ - Obwohl die Hauptgeschichte der Gereon-Rath-Reihe abgeschlossen ist, wird demnächst
38
+ noch ein Kurzgeschichtenband aus diesem Universum sowie ein dritter Band einer
39
+ illustrierten Reihe mit der Zeichnerin Kat Menschik erscheinen. Kutscher selbst
40
+ plant, sich in zwei bis drei Jahren einem völlig neuen Romanstoff zu widmen, dessen
41
+ Thema er noch nicht kennt.
42
+ - source_sentence: Wie bewerten Experten die aktuelle Regierungsumbildung in der Ukraine?
43
+ sentences:
44
+ - Beobachter wie der Investmentbanker Serhij Fursa und der Politikwissenschaftler
45
+ Wolodymyr Fesenko sehen die Umbildung positiv oder neutral. Fursa hebt die wirtschaftliche
46
+ Kompetenz der neuen Ministerpräsidentin Swyrydenko und die Beförderung von Soboljew
47
+ und Katschka hervor. Fesenko bezeichnet die Änderungen als taktische Neukonfiguration
48
+ zur Optimierung der Regierungsarbeit und Sicherung des Überlebens des Landes,
49
+ wobei er auf die Erfahrung des eingesetzten Personals verweist und von keinen
50
+ Wundern, aber von kompetentem Handeln ausgeht.
51
+ - Volkswagen führt die Rangliste bei den Gesamtausgaben für Aufsichtsräte an. Der
52
+ Konzern zahlte seinen 20 Aufsichtsräten insgesamt rund 7,5 Millionen Euro, was
53
+ einer Steigerung von 42 Prozent gegenüber 2022 entspricht und die erste Anhebung
54
+ seit sechs Jahren war. Dahinter folgen die Deutsche Bank mit rund 7,4 Millionen
55
+ Euro und Mercedes-Benz mit rund 5,9 Millionen Euro.
56
+ - Nach dem Schlusspfiff kam es zu einem Platzsturm der Dresdner Fans, bei dem Böller
57
+ und Bengalos gezündet wurden. Die Situation eskalierte kurzzeitig, wurde aber
58
+ von Sicherheitskräften unter Kontrolle gebracht. Später feierten die Spieler friedlich
59
+ mit Aufstiegsshirts und Getränken.
60
+ - source_sentence: Welche Rolle spielt der Volksbund deutsche Kriegsgräberfürsorge
61
+ in Hessen?
62
+ sentences:
63
+ - Berichten zufolge gab es Fortschritte bei Gesprächen zwischen Vertretern der USA,
64
+ Israels und Katars im Weißen Haus. Es ging um eine 60-tägige Waffenruhe, den teilweisen
65
+ Rückzug israelischer Truppen und die Vorlage einer Lagekarte mit einem weitergehenden
66
+ Truppenrückzug, was die Chancen auf einen Deal erhöht haben soll.
67
+ - Der Volksbund deutsche Kriegsgräberfürsorge in Hessen trägt dazu bei, dass die
68
+ Toten des Zweiten Weltkrieges nicht vergessen werden. Seine Aufgabe ist der Erhalt
69
+ von Kriegsgräberstätten im In- und Ausland, um als Mahnung zum Frieden zu dienen.
70
+ Das internationale Völkerrecht schützt das dauernde Ruherecht der Kriegstoten,
71
+ und die Kriegsgräberfürsorge kümmert sich um die Pflege ihrer Gräber in Deutschland.
72
+ - Das verdichtende Augenbrauengel von Typology Paris wird als Entdeckung des Jahres
73
+ bezeichnet. Es ist silikonfrei, vegan und in drei Farben erhältlich. Die Formel
74
+ mit Erbsenpeptid und pflanzlichem Keratin soll die Augenbrauen stärken und das
75
+ Wachstum anregen, was zu volleren Brauen führt.
76
+ - source_sentence: Was ist das Rückhaltebecken Siefenwang und wann wurde es geplant?
77
+ sentences:
78
+ - Das Rückhaltebecken Siefenwang ist ein Projekt zum Hochwasserschutz, benannt nach
79
+ einem Ortsteil von Dinkelscherben. Die Pläne dafür stammen aus den Jahren 2000
80
+ und 2005. Es soll bis zu 1,25 Millionen Kubikmeter Wasser fassen und eine Überflutungsfläche
81
+ von bis zu 136 Hektar haben. Die Gesamtkosten belaufen sich auf 9,5 Millionen
82
+ Euro.
83
+ - Der Kakaopreis hat sich innerhalb eines Jahres mehr als verdoppelt, von rund 4000
84
+ auf über 9200 Euro pro Tonne. Hauptursachen sind Missernten in Westafrika, insbesondere
85
+ an der Elfenbeinküste, die für über ein Drittel der weltweiten Kakaoproduktion
86
+ verantwortlich ist. Schlechte Wetterbedingungen und kranke Bäume haben dort im
87
+ zweiten Jahr in Folge zu erheblichen Ernteausfällen geführt, was die weltweiten
88
+ Kakaobestände auf ein 20-Jahres-Tief sinken ließ.
89
+ - Der parteilose Ex-Minister Volker Wissing warnt vor einem Scheitern der schwarz-roten
90
+ Koalition aufgrund innerer Spannungen, die sich auch in der Gesellschaft widerspiegeln.
91
+ Er verweist auf die gescheiterte Wahl von Frauke Brosius-Gersdorf zur Verfassungsrichterin
92
+ und die verfehlte Mehrheit für Friedrich Merz als Zeichen mangelnder Disziplin.
93
+ datasets:
94
+ - ktcapraz/german-qna-full
95
+ pipeline_tag: sentence-similarity
96
+ library_name: sentence-transformers
97
+ metrics:
98
+ - cosine_accuracy@1
99
+ - cosine_accuracy@3
100
+ - cosine_accuracy@5
101
+ - cosine_accuracy@10
102
+ - cosine_precision@1
103
+ - cosine_precision@3
104
+ - cosine_precision@5
105
+ - cosine_precision@10
106
+ - cosine_recall@1
107
+ - cosine_recall@3
108
+ - cosine_recall@5
109
+ - cosine_recall@10
110
+ - cosine_ndcg@10
111
+ - cosine_mrr@10
112
+ - cosine_map@100
113
+ model-index:
114
+ - name: SentenceTransformer based on google/embeddinggemma-300m
115
+ results:
116
+ - task:
117
+ type: information-retrieval
118
+ name: Information Retrieval
119
+ dataset:
120
+ name: germanqna eval
121
+ type: germanqna-eval
122
+ metrics:
123
+ - type: cosine_accuracy@1
124
+ value: 0.7826888399118413
125
+ name: Cosine Accuracy@1
126
+ - type: cosine_accuracy@3
127
+ value: 0.9020236425566018
128
+ name: Cosine Accuracy@3
129
+ - type: cosine_accuracy@5
130
+ value: 0.9311961530755359
131
+ name: Cosine Accuracy@5
132
+ - type: cosine_accuracy@10
133
+ value: 0.9562813063514326
134
+ name: Cosine Accuracy@10
135
+ - type: cosine_precision@1
136
+ value: 0.7826888399118413
137
+ name: Cosine Precision@1
138
+ - type: cosine_precision@3
139
+ value: 0.3006745475188672
140
+ name: Cosine Precision@3
141
+ - type: cosine_precision@5
142
+ value: 0.18623923061510722
143
+ name: Cosine Precision@5
144
+ - type: cosine_precision@10
145
+ value: 0.09562813063514328
146
+ name: Cosine Precision@10
147
+ - type: cosine_recall@1
148
+ value: 0.7826888399118413
149
+ name: Cosine Recall@1
150
+ - type: cosine_recall@3
151
+ value: 0.9020236425566018
152
+ name: Cosine Recall@3
153
+ - type: cosine_recall@5
154
+ value: 0.9311961530755359
155
+ name: Cosine Recall@5
156
+ - type: cosine_recall@10
157
+ value: 0.9562813063514326
158
+ name: Cosine Recall@10
159
+ - type: cosine_ndcg@10
160
+ value: 0.8740587256774777
161
+ name: Cosine Ndcg@10
162
+ - type: cosine_mrr@10
163
+ value: 0.8471928996002355
164
+ name: Cosine Mrr@10
165
+ - type: cosine_map@100
166
+ value: 0.8489725949192556
167
+ name: Cosine Map@100
168
+ ---
169
+
170
+ # SentenceTransformer based on google/embeddinggemma-300m
171
+
172
+ This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [google/embeddinggemma-300m](https://huggingface.co/google/embeddinggemma-300m) on the [german-qna-full](https://huggingface.co/datasets/ktcapraz/german-qna-full) dataset. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.
173
+
174
+ ## Model Details
175
+
176
+ ### Model Description
177
+ - **Model Type:** Sentence Transformer
178
+ - **Base model:** [google/embeddinggemma-300m](https://huggingface.co/google/embeddinggemma-300m) <!-- at revision c5cfa06e5e282a820e85d57f7fb053207494f41d -->
179
+ - **Maximum Sequence Length:** 2048 tokens
180
+ - **Output Dimensionality:** 768 dimensions
181
+ - **Similarity Function:** Cosine Similarity
182
+ - **Training Dataset:**
183
+ - [german-qna-full](https://huggingface.co/datasets/ktcapraz/german-qna-full)
184
+ <!-- - **Language:** Unknown -->
185
+ <!-- - **License:** Unknown -->
186
+
187
+ ### Model Sources
188
+
189
+ - **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
190
+ - **Repository:** [Sentence Transformers on GitHub](https://github.com/UKPLab/sentence-transformers)
191
+ - **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
192
+
193
+ ### Full Model Architecture
194
+
195
+ ```
196
+ SentenceTransformer(
197
+ (0): Transformer({'max_seq_length': 2048, 'do_lower_case': False, 'architecture': 'Gemma3TextModel'})
198
+ (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
199
+ (2): Dense({'in_features': 768, 'out_features': 3072, 'bias': False, 'activation_function': 'torch.nn.modules.linear.Identity'})
200
+ (3): Dense({'in_features': 3072, 'out_features': 768, 'bias': False, 'activation_function': 'torch.nn.modules.linear.Identity'})
201
+ (4): Normalize()
202
+ )
203
+ ```
204
+
205
+ ## Usage
206
+
207
+ ### Direct Usage (Sentence Transformers)
208
+
209
+ First install the Sentence Transformers library:
210
+
211
+ ```bash
212
+ pip install -U sentence-transformers
213
+ ```
214
+
215
+ Then you can load this model and run inference.
216
+ ```python
217
+ from sentence_transformers import SentenceTransformer
218
+
219
+ # Download from the 🤗 Hub
220
+ model = SentenceTransformer("ktcapraz/embeddinggemma-german_qna-checkpoint-500")
221
+ # Run inference
222
+ queries = [
223
+ "Was ist das R\u00fcckhaltebecken Siefenwang und wann wurde es geplant?",
224
+ ]
225
+ documents = [
226
+ 'Das Rückhaltebecken Siefenwang ist ein Projekt zum Hochwasserschutz, benannt nach einem Ortsteil von Dinkelscherben. Die Pläne dafür stammen aus den Jahren 2000 und 2005. Es soll bis zu 1,25 Millionen Kubikmeter Wasser fassen und eine Überflutungsfläche von bis zu 136 Hektar haben. Die Gesamtkosten belaufen sich auf 9,5 Millionen Euro.',
227
+ 'Der parteilose Ex-Minister Volker Wissing warnt vor einem Scheitern der schwarz-roten Koalition aufgrund innerer Spannungen, die sich auch in der Gesellschaft widerspiegeln. Er verweist auf die gescheiterte Wahl von Frauke Brosius-Gersdorf zur Verfassungsrichterin und die verfehlte Mehrheit für Friedrich Merz als Zeichen mangelnder Disziplin.',
228
+ 'Der Kakaopreis hat sich innerhalb eines Jahres mehr als verdoppelt, von rund 4000 auf über 9200 Euro pro Tonne. Hauptursachen sind Missernten in Westafrika, insbesondere an der Elfenbeinküste, die für über ein Drittel der weltweiten Kakaoproduktion verantwortlich ist. Schlechte Wetterbedingungen und kranke Bäume haben dort im zweiten Jahr in Folge zu erheblichen Ernteausfällen geführt, was die weltweiten Kakaobestände auf ein 20-Jahres-Tief sinken ließ.',
229
+ ]
230
+ query_embeddings = model.encode_query(queries)
231
+ document_embeddings = model.encode_document(documents)
232
+ print(query_embeddings.shape, document_embeddings.shape)
233
+ # [1, 768] [3, 768]
234
+
235
+ # Get the similarity scores for the embeddings
236
+ similarities = model.similarity(query_embeddings, document_embeddings)
237
+ print(similarities)
238
+ # tensor([[ 0.6243, 0.0075, -0.1137]])
239
+ ```
240
+
241
+ <!--
242
+ ### Direct Usage (Transformers)
243
+
244
+ <details><summary>Click to see the direct usage in Transformers</summary>
245
+
246
+ </details>
247
+ -->
248
+
249
+ <!--
250
+ ### Downstream Usage (Sentence Transformers)
251
+
252
+ You can finetune this model on your own dataset.
253
+
254
+ <details><summary>Click to expand</summary>
255
+
256
+ </details>
257
+ -->
258
+
259
+ <!--
260
+ ### Out-of-Scope Use
261
+
262
+ *List how the model may foreseeably be misused and address what users ought not to do with the model.*
263
+ -->
264
+
265
+ ## Evaluation
266
+
267
+ ### Metrics
268
+
269
+ #### Information Retrieval
270
+
271
+ * Dataset: `germanqna-eval`
272
+ * Evaluated with [<code>InformationRetrievalEvaluator</code>](https://sbert.net/docs/package_reference/sentence_transformer/evaluation.html#sentence_transformers.evaluation.InformationRetrievalEvaluator)
273
+
274
+ | Metric | Value |
275
+ |:--------------------|:-----------|
276
+ | cosine_accuracy@1 | 0.7827 |
277
+ | cosine_accuracy@3 | 0.902 |
278
+ | cosine_accuracy@5 | 0.9312 |
279
+ | cosine_accuracy@10 | 0.9563 |
280
+ | cosine_precision@1 | 0.7827 |
281
+ | cosine_precision@3 | 0.3007 |
282
+ | cosine_precision@5 | 0.1862 |
283
+ | cosine_precision@10 | 0.0956 |
284
+ | cosine_recall@1 | 0.7827 |
285
+ | cosine_recall@3 | 0.902 |
286
+ | cosine_recall@5 | 0.9312 |
287
+ | cosine_recall@10 | 0.9563 |
288
+ | **cosine_ndcg@10** | **0.8741** |
289
+ | cosine_mrr@10 | 0.8472 |
290
+ | cosine_map@100 | 0.849 |
291
+
292
+ <!--
293
+ ## Bias, Risks and Limitations
294
+
295
+ *What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model.*
296
+ -->
297
+
298
+ <!--
299
+ ### Recommendations
300
+
301
+ *What are recommendations with respect to the foreseeable issues? For example, filtering explicit content.*
302
+ -->
303
+
304
+ ## Training Details
305
+
306
+ ### Training Dataset
307
+
308
+ #### german-qna-full
309
+
310
+ * Dataset: [german-qna-full](https://huggingface.co/datasets/ktcapraz/german-qna-full) at [24161ff](https://huggingface.co/datasets/ktcapraz/german-qna-full/tree/24161ff65fff43c329f27f4533da0dd776a3cda7)
311
+ * Size: 74,864 training samples
312
+ * Columns: <code>frage</code> and <code>antwort</code>
313
+ * Approximate statistics based on the first 1000 samples:
314
+ | | frage | antwort |
315
+ |:--------|:----------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|
316
+ | type | string | string |
317
+ | details | <ul><li>min: 8 tokens</li><li>mean: 18.54 tokens</li><li>max: 42 tokens</li></ul> | <ul><li>min: 18 tokens</li><li>mean: 71.88 tokens</li><li>max: 165 tokens</li></ul> |
318
+ * Samples:
319
+ | frage | antwort |
320
+ |:---------------------------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
321
+ | <code>Welche konkreten Maßnahmen für E-Autos sind im Koalitionsvertrag von Union und SPD geplant?</code> | <code>Geplant sind eine steuerliche Begünstigung für Dienstwagen als E-Autos, eine Sonderabschreibung für E-Fahrzeuge und eine Verlängerung der Kfz-Steuerbefreiung für Elektroautos bis 2035. Zudem soll der Ausbau des Ladenetzes beschleunigt werden.</code> |
322
+ | <code>Welche Kritik übte Bundeskanzler Olaf Scholz an der CDU und Friedrich Merz?</code> | <code>Bundeskanzler Olaf Scholz warf der CDU unter ihrem Kanzlerkandidaten Friedrich Merz vor, sich sehr weit von der Linie der ehemaligen Bundeskanzlerin Angela Merkel entfernt zu haben. Er sagte, die CDU habe sich von ihren sozialen Werten abgewandt und warnte vor ihrer konservativen Politik, insbesondere in der Rentenpolitik.</code> |
323
+ | <code>Welche Koalitionspräferenz äußerte Aiwanger?</code> | <code>Aiwanger äußerte die Hoffnung auf eine "bürgerliche Koalition der Mitte" im Bundestag, idealerweise mit seiner Partei. Er zeigte sich besorgt über eine mögliche Koalition aus Schwarz-Rot-Grün, da diese die Probleme des Landes seiner Meinung nach nicht lösen würde. Sollte seine Partei nicht in Berlin vertreten sein, plane er, in Bayern zu bleiben.</code> |
324
+ * Loss: [<code>CachedMultipleNegativesRankingLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cachedmultiplenegativesrankingloss) with these parameters:
325
+ ```json
326
+ {
327
+ "scale": 20.0,
328
+ "similarity_fct": "cos_sim",
329
+ "mini_batch_size": 8,
330
+ "gather_across_devices": false
331
+ }
332
+ ```
333
+
334
+ ### Evaluation Dataset
335
+
336
+ #### german-qna-full
337
+
338
+ * Dataset: [german-qna-full](https://huggingface.co/datasets/ktcapraz/german-qna-full) at [24161ff](https://huggingface.co/datasets/ktcapraz/german-qna-full/tree/24161ff65fff43c329f27f4533da0dd776a3cda7)
339
+ * Size: 24,955 evaluation samples
340
+ * Columns: <code>frage</code> and <code>antwort</code>
341
+ * Approximate statistics based on the first 1000 samples:
342
+ | | frage | antwort |
343
+ |:--------|:----------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|
344
+ | type | string | string |
345
+ | details | <ul><li>min: 8 tokens</li><li>mean: 18.44 tokens</li><li>max: 40 tokens</li></ul> | <ul><li>min: 18 tokens</li><li>mean: 71.59 tokens</li><li>max: 168 tokens</li></ul> |
346
+ * Samples:
347
+ | frage | antwort |
348
+ |:----------------------------------------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
349
+ | <code>Warum haben Griechenland und Italien viele Lobbyisten für fossile Brennstoffe zur COP29 entsandt?</code> | <code>Griechenland und Italien sind die größten Abnehmer von aserbaidschanischem Gas. Beide Länder sind auf die südeuropäische Erdgaspipeline angewiesen, die Aserbaidschan über die Türkei mit Europa verbindet und eine Kapazität von mindestens 10 Milliarden Kubikmetern Gas pro Jahr hat. Dies erklärt die hohe Präsenz von Lobbyisten für fossile Brennstoffe aus diesen Ländern.</code> |
350
+ | <code>Welche Strafe erhielt der Angeklagte und warum?</code> | <code>Der 29-jährige Angeklagte wurde zu fünfeinhalb Jahren Haft verurteilt. Die Strafkammer berücksichtigte sein Geständnis, kritisierte jedoch, dass er seinen Tatbeitrag herunterspielen wollte. Strafverschärfend wirkte, dass die Seniorin gefesselt zurückgelassen wurde und unter Todesangst litt.</code> |
351
+ | <code>Wann werden die neuen Direktverbindungen zwischen Deutschland und Italien voraussichtlich starten?</code> | <code>Die Direktverbindungen im Hochgeschwindigkeitszug von München nach Mailand und Rom sollen voraussichtlich ab Dezember 2026 starten. Zunächst wird es je eine Verbindung pro Tag geben, mit italienischen Frecciarossa-Zügen, die auch in Deutschland verkehren.</code> |
352
+ * Loss: [<code>CachedMultipleNegativesRankingLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cachedmultiplenegativesrankingloss) with these parameters:
353
+ ```json
354
+ {
355
+ "scale": 20.0,
356
+ "similarity_fct": "cos_sim",
357
+ "mini_batch_size": 8,
358
+ "gather_across_devices": false
359
+ }
360
+ ```
361
+
362
+ ### Training Hyperparameters
363
+ #### Non-Default Hyperparameters
364
+
365
+ - `eval_strategy`: steps
366
+ - `per_device_train_batch_size`: 128
367
+ - `per_device_eval_batch_size`: 128
368
+ - `learning_rate`: 2e-05
369
+ - `num_train_epochs`: 1
370
+ - `warmup_ratio`: 0.1
371
+ - `fp16`: True
372
+ - `prompts`: {'frage': 'task: search result | query: ', 'antwort': 'title: none | text: '}
373
+ - `batch_sampler`: no_duplicates
374
+
375
+ #### All Hyperparameters
376
+ <details><summary>Click to expand</summary>
377
+
378
+ - `overwrite_output_dir`: False
379
+ - `do_predict`: False
380
+ - `eval_strategy`: steps
381
+ - `prediction_loss_only`: True
382
+ - `per_device_train_batch_size`: 128
383
+ - `per_device_eval_batch_size`: 128
384
+ - `per_gpu_train_batch_size`: None
385
+ - `per_gpu_eval_batch_size`: None
386
+ - `gradient_accumulation_steps`: 1
387
+ - `eval_accumulation_steps`: None
388
+ - `torch_empty_cache_steps`: None
389
+ - `learning_rate`: 2e-05
390
+ - `weight_decay`: 0.0
391
+ - `adam_beta1`: 0.9
392
+ - `adam_beta2`: 0.999
393
+ - `adam_epsilon`: 1e-08
394
+ - `max_grad_norm`: 1.0
395
+ - `num_train_epochs`: 1
396
+ - `max_steps`: -1
397
+ - `lr_scheduler_type`: linear
398
+ - `lr_scheduler_kwargs`: {}
399
+ - `warmup_ratio`: 0.1
400
+ - `warmup_steps`: 0
401
+ - `log_level`: passive
402
+ - `log_level_replica`: warning
403
+ - `log_on_each_node`: True
404
+ - `logging_nan_inf_filter`: True
405
+ - `save_safetensors`: True
406
+ - `save_on_each_node`: False
407
+ - `save_only_model`: False
408
+ - `restore_callback_states_from_checkpoint`: False
409
+ - `no_cuda`: False
410
+ - `use_cpu`: False
411
+ - `use_mps_device`: False
412
+ - `seed`: 42
413
+ - `data_seed`: None
414
+ - `jit_mode_eval`: False
415
+ - `use_ipex`: False
416
+ - `bf16`: False
417
+ - `fp16`: True
418
+ - `fp16_opt_level`: O1
419
+ - `half_precision_backend`: auto
420
+ - `bf16_full_eval`: False
421
+ - `fp16_full_eval`: False
422
+ - `tf32`: None
423
+ - `local_rank`: 0
424
+ - `ddp_backend`: None
425
+ - `tpu_num_cores`: None
426
+ - `tpu_metrics_debug`: False
427
+ - `debug`: []
428
+ - `dataloader_drop_last`: False
429
+ - `dataloader_num_workers`: 0
430
+ - `dataloader_prefetch_factor`: None
431
+ - `past_index`: -1
432
+ - `disable_tqdm`: False
433
+ - `remove_unused_columns`: True
434
+ - `label_names`: None
435
+ - `load_best_model_at_end`: False
436
+ - `ignore_data_skip`: False
437
+ - `fsdp`: []
438
+ - `fsdp_min_num_params`: 0
439
+ - `fsdp_config`: {'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}
440
+ - `fsdp_transformer_layer_cls_to_wrap`: None
441
+ - `accelerator_config`: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
442
+ - `parallelism_config`: None
443
+ - `deepspeed`: None
444
+ - `label_smoothing_factor`: 0.0
445
+ - `optim`: adamw_torch_fused
446
+ - `optim_args`: None
447
+ - `adafactor`: False
448
+ - `group_by_length`: False
449
+ - `length_column_name`: length
450
+ - `ddp_find_unused_parameters`: None
451
+ - `ddp_bucket_cap_mb`: None
452
+ - `ddp_broadcast_buffers`: False
453
+ - `dataloader_pin_memory`: True
454
+ - `dataloader_persistent_workers`: False
455
+ - `skip_memory_metrics`: True
456
+ - `use_legacy_prediction_loop`: False
457
+ - `push_to_hub`: False
458
+ - `resume_from_checkpoint`: None
459
+ - `hub_model_id`: None
460
+ - `hub_strategy`: every_save
461
+ - `hub_private_repo`: None
462
+ - `hub_always_push`: False
463
+ - `hub_revision`: None
464
+ - `gradient_checkpointing`: False
465
+ - `gradient_checkpointing_kwargs`: None
466
+ - `include_inputs_for_metrics`: False
467
+ - `include_for_metrics`: []
468
+ - `eval_do_concat_batches`: True
469
+ - `fp16_backend`: auto
470
+ - `push_to_hub_model_id`: None
471
+ - `push_to_hub_organization`: None
472
+ - `mp_parameters`:
473
+ - `auto_find_batch_size`: False
474
+ - `full_determinism`: False
475
+ - `torchdynamo`: None
476
+ - `ray_scope`: last
477
+ - `ddp_timeout`: 1800
478
+ - `torch_compile`: False
479
+ - `torch_compile_backend`: None
480
+ - `torch_compile_mode`: None
481
+ - `include_tokens_per_second`: False
482
+ - `include_num_input_tokens_seen`: False
483
+ - `neftune_noise_alpha`: None
484
+ - `optim_target_modules`: None
485
+ - `batch_eval_metrics`: False
486
+ - `eval_on_start`: False
487
+ - `use_liger_kernel`: False
488
+ - `liger_kernel_config`: None
489
+ - `eval_use_gather_object`: False
490
+ - `average_tokens_across_devices`: False
491
+ - `prompts`: {'frage': 'task: search result | query: ', 'antwort': 'title: none | text: '}
492
+ - `batch_sampler`: no_duplicates
493
+ - `multi_dataset_batch_sampler`: proportional
494
+ - `router_mapping`: {}
495
+ - `learning_rate_mapping`: {}
496
+
497
+ </details>
498
+
499
+ ### Training Logs
500
+ | Epoch | Step | Training Loss | Validation Loss | germanqna-eval_cosine_ndcg@10 |
501
+ |:------:|:----:|:-------------:|:---------------:|:-----------------------------:|
502
+ | -1 | -1 | - | - | 0.6554 |
503
+ | 0.0342 | 20 | 0.4638 | - | - |
504
+ | 0.0684 | 40 | 0.125 | - | - |
505
+ | 0.1026 | 60 | 0.1045 | - | - |
506
+ | 0.1368 | 80 | 0.1135 | - | - |
507
+ | 0.1709 | 100 | 0.1174 | 0.1014 | 0.8230 |
508
+ | 0.2051 | 120 | 0.1047 | - | - |
509
+ | 0.2393 | 140 | 0.1092 | - | - |
510
+ | 0.2735 | 160 | 0.1067 | - | - |
511
+ | 0.3077 | 180 | 0.0822 | - | - |
512
+ | 0.3419 | 200 | 0.0809 | 0.0840 | 0.8315 |
513
+ | 0.3761 | 220 | 0.0767 | - | - |
514
+ | 0.4103 | 240 | 0.0841 | - | - |
515
+ | 0.4444 | 260 | 0.0654 | - | - |
516
+ | 0.4786 | 280 | 0.0771 | - | - |
517
+ | 0.5128 | 300 | 0.0843 | 0.0699 | 0.8462 |
518
+ | 0.5470 | 320 | 0.076 | - | - |
519
+ | 0.5812 | 340 | 0.0543 | - | - |
520
+ | 0.6154 | 360 | 0.0563 | - | - |
521
+ | 0.6496 | 380 | 0.0584 | - | - |
522
+ | 0.6838 | 400 | 0.053 | 0.0593 | 0.8596 |
523
+ | 0.7179 | 420 | 0.0525 | - | - |
524
+ | 0.7521 | 440 | 0.0625 | - | - |
525
+ | 0.7863 | 460 | 0.0544 | - | - |
526
+ | 0.8205 | 480 | 0.0537 | - | - |
527
+ | 0.8547 | 500 | 0.0651 | 0.0505 | 0.8741 |
528
+
529
+
530
+ ### Framework Versions
531
+ - Python: 3.12.11
532
+ - Sentence Transformers: 5.1.0
533
+ - Transformers: 4.56.1
534
+ - PyTorch: 2.8.0+cu126
535
+ - Accelerate: 1.10.1
536
+ - Datasets: 4.0.0
537
+ - Tokenizers: 0.22.0
538
+
539
+ ## Citation
540
+
541
+ ### BibTeX
542
+
543
+ #### Sentence Transformers
544
+ ```bibtex
545
+ @inproceedings{reimers-2019-sentence-bert,
546
+ title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
547
+ author = "Reimers, Nils and Gurevych, Iryna",
548
+ booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
549
+ month = "11",
550
+ year = "2019",
551
+ publisher = "Association for Computational Linguistics",
552
+ url = "https://arxiv.org/abs/1908.10084",
553
+ }
554
+ ```
555
+
556
+ #### CachedMultipleNegativesRankingLoss
557
+ ```bibtex
558
+ @misc{gao2021scaling,
559
+ title={Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup},
560
+ author={Luyu Gao and Yunyi Zhang and Jiawei Han and Jamie Callan},
561
+ year={2021},
562
+ eprint={2101.06983},
563
+ archivePrefix={arXiv},
564
+ primaryClass={cs.LG}
565
+ }
566
+ ```
567
+
568
+ <!--
569
+ ## Glossary
570
+
571
+ *Clearly define terms in order to be accessible across audiences.*
572
+ -->
573
+
574
+ <!--
575
+ ## Model Card Authors
576
+
577
+ *Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction.*
578
+ -->
579
+
580
+ <!--
581
+ ## Model Card Contact
582
+
583
+ *Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors.*
584
+ -->
added_tokens.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ {
2
+ "<image_soft_token>": 262144
3
+ }
config.json ADDED
@@ -0,0 +1,60 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_sliding_window_pattern": 6,
3
+ "architectures": [
4
+ "Gemma3TextModel"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "attn_logit_softcapping": null,
9
+ "bos_token_id": 2,
10
+ "dtype": "float32",
11
+ "eos_token_id": 1,
12
+ "final_logit_softcapping": null,
13
+ "head_dim": 256,
14
+ "hidden_activation": "gelu_pytorch_tanh",
15
+ "hidden_size": 768,
16
+ "initializer_range": 0.02,
17
+ "intermediate_size": 1152,
18
+ "layer_types": [
19
+ "sliding_attention",
20
+ "sliding_attention",
21
+ "sliding_attention",
22
+ "sliding_attention",
23
+ "sliding_attention",
24
+ "full_attention",
25
+ "sliding_attention",
26
+ "sliding_attention",
27
+ "sliding_attention",
28
+ "sliding_attention",
29
+ "sliding_attention",
30
+ "full_attention",
31
+ "sliding_attention",
32
+ "sliding_attention",
33
+ "sliding_attention",
34
+ "sliding_attention",
35
+ "sliding_attention",
36
+ "full_attention",
37
+ "sliding_attention",
38
+ "sliding_attention",
39
+ "sliding_attention",
40
+ "sliding_attention",
41
+ "sliding_attention",
42
+ "full_attention"
43
+ ],
44
+ "max_position_embeddings": 2048,
45
+ "model_type": "gemma3_text",
46
+ "num_attention_heads": 3,
47
+ "num_hidden_layers": 24,
48
+ "num_key_value_heads": 1,
49
+ "pad_token_id": 0,
50
+ "query_pre_attn_scalar": 256,
51
+ "rms_norm_eps": 1e-06,
52
+ "rope_local_base_freq": 10000.0,
53
+ "rope_scaling": null,
54
+ "rope_theta": 1000000.0,
55
+ "sliding_window": 512,
56
+ "transformers_version": "4.56.1",
57
+ "use_bidirectional_attention": true,
58
+ "use_cache": true,
59
+ "vocab_size": 262144
60
+ }
config_sentence_transformers.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_type": "SentenceTransformer",
3
+ "__version__": {
4
+ "sentence_transformers": "5.1.0",
5
+ "transformers": "4.56.1",
6
+ "pytorch": "2.8.0+cu126"
7
+ },
8
+ "prompts": {
9
+ "query": "task: search result | query: ",
10
+ "document": "title: none | text: ",
11
+ "BitextMining": "task: search result | query: ",
12
+ "Clustering": "task: clustering | query: ",
13
+ "Classification": "task: classification | query: ",
14
+ "InstructionRetrieval": "task: code retrieval | query: ",
15
+ "MultilabelClassification": "task: classification | query: ",
16
+ "PairClassification": "task: sentence similarity | query: ",
17
+ "Reranking": "task: search result | query: ",
18
+ "Retrieval": "task: search result | query: ",
19
+ "Retrieval-query": "task: search result | query: ",
20
+ "Retrieval-document": "title: none | text: ",
21
+ "STS": "task: sentence similarity | query: ",
22
+ "Summarization": "task: summarization | query: "
23
+ },
24
+ "default_prompt_name": null,
25
+ "similarity_fn_name": "cosine"
26
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:afec63305067be59ef27c04b230efcf6fe716fb39a02a20298aac751c0972c79
3
+ size 1211486072
modules.json ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [
2
+ {
3
+ "idx": 0,
4
+ "name": "0",
5
+ "path": "",
6
+ "type": "sentence_transformers.models.Transformer"
7
+ },
8
+ {
9
+ "idx": 1,
10
+ "name": "1",
11
+ "path": "1_Pooling",
12
+ "type": "sentence_transformers.models.Pooling"
13
+ },
14
+ {
15
+ "idx": 2,
16
+ "name": "2",
17
+ "path": "2_Dense",
18
+ "type": "sentence_transformers.models.Dense"
19
+ },
20
+ {
21
+ "idx": 3,
22
+ "name": "3",
23
+ "path": "3_Dense",
24
+ "type": "sentence_transformers.models.Dense"
25
+ },
26
+ {
27
+ "idx": 4,
28
+ "name": "4",
29
+ "path": "4_Normalize",
30
+ "type": "sentence_transformers.models.Normalize"
31
+ }
32
+ ]
sentence_bert_config.json ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ {
2
+ "max_seq_length": 2048,
3
+ "do_lower_case": false
4
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,33 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "boi_token": "<start_of_image>",
3
+ "bos_token": {
4
+ "content": "<bos>",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false
9
+ },
10
+ "eoi_token": "<end_of_image>",
11
+ "eos_token": {
12
+ "content": "<eos>",
13
+ "lstrip": false,
14
+ "normalized": false,
15
+ "rstrip": false,
16
+ "single_word": false
17
+ },
18
+ "image_token": "<image_soft_token>",
19
+ "pad_token": {
20
+ "content": "<pad>",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false
25
+ },
26
+ "unk_token": {
27
+ "content": "<unk>",
28
+ "lstrip": false,
29
+ "normalized": false,
30
+ "rstrip": false,
31
+ "single_word": false
32
+ }
33
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:216e2a79606fe879c9f17c529c71cd241338407fd5646b595ffd3c4b9ea1d503
3
+ size 33385262
tokenizer.model ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1299c11d7cf632ef3b4e11937501358ada021bbdf7c47638d13c0ee982f2e79c
3
+ size 4689074
tokenizer_config.json ADDED
The diff for this file is too large to render. See raw diff