Sentence Similarity
sentence-transformers
Safetensors
Nepali
bert
feature-extraction
embedding
nepali
information-retrieval
text-embeddings
text-embeddings-inference
Instructions to use premmm/nepali-embedder-v1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use premmm/nepali-embedder-v1 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("premmm/nepali-embedder-v1") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
Add new SentenceTransformer model
Browse files- 1_Pooling/config.json +5 -0
- README.md +584 -0
- config.json +29 -0
- config_sentence_transformers.json +14 -0
- model.safetensors +3 -0
- modules.json +14 -0
- sentence_bert_config.json +10 -0
- tokenizer.json +0 -0
- tokenizer_config.json +23 -0
1_Pooling/config.json
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"embedding_dimension": 768,
|
| 3 |
+
"pooling_mode": "mean",
|
| 4 |
+
"include_prompt": true
|
| 5 |
+
}
|
README.md
ADDED
|
@@ -0,0 +1,584 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
---
|
| 2 |
+
tags:
|
| 3 |
+
- sentence-transformers
|
| 4 |
+
- sentence-similarity
|
| 5 |
+
- feature-extraction
|
| 6 |
+
- generated_from_trainer
|
| 7 |
+
- dataset_size:55682
|
| 8 |
+
- loss:MultipleNegativesRankingLoss
|
| 9 |
+
base_model: google/muril-base-cased
|
| 10 |
+
widget:
|
| 11 |
+
- source_sentence: योसिप ब्रोज तितो
|
| 12 |
+
sentences:
|
| 13 |
+
- रोमन राज्य रोमन इतिहासको सबैभन्दा प्रारम्भिक अवधि थियो जब शहर र यसको क्षेत्र राजाहरू
|
| 14 |
+
द्वारा शासन गरिएको थियो। परम्परा अनुसार, रोमन राज्य ७५३ ईसा पूर्व मा शहरको स्थापना
|
| 15 |
+
संग शुरू भयो, मध्य इटाली मा टाइबर नदी संग प्यालाटिन हिल वरपर बसोबास संग, र राजाहरू
|
| 16 |
+
को सत्ताच्युत र ५०९ ईसा पूर्व मा गणतन्त्र को स्थापना संग समाप्त भयो। राज्यको इतिहासको
|
| 17 |
+
बारेमा थोरै निश्चित छ किनकि कुनै अभिलेख र राजाहरूको समयका केही शिलालेखहरू जीवित
|
| 18 |
+
छैनन्। गणतन्त्र र साम्राज्यको समयमा लेखिएका यस अवधिका विवरणहरू मौखिक परम्परामा
|
| 19 |
+
आधारित रहेको मानिन्छ।
|
| 20 |
+
- विश्व स्वास्थ्य सङ्गठनका अनुसार "स्वास्थ्य भनेको रोग तथा दुर्बलताबाट मुक्त हुनु
|
| 21 |
+
मात्र नभई सम्पूर्ण शारीरिक, मानसिक तथा सामाजिक अवस्था तन्दुरुस्त हुनु पनि हो ।"
|
| 22 |
+
<blockquote>'रोग र दुर्बलताबाट मुक्त हुनु मात्र नभई शारीरिक, मानसिक तथा सामाजिक
|
| 23 |
+
तवरले पुर्ण तन्दुरूस्तिको अवस्थालाई नै स्वास्थ्य भनिन्छ ।" (डब्लु.एच.ओ, १९४६)</blockquote>
|
| 24 |
+
- 'योसिप ब्रोज तितो ( सिरिलिक लिपि: Јосип Броз Тито, , ; ७ मे १८९२-४ मे १९८०),
|
| 25 |
+
सामान्यतः तितो को नामले परिचित (, युगोस्लाभ कम्युनिष्ट क्रान्तिकारी तथा राजनेता
|
| 26 |
+
थिए। दोस्रो विश्वयुद्धको क्रममा उनी पार्टीिसनका नेता थिए जसलाई प्रायः नाजी जर्मन
|
| 27 |
+
नियन्त्रित यूरोपमा सबैभन्दा प्रभावकारी प्रतिरोध आन्दोलनको रूपमा लिइन्छ । उनले
|
| 28 |
+
सन् १९४३ देखि १९८० सम्म विभिन्न भूमिकामा सेवा गरेका थिए। उनले १४ जनवरी १९५३ देखि
|
| 29 |
+
४ मे १९८० सम्म समाजवादी सङ्घीय गणतन्त्र युगोस्लाभियाका अध्यक्षको रूपमा पनि काम
|
| 30 |
+
गरेका थिए। जबकि केहीले उनको आफ्नो राष्ट्रपतिको पदलाई अधिनायकवादको रूपमा आलोचना
|
| 31 |
+
गर्छन् र उनलाई स्टालिन जस्तै क्रुर तानाशाहको रूपमा समेत तुलना गर्छन्, धेरैले
|
| 32 |
+
उनलाई उदार तानाशाह मान्छन्। उनी युगोस्लाभिया र विदेशमा एक लोकप्रिय सार्वजनिक
|
| 33 |
+
व्यक्तित्व थिए। उनलाई युगोस्लाभियाको एकीकरणको प्रतीकको रूपमा हेरिएको थियो , उनका
|
| 34 |
+
आन्तरिक नीतिहरूले युगोस्लाभ महासंघका राष्ट्रहरूको शान्तिमय सह-अस्तित्व कायम राख्यो।
|
| 35 |
+
भारतको जवाहरलाल नेहरू, इजिप्टका गमाल अब्देल नासेर र घानाक��� क्वामे नक्रुमहको साथ
|
| 36 |
+
असंलग्न अभियान आन्दोलनका प्रमुख नेताको रूपमा उनले थप अन्तर्राष्ट्रिय ध्यान खिचे। शीत
|
| 37 |
+
युद्ध दुवै ब्लकमा विदेश अत्यधिक अनुकूल सम्बन्ध कायम गर्दै, उनले लिजन अफ अनर,
|
| 38 |
+
र अडर अफ बाथ सहित ९८ विदेशी सम्मान प्राप्त गरे।'
|
| 39 |
+
- source_sentence: 'मेन्डी काप्रिस्तो - सन् २००१-२००५: किडि कन्टेस्ट'
|
| 40 |
+
sentences:
|
| 41 |
+
- काप्रिस्तो ४ वर्षको उमेरमै गाउन र नृत्य गर्न थालेकी थिइन्। सन् २००१ मा, काप्रिस्तोका
|
| 42 |
+
सङ्गीत शिक्षकले उनलाई अस्ट्रियामा भएको किडि कन्टेस्टका लागि प्रवेश गराएका थिए।
|
| 43 |
+
उक्त प्रतियोगिताको उपाधि उनले आफ्नो गीत "Ich wünsche mir einen Bankomat" मार्फत
|
| 44 |
+
हात पार्न सफल भएकी थिइन् भने उक्त गीत लगत्तै किडि कस्टेस्ट संस्करण ७ (सन् २००१)
|
| 45 |
+
को शीर्ष स्थानको गीत बन्न सफल भएको थियो। त्यसपछि उनी ताबालुगा तिभी नामक कार्यक्रममा
|
| 46 |
+
देखा परेकी थिइन् र उनले सन् २००२ को संस्करणको किडि कस्टेस्टको गीति सङ्गालोका लागि
|
| 47 |
+
मास्कितो नामक गीतलाई कैद गराएकी थिइन्। यो गीत अस्ट्रियामा शीर्ष स्थानमा आएको थियो।
|
| 48 |
+
त्यसपछि उनी अस्ट्रियाको प्रसारक ओआरएफद्वारा बालबालिकाहरूका लागि निर्माण गरिएको
|
| 49 |
+
दूरदर्शन शृङ्खला ग्लुबसाउगामा देखा परेकी थिइन्।
|
| 50 |
+
- अवुल पकिर जैनुलाअबदीन अब्दुल कलाम ( उनको एक मध्यम वर्गीय मुस्लिम परिवारमा १५ अक्टोबर,
|
| 51 |
+
१९३१, रामेश्वरम धनुषकोटि, तमिलनाडु, भारत), मा जन्म भएको थियो जसलाई सामान्यतया
|
| 52 |
+
डाक्टर ए पी जे अब्दुल कलामका नामले जानिन्छ । डाक्टर ए.पी.जे. अब्दुल कलाम भारतीय
|
| 53 |
+
गणतन्त्रका ११ औँ निर्वाचित राष्ट्रपतिका रूपमा चिनिन्छन्। उनी भारतका पूर्व राष्ट्रपति,
|
| 54 |
+
प्रसिद्ध वैज्ञानिक र अभियन्ता हुनाका साथै उनी अविवाहित थिए। डा. आरजे आब्दुल कलाम
|
| 55 |
+
भारतको मिसायल कार्यक्रमको प्रमुख वास्तुकार हुन्।।
|
| 56 |
+
- वाणिज्य बैङ्क भन्नाले नेपाल राष्ट्र बैङ्कबाट "क" श्रेणीको इजाजत प्राप्त संस्थाहरूलाई
|
| 57 |
+
बुझाउँदछ । यस्तो प्रकारको बैङ्क नेपालमा कुल ३० वटा रहेका छन् । नेपालमा पहिलो स्थापित
|
| 58 |
+
वाणिज्य बैङ्क नेपाल बैङ्क लिमिटेड हो ।
|
| 59 |
+
- source_sentence: कृषि तथा पशुपंक्षी विकास मन्त्रालय (नेपाल) - कृषि फारम र कृषि केन्द्रहरू
|
| 60 |
+
सम्बन्धी,
|
| 61 |
+
sentences:
|
| 62 |
+
- बाली संरक्षण विषयक अनुसन्धान तथा र्सर्वेक्षण सम्बन्धी, कृषि प्रचार प्रसार तथा
|
| 63 |
+
युवा कृषक कार्यक्रम सम्बन्धी, कृषि नर्सरी तथा बिउ बिजनको विकास सम्बन्धी, पशुपंक्षी
|
| 64 |
+
पालन तथा यसको विकास, नश्ल सुधार, दाना र चरन विकास सम्बन्धी, पशु चिकित्सा, पशु
|
| 65 |
+
रोगको रोकथाम र औषधि उत्पादन सम्बन्धी,
|
| 66 |
+
- चन्द्र मोहन जैन (११ डिसेम्बर १९३१ - १९ जनवरी १९९०), आचार्य रजनीश नामबाट परिचित,
|
| 67 |
+
सन् १९६० देखि १९८० को दशकसम्म भगवान श्री रजनीश र १९८९ देखि ओशोको नामले विश्व परिचित,
|
| 68 |
+
एक भारतीय रहस्यवादी गुरु, आध्यात्मिक व्यक्तित्व तथा ओशो आन्दोलनका सुरुवातकर्ता
|
| 69 |
+
थिए । सन् १९६० को दशकमा उनले सार्वजनिक वक्ताको रूपमा पूरा भारतको यात्रा गरेका
|
| 70 |
+
थिए। उनले राजनीतिज्ञहरू र राजनीतिक विचार, महात्मा गान्धी र संस्थागत धर्म बारेमा
|
| 71 |
+
गरेको खरो आलोचनाले उनलाई विवादित बनाए जो आफ्नो विवादास्पद नयाँ धार्मिक (आध्यात्मिक)
|
| 72 |
+
आन्दोलनको लागि चर्चित बनेका थिए। उनी भारत तथा संयुक्त राज्य अमेरिका पनि बसेका
|
| 73 |
+
थिए। ओशोले प्रचलित धर्महरूको व्याख्या गर्दै प्रेम, ध्यान र खुसीहरूलाई जीवनका प्रमुख
|
| 74 |
+
मूल्य मानेका थिए।
|
| 75 |
+
- शाहरुख खान ताहिर तालियार खानको रूपमा, सबाको पूर्व पति लिजा हेडन लिना डिसूजाको
|
| 76 |
+
रूपमा, अयानको पूर्व प्रेमिका इमरान अली अब्बास डा फैसल खानको रूपमा, अलिजेहको पूर्व
|
| 77 |
+
प्रेमी
|
| 78 |
+
- source_sentence: छोइला
|
| 79 |
+
sentences:
|
| 80 |
+
- उमा रेग्मी एक नेपाली राजनीतिज्ञ र वर्तमान महिला, बालबालिका तथा ज्येष्ठ नागरिक
|
| 81 |
+
मन्त्री हुन्। उनी समानुपातिक प्रतिनिधित्व प्रणाली मार्फत निर्वाचित प्रतिनिधि सभाकी
|
| 82 |
+
सदस्य हुन्। उनी नेपाली कांग्रेस पार्टीकी सदस्य तथा नेपाली कांग्रेसको भातृ सङ्गठन
|
| 83 |
+
नेपाल महिला सङ्घकी वर्तमान अध्यक्ष पनि हुन्।
|
| 84 |
+
- 'ग्रान्ड थेफ्ट अटो: भाइस सिटी सन् २००२ मा रकस्टार नर्थद्वारा विकसित र रकस्टार
|
| 85 |
+
गेम्सद्वारा जारी गरिएको साहसिक भिडन्तमा आधारित भिडियो गेम हो। सन् २००१ को ग्रान्ड
|
| 86 |
+
थेफ्ट अटो तेस्रो पछि ''ग्रान्ड थेफ्ट अटो'' शृङ्खलाको यो पहिलो संस्करण हो। सन्
|
| 87 |
+
१९८६ मा मियामी स्थित काल्पनिक भाइस सिटी भित्र स्थापित गरिएको यो भिडियो गेमले जेलमुक्त
|
| 88 |
+
भएपछिको डकैत टोमी भर्सेट्टीलाई पछ्याएको छ। एउटा घातक लागूऔषध कारोबारको धरापमा
|
| 89 |
+
परेपछि टोमीले आफ्नो छुट्टै आपराधिक साम्राज्यको निर्माण गर्नुका साथै सहरभित्र रहेका
|
| 90 |
+
अन्य आपराधिक सङ्गठनहरूको सत्ता हत्याउनका निमित्त जिम्मेवार व्यक्तिहरूको खोजी गर्ने
|
| 91 |
+
कार्य गर्दछ। यो भिडियो गेम ��ेस्रो व्यक्तिको परिप्रेक्ष्यबाट खेल्नको लागि निर्माण
|
| 92 |
+
गरिएको छ। भिडियो गेम खेल्ने व्यक्तिको संसारलाई पैदल वा सवारीमा सीमित गरिएको छ।
|
| 93 |
+
खुला विश्व डिजाइनले गर्दा भिडियो गेमरलाई दुईवटा मुख्य टापुहरूसहित भाइस सिटी स्वतन्त्र
|
| 94 |
+
रूपमा घुम्न दिन्छ। यस गेमको कथावस्तु मियामीमा रहेका वास्तविक व्यक्तिहरू र घटनाहरू
|
| 95 |
+
जस्तै क्युबाली, हाइटियाली, र बाइकर गिरोह, १९८० को दशकको महामारी, मियामीको माफिओसो
|
| 96 |
+
लागुपदार्थ मालिक, र ग्ल्याम धातुको प्रभुत्वमा आधारित छ। गेम ''स्कारफेस'' र ''मियामी
|
| 97 |
+
भाइस'' सहित सो समयको चलचित्र र टेलिभिजनबाट प्रभावित थियो। यो भिडियो गेमको पात्रहरू
|
| 98 |
+
घटनाबाट प्रेरित र सो समयको वास्तविक चित्रण गर्नको लागि विकासकर्ता टोलीले गेमको
|
| 99 |
+
संसार सिर्जना गर्ने क्रममा मियामीको विस्तृत क्षेत्रहरूको अनुसन्धान गरेका थिए।
|
| 100 |
+
यो भिडियो गेमलाई सन् २००२ अक्टोबरमा प्लेस्टेसन २को लागि, सन् २००३ मेमा माइक्रोसफ्ट
|
| 101 |
+
विन्डोजको लागि र सन् २००३ अक्टोबरमा एक्सबक्सको लागि जारी गरिएको थियो। जारी भएपछि,
|
| 102 |
+
भाइस सिटीले विशेष गरी यसको सङ्गीत, गेमप्ले र खुला विश्व डिजाइनको लागि प्रशंसा
|
| 103 |
+
पाएको थियो भने यसको आलोचनापनि गरिएको थियो। भिडियो गेममा दर्शाइएको हिंसा र जातीय
|
| 104 |
+
समूहहरूको चित्रणले गर्दा विवाद उत्पन्न भएको थियो जसको फलस्वरुप गेम निर्मातामाथि
|
| 105 |
+
मुद्दा र विरोध प्रदर्शन झेल्नुपरेको थियो। ''भाइस सिटी'' सन् २००२ को सबैभन्दा धेरै
|
| 106 |
+
बिक्री हुने भिडियो गेम भएको थियो। सो वर्ष यो भिडियो गेमको १ करोड ७५ लाखभन्दा बढी
|
| 107 |
+
प्रतिहरू बिक्री भएको थियो। भिडियो गेमको छैठौँ पुस्ताको सबैभन्दा महत्त्वपूर्ण शीर्षकमध्ये
|
| 108 |
+
एक, अहिलेसम्म बनेको सबैभन्दा राम्रो भिडियो गेमहरूमध'
|
| 109 |
+
- छोइला राँगोको मासुलाई पोलेर बनाइने नेवारी परिकार हो। सुरुमा यो परिकार राँगोको
|
| 110 |
+
मासुबाट मात्रै बनाइने गरिन्थ्यो तर हाल आएर यो खसी, कुखुरा तथा हाँसको मासुको समेत
|
| 111 |
+
प्रयोग गरेर बनाइने गरिन्छ। सामान्यतया यो चिउरा वा बजिसँग खाने गरिन्छ भने यो धेरै
|
| 112 |
+
नै मसालेदार परिकारहरू मध्ये पर्ने गर्दछ। छोइला नेवारी समुदायको चाड पर्वहरू विशेषत
|
| 113 |
+
प्रयोग हुने परिकार हो साथै यो समय् बजिको विभिन्न परिकार मध्ये मुख्य परिकार मध्ये
|
| 114 |
+
एक हो।
|
| 115 |
+
- source_sentence: घरपालुवा मौरी
|
| 116 |
+
sentences:
|
| 117 |
+
- विहाह पश्चात दम्पतिका ���ाइ बैनीले एक आपसमा लगाउने साइनो सोल्टिनी हो । उदाहरणको
|
| 118 |
+
लागि राम र शर्मिलाको बिवाह पश्चात, रामको भाइ बैनीले शर्मिलाको बैनीलाई सोल्टीनी
|
| 119 |
+
नाता लगाउँछन् । त्यस्तै शर्मिलाको भाइ बैनीले रामको बैनीलाई सोल्टीनी नाता लगाउँछन्
|
| 120 |
+
। यसै गरी भाइलाई सोल्टी नाता लाग्दछ । दाजु र दिदिको लागि भने कतै कतै यो साईनो
|
| 121 |
+
प्रयोग गरेको देखिएता पनि त्यति प्रचलित छैन । यो नाता ठकुरी र मगर गुरुङहरूमा आम
|
| 122 |
+
रूपमा प्रयोग हुन्छ भने , क्षत्री, वाहुन, नेवार, राई लिम्बु हरूमा त्यति प्रयोग
|
| 123 |
+
भएको पाईदैन ।
|
| 124 |
+
- वासु शशीका नाटक वासु शशीद्वारा लेखिएको कृति हो। यस कृतिलाई साझा प्रकाशनले बजारमा
|
| 125 |
+
ल्याएको हो। यो एक नेपाली भाषाको नाटक हो।
|
| 126 |
+
- मौरी (वा मधुकर) एपिस वंशजको सदस्य हो, जसलाई महको उत्पादन र सञ्चयका लागि चिनिन्छ
|
| 127 |
+
। यिनिहरूले पहेँलो मैन प्रयोग गरी टिकाउ गुण (चाका) बनाउँछन् भने त्यहीँ मह उत्पादन
|
| 128 |
+
समेत गर्दछन् । २१औँ सताब्दीको प्रारम्भमा मौरीका कुल सात प्रजाति भेटिए भने ४४ उपप्रजाति
|
| 129 |
+
भेटिए, यद्दपी मधुकरका सात देखि एघार प्रजाति ऐतिहाँसिक रूपमा भेटिएका छन् । मह उत्पादनको
|
| 130 |
+
लागि चिनिने सबैभन्दा उत्तम प्रजाति पश्चिमी मधुकर हो जसलाइ बालीहरूको परागसेचन र
|
| 131 |
+
मह उत्पादनका लागि घार बनाएर पाल्ने गरिन्छ । मौरीका कुल २०,००० प्रजातिमध्ये मह
|
| 132 |
+
दिने मौरी सानो सङ्ख्यामा छन् ।मौरी एक किसिमको कीरा हो । यसले विभिन्न फूलको रस
|
| 133 |
+
सङ्कलन गरी मह लगाउने गर्दछ । मौरीलाई मेहनती जीवको रूपमा चिनिन्छ । मौरी पालन अथवा
|
| 134 |
+
एपिकल्चर (apiculture) एपि ल्याटिन शव्दबाट आएको हो, जसको अर्थ मौरीको रेखदेख भन्ने
|
| 135 |
+
बुझिन्छ । मौरी राख्ने बाकसलाई अङ्ग्रेजीमा एपियारी भनिन्छ ।
|
| 136 |
+
pipeline_tag: sentence-similarity
|
| 137 |
+
library_name: sentence-transformers
|
| 138 |
+
metrics:
|
| 139 |
+
- cosine_accuracy@1
|
| 140 |
+
- cosine_accuracy@3
|
| 141 |
+
- cosine_accuracy@5
|
| 142 |
+
- cosine_accuracy@10
|
| 143 |
+
- cosine_precision@1
|
| 144 |
+
- cosine_precision@3
|
| 145 |
+
- cosine_precision@5
|
| 146 |
+
- cosine_precision@10
|
| 147 |
+
- cosine_recall@1
|
| 148 |
+
- cosine_recall@3
|
| 149 |
+
- cosine_recall@5
|
| 150 |
+
- cosine_recall@10
|
| 151 |
+
- cosine_ndcg@10
|
| 152 |
+
- cosine_mrr@10
|
| 153 |
+
- cosine_map@100
|
| 154 |
+
model-index:
|
| 155 |
+
- name: SentenceTransformer based on google/muril-base-cased
|
| 156 |
+
results:
|
| 157 |
+
- task:
|
| 158 |
+
type: information-retrieval
|
| 159 |
+
name: Information Retrieval
|
| 160 |
+
dataset:
|
| 161 |
+
name: nepali ir eval
|
| 162 |
+
type: nepali-ir-eval
|
| 163 |
+
metrics:
|
| 164 |
+
- type: cosine_accuracy@1
|
| 165 |
+
value: 0.9270462633451957
|
| 166 |
+
name: Cosine Accuracy@1
|
| 167 |
+
- type: cosine_accuracy@3
|
| 168 |
+
value: 0.9768683274021353
|
| 169 |
+
name: Cosine Accuracy@3
|
| 170 |
+
- type: cosine_accuracy@5
|
| 171 |
+
value: 0.9875444839857651
|
| 172 |
+
name: Cosine Accuracy@5
|
| 173 |
+
- type: cosine_accuracy@10
|
| 174 |
+
value: 0.9928825622775801
|
| 175 |
+
name: Cosine Accuracy@10
|
| 176 |
+
- type: cosine_precision@1
|
| 177 |
+
value: 0.9270462633451957
|
| 178 |
+
name: Cosine Precision@1
|
| 179 |
+
- type: cosine_precision@3
|
| 180 |
+
value: 0.32562277580071175
|
| 181 |
+
name: Cosine Precision@3
|
| 182 |
+
- type: cosine_precision@5
|
| 183 |
+
value: 0.197508896797153
|
| 184 |
+
name: Cosine Precision@5
|
| 185 |
+
- type: cosine_precision@10
|
| 186 |
+
value: 0.099288256227758
|
| 187 |
+
name: Cosine Precision@10
|
| 188 |
+
- type: cosine_recall@1
|
| 189 |
+
value: 0.9270462633451957
|
| 190 |
+
name: Cosine Recall@1
|
| 191 |
+
- type: cosine_recall@3
|
| 192 |
+
value: 0.9768683274021353
|
| 193 |
+
name: Cosine Recall@3
|
| 194 |
+
- type: cosine_recall@5
|
| 195 |
+
value: 0.9875444839857651
|
| 196 |
+
name: Cosine Recall@5
|
| 197 |
+
- type: cosine_recall@10
|
| 198 |
+
value: 0.9928825622775801
|
| 199 |
+
name: Cosine Recall@10
|
| 200 |
+
- type: cosine_ndcg@10
|
| 201 |
+
value: 0.9621261269732698
|
| 202 |
+
name: Cosine Ndcg@10
|
| 203 |
+
- type: cosine_mrr@10
|
| 204 |
+
value: 0.9519918940292603
|
| 205 |
+
name: Cosine Mrr@10
|
| 206 |
+
- type: cosine_map@100
|
| 207 |
+
value: 0.9521634822017773
|
| 208 |
+
name: Cosine Map@100
|
| 209 |
+
---
|
| 210 |
+
|
| 211 |
+
# SentenceTransformer based on google/muril-base-cased
|
| 212 |
+
|
| 213 |
+
This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [google/muril-base-cased](https://huggingface.co/google/muril-base-cased). It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for retrieval.
|
| 214 |
+
|
| 215 |
+
## Model Details
|
| 216 |
+
|
| 217 |
+
### Model Description
|
| 218 |
+
- **Model Type:** Sentence Transformer
|
| 219 |
+
- **Base model:** [google/muril-base-cased](https://huggingface.co/google/muril-base-cased) <!-- at revision afd9f36c7923d54e97903922ff1b260d091d202f -->
|
| 220 |
+
- **Maximum Sequence Length:** 256 tokens
|
| 221 |
+
- **Output Dimensionality:** 768 dimensions
|
| 222 |
+
- **Similarity Function:** Cosine Similarity
|
| 223 |
+
- **Supported Modality:** Text
|
| 224 |
+
<!-- - **Training Dataset:** Unknown -->
|
| 225 |
+
<!-- - **Language:** Unknown -->
|
| 226 |
+
<!-- - **License:** Unknown -->
|
| 227 |
+
|
| 228 |
+
### Model Sources
|
| 229 |
+
|
| 230 |
+
- **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
|
| 231 |
+
- **Repository:** [Sentence Transformers on GitHub](https://github.com/huggingface/sentence-transformers)
|
| 232 |
+
- **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
|
| 233 |
+
|
| 234 |
+
### Full Model Architecture
|
| 235 |
+
|
| 236 |
+
```
|
| 237 |
+
SentenceTransformer(
|
| 238 |
+
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
|
| 239 |
+
(1): Pooling({'embedding_dimension': 768, 'pooling_mode': 'mean', 'include_prompt': True})
|
| 240 |
+
)
|
| 241 |
+
```
|
| 242 |
+
|
| 243 |
+
## Usage
|
| 244 |
+
|
| 245 |
+
### Direct Usage (Sentence Transformers)
|
| 246 |
+
|
| 247 |
+
First install the Sentence Transformers library:
|
| 248 |
+
|
| 249 |
+
```bash
|
| 250 |
+
pip install -U sentence-transformers
|
| 251 |
+
```
|
| 252 |
+
Then you can load this model and run inference.
|
| 253 |
+
```python
|
| 254 |
+
from sentence_transformers import SentenceTransformer
|
| 255 |
+
|
| 256 |
+
# Download from the 🤗 Hub
|
| 257 |
+
model = SentenceTransformer("premmm/nepali-embedder-v1")
|
| 258 |
+
# Run inference
|
| 259 |
+
queries = [
|
| 260 |
+
'घरपालुवा मौरी',
|
| 261 |
+
]
|
| 262 |
+
documents = [
|
| 263 |
+
'मौरी (वा मधुकर) एपिस वंशजको सदस्य हो, जसलाई महको उत्पादन र सञ्चयका लागि चिनिन्छ । यिनिहरूले पहेँलो मैन प्रयोग गरी टिकाउ गुण (चाका) बनाउँछन् भने त्यहीँ मह उत्पादन समेत गर्दछन् । २१औँ सताब्दीको प्रारम्भमा मौरीका कुल सात प्रजाति भेटिए भने ४४ उपप्रजाति भेटिए, यद्दपी मधुकरका सात देखि एघार प्रजाति ऐतिहाँसिक रूपमा भेटिएका छन् । मह उत्पादनको लागि चिनिने सबैभन्दा उत्तम प्रजाति पश्चिमी मधुकर हो जसलाइ बालीहरूको परागसेचन र मह उत्पादनका लागि घार बनाएर पाल्ने गरिन्छ । मौरीका कुल २०,००० प्रजातिमध्ये मह दिने मौरी सानो सङ्ख्यामा छन् ।मौरी एक किसिमको कीरा हो । यसले विभिन्न फूलको रस सङ्कलन गरी मह लगाउने गर्दछ । मौरीलाई मेहनती जीवको रूपमा चिनिन्छ । मौरी पालन अथवा एपिकल्चर (apiculture) एपि ल्याटिन शव्दबाट आएको हो, जसको अर्थ मौरीको रेखदेख भन्ने बुझिन्छ । मौरी राख्ने बाकसलाई अङ्ग्रेजीमा एपियारी भनिन्छ ।',
|
| 264 |
+
'वासु शशीका नाटक वासु शशीद्वारा लेखिएको कृति हो। यस कृतिलाई साझा प्रकाशनले बजारमा ल्याएको हो। यो एक नेपाली भाषाको नाटक हो।',
|
| 265 |
+
'विहाह पश्चात दम्���तिका भाइ बैनीले एक आपसमा लगाउने साइनो सोल्टिनी हो । उदाहरणको लागि राम र शर्मिलाको बिवाह पश्चात, रामको भाइ बैनीले शर्मिलाको बैनीलाई सोल्टीनी नाता लगाउँछन् । त्यस्तै शर्मिलाको भाइ बैनीले रामको बैनीलाई सोल्टीनी नाता लगाउँछन् । यसै गरी भाइलाई सोल्टी नाता लाग्दछ । दाजु र दिदिको लागि भने कतै कतै यो साईनो प्रयोग गरेको देखिएता पनि त्यति प्रचलित छैन । यो नाता ठकुरी र मगर गु\u200dरुङहरूमा आम रूपमा प्रयोग हुन्छ भने , क्षत्री, वाहुन, नेवार, राई लिम्बु हरूमा त्यति प्रयोग भएको पाईदैन ।',
|
| 266 |
+
]
|
| 267 |
+
query_embeddings = model.encode_query(queries)
|
| 268 |
+
document_embeddings = model.encode_document(documents)
|
| 269 |
+
print(query_embeddings.shape, document_embeddings.shape)
|
| 270 |
+
# [1, 768] [3, 768]
|
| 271 |
+
|
| 272 |
+
# Get the similarity scores for the embeddings
|
| 273 |
+
similarities = model.similarity(query_embeddings, document_embeddings)
|
| 274 |
+
print(similarities)
|
| 275 |
+
# tensor([[0.7363, 0.0150, 0.0449]])
|
| 276 |
+
```
|
| 277 |
+
<!--
|
| 278 |
+
### Direct Usage (Transformers)
|
| 279 |
+
|
| 280 |
+
<details><summary>Click to see the direct usage in Transformers</summary>
|
| 281 |
+
|
| 282 |
+
</details>
|
| 283 |
+
-->
|
| 284 |
+
|
| 285 |
+
<!--
|
| 286 |
+
### Downstream Usage (Sentence Transformers)
|
| 287 |
+
|
| 288 |
+
You can finetune this model on your own dataset.
|
| 289 |
+
|
| 290 |
+
<details><summary>Click to expand</summary>
|
| 291 |
+
|
| 292 |
+
</details>
|
| 293 |
+
-->
|
| 294 |
+
|
| 295 |
+
<!--
|
| 296 |
+
### Out-of-Scope Use
|
| 297 |
+
|
| 298 |
+
*List how the model may foreseeably be misused and address what users ought not to do with the model.*
|
| 299 |
+
-->
|
| 300 |
+
|
| 301 |
+
## Evaluation
|
| 302 |
+
|
| 303 |
+
### Metrics
|
| 304 |
+
|
| 305 |
+
#### Information Retrieval
|
| 306 |
+
|
| 307 |
+
* Dataset: `nepali-ir-eval`
|
| 308 |
+
* Evaluated with [<code>InformationRetrievalEvaluator</code>](https://sbert.net/docs/package_reference/sentence_transformer/evaluation.html#sentence_transformers.sentence_transformer.evaluation.InformationRetrievalEvaluator)
|
| 309 |
+
|
| 310 |
+
| Metric | Value |
|
| 311 |
+
|:--------------------|:-----------|
|
| 312 |
+
| cosine_accuracy@1 | 0.927 |
|
| 313 |
+
| cosine_accuracy@3 | 0.9769 |
|
| 314 |
+
| cosine_accuracy@5 | 0.9875 |
|
| 315 |
+
| cosine_accuracy@10 | 0.9929 |
|
| 316 |
+
| cosine_precision@1 | 0.927 |
|
| 317 |
+
| cosine_precision@3 | 0.3256 |
|
| 318 |
+
| cosine_precision@5 | 0.1975 |
|
| 319 |
+
| cosine_precision@10 | 0.0993 |
|
| 320 |
+
| cosine_recall@1 | 0.927 |
|
| 321 |
+
| cosine_recall@3 | 0.9769 |
|
| 322 |
+
| cosine_recall@5 | 0.9875 |
|
| 323 |
+
| cosine_recall@10 | 0.9929 |
|
| 324 |
+
| **cosine_ndcg@10** | **0.9621** |
|
| 325 |
+
| cosine_mrr@10 | 0.952 |
|
| 326 |
+
| cosine_map@100 | 0.9522 |
|
| 327 |
+
|
| 328 |
+
<!--
|
| 329 |
+
## Bias, Risks and Limitations
|
| 330 |
+
|
| 331 |
+
*What are the known or foreseeable issues stemming from this model? You could also flag here known failure cases or weaknesses of the model.*
|
| 332 |
+
-->
|
| 333 |
+
|
| 334 |
+
<!--
|
| 335 |
+
### Recommendations
|
| 336 |
+
|
| 337 |
+
*What are recommendations with respect to the foreseeable issues? For example, filtering explicit content.*
|
| 338 |
+
-->
|
| 339 |
+
|
| 340 |
+
## Training Details
|
| 341 |
+
|
| 342 |
+
### Training Dataset
|
| 343 |
+
|
| 344 |
+
#### Unnamed Dataset
|
| 345 |
+
|
| 346 |
+
* Size: 55,682 training samples
|
| 347 |
+
* Columns: <code>sentence_0</code> and <code>sentence_1</code>
|
| 348 |
+
* Approximate statistics based on the first 100 samples:
|
| 349 |
+
| | sentence_0 | sentence_1 |
|
| 350 |
+
|:---------|:---------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|
|
| 351 |
+
| type | string | string |
|
| 352 |
+
| modality | text | text |
|
| 353 |
+
| details | <ul><li>min: 3 tokens</li><li>mean: 7.49 tokens</li><li>max: 17 tokens</li></ul> | <ul><li>min: 15 tokens</li><li>mean: 107.4 tokens</li><li>max: 256 tokens</li></ul> |
|
| 354 |
+
* Samples:
|
| 355 |
+
| sentence_0 | sentence_1 |
|
| 356 |
+
|:-----------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
|
| 357 |
+
| <code>हाइकु - हेर, पुतली</code> | <code>हालसम्म भेटिएका सामग्रीहरूलाई आधार मान्दा सम्भवत उल्लेखित हाइकु नै जापानी साहित्यको पहिलो हाइकु रूपी रचना हो। मोरिताकेलाई अर्का कवि यामाकाजी सोकान (१४६५–१५५३)ले पनि सहयोग गरेका थिए। यद्यपी हाइकाइ हास्य अभिव्यक्तिलाई काव्यात्मक आस्वादन पस्कीने काममा भिन्न विचार राख्ने तत्कालीन उदयीमान कवि माचुनागा तोइतोकु तथा निशियामा सोइनले पनि यस अघि प्रयास गरेका थिए तर उनीहरूको प्रयासले पूर्णता पाउन सकेको थिएन। हेइयान युग (७९४–११८५)मा लेख्ने गरिएको शृङ्खला बद्घ कविता वा रेङ्गाको रूप वदलिदै जान्छ। कविताहरू थकान मेट्न होस् वा विछोडको वेदना मेट्न होस्– होक्कु लेख्छन्। वाका लेख्छन्। हाइकाइ र रेङ्गामा खासै भिन्नता पाइँदैन। हाइकाइ शृङ्खला नै रेङ्गा हो। माचुनागा तेइतोकु (१५७१–१६५३) हाइकाइका क्षेत्रमा माहीर मानिन्छन्। खासगरी अधिकारीक र परम्परागत संरचना यिनले छोडेनन्। सठौ शास्त्रिय नियमको अनुसरण गरे। जथावाभि विषयवस्तुको छनौट र छाडा हास्यव्यङ्ग्य प्रवृत्ति बढ्दै जाँदा तेइतोकुले बौद्घिक हास्यव्यंग्यलाई बढावा दिए र उनी यसमा सफल पनि मानिन्छन्। हाइकाइका क्षेत्रमा नियमपालनको हकमा कडा रूपमा प्रस्तुत भए। तर उनको निधन...</code> |
|
| 358 |
+
| <code>बहादुर शाह - निर्वासन</code> | <code>दुई दाजुभाइमा मेल नहुँदा चेपेपार धपाइएपछी बहादुर शाह कहिले पाल्पा, कहिले तनहु तिर गइ रहन लागे। त्यहाँ रहंदा ती राज्यसंग सम्पर्क राखी आफ्नो राज्यको हित गर्ने कुरा तिर उनले दृष्टि दिएका थिए। यस विषयमा बहादुर शाह आफ्ना दाजुलाई बराबर पत्र लेखि पठाउँथे। दाजुको हृदय परिवर्त��� गराई पाए फर्कने सुरमा उनी थिए। प्रतापसिंह उनलाई यहाँ पस्न चाहि नदिने , उनलाई चाहिने चिजबिज चाहि बराबर पठाइदिने गर्ने भन्ने कुरा उनले लेखेका पत्रले स्पस्ट रुपमा देखाएको छ। बि.सं १८३३ को शुरुमा बहादुर शाहले तनहुँ बाट प्रतापसिंह शाहलाई "हजुरको हामीले सोझै गरेका थियौ। हजुरले हामीलाई निकाल्नु भयो, हामीले तनहुँको नून खाएका छौ, उनीहरूले जे गराउलान्, सो गरौला, तर हजुरले भलो गर्नु भयो भने हामीले अन्यथा गर्नु हुदैन। आफ्नै मुलुकमा आएर बस्नु छ" भनी पत्र लेखे। त्यसको जवाफामा बि.सं १८३३ श्रावण १५ गते प्रतापसिंह ले "तिमीहरूले गरे अनुसार ओखती गरिएको हो, तिमीहरूले राम्रो चाल चलन गर्यौ भने यो घर तिमीहरूकै हो, यो कुरा मैले अस्तिको चिठीमा पनि लेखेको थिए। तिमीले तनहुँ संग मिलेर लमजुङका राजासंग भेट गरेछु, यसको फल कस्तो हुन्छ पछी थाहा होला, तन...</code> |
|
| 359 |
+
| <code>डल्फिन</code> | <code>डल्फिन समुद्री स्तनधारी जीव हो। यो जीवको ह्वेल सँग निकट सम्बन्ध छ। डल्फिनको १७ वंश र ४० प्रजातिहरू छन्। यिनीहरूका आकार १.२ मी (४ फीट) एवं ४०० कि.ग्रा (माउई डल्फिन) देखि लिएर ९.५ मी (३० फीट) १० टन (ओर्का या किलर व्हेल) सम्म हुन सक्छ। यो विश्वका सबै ठाउँमा पाइन्छ। खासगरी महाद्वीपीय तख्ताको समुन्द्री क्षेत्रमा यो जीव पाइन्छ। यो मांसाहारी हुन्छ र सानो माछाहरू र समुद्री जीव यसको मुख्य आहार हो। डल्फिनको उत्पत्ति लगभग १ करोड वर्ष पहिले मियोसीन कालको समयमा भएको थियो। डल्फीन पृथ्वीमा रहेका केहि धेरै बुद्धिमान जीवमध्येमा पर्दछ। डल्फिनको सधैं खुशी रहन बानी र मानिस सँगको मित्रवत व्यवहारले यो मानिसको प्रिय जीवको रूपमा परिचित छ। गंगा नदीमा पाइने डल्फीनलाई भारत सरकारले भारतको राष्ट्रिय जलीय जीव घोषित गरेको छ।</code> |
|
| 360 |
+
* Loss: [<code>MultipleNegativesRankingLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#multiplenegativesrankingloss) with these parameters:
|
| 361 |
+
```json
|
| 362 |
+
{
|
| 363 |
+
"scale": 20.0,
|
| 364 |
+
"similarity_fct": "cos_sim",
|
| 365 |
+
"gather_across_devices": false,
|
| 366 |
+
"directions": [
|
| 367 |
+
"query_to_doc"
|
| 368 |
+
],
|
| 369 |
+
"partition_mode": "joint",
|
| 370 |
+
"hardness_mode": null,
|
| 371 |
+
"hardness_strength": 0.0
|
| 372 |
+
}
|
| 373 |
+
```
|
| 374 |
+
|
| 375 |
+
### Training Hyperparameters
|
| 376 |
+
#### Non-Default Hyperparameters
|
| 377 |
+
|
| 378 |
+
- `per_device_train_batch_size`: 16
|
| 379 |
+
- `per_device_eval_batch_size`: 16
|
| 380 |
+
- `multi_dataset_batch_sampler`: round_robin
|
| 381 |
+
|
| 382 |
+
#### All Hyperparameters
|
| 383 |
+
<details><summary>Click to expand</summary>
|
| 384 |
+
|
| 385 |
+
- `per_device_train_batch_size`: 16
|
| 386 |
+
- `num_train_epochs`: 3
|
| 387 |
+
- `max_steps`: -1
|
| 388 |
+
- `learning_rate`: 5e-05
|
| 389 |
+
- `lr_scheduler_type`: linear
|
| 390 |
+
- `lr_scheduler_kwargs`: None
|
| 391 |
+
- `warmup_steps`: 0
|
| 392 |
+
- `optim`: adamw_torch_fused
|
| 393 |
+
- `optim_args`: None
|
| 394 |
+
- `weight_decay`: 0.0
|
| 395 |
+
- `adam_beta1`: 0.9
|
| 396 |
+
- `adam_beta2`: 0.999
|
| 397 |
+
- `adam_epsilon`: 1e-08
|
| 398 |
+
- `optim_target_modules`: None
|
| 399 |
+
- `gradient_accumulation_steps`: 1
|
| 400 |
+
- `average_tokens_across_devices`: True
|
| 401 |
+
- `max_grad_norm`: 1
|
| 402 |
+
- `label_smoothing_factor`: 0.0
|
| 403 |
+
- `bf16`: False
|
| 404 |
+
- `fp16`: False
|
| 405 |
+
- `bf16_full_eval`: False
|
| 406 |
+
- `fp16_full_eval`: False
|
| 407 |
+
- `tf32`: None
|
| 408 |
+
- `gradient_checkpointing`: False
|
| 409 |
+
- `gradient_checkpointing_kwargs`: None
|
| 410 |
+
- `torch_compile`: False
|
| 411 |
+
- `torch_compile_backend`: None
|
| 412 |
+
- `torch_compile_mode`: None
|
| 413 |
+
- `use_liger_kernel`: False
|
| 414 |
+
- `liger_kernel_config`: None
|
| 415 |
+
- `use_cache`: False
|
| 416 |
+
- `neftune_noise_alpha`: None
|
| 417 |
+
- `torch_empty_cache_steps`: None
|
| 418 |
+
- `auto_find_batch_size`: False
|
| 419 |
+
- `log_on_each_node`: True
|
| 420 |
+
- `logging_nan_inf_filter`: True
|
| 421 |
+
- `include_num_input_tokens_seen`: no
|
| 422 |
+
- `log_level`: passive
|
| 423 |
+
- `log_level_replica`: warning
|
| 424 |
+
- `disable_tqdm`: False
|
| 425 |
+
- `project`: huggingface
|
| 426 |
+
- `trackio_space_id`: None
|
| 427 |
+
- `trackio_bucket_id`: None
|
| 428 |
+
- `trackio_static_space_id`: None
|
| 429 |
+
- `per_device_eval_batch_size`: 16
|
| 430 |
+
- `prediction_loss_only`: True
|
| 431 |
+
- `eval_on_start`: False
|
| 432 |
+
- `eval_do_concat_batches`: True
|
| 433 |
+
- `eval_use_gather_object`: False
|
| 434 |
+
- `eval_accumulation_steps`: None
|
| 435 |
+
- `include_for_metrics`: []
|
| 436 |
+
- `batch_eval_metrics`: False
|
| 437 |
+
- `save_only_model`: False
|
| 438 |
+
- `save_on_each_node`: False
|
| 439 |
+
- `enable_jit_checkpoint`: False
|
| 440 |
+
- `push_to_hub`: False
|
| 441 |
+
- `hub_private_repo`: None
|
| 442 |
+
- `hub_model_id`: None
|
| 443 |
+
- `hub_strategy`: every_save
|
| 444 |
+
- `hub_always_push`: False
|
| 445 |
+
- `hub_revision`: None
|
| 446 |
+
- `load_best_model_at_end`: False
|
| 447 |
+
- `ignore_data_skip`: False
|
| 448 |
+
- `restore_callback_states_from_checkpoint`: False
|
| 449 |
+
- `full_determinism`: False
|
| 450 |
+
- `seed`: 42
|
| 451 |
+
- `data_seed`: None
|
| 452 |
+
- `use_cpu`: False
|
| 453 |
+
- `accelerator_config`: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
|
| 454 |
+
- `parallelism_config`: None
|
| 455 |
+
- `dataloader_drop_last`: False
|
| 456 |
+
- `dataloader_num_workers`: 0
|
| 457 |
+
- `dataloader_pin_memory`: True
|
| 458 |
+
- `dataloader_persistent_workers`: False
|
| 459 |
+
- `dataloader_prefetch_factor`: None
|
| 460 |
+
- `remove_unused_columns`: True
|
| 461 |
+
- `label_names`: None
|
| 462 |
+
- `train_sampling_strategy`: random
|
| 463 |
+
- `length_column_name`: length
|
| 464 |
+
- `ddp_find_unused_parameters`: None
|
| 465 |
+
- `ddp_bucket_cap_mb`: None
|
| 466 |
+
- `ddp_broadcast_buffers`: False
|
| 467 |
+
- `ddp_static_graph`: None
|
| 468 |
+
- `ddp_backend`: None
|
| 469 |
+
- `ddp_timeout`: 1800
|
| 470 |
+
- `fsdp`: None
|
| 471 |
+
- `fsdp_config`: None
|
| 472 |
+
- `deepspeed`: None
|
| 473 |
+
- `debug`: []
|
| 474 |
+
- `skip_memory_metrics`: True
|
| 475 |
+
- `do_predict`: False
|
| 476 |
+
- `resume_from_checkpoint`: None
|
| 477 |
+
- `warmup_ratio`: None
|
| 478 |
+
- `local_rank`: -1
|
| 479 |
+
- `prompts`: None
|
| 480 |
+
- `batch_sampler`: batch_sampler
|
| 481 |
+
- `multi_dataset_batch_sampler`: round_robin
|
| 482 |
+
- `router_mapping`: {}
|
| 483 |
+
- `learning_rate_mapping`: {}
|
| 484 |
+
|
| 485 |
+
</details>
|
| 486 |
+
|
| 487 |
+
### Training Logs
|
| 488 |
+
| Epoch | Step | Training Loss | nepali-ir-eval_cosine_ndcg@10 |
|
| 489 |
+
|:------:|:-----:|:-------------:|:-----------------------------:|
|
| 490 |
+
| 0.1436 | 500 | 1.4164 | - |
|
| 491 |
+
| 0.2499 | 870 | - | 0.9157 |
|
| 492 |
+
| 0.2873 | 1000 | 0.1274 | - |
|
| 493 |
+
| 0.4309 | 1500 | 0.0545 | - |
|
| 494 |
+
| 0.4999 | 1740 | - | 0.9364 |
|
| 495 |
+
| 0.5745 | 2000 | 0.0470 | - |
|
| 496 |
+
| 0.7182 | 2500 | 0.0358 | - |
|
| 497 |
+
| 0.7498 | 2610 | - | 0.9456 |
|
| 498 |
+
| 0.8618 | 3000 | 0.0313 | - |
|
| 499 |
+
| 0.9997 | 3480 | - | 0.9504 |
|
| 500 |
+
| 1.0 | 3481 | - | 0.9510 |
|
| 501 |
+
| 1.0055 | 3500 | 0.0246 | - |
|
| 502 |
+
| 1.1491 | 4000 | 0.0130 | - |
|
| 503 |
+
| 1.2496 | 4350 | - | 0.9539 |
|
| 504 |
+
| 1.2927 | 4500 | 0.0124 | - |
|
| 505 |
+
| 1.4364 | 5000 | 0.0135 | - |
|
| 506 |
+
| 1.4996 | 5220 | - | 0.9514 |
|
| 507 |
+
| 1.5800 | 5500 | 0.0108 | - |
|
| 508 |
+
| 1.7236 | 6000 | 0.0109 | - |
|
| 509 |
+
| 1.7495 | 6090 | - | 0.9534 |
|
| 510 |
+
| 1.8673 | 6500 | 0.0094 | - |
|
| 511 |
+
| 1.9994 | 6960 | - | 0.9541 |
|
| 512 |
+
| 2.0 | 6962 | - | 0.9547 |
|
| 513 |
+
| 2.0109 | 7000 | 0.0093 | - |
|
| 514 |
+
| 2.1546 | 7500 | 0.0050 | - |
|
| 515 |
+
| 2.2494 | 7830 | - | 0.9591 |
|
| 516 |
+
| 2.2982 | 8000 | 0.0078 | - |
|
| 517 |
+
| 2.4418 | 8500 | 0.0036 | - |
|
| 518 |
+
| 2.4993 | 8700 | - | 0.9581 |
|
| 519 |
+
| 2.5855 | 9000 | 0.0031 | - |
|
| 520 |
+
| 2.7291 | 9500 | 0.0057 | - |
|
| 521 |
+
| 2.7492 | 9570 | - | 0.9611 |
|
| 522 |
+
| 2.8727 | 10000 | 0.0051 | - |
|
| 523 |
+
| 2.9991 | 10440 | - | 0.9621 |
|
| 524 |
+
|
| 525 |
+
|
| 526 |
+
### Training Time
|
| 527 |
+
- **Training**: 2.7 hours
|
| 528 |
+
|
| 529 |
+
### Framework Versions
|
| 530 |
+
- Python: 3.12.13
|
| 531 |
+
- Sentence Transformers: 5.6.0
|
| 532 |
+
- Transformers: 5.12.1
|
| 533 |
+
- PyTorch: 2.11.0+cu128
|
| 534 |
+
- Accelerate: 1.14.0
|
| 535 |
+
- Datasets: 4.0.0
|
| 536 |
+
- Tokenizers: 0.22.2
|
| 537 |
+
|
| 538 |
+
## Citation
|
| 539 |
+
|
| 540 |
+
### BibTeX
|
| 541 |
+
|
| 542 |
+
#### Sentence Transformers
|
| 543 |
+
```bibtex
|
| 544 |
+
@inproceedings{reimers-2019-sentence-bert,
|
| 545 |
+
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
|
| 546 |
+
author = "Reimers, Nils and Gurevych, Iryna",
|
| 547 |
+
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
|
| 548 |
+
month = "11",
|
| 549 |
+
year = "2019",
|
| 550 |
+
publisher = "Association for Computational Linguistics",
|
| 551 |
+
url = "https://arxiv.org/abs/1908.10084",
|
| 552 |
+
}
|
| 553 |
+
```
|
| 554 |
+
|
| 555 |
+
#### MultipleNegativesRankingLoss
|
| 556 |
+
```bibtex
|
| 557 |
+
@misc{oord2019representationlearningcontrastivepredictive,
|
| 558 |
+
title={Representation Learning with Contrastive Predictive Coding},
|
| 559 |
+
author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
|
| 560 |
+
year={2019},
|
| 561 |
+
eprint={1807.03748},
|
| 562 |
+
archivePrefix={arXiv},
|
| 563 |
+
primaryClass={cs.LG},
|
| 564 |
+
url={https://arxiv.org/abs/1807.03748},
|
| 565 |
+
}
|
| 566 |
+
```
|
| 567 |
+
|
| 568 |
+
<!--
|
| 569 |
+
## Glossary
|
| 570 |
+
|
| 571 |
+
*Clearly define terms in order to be accessible across audiences.*
|
| 572 |
+
-->
|
| 573 |
+
|
| 574 |
+
<!--
|
| 575 |
+
## Model Card Authors
|
| 576 |
+
|
| 577 |
+
*Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction.*
|
| 578 |
+
-->
|
| 579 |
+
|
| 580 |
+
<!--
|
| 581 |
+
## Model Card Contact
|
| 582 |
+
|
| 583 |
+
*Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors.*
|
| 584 |
+
-->
|
config.json
ADDED
|
@@ -0,0 +1,29 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_cross_attention": false,
|
| 3 |
+
"architectures": [
|
| 4 |
+
"BertModel"
|
| 5 |
+
],
|
| 6 |
+
"attention_probs_dropout_prob": 0.1,
|
| 7 |
+
"bos_token_id": null,
|
| 8 |
+
"classifier_dropout": null,
|
| 9 |
+
"dtype": "float32",
|
| 10 |
+
"embedding_size": 768,
|
| 11 |
+
"eos_token_id": null,
|
| 12 |
+
"hidden_act": "gelu",
|
| 13 |
+
"hidden_dropout_prob": 0.1,
|
| 14 |
+
"hidden_size": 768,
|
| 15 |
+
"initializer_range": 0.02,
|
| 16 |
+
"intermediate_size": 3072,
|
| 17 |
+
"is_decoder": false,
|
| 18 |
+
"layer_norm_eps": 1e-12,
|
| 19 |
+
"max_position_embeddings": 512,
|
| 20 |
+
"model_type": "bert",
|
| 21 |
+
"num_attention_heads": 12,
|
| 22 |
+
"num_hidden_layers": 12,
|
| 23 |
+
"pad_token_id": 0,
|
| 24 |
+
"tie_word_embeddings": true,
|
| 25 |
+
"transformers_version": "5.12.1",
|
| 26 |
+
"type_vocab_size": 2,
|
| 27 |
+
"use_cache": false,
|
| 28 |
+
"vocab_size": 197285
|
| 29 |
+
}
|
config_sentence_transformers.json
ADDED
|
@@ -0,0 +1,14 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"__version__": {
|
| 3 |
+
"pytorch": "2.11.0+cu128",
|
| 4 |
+
"sentence_transformers": "5.6.0",
|
| 5 |
+
"transformers": "5.12.1"
|
| 6 |
+
},
|
| 7 |
+
"default_prompt_name": null,
|
| 8 |
+
"model_type": "SentenceTransformer",
|
| 9 |
+
"prompts": {
|
| 10 |
+
"document": "",
|
| 11 |
+
"query": ""
|
| 12 |
+
},
|
| 13 |
+
"similarity_fn_name": "cosine"
|
| 14 |
+
}
|
model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bb7b9434863e5b9c9f43b74e6aa8642ce90aafe36412f7e3d720079d196dc7a4
|
| 3 |
+
size 950247272
|
modules.json
ADDED
|
@@ -0,0 +1,14 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
[
|
| 2 |
+
{
|
| 3 |
+
"idx": 0,
|
| 4 |
+
"name": "0",
|
| 5 |
+
"path": "",
|
| 6 |
+
"type": "sentence_transformers.base.modules.transformer.Transformer"
|
| 7 |
+
},
|
| 8 |
+
{
|
| 9 |
+
"idx": 1,
|
| 10 |
+
"name": "1",
|
| 11 |
+
"path": "1_Pooling",
|
| 12 |
+
"type": "sentence_transformers.sentence_transformer.modules.pooling.Pooling"
|
| 13 |
+
}
|
| 14 |
+
]
|
sentence_bert_config.json
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"transformer_task": "feature-extraction",
|
| 3 |
+
"modality_config": {
|
| 4 |
+
"text": {
|
| 5 |
+
"method": "forward",
|
| 6 |
+
"method_output_name": "last_hidden_state"
|
| 7 |
+
}
|
| 8 |
+
},
|
| 9 |
+
"module_output_name": "token_embeddings"
|
| 10 |
+
}
|
tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
tokenizer_config.json
ADDED
|
@@ -0,0 +1,23 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"backend": "tokenizers",
|
| 3 |
+
"cls_token": "[CLS]",
|
| 4 |
+
"do_lower_case": false,
|
| 5 |
+
"is_local": true,
|
| 6 |
+
"local_files_only": false,
|
| 7 |
+
"lowercase": false,
|
| 8 |
+
"mask_token": "[MASK]",
|
| 9 |
+
"max_length": 256,
|
| 10 |
+
"model_max_length": 256,
|
| 11 |
+
"pad_to_multiple_of": null,
|
| 12 |
+
"pad_token": "[PAD]",
|
| 13 |
+
"pad_token_type_id": 0,
|
| 14 |
+
"padding_side": "right",
|
| 15 |
+
"sep_token": "[SEP]",
|
| 16 |
+
"stride": 0,
|
| 17 |
+
"strip_accents": false,
|
| 18 |
+
"tokenize_chinese_chars": true,
|
| 19 |
+
"tokenizer_class": "BertTokenizer",
|
| 20 |
+
"truncation_side": "right",
|
| 21 |
+
"truncation_strategy": "longest_first",
|
| 22 |
+
"unk_token": "[UNK]"
|
| 23 |
+
}
|