Text Generation
Transformers
Safetensors
English
qwen2
conversational
text-generation-inference
krogoldAI commited on
Commit
eca8654
·
verified ·
1 Parent(s): b61271b

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +7 -2
README.md CHANGED
@@ -131,9 +131,14 @@ Typical deployment scenarios include conversational search systems, question-ans
131
 
132
  ## Training Data
133
 
134
- The model was trained on two complementary datasets totaling approximately 10,000 examples.
135
 
136
- The primary dataset, [krogoldAI/rag-query-analysis](https://huggingface.co/datasets/krogoldAI/rag-query-analysis), contains 7,305 high-quality query-analysis pairs. Approximately 20% of the training examples include queries with systematically introduced ambiguity at varying levels to ensure the model can handle realistic user inputs across the ambiguity spectrum.
 
 
 
 
 
137
 
138
  The training data underwent rigorous quality assurance through a dual evaluation framework. Each example was validated for strict XML schema conformance and semantically evaluated using an LLM-as-a-judge protocol with six quality dimensions. Only examples achieving both perfect structural validity and high semantic quality scores were included in the final dataset, ensuring the model was trained exclusively on gold-standard examples.
139
 
 
131
 
132
  ## Training Data
133
 
134
+ The model was trained on two complementary datasets, totaling approximately 10,000 examples.
135
 
136
+ The primary dataset, [krogoldAI/rag-query-analysis](https://huggingface.co/datasets/krogoldAI/rag-query-analysis), contains 7,305 high-quality query-analysis pairs. This dataset was carefully curated from three sources:
137
+ - [rag-datasets/rag-mini-wikipedia](https://huggingface.co/datasets/rag-datasets/rag-mini-wikipedia)
138
+ - [razbit96/Ambiguity-Handling-in-User-Queries](https://huggingface.co/datasets/razbit96/Ambiguity-Handling-in-User-Queries)
139
+ - [glaiveai/RAG-v1](https://huggingface.co/datasets/glaiveai/RAG-v1).
140
+
141
+ Approximately 20% of the training examples include queries with systematically introduced ambiguity at varying levels to ensure the model can handle realistic user inputs across the ambiguity spectrum.
142
 
143
  The training data underwent rigorous quality assurance through a dual evaluation framework. Each example was validated for strict XML schema conformance and semantically evaluated using an LLM-as-a-judge protocol with six quality dimensions. Only examples achieving both perfect structural validity and high semantic quality scores were included in the final dataset, ensuring the model was trained exclusively on gold-standard examples.
144