Spaces:
Runtime error
Runtime error
Aryan Mishra commited on
Commit ·
db13628
1
Parent(s): 7fe1de1
fix: add IndicSentiment Hindi dataset
Browse files- requirements.txt +2 -2
- scripts/download_data.py +8 -7
requirements.txt
CHANGED
|
@@ -1,11 +1,11 @@
|
|
| 1 |
-
transformers==4.
|
| 2 |
datasets==2.19.0
|
| 3 |
torch==2.3.0
|
| 4 |
onnxruntime==1.18.0
|
| 5 |
optimum[onnxruntime]==1.19.0
|
| 6 |
peft==0.10.0
|
| 7 |
fasttext-wheel==0.9.2
|
| 8 |
-
|
| 9 |
nlpaug==1.1.11
|
| 10 |
scikit-learn==1.4.2
|
| 11 |
pandas==2.2.2
|
|
|
|
| 1 |
+
transformers==4.39.3
|
| 2 |
datasets==2.19.0
|
| 3 |
torch==2.3.0
|
| 4 |
onnxruntime==1.18.0
|
| 5 |
optimum[onnxruntime]==1.19.0
|
| 6 |
peft==0.10.0
|
| 7 |
fasttext-wheel==0.9.2
|
| 8 |
+
indic-nlp-library @ git+https://github.com/anoopkunchukuttan/indic_nlp_library.git
|
| 9 |
nlpaug==1.1.11
|
| 10 |
scikit-learn==1.4.2
|
| 11 |
pandas==2.2.2
|
scripts/download_data.py
CHANGED
|
@@ -15,8 +15,8 @@ def download_fasttext():
|
|
| 15 |
|
| 16 |
def download_semeval():
|
| 17 |
print("Downloading SemEval datasets...")
|
| 18 |
-
restaurants = load_dataset("tomaarsen/absa-semeval-
|
| 19 |
-
laptops = load_dataset("tomaarsen/absa-semeval-
|
| 20 |
|
| 21 |
rest_path = RAW_DIR / "semeval_restaurants"
|
| 22 |
lap_path = RAW_DIR / "semeval_laptops"
|
|
@@ -29,13 +29,14 @@ def download_semeval():
|
|
| 29 |
|
| 30 |
def download_amazon_hindi():
|
| 31 |
print("Downloading Amazon Hindi dataset...")
|
| 32 |
-
|
| 33 |
-
|
| 34 |
|
| 35 |
amz_path = RAW_DIR / "amazon_hindi"
|
| 36 |
-
|
| 37 |
-
|
| 38 |
-
|
|
|
|
| 39 |
|
| 40 |
if __name__ == "__main__":
|
| 41 |
os.makedirs(RAW_DIR, exist_ok=True)
|
|
|
|
| 15 |
|
| 16 |
def download_semeval():
|
| 17 |
print("Downloading SemEval datasets...")
|
| 18 |
+
restaurants = load_dataset("tomaarsen/setfit-absa-semeval-restaurants")
|
| 19 |
+
laptops = load_dataset("tomaarsen/setfit-absa-semeval-laptops")
|
| 20 |
|
| 21 |
rest_path = RAW_DIR / "semeval_restaurants"
|
| 22 |
lap_path = RAW_DIR / "semeval_laptops"
|
|
|
|
| 29 |
|
| 30 |
def download_amazon_hindi():
|
| 31 |
print("Downloading Amazon Hindi dataset...")
|
| 32 |
+
ds = load_dataset("ai4bharat/IndicSentiment", "translation-hi",
|
| 33 |
+
trust_remote_code=True, split="test")
|
| 34 |
|
| 35 |
amz_path = RAW_DIR / "amazon_hindi"
|
| 36 |
+
os.makedirs(amz_path, exist_ok=True)
|
| 37 |
+
file_path = amz_path / "hindi_sentiment.jsonl"
|
| 38 |
+
ds.to_json(str(file_path))
|
| 39 |
+
print(f"Downloaded {len(ds)} Hindi samples")
|
| 40 |
|
| 41 |
if __name__ == "__main__":
|
| 42 |
os.makedirs(RAW_DIR, exist_ok=True)
|