Aryan Mishra commited on
Commit
db13628
·
1 Parent(s): 7fe1de1

fix: add IndicSentiment Hindi dataset

Browse files
Files changed (2) hide show
  1. requirements.txt +2 -2
  2. scripts/download_data.py +8 -7
requirements.txt CHANGED
@@ -1,11 +1,11 @@
1
- transformers==4.40.0
2
  datasets==2.19.0
3
  torch==2.3.0
4
  onnxruntime==1.18.0
5
  optimum[onnxruntime]==1.19.0
6
  peft==0.10.0
7
  fasttext-wheel==0.9.2
8
- indicnlp @ git+https://github.com/anoopkunchukuttan/indic_nlp_library.git
9
  nlpaug==1.1.11
10
  scikit-learn==1.4.2
11
  pandas==2.2.2
 
1
+ transformers==4.39.3
2
  datasets==2.19.0
3
  torch==2.3.0
4
  onnxruntime==1.18.0
5
  optimum[onnxruntime]==1.19.0
6
  peft==0.10.0
7
  fasttext-wheel==0.9.2
8
+ indic-nlp-library @ git+https://github.com/anoopkunchukuttan/indic_nlp_library.git
9
  nlpaug==1.1.11
10
  scikit-learn==1.4.2
11
  pandas==2.2.2
scripts/download_data.py CHANGED
@@ -15,8 +15,8 @@ def download_fasttext():
15
 
16
  def download_semeval():
17
  print("Downloading SemEval datasets...")
18
- restaurants = load_dataset("tomaarsen/absa-semeval-2014-restaurants")
19
- laptops = load_dataset("tomaarsen/absa-semeval-2014-laptops")
20
 
21
  rest_path = RAW_DIR / "semeval_restaurants"
22
  lap_path = RAW_DIR / "semeval_laptops"
@@ -29,13 +29,14 @@ def download_semeval():
29
 
30
  def download_amazon_hindi():
31
  print("Downloading Amazon Hindi dataset...")
32
- # Load just 5000 from train
33
- amz_hi = load_dataset("amazon_reviews_multi", "hi", split="train[:5000]")
34
 
35
  amz_path = RAW_DIR / "amazon_hindi"
36
- amz_hi.save_to_disk(str(amz_path))
37
-
38
- print(f"Amazon Hindi train samples: {len(amz_hi)}")
 
39
 
40
  if __name__ == "__main__":
41
  os.makedirs(RAW_DIR, exist_ok=True)
 
15
 
16
  def download_semeval():
17
  print("Downloading SemEval datasets...")
18
+ restaurants = load_dataset("tomaarsen/setfit-absa-semeval-restaurants")
19
+ laptops = load_dataset("tomaarsen/setfit-absa-semeval-laptops")
20
 
21
  rest_path = RAW_DIR / "semeval_restaurants"
22
  lap_path = RAW_DIR / "semeval_laptops"
 
29
 
30
  def download_amazon_hindi():
31
  print("Downloading Amazon Hindi dataset...")
32
+ ds = load_dataset("ai4bharat/IndicSentiment", "translation-hi",
33
+ trust_remote_code=True, split="test")
34
 
35
  amz_path = RAW_DIR / "amazon_hindi"
36
+ os.makedirs(amz_path, exist_ok=True)
37
+ file_path = amz_path / "hindi_sentiment.jsonl"
38
+ ds.to_json(str(file_path))
39
+ print(f"Downloaded {len(ds)} Hindi samples")
40
 
41
  if __name__ == "__main__":
42
  os.makedirs(RAW_DIR, exist_ok=True)