| import json | |
| import os | |
| from pathlib import Path | |
| from datasets import load_dataset | |
| from dotenv import load_dotenv | |
| load_dotenv() | |
| OUTPUT_DIR = Path("data/raw_sources/hackaprompt") | |
| OUTPUT_DIR.mkdir(parents=True, exist_ok=True) | |
| OUTPUT_FILE = OUTPUT_DIR / "hackaprompt_full.jsonl" | |
| def main(): | |
| # Replace this with the exact dataset ID your team uses on Hugging Face | |
| dataset_id = "hackaprompt/hackaprompt-dataset" | |
| token = os.getenv("HUGGINGFACE_TOKEN") or os.getenv("HF_TOKEN") | |
| load_kw = {"split": "train"} | |
| if token: | |
| load_kw["token"] = token | |
| ds = load_dataset(dataset_id, **load_kw) | |
| with OUTPUT_FILE.open("w", encoding="utf-8") as f: | |
| for row in ds: | |
| f.write(json.dumps(row, ensure_ascii=False) + "\n") | |
| print(f"Saved full HackAPrompt dataset to: {OUTPUT_FILE}") | |
| print(f"Total rows written: {len(ds)}") | |
| if __name__ == "__main__": | |
| main() |