Buckets:
| language: | |
| - zh | |
| - en | |
| license: apache-2.0 | |
| task_categories: | |
| - text-generation | |
| tags: | |
| - glm | |
| - distillation | |
| - sft | |
| - synthetic | |
| pretty_name: GLM5.2 Distillation Dataset | |
| configs: | |
| - config_name: zh | |
| data_files: ga_generated_zh.jsonl | |
| - config_name: en | |
| data_files: ga_generated_en.jsonl | |
| # GLM5.2 Distillation Dataset | |
| ## 数据集描述 | |
| 本数据集为 GLM5.2 蒸馏(Distillation)数据,包含中文和英文两部分,采用 `seed_driven` 策略生成,覆盖计算机科学、数学、人工智能、工程技术、医学健康等 10 个领域。可用于大语言模型的监督微调(SFT)与知识蒸馏。 | |
| ## 数据规模 | |
| | 语言 | 文件 | 条目数 | | |
| |------|------|--------| | |
| | 中文 | `ga_generated_zh.jsonl` | 17,126 | | |
| | 英文 | `ga_generated_en.jsonl` | 18,419 | | |
| | **合计** | | **35,545** | | |
| ## 数据格式 | |
| 每条数据为 JSON Lines 格式,字段说明如下: | |
| | 字段 | 类型 | 说明 | | |
| |------|------|------| | |
| | `system` | string | 系统提示词,定义模型角色与领域 | | |
| | `instruction` | string | 用户输入/指令 | | |
| | `output` | string | 模型回答 | | |
| | `metadata` | object | 元数据,包含 `strategy`(生成策略)和 `topic`(主题) | | |
| | `scores` | object | 质量评分,包含 `correctness`、`completeness`、`clarity`(各 0-10 分) | | |
| | `total_score` | float | 总分(三项之和,满分 30) | | |
| ### 示例 | |
| ```json | |
| { | |
| "system": "你是工程技术领域的专家,擅长以准确、简洁的方式回答专业问题。", | |
| "instruction": "什么是金属的疲劳破坏?工程上如何提高构件的疲劳寿命?", | |
| "output": "疲劳破坏是指金属材料在交变应力作用下...", | |
| "metadata": {"strategy": "seed_driven", "topic": "工程技术"}, | |
| "scores": {"correctness": 10.0, "completeness": 9.0, "clarity": 9.0}, | |
| "total_score": 28.0 | |
| } | |
| ``` | |
| ## 主题分布 | |
| | 主题 | 中文条数 | 英文条数 | | |
| |------|---------|---------| | |
| | 计算机 / Computer Science | 2,998 | 3,564 | | |
| | 数学 / Mathematics | 2,345 | 3,045 | | |
| | 人工智能 / Artificial Intelligence | 2,188 | 2,776 | | |
| | 社会科学 / Social Science | 1,548 | 1,573 | | |
| | 教育学习 / Education | 1,526 | 1,617 | | |
| | 商业管理 / Business Management | 1,468 | 1,582 | | |
| | 自然科学 / Natural Science | 1,443 | 1,578 | | |
| | 工程技术 / Engineering | 1,397 | 1,502 | | |
| | 人文艺术 / Humanities & Arts | 1,144 | 1,220 | | |
| | 医学健康 / Medicine & Health | 1,075 | 1,198 | | |
| ## 质量评分统计 | |
| ### 中文(zh) | |
| | 维度 | 均值 | 中位数 | P25 | P75 | | |
| |------|------|--------|-----|-----| | |
| | Correctness | 9.7 | 10.0 | 10.0 | 10.0 | | |
| | Completeness | 9.4 | 10.0 | 9.0 | 10.0 | | |
| | Clarity | 9.7 | 10.0 | 9.0 | 10.0 | | |
| | **Total** | **28.8** | **30.0** | **28.0** | **30.0** | | |
| ### 英文(en) | |
| | 维度 | 均值 | 中位数 | P25 | P75 | | |
| |------|------|--------|-----|-----| | |
| | Correctness | 9.5 | 10.0 | 9.0 | 10.0 | | |
| | Completeness | 9.3 | 9.0 | 9.0 | 10.0 | | |
| | Clarity | 9.4 | 9.0 | 9.0 | 10.0 | | |
| | **Total** | **28.3** | **29.0** | **27.0** | **30.0** | | |
| ## 长度统计 | |
| | 语言 | 指令长度(均值/中位) | 回答长度(均值/中位) | | |
| |------|---------------------|---------------------| | |
| | 中文 | 76 / 58 tokens | 482 / 457 tokens | | |
| | 英文 | 177 / 121 tokens | 1381 / 1164 tokens | | |
| ## 使用方式 | |
| ```python | |
| from datasets import load_dataset | |
| # 加载中文数据 | |
| ds_zh = load_dataset("ViperEk/glm5.2-distill", "zh") | |
| # 加载英文数据 | |
| ds_en = load_dataset("ViperEk/glm5.2-distill", "en") | |
| # 也可以直接加载全部 | |
| ds = load_dataset("ViperEk/glm5.2-distill") | |
| ``` | |
Xet Storage Details
- Size:
- 3.58 kB
- Xet hash:
- 685993cb06ea67f588f6708fceecae6b56c892a2f3dda07ca43f6190582bf841
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.