Buckets:
68.2 MB
4 files
Updated 4 days ago
Ctrl+K
| Name | Size | Uploaded | Xet hash |
|---|---|---|---|
| .gitattributes | 2.62 kB xet | 5da86fb3 | |
| README.md | 3.58 kB xet | 685993cb | |
| ga_generated_en.jsonl | 36.8 MB xet | 73d68628 | |
| ga_generated_zh.jsonl | 31.4 MB xet | 52a162e6 |
GLM5.2 Distillation Dataset
数据集描述
本数据集为 GLM5.2 蒸馏(Distillation)数据,包含中文和英文两部分,采用 seed_driven 策略生成,覆盖计算机科学、数学、人工智能、工程技术、医学健康等 10 个领域。可用于大语言模型的监督微调(SFT)与知识蒸馏。
数据规模
| 语言 | 文件 | 条目数 |
|---|---|---|
| 中文 | ga_generated_zh.jsonl |
17,126 |
| 英文 | ga_generated_en.jsonl |
18,419 |
| 合计 | 35,545 |
数据格式
每条数据为 JSON Lines 格式,字段说明如下:
| 字段 | 类型 | 说明 |
|---|---|---|
system |
string | 系统提示词,定义模型角色与领域 |
instruction |
string | 用户输入/指令 |
output |
string | 模型回答 |
metadata |
object | 元数据,包含 strategy(生成策略)和 topic(主题) |
scores |
object | 质量评分,包含 correctness、completeness、clarity(各 0-10 分) |
total_score |
float | 总分(三项之和,满分 30) |
示例
{
"system": "你是工程技术领域的专家,擅长以准确、简洁的方式回答专业问题。",
"instruction": "什么是金属的疲劳破坏?工程上如何提高构件的疲劳寿命?",
"output": "疲劳破坏是指金属材料在交变应力作用下...",
"metadata": {"strategy": "seed_driven", "topic": "工程技术"},
"scores": {"correctness": 10.0, "completeness": 9.0, "clarity": 9.0},
"total_score": 28.0
}
主题分布
| 主题 | 中文条数 | 英文条数 |
|---|---|---|
| 计算机 / Computer Science | 2,998 | 3,564 |
| 数学 / Mathematics | 2,345 | 3,045 |
| 人工智能 / Artificial Intelligence | 2,188 | 2,776 |
| 社会科学 / Social Science | 1,548 | 1,573 |
| 教育学习 / Education | 1,526 | 1,617 |
| 商业管理 / Business Management | 1,468 | 1,582 |
| 自然科学 / Natural Science | 1,443 | 1,578 |
| 工程技术 / Engineering | 1,397 | 1,502 |
| 人文艺术 / Humanities & Arts | 1,144 | 1,220 |
| 医学健康 / Medicine & Health | 1,075 | 1,198 |
质量评分统计
中文(zh)
| 维度 | 均值 | 中位数 | P25 | P75 |
|---|---|---|---|---|
| Correctness | 9.7 | 10.0 | 10.0 | 10.0 |
| Completeness | 9.4 | 10.0 | 9.0 | 10.0 |
| Clarity | 9.7 | 10.0 | 9.0 | 10.0 |
| Total | 28.8 | 30.0 | 28.0 | 30.0 |
英文(en)
| 维度 | 均值 | 中位数 | P25 | P75 |
|---|---|---|---|---|
| Correctness | 9.5 | 10.0 | 9.0 | 10.0 |
| Completeness | 9.3 | 9.0 | 9.0 | 10.0 |
| Clarity | 9.4 | 9.0 | 9.0 | 10.0 |
| Total | 28.3 | 29.0 | 27.0 | 30.0 |
长度统计
| 语言 | 指令长度(均值/中位) | 回答长度(均值/中位) |
|---|---|---|
| 中文 | 76 / 58 tokens | 482 / 457 tokens |
| 英文 | 177 / 121 tokens | 1381 / 1164 tokens |
使用方式
from datasets import load_dataset
# 加载中文数据
ds_zh = load_dataset("ViperEk/glm5.2-distill", "zh")
# 加载英文数据
ds_en = load_dataset("ViperEk/glm5.2-distill", "en")
# 也可以直接加载全部
ds = load_dataset("ViperEk/glm5.2-distill")
- Total size
- 68.2 MB
- Files
- 4
- Last updated
- Jul 23
- Pre-warmed CDN
- US EU US EU