dataopsnick's picture
|
download
raw
3.58 kB
---
language:
- zh
- en
license: apache-2.0
task_categories:
- text-generation
tags:
- glm
- distillation
- sft
- synthetic
pretty_name: GLM5.2 Distillation Dataset
configs:
- config_name: zh
data_files: ga_generated_zh.jsonl
- config_name: en
data_files: ga_generated_en.jsonl
---
# GLM5.2 Distillation Dataset
## 数据集描述
本数据集为 GLM5.2 蒸馏(Distillation)数据,包含中文和英文两部分,采用 `seed_driven` 策略生成,覆盖计算机科学、数学、人工智能、工程技术、医学健康等 10 个领域。可用于大语言模型的监督微调(SFT)与知识蒸馏。
## 数据规模
| 语言 | 文件 | 条目数 |
|------|------|--------|
| 中文 | `ga_generated_zh.jsonl` | 17,126 |
| 英文 | `ga_generated_en.jsonl` | 18,419 |
| **合计** | | **35,545** |
## 数据格式
每条数据为 JSON Lines 格式,字段说明如下:
| 字段 | 类型 | 说明 |
|------|------|------|
| `system` | string | 系统提示词,定义模型角色与领域 |
| `instruction` | string | 用户输入/指令 |
| `output` | string | 模型回答 |
| `metadata` | object | 元数据,包含 `strategy`(生成策略)和 `topic`(主题) |
| `scores` | object | 质量评分,包含 `correctness``completeness``clarity`(各 0-10 分) |
| `total_score` | float | 总分(三项之和,满分 30) |
### 示例
```json
{
"system": "你是工程技术领域的专家,擅长以准确、简洁的方式回答专业问题。",
"instruction": "什么是金属的疲劳破坏?工程上如何提高构件的疲劳寿命?",
"output": "疲劳破坏是指金属材料在交变应力作用下...",
"metadata": {"strategy": "seed_driven", "topic": "工程技术"},
"scores": {"correctness": 10.0, "completeness": 9.0, "clarity": 9.0},
"total_score": 28.0
}
```
## 主题分布
| 主题 | 中文条数 | 英文条数 |
|------|---------|---------|
| 计算机 / Computer Science | 2,998 | 3,564 |
| 数学 / Mathematics | 2,345 | 3,045 |
| 人工智能 / Artificial Intelligence | 2,188 | 2,776 |
| 社会科学 / Social Science | 1,548 | 1,573 |
| 教育学习 / Education | 1,526 | 1,617 |
| 商业管理 / Business Management | 1,468 | 1,582 |
| 自然科学 / Natural Science | 1,443 | 1,578 |
| 工程技术 / Engineering | 1,397 | 1,502 |
| 人文艺术 / Humanities & Arts | 1,144 | 1,220 |
| 医学健康 / Medicine & Health | 1,075 | 1,198 |
## 质量评分统计
### 中文(zh)
| 维度 | 均值 | 中位数 | P25 | P75 |
|------|------|--------|-----|-----|
| Correctness | 9.7 | 10.0 | 10.0 | 10.0 |
| Completeness | 9.4 | 10.0 | 9.0 | 10.0 |
| Clarity | 9.7 | 10.0 | 9.0 | 10.0 |
| **Total** | **28.8** | **30.0** | **28.0** | **30.0** |
### 英文(en)
| 维度 | 均值 | 中位数 | P25 | P75 |
|------|------|--------|-----|-----|
| Correctness | 9.5 | 10.0 | 9.0 | 10.0 |
| Completeness | 9.3 | 9.0 | 9.0 | 10.0 |
| Clarity | 9.4 | 9.0 | 9.0 | 10.0 |
| **Total** | **28.3** | **29.0** | **27.0** | **30.0** |
## 长度统计
| 语言 | 指令长度(均值/中位) | 回答长度(均值/中位) |
|------|---------------------|---------------------|
| 中文 | 76 / 58 tokens | 482 / 457 tokens |
| 英文 | 177 / 121 tokens | 1381 / 1164 tokens |
## 使用方式
```python
from datasets import load_dataset
# 加载中文数据
ds_zh = load_dataset("ViperEk/glm5.2-distill", "zh")
# 加载英文数据
ds_en = load_dataset("ViperEk/glm5.2-distill", "en")
# 也可以直接加载全部
ds = load_dataset("ViperEk/glm5.2-distill")
```

Xet Storage Details

Size:
3.58 kB
·
Xet hash:
685993cb06ea67f588f6708fceecae6b56c892a2f3dda07ca43f6190582bf841

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.