68.2 MB
4 files
Updated 4 days ago
README.md

GLM5.2 Distillation Dataset

数据集描述

本数据集为 GLM5.2 蒸馏(Distillation)数据,包含中文和英文两部分,采用 seed_driven 策略生成,覆盖计算机科学、数学、人工智能、工程技术、医学健康等 10 个领域。可用于大语言模型的监督微调(SFT)与知识蒸馏。

数据规模

语言 文件 条目数
中文 ga_generated_zh.jsonl 17,126
英文 ga_generated_en.jsonl 18,419
合计 35,545

数据格式

每条数据为 JSON Lines 格式,字段说明如下:

字段 类型 说明
system string 系统提示词,定义模型角色与领域
instruction string 用户输入/指令
output string 模型回答
metadata object 元数据,包含 strategy(生成策略)和 topic(主题)
scores object 质量评分,包含 correctnesscompletenessclarity(各 0-10 分)
total_score float 总分(三项之和,满分 30)

示例

{
  "system": "你是工程技术领域的专家,擅长以准确、简洁的方式回答专业问题。",
  "instruction": "什么是金属的疲劳破坏?工程上如何提高构件的疲劳寿命?",
  "output": "疲劳破坏是指金属材料在交变应力作用下...",
  "metadata": {"strategy": "seed_driven", "topic": "工程技术"},
  "scores": {"correctness": 10.0, "completeness": 9.0, "clarity": 9.0},
  "total_score": 28.0
}

主题分布

主题 中文条数 英文条数
计算机 / Computer Science 2,998 3,564
数学 / Mathematics 2,345 3,045
人工智能 / Artificial Intelligence 2,188 2,776
社会科学 / Social Science 1,548 1,573
教育学习 / Education 1,526 1,617
商业管理 / Business Management 1,468 1,582
自然科学 / Natural Science 1,443 1,578
工程技术 / Engineering 1,397 1,502
人文艺术 / Humanities & Arts 1,144 1,220
医学健康 / Medicine & Health 1,075 1,198

质量评分统计

中文(zh)

维度 均值 中位数 P25 P75
Correctness 9.7 10.0 10.0 10.0
Completeness 9.4 10.0 9.0 10.0
Clarity 9.7 10.0 9.0 10.0
Total 28.8 30.0 28.0 30.0

英文(en)

维度 均值 中位数 P25 P75
Correctness 9.5 10.0 9.0 10.0
Completeness 9.3 9.0 9.0 10.0
Clarity 9.4 9.0 9.0 10.0
Total 28.3 29.0 27.0 30.0

长度统计

语言 指令长度(均值/中位) 回答长度(均值/中位)
中文 76 / 58 tokens 482 / 457 tokens
英文 177 / 121 tokens 1381 / 1164 tokens

使用方式

from datasets import load_dataset

# 加载中文数据
ds_zh = load_dataset("ViperEk/glm5.2-distill", "zh")

# 加载英文数据
ds_en = load_dataset("ViperEk/glm5.2-distill", "en")

# 也可以直接加载全部
ds = load_dataset("ViperEk/glm5.2-distill")
Total size
68.2 MB
Files
4
Last updated
Jul 23
Pre-warmed CDN
US EU US EU

Contributors