返回学习地图
trainingPhase D · 第 28

D3.4 数据准备(质量 > 数量)

100 条 vs 10 万条,哪种更好?

3 个章节·按类别展开/折叠
知识

数据源

  1. 公开数据集:HuggingFace datasets、魔搭社区、智源 FlagOpen
  2. 合成数据:用 GPT-4 / Claude 生成训练样本(蒸馏)
  3. 业务数据:你自己领域的真实数据(如汽车安全法规)

格式标准(OpenAI ChatML):

{"messages": [
  {"role": "system", "content": "你是汽车安全法规专家"},
  {"role": "user", "content": "C-NCAP 五星需要满足什么?"},
  {"role": "assistant", "content": "正面 100% 重叠刚性壁障碰撞..."}
]}
知识

数据清洗关键步骤

  1. 去重:用 sentence-transformers 算 embedding,cosine > 0.9 视为重复
  2. 去噪:删除太短(<50字)、太长(>3000字)、有特殊字符
  3. 校验:人工抽检 50 条,看质量
  4. 平衡:保证类别分布均衡
callout

数量参考