3 个章节·按类别展开/折叠
知识
数据源
- 公开数据集:HuggingFace datasets、魔搭社区、智源 FlagOpen
- 合成数据:用 GPT-4 / Claude 生成训练样本(蒸馏)
- 业务数据:你自己领域的真实数据(如汽车安全法规)
格式标准(OpenAI ChatML):
{"messages": [
{"role": "system", "content": "你是汽车安全法规专家"},
{"role": "user", "content": "C-NCAP 五星需要满足什么?"},
{"role": "assistant", "content": "正面 100% 重叠刚性壁障碰撞..."}
]}知识
数据清洗关键步骤
- 去重:用 sentence-transformers 算 embedding,cosine > 0.9 视为重复
- 去噪:删除太短(<50字)、太长(>3000字)、有特殊字符
- 校验:人工抽检 50 条,看质量
- 平衡:保证类别分布均衡
callout