数据准备 = 在AI产品研发中,把"原始的、杂乱的、不可用的"数据,变成"干净的、有标注的、模型能学的"高质量数据集的过程。

行业铁律:Garbage In, Garbage Out。算法工程师80%的时间花在数据上,只有20%花在模型上。数据质量直接决定模型效果上限。

核心认知:数据准备不是"前期琐碎工作",是AI产品的根基。在AI产品研发中,数据是核心资产(对比传统软件工程中代码是核心资产)。

五个核心环节

1. 采集(Collection)

来源类型

  • 自有业务数据(用户行为日志、订单记录、客服对话)
  • 公开数据集(HuggingFace、Kaggle、学术Benchmark)
  • 爬虫采集(注意合规和版权)
  • 人工生成(仿写、专家撰写)
  • 模型合成(用大模型生成训练数据)

PM核心判断:数据是否覆盖真实场景的全部分布?

2. 清洗(Cleaning)

  • 去重:相同内容的样本、过度模板化
  • 去噪:去掉乱码、空值、HTML标签、特殊字符
  • 去隐私:脱敏个人信息(手机号、身份证、住址)
  • 过滤:过滤色情、暴力、歧视等违规内容
  • 统一规范:编码、单位、时间格式标准化

PM核心判断:清洗规则是否完整,数据是否干净可用?

3. 标注(Labeling)★最贵、最关键的环节

标注成本占整个数据准备的60-80%。

标注方式:人工标注 / 半自动标注 / 模型标注

  • 多人交叉验证:同一条数据≥2人标注,分歧投票处理
  • 单一性验证:定期抽查,保证不同标注员标准一致
  • 成本占整个数据准备的60-80%

PM核心判断:把控标注任务是否合理,避免数据泛滥。

4. 划分(Splitting)

典型比例:训练集70% / 验证集15% / 测试集15%

PM核心判断:划分方式是否合理,避免数据泄露。

5. 评测(Evaluation)

  • 数据分布是否均匀(不能某类样本占比>90%)
  • 标注质量是否过关(一致性检查,错误率)
  • 是否覆盖关键场景(特别是badcase和长尾case)
  • 数据规模是否足够(不同任务有无基线)

PM核心判断:数据质量是否达标,能否支撑业务目标?

数据没准备好的代价

问题 后果
模型准确率上不去 无论怎么调参都没用
训练数据有偏差 上线后对特定人群效果极差
评测集和实际场景不一致 实验室95%,线上65%
数据格式混乱 工程师每天都在补数据,迭代效率为0

数据质量5个标准(PM验收清单)

标准 定义 检验方式
准确性(Accuracy) 标注答案是对的,没有错标、漏标 双盲标注一致率 ≥ 90%
完整性(Completeness) 字段填写完整,没有大量空值或缺失 关键字段缺失率 < 1%
一致性(Consistency) 同类数据用同一套标准,格式统一 抽样1%人工审查,标准偏差 < 5%
多样性(Diversity) 覆盖各种真实场景,不是单一类型重复 场景分布表 + 长尾case占比 ≥ 15%
时效性(Timeliness) 数据反映当前业务状态,不是过时数据 数据采集时间 vs 业务变化周期

数据准备的成本分布(典型占比)

  • 标注:60-80%
  • 采集:10-20%
  • 清洗:5-10%
  • 其他:5-10%

PM 怎么用 / 何时用

  • 启动数据工作时,按五环节(采集/清洗/标注/划分/评测)拆任务,每环用对应的"PM核心判断"逐条把关。
  • 排预算和排期时,记住标注占 60-80% 成本——优先确认标注方案(人工/半自动/模型)与交叉验证规则。
  • 数据集交付验收时,用"数据质量 5 个标准"(准确/完整/一致/多样/时效)逐项核对检验方式,达标才进训练。

相关页面

AIPM课程 Day2POC验证效果评测体系模型选型五维度