数据准备 = 在AI产品研发中,把"原始的、杂乱的、不可用的"数据,变成"干净的、有标注的、模型能学的"高质量数据集的过程。
行业铁律:Garbage In, Garbage Out。算法工程师80%的时间花在数据上,只有20%花在模型上。数据质量直接决定模型效果上限。
核心认知:数据准备不是"前期琐碎工作",是AI产品的根基。在AI产品研发中,数据是核心资产(对比传统软件工程中代码是核心资产)。
五个核心环节
1. 采集(Collection)
来源类型:
- 自有业务数据(用户行为日志、订单记录、客服对话)
- 公开数据集(HuggingFace、Kaggle、学术Benchmark)
- 爬虫采集(注意合规和版权)
- 人工生成(仿写、专家撰写)
- 模型合成(用大模型生成训练数据)
PM核心判断:数据是否覆盖真实场景的全部分布?
2. 清洗(Cleaning)
- 去重:相同内容的样本、过度模板化
- 去噪:去掉乱码、空值、HTML标签、特殊字符
- 去隐私:脱敏个人信息(手机号、身份证、住址)
- 过滤:过滤色情、暴力、歧视等违规内容
- 统一规范:编码、单位、时间格式标准化
PM核心判断:清洗规则是否完整,数据是否干净可用?
3. 标注(Labeling)★最贵、最关键的环节
标注成本占整个数据准备的60-80%。
标注方式:人工标注 / 半自动标注 / 模型标注
- 多人交叉验证:同一条数据≥2人标注,分歧投票处理
- 单一性验证:定期抽查,保证不同标注员标准一致
- 成本占整个数据准备的60-80%
PM核心判断:把控标注任务是否合理,避免数据泛滥。
4. 划分(Splitting)
典型比例:训练集70% / 验证集15% / 测试集15%
PM核心判断:划分方式是否合理,避免数据泄露。
5. 评测(Evaluation)
- 数据分布是否均匀(不能某类样本占比>90%)
- 标注质量是否过关(一致性检查,错误率)
- 是否覆盖关键场景(特别是badcase和长尾case)
- 数据规模是否足够(不同任务有无基线)
PM核心判断:数据质量是否达标,能否支撑业务目标?
数据没准备好的代价
| 问题 | 后果 |
|---|---|
| 模型准确率上不去 | 无论怎么调参都没用 |
| 训练数据有偏差 | 上线后对特定人群效果极差 |
| 评测集和实际场景不一致 | 实验室95%,线上65% |
| 数据格式混乱 | 工程师每天都在补数据,迭代效率为0 |
数据质量5个标准(PM验收清单)
| 标准 | 定义 | 检验方式 |
|---|---|---|
| 准确性(Accuracy) | 标注答案是对的,没有错标、漏标 | 双盲标注一致率 ≥ 90% |
| 完整性(Completeness) | 字段填写完整,没有大量空值或缺失 | 关键字段缺失率 < 1% |
| 一致性(Consistency) | 同类数据用同一套标准,格式统一 | 抽样1%人工审查,标准偏差 < 5% |
| 多样性(Diversity) | 覆盖各种真实场景,不是单一类型重复 | 场景分布表 + 长尾case占比 ≥ 15% |
| 时效性(Timeliness) | 数据反映当前业务状态,不是过时数据 | 数据采集时间 vs 业务变化周期 |
数据准备的成本分布(典型占比)
- 标注:60-80%
- 采集:10-20%
- 清洗:5-10%
- 其他:5-10%
PM 怎么用 / 何时用
- 启动数据工作时,按五环节(采集/清洗/标注/划分/评测)拆任务,每环用对应的"PM核心判断"逐条把关。
- 排预算和排期时,记住标注占 60-80% 成本——优先确认标注方案(人工/半自动/模型)与交叉验证规则。
- 数据集交付验收时,用"数据质量 5 个标准"(准确/完整/一致/多样/时效)逐项核对检验方式,达标才进训练。
相关页面
→ AIPM课程 Day2 → POC验证 → 效果评测体系 → 模型选型五维度