云计算百科
云计算领域专业知识百科平台

[人工智能训练师]EDA(探索性数据分析)

你说得对,我之前的框架确实遗漏了EDA(探索性数据分析)和可视化分析,而且它的位置应该是数据处理的第一步,而不是藏在清洗模块里。

正确的流程应该是:

数据采集 → 数据探索与可视化分析(EDA) → 数据清洗 → 特征工程 → 数据标注 → 质检验证 → 存储交付


🔍 数据探索与可视化分析(EDA)—— 数据处理的第一步

为什么它是第一步?

拿到数据后,不能先动手清洗,要先动手看。只有先"看懂"数据的分布、质量、结构和问题,才能决定后续怎么清洗、怎么标注、甚至要不要重新采集。

EDA包含哪些内容?

1. 描述性统计

  • 数值型:均值、中位数、标准差、四分位数、极值
  • 分类型:类别数量、频次分布、众数、唯一值占比
  • 时间型:时间跨度、采样频率、趋势方向

2. 分布可视化

  • 直方图 / 密度图:看数值分布形态(正态?偏态?长尾?)
  • 箱线图:快速定位离群点和四分位范围
  • 饼图 / 柱状图:看类别占比是否均衡
  • 时间序列图:看趋势、周期、异常时间点

3. 质量诊断可视化

  • 缺失值热力图:哪些字段缺、缺多少、有没有规律(随机缺还是整块缺)
  • 重复样本统计:精确重复 vs 模糊重复
  • 异常值散点图:二维/三维散点看离群簇

4. 关联与结构分析

  • 相关性矩阵热力图:特征之间、特征与标签之间的相关性
  • 交叉透视表:多维度组合下的分布(如"年龄段×城市×购买率")
  • 共线性检测:高度相关的冗余特征

5. 业务语义探索

  • 样本抽样人工审阅:随机抽100条,肉眼过一遍,发现规范文档里写不到的问题
  • 边界案例识别:哪些样本是模糊的、有争议的、需要标注规范特别说明的

EDA的输出是什么?

EDA发现后续动作
某类别样本只有3条 决定补采或用过采样平衡
缺失值集中在某个时间段 怀疑采集系统当时故障,决定删除该时段数据
标签与某特征相关系数0.95 怀疑数据泄露,决定剔除该特征
发现大量重复样本 清洗阶段制定去重规则
边界案例密度高 标注规范需要重点写模糊场景的处理原则
分布与业务预期不符 反馈给采集团队,检查采集逻辑是否有偏

总结

EDA不是"分析着玩",而是数据处理的"诊断报告"——它决定了清洗策略、标注规范、特征方向、甚至采集方案是否需要返工。把它放在第一步,后续所有处理动作才有依据,否则就是盲人摸象。

赞(0)
未经允许不得转载:网硕互联帮助中心 » [人工智能训练师]EDA(探索性数据分析)
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!