learning
AI 辅助数据清洗
当前阅读:进阶视角
本单元目标
学完本单元后,你将能够借助 AI 工具(如 ChatGPT、Kimi 等)快速识别并处理常见的数据质量问题,包括缺失值、重复数据和格式不统一,最终得到一份干净、可用的数据集。
概念讲解
数据清洗,简单来说就是给数据"洗澡",把脏的地方洗干净。什么是脏数据?比如你从网上下载了一份客户名单,里面有的手机号格式是 `138xxxx1234`,有的却是 `138-xxxx-1234`,这就是格式不统一;有的行里"年龄"一栏是空的,这就是缺失值;还有同一顾客出现了两次,这就是重复数据。
传统做法是手动用 Excel 或写代码来清理,费时费力。而 AI 辅助数据清洗的思路是:你不需要自己记住所有清洗规则,只需要把数据样本和你的问题描述给 AI,它就能生成清洗方案或代码,甚至直接输出清洗后的结果。
核心概念有三个:缺失值处理(是删除空行、填 0 还是填平均值?)、格式标准化(把日期、电话、金额统一成同一种写法)、去重(识别并删除重复记录)。AI 的价值在于:它能根据你的数据情况,推荐最适合的清洗策略,并自动生成可复用的处理脚本。
实操演练
- 准备一份含脏数据的 CSV 文件(如客户信息表),打开 AI 对话工具,将文件直接上传或复制前 10 行数据粘贴给 AI。
- 向 AI 提问:"请帮我检查这份数据的质量问题,列出所有发现的脏数据类别,并给出处理建议。"等待 AI 输出分析结果。
- 根据 AI 的回复,追问:"请为每个问题写出对应的 Python 清洗代码(使用 pandas),并解释每段代码的作用。"复制 AI 生成的代码。
- 将代码粘贴到 Jupyter Notebook 或在线代码编辑器(如 Colab)中运行,检查输出结果是否解决了问题。
- 如果结果不理想,将报错信息或异常输出反馈给 AI,让它修正代码,直到数据清洗完成。
练习任务
- 用 AI 清洗你手头任意一份含缺失值和格式问题的数据文件,提交清洗前后的数据对比截图(至少包含 3 处变化)。
- 让 AI 为清洗过程写一段 50 字以内的总结,说明清洗策略和最终效果,并提交这段文本。