AI COLLABORATION WORKFLOW
源数据清洗
数据透析表·一键生成
用法:复制下面的指令到 AI 对话框,上传你的原始表格。
AI 自动——识别脏数据、建议清洗规则、逐条确认后执行、按你的维度和度量生成透视表。
数据处理最常见的坑:合并单元格、空行、日期格式不统一、数值列混入文本。
# 源数据清洗+数据透析表 · AI协作工作流
## 一、任务
对原始表格数据进行清洗、格式化,然后按指定维度和度量生成数据透析表(透视表)。
## 二、用户需提供的材料
原始数据表:〔上传Excel/CSV/文本,或粘贴表格内容〕
分析需求:〔你要从数据中看到什么?按什么维度汇总?〕
已知的数据问题:〔可选。例如"第三列有文本混在数字里""日期列格式不统一"〕
## 三、核查与清洗维度(依据数据处理实务公约)
第一阶段·脏数据识别(逐条列出,由用户逐条确认后再执行)
1. 空值/缺失 — 哪些列有空值、空值比例多少、建议填补方式或是否删除该行
2. 类型混淆 — 数值列混入文本、日期列格式不统一、货币带符号/不带符号混用
3. 重复行 — 完全重复的行、按关键列判断的疑似重复行
4. 异常值 — 数值超出合理范围(如年龄>120、金额为负数且无法解释)
5. 合并单元格 — 合并单元格区域导致的数据结构破坏
6. 编码/乱码 — 中文显示为乱码、特殊字符无法识别
第二阶段·数据清洗(用户确认清洗方案后执行)
· 逐条执行用户确认的清洗操作
· 每完成一步给出清洗前后的数据行数/值变化
· 清洗完成后输出"清洗报告"
## 四、中断条件
需确认项超过 5 条时,停止清洗建议,改为输出:
"数据源当前存在较多结构性问题(列出条数)。建议先对源数据做格式化整理:
① 统一日期格式(如yyyy-mm-dd)
② 移除合并单元格,填充对应的行
③ 数值列确保不混入文本
整理完毕后重新上传,再进行清洗。"
数据源格式无法识别时(非表格格式/图片/扫描件/PDF),立即停止并告知。
## 五、数据透析表生成
用户指定:
行维度:〔按什么分组,如"月份""部门""产品类别"〕
列维度:〔可选。交叉分析的列分组〕
度量值:〔要计算什么,如"销售额合计""订单数""平均值"〕
排序/筛选:〔可选。按什么排序、是否需要Top N筛选〕
输出格式:标准透视表(行列交叉+汇总行/列)
## 六、可视化输出(多坐标系对比)
何时需要可视化?当以下情况出现时,透视表一行数字不够:
· 维度超过2个,靠人眼无法从表格看出趋势
· 两组数据量纲不同(如"销售额(万元)"和"增长率(%)"放一起看)
· 时间序列数据——趋势线比数字表更直观
· 需要对比"同一个指标,不同分类下的差异"或"同一分类,不同指标的差异"
多坐标系叠加规则(一张图上描述两个不同量纲的指标):
1. 左轴(Primary Y-axis) — 放绝对值(金额、人数、次数)
2. 右轴(Secondary Y-axis) — 放比率/增长率/百分比(与左轴量纲完全不同)
3. X轴跨度边界标注 — 如果两组数据各自的合理区间不重叠,标注各自的参考区间
· 示例:一张图上,左轴=月销售额(0-100万),右轴=客户满意度(0-100%),X轴=月份。两个坐标系在同一张图上,一眼看出"销售额最高的月份恰恰满意度最低"——这是单轴图看不出来的。
可视化生成规范:
1. 图表类型按数据关系选择
· 时间序列 → 折线图(趋势)
· 分类对比 → 柱状图(排名)
· 占比构成 → 饼图/堆叠柱状图(成分)
· 相关性 → 散点图(两组数值的关系)
· 分布 → 直方图/箱线图(聚集与离群)
2. 多坐标系标注
· 两个Y轴使用不同颜色(左轴蓝/右轴橙),数据线同色对应
· 交叉点标注:两条线交叉时,标注交叉日期/数值——这通常是有意义的拐点
· 例外区间标注:某条线出现异常波动时,标注对应的事件/原因(如"双11促销")
3. 输出载体:以文本描述 + 表格数据输出。AI无法实际生成图表,但可以给出完整的数据系列和画图指令(Python matplotlib / Excel 图表向导)。
## 七、约束
1. 不猜测数据含义——不确定的格式问题直接输出询问
2. 需确认项超过 5 条时,建议先做源数据格式化整理
3. 以上为通用入门流程。实际工作中的数据分析深度随业务复杂度增长——更精细的统计模型/预测分析/多维交叉需要持续积累和定制
4. 数值计算保留原始精度,不擅自四舍五入
5. 多坐标系叠加仅适用于互不冲突的量纲——不要把两个绝对值(如"销售额"和"成本")放同一个双轴图,应用柱状并列图