跳转到主要内容
资料与数据处理

表格分析 · 脏数据出结论

不把整表塞给模型,只发表头与样本让它写清洗分析脚本,数据留在本地跑。

免责声明:本页展示内容均为 AI 模型生成,仅供参考,不构成任何效果承诺;实际产出效果与 Credits 消耗以平台用量统计为准。
从业务系统导出的表可能不整洁:日期几种格式混着、金额带¥带逗号、缺失值有四种写法、还夹着重复行。正确用法不是把表塞给模型,而是让它写清洗与分析脚本、数据留在你本地跑——省钱、不外传、还能反复用。 调用链:qwen3.7-plus(写清洗分析脚本)· 一份从业务系统导出的脏订单表(3,695 行 / 11 列,日期乱、金额带¥、有重复空值)· 三段式:(1) 只把表头 + 20 行样本发给模型,让它写清洗分析脚本 → (2) 脚本在你本地跑,整份数据不上传 → (3) 看它给的结论。 产出一句:抖音渠道退款率 16.15%,五个渠道里唯一偏离;客户 C2077 单日下单 38 笔,疑似刷单——展开看体检数字、渠道表与 4 个必须复核的坑。

步骤:让它写脚本,而不是把数据给它

只发表头与前 20 行样本,让 qwen3.7-plus 写出可直接跑的脚本:
我从订单系统导出了一份 2025 年全年订单明细 CSV,共 3695 行。数据不发给你(含客户信息且太大),
只给你表头和前 20 行样本,你据此写一份可以直接跑的 Python 脚本。
样本(含表头):【粘贴表头 + 前 20 行】
脚本要做四件事,每件事都把结果 print 出来:
一、数据体检:逐类检查并报告受影响行数(列名规范、日期格式种类、金额非数字写法、
    缺失值表示方式、完全重复行、负数或极端离群金额、关键字段空值)。
    样本只有 20 行,实际数据的脏法可能更多,检查要健壮,遇到没见过的格式归到"无法解析"并计数。
二、清洗:按你判断的规则清洗并 print 出规则。至少处理:日期统一 YYYY-MM-DD、金额转 float、
    缺失值统一、去重、省份名归一化、异常值取舍。
三、统计:清洗前后行数、全年净销售额、按月订单数与销售额、按渠道订单数销售额退款率、
    按省份销售额、单客单日最大下单笔数及前 3。
四、可疑项:自动标出数据量偏离的月份、退款率偏离的渠道、下单行为异常的客户。判断基于算出来的数,别写死阈值。
硬性要求:只用标准库(csv/re/collections/datetime/statistics),不要 pandas;
文件路径用命令行参数;文件是 UTF-8 带 BOM 用 utf-8-sig;代码能直接跑、无占位符无 TODO;输出中文。
只输出一个完整的 Python 脚本,不要解释。
三、数据统计
============================================================
[3] 按渠道订单数、销售额、退款率:
渠道              |      订单数 |            总销售额 |      退款率
---------------------------------------------------------
京东              |      743 | ¥   941,442.03 |    5.04%
天猫              |      737 | ¥   836,619.78 |    4.35%
抖音              |      700 | ¥   959,251.32 |   16.15%
私域小程序           |      710 | ¥ 1,091,549.47 |    2.37%
线下门店            |      745 | ¥ 1,088,475.68 |    6.17%

四、可疑项分析
============================================================
[1] 数据量明显偏离的月份 (Z-score 绝对值 > 1.5):
  - 2025-08: 订单数 519, Z-score: 1.51
  - 2025-10: 订单数 11, Z-score: -2.04

[2] 退款率明显偏离整体的渠道 (Z-score 绝对值 > 1.5):
  - 抖音: 退款率 16.15%, Z-score: 1.73

[3] 下单行为异常的客户 (单日下单笔数 Z-score > 2.0 或 总退款率极高):
  - 客户 C2077: 单日最高下单 38 笔 (Z=41.73)
  - 客户 C2271: 总退款率 97.42% (Z=4.50)
  - 客户 C2134: 总退款率 90.37% (Z=4.15)
  ……(共列出 16 个)

说明

  • 消耗:本玩法涉及文本生成(qwen3.7-plus)。输入只有 20 行样本而不是整份表;数据量大时不要把整表塞进去(容易超时),让它写脚本、你本地跑更稳。
  • 数据不出本地:模型只看到 20 行样本用来写脚本,整份订单表(含客户 ID、金额)始终在你自己机器上跑,不上传。
  • 结果要自己复核关键数字:脚本给的结论可直接看,但涉及金额口径、异常判定的数字建议回脚本核一遍(脚本是明文的,改几行即可)。