Case 25|让 AI 当你的数据分析师:从一个链接到交互仪表板
WorkBuddy 案例集 · 第 25 篇 分类:数据分析与可视化
一、场景描述
我不是数据分析师,但我花了 2 分钟,让 AI 帮我完成了一份涵盖 3,144 个美国县的贫困数据分析——从数据下载、字段解释、分布统计、异常诊断,到一个完整的交互仪表板,再到多年数据管道的架构设计。一句话触发,全程不用写代码。
这是一个对任何人类分析师来说都要花至少半天的任务。对 WorkBuddy,是 2 分钟。它没有让我一步一步喂数据、选列、选图表类型——它直接规划了整个分析链路,然后自动执行:加载技能 → 自动规划 6 步任务清单 → 下载数据 → 口径确认 → 分布分析 → 异常诊断 → 生成仪表板 → 设计 ETL 管道。
如果你手边有一个公开数据集想搞清楚,不需要会 Python,不需要会 SQL,不需要会数据可视化。给 WorkBuddy 一个链接,说清楚你想知道什么——它会帮你把整条链路跑完。你只需要看结果、做判断。
二、想要完成的任务
用 WorkBuddy 的 data-analysis-workflows 技能,基于 USDA ERS 县级贫困估计(2023)Excel 数据,一句话完成"贫困水平分布+异常县诊断+与失业/收入联动假设"分析,并生成包含 4 KPI+3 图+1 明细表的交互仪表板与多年数据管道表结构设计。
三、使用的 Skill
| Skill / 能力 | 用途 | 来源 | 所需权限 |
|---|---|---|---|
| data-analysis-workflows 技能 | 专为数据分析场景设计,覆盖从数据探索到可视化到仪表板的完整流程 | WorkBuddy 内置技能 | WorkBuddy 账号 |
| curl 命令 | 下载 USDA ERS 官网 Excel 文件(726KB) | 内置能力 | 网络访问 |
| Python openpyxl | 解析 Excel 两个 Sheet(Poverty Data 2023、Variable Descriptions) | 第三方库 | 本地 Python 环境 |
| Chart.js | 生成深色主题的交互 HTML 仪表板 | 第三方库 | 浏览器 |
| Todo 任务清单 | 自动规划 6 步任务清单,从上到下依次推进 | 内置能力 | WorkBuddy 账号 |
四、前置条件
- 已安装并登录 WorkBuddy 客户端
- 本机已安装 Python3 与 openpyxl 库(
pip install openpyxl) - 本机可访问网络用于下载 USDA ERS Excel 数据
- 已明确分析需求(分布分析、异常诊断、联动假设、仪表板、数据管道)
- 已有数据下载地址(如 USDA ERS poverty-estimates-2023.xlsx)
五、在 WorkBuddy 中的操作
步骤 1:加载技能并自动规划 6 步任务清单
收到需求后,WorkBuddy 第一步加载 data-analysis-workflows 技能,然后拆出一个 6 步任务清单:① 下载 Excel 并用 openpyxl 探索表结构;② 读取 Variable Descriptions Sheet 确认 34 个字段口径;③ 分离 US 总行/51 州/3,144 县行并计算全国分布;④ IQR 法识别各州离群县与州级 Top/Bottom 排名;⑤ 定义双分位阈值识别异常县 Top 20;⑥ 生成完整 HTML 仪表板与 ETL 管道设计。 关键步骤:加载 data-analysis-workflows 技能,自动规划 6 步任务清单。
步骤 2:下载数据并确认字段口径
用 curl 命令直接下载 USDA ERS 官网 Excel 文件(726KB),然后用 Python 解析两个 Sheet:Poverty Data 2023(3,144 条县级数据,34 个字段)和 Variable Descriptions(每个字段的完整口径说明)。关键发现:这个数据集有完整的 90% 置信区间(CI)字段——每个估计值都带了上下界。CI 宽度中位数 ±5.2pp,最宽 25.4pp。数据集无失业率字段,需外补 BLS LAUS 数据。 关键步骤:curl 下载 Excel,openpyxl 解析 34 个字段口径,发现需外补 BLS LAUS 失业率数据。
步骤 3:分布分析(全国/州内/离群县)
分离 US 总行/51 州/3,144 县行 → 计算全国分布(均值 14.5%,最高 49.6%)→ IQR 法识别各州离群县 → 州级 Top/Bottom 排名(LA 18.9% 最高 / NH 7.3% 最低)。 关键步骤:分离 3 层数据行,IQR 法识别离群县,州级排名 LA 最高 NH 最低。
步骤 4:异常诊断 Top 20(贫困率高但失业率不高)
定义双分位阈值:贫困率 ≥ P75(17.4%)且中位收入 ≥ P50($62,862)→ 识别 23 个异常县 → Top 20 逐一标注假说(大学城/监狱人口/农业季节工/原住民社区/收入极化)。 关键步骤:双分位阈值识别 23 个异常县,Top 20 逐一标注假说。
步骤 5:生成交互仪表板与 ETL 管道设计
生成完整 HTML 仪表板(Chart.js 深色主题):4 KPI 卡 + 频率分布图 + 州对比图 + 贫困率×收入散点图 + 异常县 Top 20 明细表 + ETL 管道设计。启动本地服务器预览。 关键步骤:生成包含 4 KPI+3 图+1 明细表的交互 HTML 仪表板,并启动本地服务器预览。
六、提示词或任务指令
| 步骤 | 指令 | 作用 |
|---|---|---|
| 1 | 根据 USDA ERS 的县级贫困估计(2023)Excel,请你做一次"贫困水平分布 + 异常县诊断 + 与失业/收入的联动假设"分析。要求:字段解释与口径确认、分布分析(全国/州内/离群县)、异常诊断 Top 20(贫困率高但失业率不高)、最小可用仪表板设计(4 KPI + 3 图 + 1 明细表)、多年数据管道表结构设计。数据下载地址:https://www.ers.usda.gov/.../poverty-estimates-...2023.xlsx | 一句话触发完整分析链路 |
七、在 WorkBuddy 中的效果
交付物
- 3,144 个美国县的贫困数据完整分析报告
- 34 个字段的口径确认表(点估计/比率/置信区间/收入估计/缺失字段)
- 全国分布统计(均值 14.5%,最高 49.6%)
- 州级 Top/Bottom 排名(LA 18.9% 最高 / NH 7.3% 最低)
- 23 个异常县诊断结果(Top 20 逐一标注假说)
- 完整 HTML 交互仪表板(4 KPI+3 图+1 明细表,Chart.js 深色主题)
- 多年数据管道 ETL 表结构设计
结果证明

字段口径梳理结果表
| 类型 | 代表字段 | 说明 |
|---|---|---|
| 点估计(人数) | POVALL_2023 | 贫困人口绝对数 |
| 比率(%) | PCTPOVALL_2023 | 贫困率 |
| 置信区间 | CI90LB/UB* | 90% 上下界,中位宽度 ±5.2pp |
| 收入估计 | MEDHHINC_2023 | 中位家庭收入 |
| ⚠️ 缺失 | 无失业率字段 | 需外补 BLS LAUS 数据 |
人类分析师 vs WorkBuddy 对比表
| 维度 | 人类分析师 | WorkBuddy |
|---|---|---|
| 耗时 | 至少半天 | 约 2 分钟 |
| 数据下载 | 手动下载整理 | curl 自动下载 |
| 字段口径 | 逐字段阅读文档 | openpyxl 自动解析 |
| 分布分析 | 手写 SQL/Python | 自动计算全国/州内/离群县 |
| 异常诊断 | 手动筛选排序 | 双分位阈值自动识别 Top 20 |
| 仪表板 | 手工搭建 | Chart.js 深色主题自动生成 |
| 数据管道 | 单独设计 | ETL 表结构一并输出 |
| 编程能力 | 需要 Python/SQL | 不需要 |
八、验收标准
- [ ] 一句话指令能触发 WorkBuddy 自动加载 data-analysis-workflows 技能
- [ ] 自动规划 6 步任务清单并依次推进
- [ ] curl 成功下载 USDA ERS Excel 文件(726KB)
- [ ] openpyxl 解析两个 Sheet(Poverty Data 2023 3,144 条、Variable Descriptions)
- [ ] 确认 34 个字段口径,识别出 90% CI 字段与缺失的失业率字段
- [ ] 全国分布计算正确(均值 14.5%,最高 49.6%)
- [ ] IQR 法识别各州离群县,州级排名正确(LA 18.9% 最高 / NH 7.3% 最低)
- [ ] 双分位阈值(P75 17.4% + P50 $62,862)识别 23 个异常县,Top 20 逐一标注假说
- [ ] 生成完整 HTML 仪表板(4 KPI 卡 + 频率分布图 + 州对比图 + 散点图 + Top 20 明细表)
- [ ] 仪表板使用 Chart.js 深色主题,启动本地服务器可预览
- [ ] 输出多年数据管道 ETL 表结构设计
- [ ] 全程不用写代码,2 分钟内完成