数据分析助手(免费版)
输入格式
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | 数据分析助手(免费版)处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
概述
没有决策目标的分析只是算术。本免费版提供基础的数据分析框架,帮助你在分析前明确决策目标,在分析后规范输出结论.
核心能力
方法论优先框架
在处理数据之前,必须先回答四个问题:
- 决策目标:本次分析支撑什么决策?
- 证伪条件:什么结果会改变你的判断?
- 数据盘点:你实际拥有什么数据 vs 你希望拥有什么数据?
- 时间窗口:哪个时间段与决策相关?
统计严谨性检查清单
- 样本量是否充足:小N会导致置信区间过宽(如 N<30 时 t 检验效力不足)
- 对照组是否公平:相同时间段、相似条件下的对比才有意义
- 效应量是否有意义:统计显著不等于实际重要,需报告相对提升幅度
升级提示:多重比较校正(Bonferroni)、不确定性量化(置信区间报告)、完整分析陷阱识别表(辛普森悖论、幸存者偏差、p值操纵等6类陷阱)为付费版专享功能.
基础分析方法选择
| 问题类型 | 推荐方法 | 关键输出 |
|---|---|---|
| "X和Y是否有差异?" | 假设检验(t检验/卡方检验) | p值 + 效应量 |
| "什么因素预测Z?" | 回归/相关分析 | 回归系数 + R² |
升级提示:队列分析(留存曲线)、用户分群(画像比较)、异常检测(标记异常点)为付费版专享功能.
输出规范
- 洞察先行:先说结论,再说方法
- 量化不确定性:用区间估计代替点估计
升级提示:声明局限分析、推荐下一步实验设计为付费版专享功能.
快速开始
- 确认运行环境满足依赖说明中的要求
- 在AI Agent对话中调用本技能,提供必要的输入参数
- 检查输出结果,根据需要进行后续处理
详细的输入输出格式请参考下方章节说明。
依赖说明
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
依赖项
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key 配置
需要配置对应API Key,详见上文环境配置章节
可用性分类
- 分类: MD+EXEC()
API Key配置方式:
export API_KEY=${API_KEY:?请设置环境变量}
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
使用流程
- 明确决策:与用户确认分析支撑的决策目标
- 盘点数据:评估可用数据的范围与质量
- 选择方法:根据问题类型匹配假设检验或回归分析
- 执行分析:运行统计检验,检查样本量与效应量
- 输出报告:洞察先行,量化不确定性
示例
示例1:A/B测试基础判断
问题: 实验组转化率 3.2%,对照组 2.8%,样本各 5000 人,是否显著?
# ...
分析:
- 比例差异检验 (z-test)
- p-value = 0.043 < 0.05,统计显著
- 效应量: 相对提升 14.3%
- 结论: 统计显著,建议进一步评估业务意义
示例2:描述性统计
问题: 上月销售额的整体分布如何?
# ...
分析:
- 均值: ¥45,230
- 中位数: ¥38,500
- 标准差: ¥12,400
- 偏度: 1.2(右偏,存在高订单拉高均值)
- 结论: 中位数低于均值,分布右偏,关注大额订单影响
错误处理
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 小样本过度解读 | N<30 时置信区间过宽 | 报告置信区间宽度,标注"样本量不足" |
| 对照组不公平 | 不同时间段或条件下的对比 | 确保对比组在相同时间段、相似条件下 |
| 效应量被忽略 | 仅看 p 值不看实际提升幅度 | 同时报告 p 值和效应量(如相对提升%) |
| 点估计无不确定性 | 仅报告"提升15%"未给区间 | 报告置信区间,如"提升12-18%(95% CI)" |
| 预设结论确认偏误 | 用户试图"证明"已有结论 | 先列出证伪条件,再执行分析 |
常见问题
Q1: A/B测试结果 p<0.05 就可以上线吗?
A: 不一定。还需检查效应量是否具有业务意义,置信区间下界是否远离0.
Q2: 样本量太小(N<30)还能做分析吗?
A: 可以做描述性统计,但推断性结论需特别谨慎。建议使用非参数检验并明确标注"样本量不足".
Q3: 如何识别辛普森悖论?
A: 辛普森悖论的完整识别与规避方法为付费版专享功能。免费版建议手动按关键维度(设备、渠道等)拆分后检查趋势是否反转.
Q4: 报告里应该写"提升15%"还是"提升12-18%"?
A: 应写"提升12-18%(95%置信区间)"。点估计不传达不确定性,区间估计让决策者知道结论的可靠程度.
Q5: 如何避免 p 值操纵?
A: p 值操纵的完整校正方法(Bonferroni 校正、预注册假设)为付费版专享。免费版建议在分析前明确列出要检验的指标,避免事后追加检验.
已知限制
- 免费版不包含完整分析陷阱识别表(仅基础检查)
- 免费版不包含队列分析、用户分群、异常检测方法
- 免费版不包含风险升级机制(预设结论、混杂因素检测)
- 免费版不包含多重比较校正(Bonferroni)指导
- 统计检验效力依赖于样本量,小样本场景结论可靠性有限
- 升级至付费版可解锁全部高级功能
评论
加载中…