Data Analysis

lingzhi227/agent-research-skills/skills/data-analysis

作者 lingzhi2279e6c085d65e3無授權條款386 個星標收錄於 2026年10月8日更新於 2026年10月8日儲存庫7 個月前更新

Generate statistical analysis code with 4-round review. Select appropriate statistical tests, interpret results, and produce analysis reports with p-values, effect sizes, and confidence intervals. Use when analyzing experimental data for a paper.

包含腳本Data & Analytics
AI 產生的概覽

產生經過審查的統計分析程式碼與報告,包含 p 值、效果量與信賴區間。

功能
為實驗資料產生統計分析程式碼,依匯入、載入、資料準備、描述性統計、前處理、分析與結果儲存等區段組織。它會選擇合適的檢定方法,執行四輪程式碼審查(程式碼缺失、資料處理、逐表檢查與跨表檢查),並產出包含 p 值、效果量與信賴區間的報告。內附兩支指令碼,用於統計摘要與比較,以及將 p 值格式化為星號、LaTeX 或純文字。
適用情境
適用於為論文分析實驗資料、需要報告不確定性的嚴謹統計結果時。適合對 CSV、JSON、pickle 或實驗日誌資料進行組間比較、相關分析與迴歸分析。
執行需求
需要 Python 及 numpy、scipy、pandas、statsmodels、sklearn 與 pickle;此技能內附兩支可執行指令碼(stat_summary.py 與 format_pvalue.py)以及一份審查提示參考檔案。

Data Analysis

Generate rigorous statistical analysis code with multi-round review.

Input

  • $0 — Data source (CSV, JSON, pickle, or experiment logs)
  • $1 — Research goal or hypothesis to test

References

  • 4-round code review prompts: ~/.claude/skills/data-analysis/references/review-prompts.md

Scripts

Statistical summary and comparison

bash
python ~/.claude/skills/data-analysis/scripts/stat_summary.py --input results.csv --compare method --metric accuracy --output summary.jsonpython ~/.claude/skills/data-analysis/scripts/stat_summary.py --input results.csv --describe

Detects data types, recommends tests, runs comparisons, outputs effect sizes and significance stars. Requires numpy, scipy.

Format p-values

bash
python ~/.claude/skills/data-analysis/scripts/format_pvalue.py --values "0.001 0.05 0.23" --format starspython ~/.claude/skills/data-analysis/scripts/format_pvalue.py --csv results.csv --column pvalue --format latex

Formats p-values with stars, LaTeX notation, or plain text. Stdlib-only.

Workflow

Step 1: Generate Analysis Code

Structure the code with these sections:

  1. # IMPORT — pandas, numpy, scipy, statsmodels, sklearn
  2. # LOAD DATA — Load from original data files
  3. # DATASET PREPARATIONS — Missing values, units, exclusion criteria
  4. # DESCRIPTIVE STATISTICS — Summary tables if needed
  5. # PREPROCESSING — Dummy variables, normalization
  6. # ANALYSIS — Statistical tests per hypothesis
  7. # SAVE ADDITIONAL RESULTS — Extra results to pickle

Step 2: 4-Round Code Review

  1. Round 1 — Code Flaws: Mathematical/statistical errors, wrong calculations, trivial tests
  2. Round 2 — Data Handling: Missing values, units, preprocessing, test choice
  3. Round 3 — Per-Table: Sensible values, measures of uncertainty, missing data
  4. Round 4 — Cross-Table: Completeness, consistency, missing variables

Step 3: Produce Results

  • Every nominal value must have uncertainty (CI, STD, or p-value)
  • Statistical tests must be appropriate for the data type
  • Results must match actual data — never hallucinate

Allowed Packages

pandas, numpy, scipy, statsmodels, sklearn, pickle

Statistical Test Selection

Data TypeTest
Two groups, normalIndependent t-test
Two groups, non-normalMann-Whitney U
Paired samplesPaired t-test / Wilcoxon
Multiple groupsANOVA / Kruskal-Wallis
CategoricalChi-square / Fisher's exact
CorrelationPearson / Spearman
RegressionOLS / Logistic / Mixed effects

Rules

  • Always report p-values for statistical tests
  • Account for relevant confounding variables
  • Use inherent package functionality (e.g., formula = "y ~ a * b" for interactions)
  • Do not manually implement available statistical functions
  • Access dataframes using string-based column names, not integer indices

Related Skills

  • Upstream: experiment-code, experiment-design
  • Downstream: table-generation, figure-generation, backward-traceability
  • See also: math-reasoning

來源與署名

來源:lingzhi227/agent-research-skills位於skills/data-analysis提交9e6c085

授權條款: 無授權條款

內容歸原作者所有。SourceWeft 從公開儲存庫中收錄這些內容。

檢舉或申請下架

Data Analysis · skills/data-analysis 代理程式技能 | SourceWeft