Statistical methods
This page is the citable methodology index. Implementations prefer published estimators over ad-hoc thresholds. Assumptions and limitations are listed with each method.
Change detection
- CUSUM (Page, 1954). Two-sided standardized CUSUM with allowance
k(default 0.5) and decision intervalh(default 5). Localization uses the CUSUM pathargmax |∑(x−x̄)|. Assumes approximately independent observations after standardization. Sensitive to misspecified σ on short series. - Likelihood / SIC scan. Gaussian mean-change log-likelihood ratio versus a single-mean model, penalized by
log n. Assumes normality and a single dominant change. - PELT (Killick et al., 2012). Standardized L2 piecewise-mean cost with MBIC penalty
3 log n.min_sizeconstrains candidate segments only; the surviving setRis pruned with the paper's inequality (K = 0for RSS). Multiple changes. - Bayesian product partition (Fearnhead, 2006). Geometric hazard prior; Gaussian observations with known variance and a weak conjugate prior on the segment mean. Forward–backward smoothing gives a posterior mass at every index; MAP segmentation can report multiple changes.
- Turing (extension). Gaussian changepoint sampled with Metropolis–Hastings or NUTS when Turing.jl is loaded (
method=:turing). Discrete cuts use MH;sampler=:nutsuses a continuous cut.model=:multiplewithncutsfits more than two piecewise means. Hierarchical site intercepts remain available viahierarchical_sites(...; method=:turing). :auto. Chooses among robust CUSUM, likelihood, Fearnhead, and PELT using n, tails, missingness, cadence, control-like series, and the number of sequential CUSUM crossings (multiple crossings → PELT).- Energy scan (Székely and Rizzo, 2013). Univariate energy distance between left and right segments.
:auto documents its decision (n, tails, missingness, cadence, controls).
Drift
- Linear: Theil–Sen (Theil, 1950) (Sen, 1968).
- Variance: Inclán–Tiao ICSS (Inclán and Tiao, 1994); 5% Brownian-bridge critical value 1.358.
- Cyclic: periodogram peak / Fisher-like g.
- Distributional: two-sample KS with Stephens-style p-value approximation.
QC
Westgard multirules (Westgard et al., 1981); Levey–Jennings geometry (Levey and Jennings, 1950). Rules are data, not a monolith.
Comparison and batches
Bland–Altman (Bland and Altman, 1986); Passing–Bablok (Passing and Bablok, 1983); Deming; Kruskal–Wallis (Kruskal and Wallis, 1952); Brown–Forsythe (Brown and Forsythe, 1974); parametric empirical-Bayes ComBat (Johnson et al., 2007).
Reference limits
CLSI EP28 nonparametric convention (Clinical and Institute, 2010); Harris–Boyd partitioning evidence (Harris and Boyd, 1990). Output is statistical, not a clinical recommendation.
Hierarchical sites
DerSimonian–Laird τ² (DerSimonian and Laird, 1986) with empirical-Bayes shrinkage of site means; Higgins I² (Higgins and Thompson, 2002); 95% prediction interval for a new site mean (Higgins et al., 2009). Attribution (:global / :site_specific / :mixed / :stable) describes statistical sharing, not a cause.
Distances
1-Wasserstein (quantile matching); Jensen–Shannon (Lin, 1991); energy distance (Székely and Rizzo, 2013).
Outliers
Normalized MAD (Rousseeuw and Croux, 1993); Tukey IQR fences. Detection annotates; deletion is a separate, explicit policy.
Sentinel Score
Documented linear penalty combination. Components and weights are always stored. The score is analytical stability, not patient risk.