Rare Disease ML Pipeline
CKD Dataset Imbalance & Strict Preprocessing Boundary
VALID PIPELINE
Pause
⏮ Step
Step ⏭
Simulate Leakage
Reset
1. RAW DATA
2. SPLIT
3. ISOLATED TRAIN PREPROCESSING
4. CANDIDATES
5. SELECTION & DEPLOY
6. EVALUATION
N=400
TRAIN 80%
HELD-OUT TEST 20% (NO OVERSAMPLING)
BALANCED
BEST MODEL
RAW DATA
91% H / 9% CKD
DATA SPLIT
STRATIFIED
MEDIAN IMPUTE
TRAIN MEDIANS ONLY
SCALER
Z-SCORE (TRAIN PARAMS)
SMOTENC
SYNTHETIC CKD
LOG REG
RND FOREST
SVM (RBF)
XGBOOST
F1 RANKING
SELECT WINNER
DEPLOYMENT
FITTED PIPELINE
TEST SET EVALUATION
UNBIASED GENERALIZATION F1
PIPELINE INITIALIZED
Hover or click nodes to inspect data shapes, preprocessing parameters, and leak-prevention boundaries.
400
SAMPLES
0.34
CKD RATIO