Rare Disease ML Pipeline

CKD Dataset Imbalance & Strict Preprocessing Boundary
VALID PIPELINE
1. RAW DATA 2. SPLIT 3. ISOLATED TRAIN PREPROCESSING 4. CANDIDATES 5. SELECTION & DEPLOY 6. EVALUATION N=400 TRAIN 80% HELD-OUT TEST 20% (NO OVERSAMPLING) BALANCED BEST MODEL RAW DATA 91% H / 9% CKD DATA SPLIT STRATIFIED MEDIAN IMPUTE TRAIN MEDIANS ONLY SCALER Z-SCORE (TRAIN PARAMS) SMOTENC SYNTHETIC CKD LOG REG RND FOREST SVM (RBF) XGBOOST F1 RANKING SELECT WINNER DEPLOYMENT FITTED PIPELINE TEST SET EVALUATION UNBIASED GENERALIZATION F1
PIPELINE INITIALIZED
Hover or click nodes to inspect data shapes, preprocessing parameters, and leak-prevention boundaries.
400 SAMPLES
0.34 CKD RATIO