Document resource
Background Ordinal Mayo Endoscopic Scoring collapses mucosal inflammation into four discrete categories, obscuring within-grade heterogeneity and limiting clinical trial sensitivity. Patients assigned identical Mayo grades may have meaningfully different inflammatory burdens, reducing statistical power to detect treatment response. We developed and validated a continuous AI-derived inflammation index (0 -10) from endoscopic images to address this fundamental limitation.Methods An EfficientNet-B3 regression model was trained on 9,590 colonoscopy images from the LIMUC dataset (564 UC patients) to output a continuous inflammation index (0 -10). Performance was assessed against expert Mayo grades using Pearson correlation, Spearman rank correlation, and mean absolute error (MAE) on a held-out test set (n=1,686). Within-grade heterogeneity was quantified by intra-class standard deviation. Trial sensitivity was evaluated by simulating response detection (n=200), comparing ordinal versus continuous scoring using independent samples t-tests.Results Training converged stably with the best validation MAE=0.297 ( IDDF2026-ABS-0257 Figure 1. Regression training curve for the continuous inflammation index). The continuous index achieved MAE=0.297, Pearson r=0.880, and Spearman ρ=0.813 against expert ordinal grades (IDDF2026-ABS-0257 Figure 4. Continuous inflammation index vs ordinal Mayo grade). Mean index values mapped logically across severity: Mayo 0: 0.72±1.03, Mayo 1: 3.11±1.56, Mayo 2: 6.50±1.84, Mayo 3: 8.60±1.33, with continuous index distributions showing progressive separation across all four Mayo grades (IDDF2026-ABS-0257 Figure 5. Continuous inflammation index distribution by Mayo endoscopic grade).Critically, within-grade standard deviations of 1.03-1.84 demonstrate substantial inflammatory heterogeneity invisible to ordinal scoring, with Mayo 2 showing the greatest variation (σ=1.84) (IDDF2026-ABS-0257 Figure 3. Within-grade heterogeneity of the continuous index per Mayo grade), confirming that patients with identical Mayo grades harbour meaningfully different inflammatory burdens. Trial simulation confirmed both scoring systems significantly separated responders from non-responders; however, the continuous index provided superior distributional separation (p=4.94×10–97 vs p=2.81×10–112) (IDDF2026-ABS-0257 Figure 2. Trial sensitivity simulation), supporting smaller required sample sizes and enhanced sensitivity for treatment response detection.Conclusions An AI-derived continuous inflammation index captures mucosal heterogeneity invisible to ordinal Mayo scoring, with strong correlation to expert grades (r=0.880) and sub-grade resolution (MAE=0.297). The substantial within-grade variance, particularly at Mayo 2 (σ=1.84), supports the adoption of continuous endpoints in UC clinical trials to improve sensitivity, reduce sample size requirements, and accelerate detection of treatment response.Abstract IDDF2026-ABS-0257 Figure 1Abstract IDDF2026-ABS-0257 Figure 2Abstract IDDF2026-ABS-0257 Figure 3Abstract IDDF2026-ABS-0257 Figure 4Abstract IDDF2026-ABS-0257 Figure 5