Head and Neck Squamous Cell Carcinoma (HNSCC), and in particular Oral Squamous Cell Carcinoma (OSCC), is characterized by marked biological heterogeneity and limited prognostic accuracy when relying solely on conventional staging systems such as TNM. This limitation often results in suboptimal risk stratification, potentially leading to overtreatment in low-risk patients and insufficient therapeutic intensity in high-risk cases. This thesis investigates the application of machine learning (ML) approaches for risk stratification and clustering in HNSCC, with a focus on oral cavity tumors. The primary objective was to evaluate whether the integration of multi-omic data—including clinical, genomic, and radiomic variables—could improve prognostic prediction and better capture tumor heterogeneity compared to traditional methods. A multi-center dataset from the European BD2Decide project was analyzed using both supervised and unsupervised ML techniques. In the supervised learning framework, Artificial Neural Networks (ANNs) and Random Forest (RF) models were developed to predict 5-year survival outcomes. RF consistently outperformed ANN, achieving higher accuracy and greater robustness, particularly in the context of limited sample size and high-dimensional data. Model performance improved with increasing dataset size, reaching approximately 70% accuracy when larger cohorts were used. Feature importance analysis revealed that, beyond traditional staging variables, functional and systemic parameters—such as swallowing function and hematological markers—contribute significantly to prognostic prediction, supporting the relevance of host-related factors alongside tumor characteristics. Additionally, the identification of genes involved in key oncogenic pathways supports the biological plausibility of the models and suggests their potential role in uncovering mechanisms underlying tumor progression. Unsupervised learning techniques, including UMAP and hierarchical clustering, enabled the identification of distinct molecular subgroups within HNSCC. Tumor anatomical site emerged as a major driver of transcriptomic variation, with perfect clustering concordance (ARI = 1). Within the OSCC cohort, clustering revealed biologically relevant subgroups that strongly aligned with an established 13-gene prognostic signature, confirming the clinical relevance of the identified patterns. Furthermore, differential expression and functional enrichment analyses identified key biological processes—such as protein translation and acetylation—suggesting a potential role of epigenetic regulation in shaping tumor behavior and patient outcomes. Despite moderate predictive performance, likely due to limited sample size and data complexity, this study demonstrates that ML-based integration of multi-dimensional data provides meaningful insights into tumor biology and prognosis. These findings support the development of more refined, data-driven stratification models and highlight the potential of ML as both a predictive and hypothesis-generating tool in precision oncology. Future research should focus on expanding cohort size, improving data harmonization, and validating models across diverse populations. The integration of these approaches into clinical decision support systems may ultimately contribute to more personalized treatment strategies, reduced overtreatment, and improved patient outcomes.

Il carcinoma a cellule squamose del distretto testa-collo (HNSCC), e in particolare il carcinoma orale (OSCC), è caratterizzato da una marcata eterogeneità biologica e da una limitata accuratezza prognostica quando si utilizzano esclusivamente i sistemi di stadiazione convenzionali, come il TNM. Questa limitazione può condurre a una stratificazione del rischio non ottimale, con conseguente rischio di sovratrattamento nei pazienti a basso rischio e trattamento insufficiente nei pazienti ad alto rischio. La presente tesi esplora l’applicazione di approcci di Machine Learning (ML) per la stratificazione del rischio e l’identificazione di sottogruppi tumorali nell’HNSCC, con particolare attenzione ai tumori del cavo orale. L’obiettivo principale è stato valutare se l’integrazione di dati multi-omici — dati clinici, genomici e radiomici — possa migliorare la previsione prognostica e descrivere più accuratamente l’eterogeneità tumorale rispetto ai metodi tradizionali. È stato analizzato un dataset multicentrico proveniente dal progetto europeo BD2Decide mediante tecniche di apprendimento supervisionato e non supervisionato. Nell’ambito dell’apprendimento supervisionato, sono stati sviluppati modelli basati su Reti Neurali Artificiali (ANN) e Random Forest (RF) per la previsione della sopravvivenza a 5 anni. I modelli RF hanno mostrato prestazioni superiori rispetto alle ANN, con maggiore accuratezza e robustezza, in particolare in presenza di dataset di dimensioni limitate e ad alta dimensionalità. Le prestazioni dei modelli sono risultate migliorare con l’aumento della numerosità del campione, raggiungendo circa il 70% di accuratezza nei dataset più ampi. L’analisi dell’importanza delle variabili ha evidenziato come, oltre ai parametri di stadiazione tradizionali, fattori funzionali e sistemici contribuiscano in modo significativo alla previsione prognostica, sottolineando il ruolo dei fattori legati all’ospite accanto alle caratteristiche tumorali. Inoltre, l’identificazione di geni coinvolti in pathway oncogenici noti supporta la plausibilità biologica dei modelli e suggerisce un potenziale contributo nella comprensione dei meccanismi alla base della progressione tumorale. Le tecniche di apprendimento non supervisionato, tra cui UMAP e clustering gerarchico, hanno permesso di identificare sottogruppi molecolari distinti all’interno dell’HNSCC. Il sito anatomico del tumore è emerso come un determinante principale della variabilità trascrittomica globale, con una perfetta concordanza nel clustering (ARI = 1). All’interno della coorte OSCC, il clustering ha evidenziato sottogruppi biologicamente rilevanti in forte accordo con una firma prognostica a 13 geni precedentemente descritta, confermando la rilevanza clinica dei pattern identificati. L’analisi dell’espressione differenziale e l’arricchimento funzionale hanno inoltre evidenziato processi biologici chiave, tra cui la traduzione proteica e l’acetilazione, suggerendo un possibile ruolo dei meccanismi epigenetici nel determinare il comportamento tumorale e l’outcome clinico. Nonostante le prestazioni predittive moderate, verosimilmente dovute alla limitata dimensione del campione e alla complessità dei dati, questo studio dimostra come l’integrazione di dati multi-dimensionali mediante approcci di ML possa fornire informazioni rilevanti sia dal punto di vista prognostico sia biologico. Questi risultati supportano lo sviluppo di modelli di stratificazione più raffinati e sottolineano il potenziale del Machine Learning come strumento sia predittivo sia esplorativo nell’ambito dell’oncologia di precisione. Studi futuri dovranno concentrarsi sull’ampliamento delle coorti, sulla validazione esterna dei modelli e sull’integrazione in sistemi di supporto decisionale clinico, al fine di favorire strategie terapeutiche più personalizzate e migliorare gli outcome dei pazienti.

OCCURS: Oral Cancer Clustering Using Risk Stratification / Bergonzani, M.. - (2026 Jul 20).

OCCURS: Oral Cancer Clustering Using Risk Stratification

BERGONZANI, MICHELA
2026-07-20

Abstract

Head and Neck Squamous Cell Carcinoma (HNSCC), and in particular Oral Squamous Cell Carcinoma (OSCC), is characterized by marked biological heterogeneity and limited prognostic accuracy when relying solely on conventional staging systems such as TNM. This limitation often results in suboptimal risk stratification, potentially leading to overtreatment in low-risk patients and insufficient therapeutic intensity in high-risk cases. This thesis investigates the application of machine learning (ML) approaches for risk stratification and clustering in HNSCC, with a focus on oral cavity tumors. The primary objective was to evaluate whether the integration of multi-omic data—including clinical, genomic, and radiomic variables—could improve prognostic prediction and better capture tumor heterogeneity compared to traditional methods. A multi-center dataset from the European BD2Decide project was analyzed using both supervised and unsupervised ML techniques. In the supervised learning framework, Artificial Neural Networks (ANNs) and Random Forest (RF) models were developed to predict 5-year survival outcomes. RF consistently outperformed ANN, achieving higher accuracy and greater robustness, particularly in the context of limited sample size and high-dimensional data. Model performance improved with increasing dataset size, reaching approximately 70% accuracy when larger cohorts were used. Feature importance analysis revealed that, beyond traditional staging variables, functional and systemic parameters—such as swallowing function and hematological markers—contribute significantly to prognostic prediction, supporting the relevance of host-related factors alongside tumor characteristics. Additionally, the identification of genes involved in key oncogenic pathways supports the biological plausibility of the models and suggests their potential role in uncovering mechanisms underlying tumor progression. Unsupervised learning techniques, including UMAP and hierarchical clustering, enabled the identification of distinct molecular subgroups within HNSCC. Tumor anatomical site emerged as a major driver of transcriptomic variation, with perfect clustering concordance (ARI = 1). Within the OSCC cohort, clustering revealed biologically relevant subgroups that strongly aligned with an established 13-gene prognostic signature, confirming the clinical relevance of the identified patterns. Furthermore, differential expression and functional enrichment analyses identified key biological processes—such as protein translation and acetylation—suggesting a potential role of epigenetic regulation in shaping tumor behavior and patient outcomes. Despite moderate predictive performance, likely due to limited sample size and data complexity, this study demonstrates that ML-based integration of multi-dimensional data provides meaningful insights into tumor biology and prognosis. These findings support the development of more refined, data-driven stratification models and highlight the potential of ML as both a predictive and hypothesis-generating tool in precision oncology. Future research should focus on expanding cohort size, improving data harmonization, and validating models across diverse populations. The integration of these approaches into clinical decision support systems may ultimately contribute to more personalized treatment strategies, reduced overtreatment, and improved patient outcomes.
20-lug-2026
XXXVII
MEDICINA MOLECOLARE
Il carcinoma a cellule squamose del distretto testa-collo (HNSCC), e in particolare il carcinoma orale (OSCC), è caratterizzato da una marcata eterogeneità biologica e da una limitata accuratezza prognostica quando si utilizzano esclusivamente i sistemi di stadiazione convenzionali, come il TNM. Questa limitazione può condurre a una stratificazione del rischio non ottimale, con conseguente rischio di sovratrattamento nei pazienti a basso rischio e trattamento insufficiente nei pazienti ad alto rischio. La presente tesi esplora l’applicazione di approcci di Machine Learning (ML) per la stratificazione del rischio e l’identificazione di sottogruppi tumorali nell’HNSCC, con particolare attenzione ai tumori del cavo orale. L’obiettivo principale è stato valutare se l’integrazione di dati multi-omici — dati clinici, genomici e radiomici — possa migliorare la previsione prognostica e descrivere più accuratamente l’eterogeneità tumorale rispetto ai metodi tradizionali. È stato analizzato un dataset multicentrico proveniente dal progetto europeo BD2Decide mediante tecniche di apprendimento supervisionato e non supervisionato. Nell’ambito dell’apprendimento supervisionato, sono stati sviluppati modelli basati su Reti Neurali Artificiali (ANN) e Random Forest (RF) per la previsione della sopravvivenza a 5 anni. I modelli RF hanno mostrato prestazioni superiori rispetto alle ANN, con maggiore accuratezza e robustezza, in particolare in presenza di dataset di dimensioni limitate e ad alta dimensionalità. Le prestazioni dei modelli sono risultate migliorare con l’aumento della numerosità del campione, raggiungendo circa il 70% di accuratezza nei dataset più ampi. L’analisi dell’importanza delle variabili ha evidenziato come, oltre ai parametri di stadiazione tradizionali, fattori funzionali e sistemici contribuiscano in modo significativo alla previsione prognostica, sottolineando il ruolo dei fattori legati all’ospite accanto alle caratteristiche tumorali. Inoltre, l’identificazione di geni coinvolti in pathway oncogenici noti supporta la plausibilità biologica dei modelli e suggerisce un potenziale contributo nella comprensione dei meccanismi alla base della progressione tumorale. Le tecniche di apprendimento non supervisionato, tra cui UMAP e clustering gerarchico, hanno permesso di identificare sottogruppi molecolari distinti all’interno dell’HNSCC. Il sito anatomico del tumore è emerso come un determinante principale della variabilità trascrittomica globale, con una perfetta concordanza nel clustering (ARI = 1). All’interno della coorte OSCC, il clustering ha evidenziato sottogruppi biologicamente rilevanti in forte accordo con una firma prognostica a 13 geni precedentemente descritta, confermando la rilevanza clinica dei pattern identificati. L’analisi dell’espressione differenziale e l’arricchimento funzionale hanno inoltre evidenziato processi biologici chiave, tra cui la traduzione proteica e l’acetilazione, suggerendo un possibile ruolo dei meccanismi epigenetici nel determinare il comportamento tumorale e l’outcome clinico. Nonostante le prestazioni predittive moderate, verosimilmente dovute alla limitata dimensione del campione e alla complessità dei dati, questo studio dimostra come l’integrazione di dati multi-dimensionali mediante approcci di ML possa fornire informazioni rilevanti sia dal punto di vista prognostico sia biologico. Questi risultati supportano lo sviluppo di modelli di stratificazione più raffinati e sottolineano il potenziale del Machine Learning come strumento sia predittivo sia esplorativo nell’ambito dell’oncologia di precisione. Studi futuri dovranno concentrarsi sull’ampliamento delle coorti, sulla validazione esterna dei modelli e sull’integrazione in sistemi di supporto decisionale clinico, al fine di favorire strategie terapeutiche più personalizzate e migliorare gli outcome dei pazienti.
POLI, Tito
MIRANDOLA, Prisco
File in questo prodotto:
File Dimensione Formato  
Tesi Dottorato_Michela Bergonzani.pdf

accesso aperto

Descrizione: tesi
Tipologia: Tesi di dottorato
Licenza: Creative commons
Dimensione 2.34 MB
Formato Adobe PDF
2.34 MB Adobe PDF Visualizza/Apri

I documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/11381/3067934
Citazioni
  • ???jsp.display-item.citation.pmc??? ND
  • Scopus ND
  • ???jsp.display-item.citation.isi??? ND
social impact