Tesi etd-06032026-143314 |
Link copiato negli appunti
Tipo di tesi
Tesi di dottorato di ricerca
URN
etd-06032026-143314
Titolo
Leveraging Knowledge Distillation in Decentralized Learning
Settore scientifico disciplinare
INF/01 - INFORMATICA
Corso di studi
INFORMATICA
Relatori
.
supervisore Carlini, Emanuele
co-supervisore Chessa, Stefano
co-supervisore Vadicamo, Lucia
co-supervisore Chessa, Stefano
co-supervisore Vadicamo, Lucia
Parole chiave
- Decentralized Learning
- Federated Learning
- Knowledge distillation
Data inizio appello
04/06/2026
Consultabilità
Completa
Riassunto (Inglese)
As Artificial Intelligence (AI) shifts from centralized infrastructures to distributed environments, learning paradigms must address challenges related to data heterogeneity, privacy, limited supervision, and constrained computational resources. This thesis investigates Knowledge Distillation (KD) as a framework for decentralized learning, interpreting distributed AI systems through the perspective of artificial social learning.
Although KD has demonstrated strong empirical performance across many applications, its behavior as a general collaborative learning mechanism remains understudied, particularly in heterogeneous, weakly supervised, and decentralized environments. In particular, questions remain regarding reliable knowledge transfer between the role of the distillation objective in learning stability, and the adaptation of KD to networked multi-client systems. This thesis addresses some of these challenges through theoretical formulation and experimental evaluation across representative edge and industrial scenarios.
The thesis first investigates whether KD can remain effective in environments where edge devices observe highly heterogeneous data distributions and where access to ground-truth supervision is limited or unavailable. The objective is to determine whether the teacher–student paradigm can act as a primary learning mechanism rather than as a complementary training strategy. Experimental results demonstrate that distilled supervision from a knowledgeable teacher alone can support stable and competitive model performance under strong distribution shifts and severe supervision constraints, confirming the suitability of KD for realistic edge learning scenarios.
Building on this, the thesis investigates knowledge exchange in fully decentralized KD settings, where each client relies exclusively on information received from peers. Learning effectiveness in this context depends on how neighborhood predictions are integrated. The study highlights that the choice of distillation loss, together with client connectivity, determines the efficiency of knowledge transfer in heterogeneous decentralized networks. By evaluating a broad family of information-theoretic measures beyond conventional Cross-Entropy and Kullback–Leibler divergence, the results identify distillation objectives that promote robust convergence and effective collaboration across distributed clients.
The thesis further extends KD to regression tasks through Remaining Useful Life prediction in industrial systems, demonstrating effectiveness while reducing local data exposure during collaborative continuous-output prediction and maintaining communication efficiency.
Overall, this thesis extends KD beyond its traditional role as a model compression technique toward a general framework for decentralized collaborative learning. The findings provide practical guidance for the design of distributed KD systems, highlighting the importance of selecting distillation objectives and adapting knowledge aggregation strategies to network connectivity.
Although KD has demonstrated strong empirical performance across many applications, its behavior as a general collaborative learning mechanism remains understudied, particularly in heterogeneous, weakly supervised, and decentralized environments. In particular, questions remain regarding reliable knowledge transfer between the role of the distillation objective in learning stability, and the adaptation of KD to networked multi-client systems. This thesis addresses some of these challenges through theoretical formulation and experimental evaluation across representative edge and industrial scenarios.
The thesis first investigates whether KD can remain effective in environments where edge devices observe highly heterogeneous data distributions and where access to ground-truth supervision is limited or unavailable. The objective is to determine whether the teacher–student paradigm can act as a primary learning mechanism rather than as a complementary training strategy. Experimental results demonstrate that distilled supervision from a knowledgeable teacher alone can support stable and competitive model performance under strong distribution shifts and severe supervision constraints, confirming the suitability of KD for realistic edge learning scenarios.
Building on this, the thesis investigates knowledge exchange in fully decentralized KD settings, where each client relies exclusively on information received from peers. Learning effectiveness in this context depends on how neighborhood predictions are integrated. The study highlights that the choice of distillation loss, together with client connectivity, determines the efficiency of knowledge transfer in heterogeneous decentralized networks. By evaluating a broad family of information-theoretic measures beyond conventional Cross-Entropy and Kullback–Leibler divergence, the results identify distillation objectives that promote robust convergence and effective collaboration across distributed clients.
The thesis further extends KD to regression tasks through Remaining Useful Life prediction in industrial systems, demonstrating effectiveness while reducing local data exposure during collaborative continuous-output prediction and maintaining communication efficiency.
Overall, this thesis extends KD beyond its traditional role as a model compression technique toward a general framework for decentralized collaborative learning. The findings provide practical guidance for the design of distributed KD systems, highlighting the importance of selecting distillation objectives and adapting knowledge aggregation strategies to network connectivity.
Riassunto (Italiano)
Con il passaggio dell'**Intelligenza Artificiale (AI)** da infrastrutture centralizzate ad ambienti distribuiti, i paradigmi di apprendimento devono affrontare sfide legate all’eterogeneità dei dati, alla privacy, alla limitata disponibilità di supervisione e alle risorse computazionali vincolate. Questa tesi studia la **Knowledge Distillation (KD)** come quadro metodologico per l’apprendimento decentralizzato, interpretando i sistemi di AI distribuiti attraverso la prospettiva dell’apprendimento sociale artificiale.
Sebbene la KD abbia dimostrato elevate prestazioni empiriche in numerose applicazioni, il suo comportamento come meccanismo generale di apprendimento collaborativo rimane ancora poco esplorato, in particolare in ambienti eterogenei, debolmente supervisionati e decentralizzati. In particolare, rimangono aperte questioni riguardanti il trasferimento affidabile della conoscenza tra modelli, il ruolo dell’obiettivo di distillazione nella stabilità dell’apprendimento e l’adattamento della KD a sistemi multi-client connessi in rete. Questa tesi affronta alcune di queste problematiche attraverso una formulazione teorica e una valutazione sperimentale in scenari rappresentativi dell’edge computing e dell’industria.
La tesi analizza innanzitutto se la KD possa rimanere efficace in contesti in cui i dispositivi edge osservano distribuzioni di dati fortemente eterogenee e in cui l’accesso alla supervisione basata su dati etichettati è limitato o assente. L’obiettivo è verificare se il paradigma **teacher–student** possa fungere da meccanismo principale di apprendimento, anziché da semplice strategia complementare di addestramento. I risultati sperimentali dimostrano che la sola supervisione distillata proveniente da un teacher competente è in grado di sostenere prestazioni stabili e competitive anche in presenza di forti cambiamenti di distribuzione e severe limitazioni nella disponibilità di etichette, confermando l’idoneità della KD per scenari realistici di apprendimento edge.
Successivamente, la tesi studia lo scambio di conoscenza in contesti di **Knowledge Distillation completamente decentralizzata**, nei quali ciascun client si affida esclusivamente alle informazioni ricevute dai propri pari. In questo scenario, l’efficacia dell’apprendimento dipende dal modo in cui le predizioni provenienti dai vicini vengono integrate. Lo studio evidenzia che la scelta della funzione di distillazione, insieme al livello di connettività dei client, determina l’efficienza del trasferimento di conoscenza nelle reti decentralizzate eterogenee. Valutando un’ampia famiglia di misure basate sulla teoria dell’informazione, oltre alle tradizionali **Cross-Entropy** e **Kullback–Leibler Divergence**, i risultati identificano obiettivi di distillazione in grado di favorire una convergenza robusta e una collaborazione efficace tra client distribuiti.
La tesi estende inoltre la KD ai problemi di **regressione** attraverso la previsione della **Remaining Useful Life (RUL)** in sistemi industriali, dimostrandone l’efficacia nel ridurre l’esposizione dei dati locali durante la collaborazione per la previsione di variabili continue e nel mantenere l’efficienza della comunicazione.
Nel complesso, questa tesi estende la Knowledge Distillation oltre il suo ruolo tradizionale di tecnica di compressione dei modelli, proponendola come un quadro generale per l’apprendimento collaborativo decentralizzato. I risultati forniscono indicazioni pratiche per la progettazione di sistemi distribuiti basati su KD, evidenziando l’importanza della scelta degli obiettivi di distillazione e dell’adattamento delle strategie di aggregazione della conoscenza alle caratteristiche di connettività della rete.
Sebbene la KD abbia dimostrato elevate prestazioni empiriche in numerose applicazioni, il suo comportamento come meccanismo generale di apprendimento collaborativo rimane ancora poco esplorato, in particolare in ambienti eterogenei, debolmente supervisionati e decentralizzati. In particolare, rimangono aperte questioni riguardanti il trasferimento affidabile della conoscenza tra modelli, il ruolo dell’obiettivo di distillazione nella stabilità dell’apprendimento e l’adattamento della KD a sistemi multi-client connessi in rete. Questa tesi affronta alcune di queste problematiche attraverso una formulazione teorica e una valutazione sperimentale in scenari rappresentativi dell’edge computing e dell’industria.
La tesi analizza innanzitutto se la KD possa rimanere efficace in contesti in cui i dispositivi edge osservano distribuzioni di dati fortemente eterogenee e in cui l’accesso alla supervisione basata su dati etichettati è limitato o assente. L’obiettivo è verificare se il paradigma **teacher–student** possa fungere da meccanismo principale di apprendimento, anziché da semplice strategia complementare di addestramento. I risultati sperimentali dimostrano che la sola supervisione distillata proveniente da un teacher competente è in grado di sostenere prestazioni stabili e competitive anche in presenza di forti cambiamenti di distribuzione e severe limitazioni nella disponibilità di etichette, confermando l’idoneità della KD per scenari realistici di apprendimento edge.
Successivamente, la tesi studia lo scambio di conoscenza in contesti di **Knowledge Distillation completamente decentralizzata**, nei quali ciascun client si affida esclusivamente alle informazioni ricevute dai propri pari. In questo scenario, l’efficacia dell’apprendimento dipende dal modo in cui le predizioni provenienti dai vicini vengono integrate. Lo studio evidenzia che la scelta della funzione di distillazione, insieme al livello di connettività dei client, determina l’efficienza del trasferimento di conoscenza nelle reti decentralizzate eterogenee. Valutando un’ampia famiglia di misure basate sulla teoria dell’informazione, oltre alle tradizionali **Cross-Entropy** e **Kullback–Leibler Divergence**, i risultati identificano obiettivi di distillazione in grado di favorire una convergenza robusta e una collaborazione efficace tra client distribuiti.
La tesi estende inoltre la KD ai problemi di **regressione** attraverso la previsione della **Remaining Useful Life (RUL)** in sistemi industriali, dimostrandone l’efficacia nel ridurre l’esposizione dei dati locali durante la collaborazione per la previsione di variabili continue e nel mantenere l’efficienza della comunicazione.
Nel complesso, questa tesi estende la Knowledge Distillation oltre il suo ruolo tradizionale di tecnica di compressione dei modelli, proponendola come un quadro generale per l’apprendimento collaborativo decentralizzato. I risultati forniscono indicazioni pratiche per la progettazione di sistemi distribuiti basati su KD, evidenziando l’importanza della scelta degli obiettivi di distillazione e dell’adattamento delle strategie di aggregazione della conoscenza alle caratteristiche di connettività della rete.
File
| Nome file | Dimensione |
|---|---|
| 2026_Mol...rsion.pdf | 7.02 Mb |
Contatta l’autore |
|