Tesi etd-05272026-210250 |
Link copiato negli appunti
Tipo di tesi
Tesi di laurea vecchio ordinamento
URN
etd-05272026-210250
Titolo
Blind Image Restoration via Dual-Conditioned Latent Diffusion
Dipartimento
INGEGNERIA DELL'INFORMAZIONE
Corso di studi
INGEGNERIA INFORMATICA
Relatori
.
relatore Prof. Uricchio, Tiberio
Parole chiave
- ARNIQA
- blind image restoration
- ControlNet
- image quality assessment
- latent diffusion models
- LPIPS
- Marigold
- perception-distortion tradeoff
- Stable Diffusion
Data inizio appello
22/07/2026
Consultabilità
Completa
Riassunto (Inglese)
This thesis addresses blind image restoration, the recovery of images degraded by blur, noise, compression, and resolution loss without prior knowledge of the applied degradation type. Existing methods fall into two main categories: regression models achieve high pixel-level fidelity but produce over-smoothed outputs; generative models based on GANs or diffusion produce realistic textures but tend to hallucinate details not present in the original image. This tradeoff between fidelity and perceptual quality is a fundamental limitation of current approaches.
The proposed method repurposes Stable Diffusion, a pretrained latent diffusion model, by introducing a dual-path conditioning strategy. The degraded image is provided to the model through two complementary pathways: a latent-space path via 8-channel concatenation (derived from the Marigold framework) that provides dense structural guidance, and a pixel-space path via ControlNet that preserves fine high-resolution details. Unlike existing methods that keep the U-Net frozen, our approach jointly trains both U-Net and ControlNet, enabling co-adaptation between the two pathways.
Experimental results on synthetic and real-world datasets show that the model achieves the best PSNR among all compared methods, surpassing even regression models optimized for fidelity, while maintaining perceptual quality competitive with generative methods.
The proposed method repurposes Stable Diffusion, a pretrained latent diffusion model, by introducing a dual-path conditioning strategy. The degraded image is provided to the model through two complementary pathways: a latent-space path via 8-channel concatenation (derived from the Marigold framework) that provides dense structural guidance, and a pixel-space path via ControlNet that preserves fine high-resolution details. Unlike existing methods that keep the U-Net frozen, our approach jointly trains both U-Net and ControlNet, enabling co-adaptation between the two pathways.
Experimental results on synthetic and real-world datasets show that the model achieves the best PSNR among all compared methods, surpassing even regression models optimized for fidelity, while maintaining perceptual quality competitive with generative methods.
Riassunto (Italiano)
Questa tesi affronta il problema della blind image restoration, ovvero il recupero di immagini degradate da blur, rumore, compressione, downsampling senza conoscere a priori il tipo di degradazione applicata. I metodi esistenti si dividono in due categorie: i modelli regressivi, che ottengono alta fedeltà pixel-per-pixel ma producono output over-smoothed; e i modelli generativi (GAN o diffusion) producono texture realistiche ma tendono ad allucinare dettagli non presenti nell'originale. Questo tradeoff tra fedeltà e qualità percettiva è un limite fondamentale degli approcci attuali.
Il metodo proposto riutilizza Stable Diffusion, un modello di diffusione latente pre-addestrato, introducendo una strategia di dual-path conditioning. L'immagine degradata viene fornita al modello attraverso due pathway complementari: un latent-space path tramite concatenazione 8-channel (derivato dal framework Marigold) che fornisce guida strutturale densa, e un pixel-space path tramite ControlNet che preserva dettagli fini ad alta risoluzione. A differenza dei metodi esistenti che mantengono la U-Net congelata, il nostro approccio addestra congiuntamente U-Net e ControlNet, permettendo co-adattazione tra i due pathway.
I risultati sperimentali su dataset sintetici e reali mostrano che il modello ottiene il miglior PSNR tra tutti i metodi confrontati, superando anche i modelli regressivi ottimizzati per la fedeltà, mantenendo al contempo qualità percettiva competitiva con i metodi generativi.
Il metodo proposto riutilizza Stable Diffusion, un modello di diffusione latente pre-addestrato, introducendo una strategia di dual-path conditioning. L'immagine degradata viene fornita al modello attraverso due pathway complementari: un latent-space path tramite concatenazione 8-channel (derivato dal framework Marigold) che fornisce guida strutturale densa, e un pixel-space path tramite ControlNet che preserva dettagli fini ad alta risoluzione. A differenza dei metodi esistenti che mantengono la U-Net congelata, il nostro approccio addestra congiuntamente U-Net e ControlNet, permettendo co-adattazione tra i due pathway.
I risultati sperimentali su dataset sintetici e reali mostrano che il modello ottiene il miglior PSNR tra tutti i metodi confrontati, superando anche i modelli regressivi ottimizzati per la fedeltà, mantenendo al contempo qualità percettiva competitiva con i metodi generativi.
File
| Nome file | Dimensione |
|---|---|
| thesis.pdf | 69.33 Mb |
Contatta l’autore |
|