... ✍️ TateoBlog 👈 sei qui
#AI #ArtificialIntelligence #IntelligenzaArtificiale #deepLearning #CNN #VisioneArtificiale #ComputerVision #SegmentatoreSemantico #encoder #decoder #downsampling #upsampling #skipConnections #uNet #FreiburgUniversity #dataAugmentation #overfitting #backbone #TateoBlog #TILLL,
U-Net è un’architettura convoluzionale (CNN) sviluppata nel 2015 presso l’Università di Friburgo, inizialmente per la segmentazione di immagini biomediche. Il nome deriva dalla caratteristica forma a “U” della rete, composta da un percorso di contrazione e da un percorso simmetrico di espansione. L’architettura è stata concepita per ottenere una localizzazione precisa degli elementi anche disponendo di un numero relativamente limitato di immagini annotate, grazie anche all’impiego della data augmentation (la rete osserva versioni differenti dello stesso esempio e impara a riconoscere le strutture d’interesse anche quando posizione, orientamento, scala o forma presentano variazioni. Questo riduce il rischio di overfitting e migliora la capacità di generalizzazione su immagini mai viste).
A differenza di una rete di classificazione, che assegna generalmente un’unica classe all’intera immagine, U-Net produce una mappa di segmentazione: a ogni pixel viene associata una classe. La rete può quindi delimitare con precisione aree di interesse in una immagine.
Se dovessimo descrivere U-Net con una metafora, potremmo paragonarla a un ispettore che non si limita a segnalare la presenza di un difetto, ma ne traccia accuratamente il contorno sulla superficie analizzata.
U-Net è costituita da due percorsi complementari:
- Encoder, o percorso di contrazione: analizza l’immagine mediante convoluzioni e operazioni di downsampling. La risoluzione spaziale viene progressivamente ridotta, mentre la rete estrae caratteristiche sempre più astratte. I primi livelli riconoscono bordi e dettagli locali; quelli più profondi individuano forme, strutture e contesto.
- Decoder, o percorso di espansione: riceve la rappresentazione compatta prodotta dall’encoder e ne aumenta gradualmente la risoluzione mediante operazioni di upsampling. Il decoder ricostruisce così una mappa nella quale viene indicata la classe di appartenenza di ciascun pixel.
La sola ricostruzione effettuata dal decoder potrebbe non recuperare completamente i dettagli spaziali persi durante il downsampling. Per questo U-Net utilizza skip connections simmetriche, che trasferiscono al decoder le mappe delle caratteristiche generate nei corrispondenti livelli dell’encoder. Il decoder combina quindi il contesto semantico profondo, necessario per comprendere che cosa è presente, con le informazioni spaziali ad alta risoluzione, necessarie per stabilire dove si trova. Questa combinazione migliora la definizione dei bordi e la localizzazione degli elementi più piccoli.
Nella configurazione originale, U-Net possiede un proprio percorso di contrazione. Nelle implementazioni moderne, tuttavia, l’encoder può essere sostituito con una rete di classificazione preaddestrata, impiegata come backbone per l’estrazione delle caratteristiche, ad esempio:
- VGG16;
- ResNet50;
- MobileNet;
- EfficientNet.
Si ottengono così configurazioni come VGG16-U-Net, ResNet50-U-Net, MobileNet-U-Net ed EfficientNet-U-Net. L’encoder preaddestrato estrae le caratteristiche dell’immagine, mentre il decoder specifico di U-Net recupera la risoluzione spaziale e genera la maschera di segmentazione. La scelta del backbone dipende dal compromesso richiesto tra accuratezza, capacità di estrazione delle caratteristiche, velocità di elaborazione, memoria disponibile e complessità computazionale.
🔗 Riferimenti per approfondire:
1. ... 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro; intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html; paragrafo §8.6. Architetture specifiche per Segmentazione semantica
2. ... 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale; Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html
🌐
3. mPaper originale, U-Net: Convolutional Networks for Biomedical Image Segmentation, Olaf Ronneberger et al. (University of Freiburg), https://arxiv.org/abs/1505.04597
4. Sito ufficiale del progetto, U-Net Project Page https://lmb.informatik.uni-freiburg.de/people/ronneber/u-net/
5. Titolo: U-Net: Convolutional Networks for Biomedical Image Segmentation; Link: https://arxiv.org/abs/1505.04597
~~~~~~~~~~=======( v.3 21/8 2026 )=====~~~~~~~~~~

Nessun commento:
Posta un commento