Visualizzazione post con etichetta #ComputerVision. Mostra tutti i post
Visualizzazione post con etichetta #ComputerVision. Mostra tutti i post

venerdì 11 settembre 2026

🧠 Architetture CNN per la Visione Artificiale

 TILLL / 🏠 HOME / ...
... ✍️ TateoBlog / 11.09.2026 👈 sei qui.
... 🎓 Learning / 🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / architetture 👈 sei qui

#deepLearning #CNN #computerVision #classificazione #riconoscimento #localizzazione #segmentazione #VGG #ResNet #DenseNet #Inception #MobileNet #EfficientNet #uNet #TateoBlog #TILLL 

🌍 Le reti neurali convoluzionali (Convolutional Neural Networks, CNN) rappresentano una delle tecnologie più importanti sviluppate negli ultimi anni nel campo dell'intelligenza artificiale applicata alle immagini. La loro caratteristica fondamentale consiste nella capacità di estrarre automaticamente informazioni significative da immagini e video, individuando schemi, forme, texture, oggetti o anomalie senza la necessità di definire manualmente regole di riconoscimento. Nel corso del tempo, le CNN hanno rivoluzionato il settore della Computer Vision, raggiungendo livelli di accuratezza paragonabili o superiori a quelli umani in numerose applicazioni.

Queste architetture, pur differenziandosi per struttura e finalità, condividono l'obiettivo di trasformare immagini grezze in informazioni utilizzabili da sistemi automatici di analisi e supporto decisionale. Per questo motivo sono diventate un punto di riferimento non solo nella ricerca accademica, ma anche in numerosi contesti industriali dove l'elaborazione automatica delle immagini rappresenta un elemento essenziale dei processi operativi.

👥 L'interesse verso le CNN è particolarmente evidente in tutti quei contesti in cui sistemi di Visione Artificiale producono quantità di immagini tali da rendere impraticabile un'ispezione esclusivamente manuale. Dall'industria manifatturiera alle infrastrutture, dai trasporti agli impianti industriali, i moderni sistemi di acquisizione generano continuamente grandi volumi di dati visivi. L'analisi manuale di tali informazioni sarebbe estremamente onerosa, mentre le CNN consentono di automatizzare attività di controllo, monitoraggio e ispezione, migliorando l'efficienza e rendendo possibile l'elaborazione sistematica di quantità di dati altrimenti difficilmente gestibili.

In particolare, queste reti rispondono alle tre esigenze fondamentali dei sistemi di visione per l'ispezione ferroviaria:

  • Classificazione, ovvero determinare se un'immagine o un componente presenta o meno un'anomalia.
  • Riconoscimento, cioè identificare la tipologia di elemento o di anomalia presente nella scena osservata.
  • Localizzazione e segmentazione, ovvero individuare con precisione la posizione di difetti, usure, cricche, componenti danneggiati o altri elementi di interesse all'interno dell'immagine.

Grazie a queste caratteristiche, le architetture CNN trovano applicazione in numerosi ambiti dell'ispezione ferroviaria, tra cui il rilevamento di difetti sulle rotaie, l'analisi dello stato di traverse e attacchi, il monitoraggio di ruote e pantografi, il controllo della linea di contatto e l'ispezione automatica di componenti dei veicoli.

⚙️ Tra le centinaia di architetture proposte dalla comunità scientifica, modelli come VGG16, VGG19, ResNet50, DenseNete121, DenseNet201GoogLeNet (Inception), MobileNet, EfficientNet e U-Net occupano una posizione di particolare rilievo. Ciascuno di essi ha introdotto innovazioni che hanno contribuito all'evoluzione della disciplina:

  • VGG ha dimostrato l'efficacia di reti profonde ma concettualmente semplici.
  • ResNet ha reso possibile l'addestramento di modelli molto più profondi.
  • DenseNet ha migliorato la condivisione delle informazioni tra i diversi livelli della rete.
  • GoogLeNet (Inception) ha introdotto un'elaborazione multi-scala efficiente.
  • MobileNet ha portato la Computer Vision sui dispositivi embedded e mobili.
  • EfficientNet ha raggiunto un equilibrio ottimale tra accuratezza e consumo di risorse.
  • U-Net ha aperto la strada alla segmentazione precisa delle immagini.

Alcune reti, come VGG, ResNet, DenseNet, GoogLeNet (Inception), MobileNet ed EfficientNet, risultano particolarmente efficaci per attività di classificazione e riconoscimento delle anomalie, mentre architetture come U-Net sono specificamente orientate alla segmentazione e alla localizzazione dettagliata dei difetti.

Per tali motivi, le reti presentate non rappresentano semplicemente alcuni esempi di CNN, ma costituiscono le architetture che più hanno influenzato lo sviluppo della moderna Computer Vision e che continuano ancora oggi a rappresentare un riferimento per la progettazione di sistemi di ispezione automatica in ambito ferroviario e industriale.


🔗 Riferimenti per approfondire:

 TILLL / 🏠 HOME 🎓 Learning / ...

1. 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro intelligenza🔗: https://tateoblog.blogspot.com/p/artificial-intelligence.htmlParagrafi: 

§8.4.1. VGG16/19: semplicità e robustezza 

§8.4.2 ResNet50: profondità efficace 

§8.4.3. GoogLeNet/Inception: efficienza ed innovazione 

2. 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale🔗:https://tateoblog.blogspot.com/p/vs-visione-artificiale.html

3. 👁️ Visione Artificiale (VS)Applicazioni (VS.6); Titolo: Machine Vision: l'applicazione industriale della Visione Artificiale🔗:https://tateoblog.blogspot.com/2017/05/vs-10-machine-vision-la-visione.html.

4. 🚂 Railway (RW) / Diagnostica (RW.5); Titolo: La Diagnostica Ferroviaria🔗:https://tateoblog.blogspot.com/p/diagnostics-rw5.html 


~~~~~~~~~~=======(   v.4   11.9.2026   )=====~~~~~~~~~~
🌍=Prospettiva divulgativa; 👥=Prospettiva Business; ⚙️=Prospettiva ingegneristica.
© 2026 Tateo’s Interdisciplinary Lifelong Learning Lab (TILLL)

sabato 29 agosto 2026

🧠 Addestramento e validazione del classificatore

TILLL / 🏠 HOME / ...
... ✍️ TateoBlog / 29/08/26 02:01 👈 sei qui 
... 🎓 Learning / 🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / architetture / classificazione / produzione / addestramento 👈 sei qui

#AI #ArtificialIntelligence #IntelligenzaArtificiale #deepLearning #CNN #VisioneArtificiale #ComputerVision #classificatore #addestramento #TateoBlog #TILLL

Una volta completata la preparazione del dataset, il modello viene addestrato utilizzando il Training Set. Durante questa fase la rete neurale apprende automaticamente le caratteristiche discriminanti delle diverse classi modificando iterativamente i propri parametri interni (pesi e bias) al fine di ridurre l'errore di classificazione.

Configurazione Architetturale

La prima attività consiste nella definizione dell'architettura della rete neurale che verrà utilizzata per il riconoscimento delle immagini.

I principali parametri architetturali comprendono:

  • Architettura CNN (ad esempio VGG10, VGG16, ResNet50, DenseNet201, EfficientNet o MobileNet): definisce la struttura della rete neurale e il modo in cui vengono estratte le caratteristiche dalle immagini.
  • Dense Layer Size (ad esempio 512 neuroni): rappresenta il numero di neuroni presenti nel layer completamente connesso (Fully Connected Layer) posto nella parte finale della rete. Questo layer combina le caratteristiche estratte dagli strati convoluzionali e produce la decisione finale di classificazione. Un numero maggiore di neuroni aumenta la capacità rappresentativa del modello ma incrementa anche il numero di parametri da addestrare e il rischio di overfitting.

Iperparametri di Addestramento

Oltre alla struttura della rete, è necessario configurare una serie di iperparametri, ovvero parametri non appresi automaticamente dal modello ma definiti dall'ingegnere durante il processo di sviluppo.

Tra i più comuni:

  • Learning Rate: determina l'entità delle modifiche applicate ai parametri della rete durante ogni iterazione di addestramento. Valori troppo elevati possono rendere instabile l'apprendimento, mentre valori troppo bassi possono rallentare eccessivamente la convergenza.
  • Numero di Epoche: indica quante volte l'intero Training Set viene presentato alla rete durante il processo di apprendimento.
  • Dropout: tecnica di regolarizzazione che disattiva casualmente una percentuale di neuroni durante l'addestramento al fine di migliorare la capacità di generalizzazione del modello.
  • Patience: parametro utilizzato nei meccanismi di Early Stopping. Definisce il numero di epoche consecutive durante le quali il modello può non migliorare prima che l'addestramento venga interrotto automaticamente.

Processo di Validazione

Durante l'addestramento il Validation Set svolge un ruolo fondamentale. A intervalli regolari il modello viene valutato su dati che non sono stati utilizzati per aggiornare i pesi della rete. Questo consente di monitorare le prestazioni del classificatore e di identificare tempestivamente eventuali problemi.

I due fenomeni principali da controllare sono:

  • Overfitting: il modello apprende in modo eccessivamente dettagliato il Training Set, ottenendo ottime prestazioni sui dati di addestramento ma risultati peggiori su dati nuovi e mai osservati.
  • Underfitting: il modello non riesce ad apprendere adeguatamente le caratteristiche del problema e mostra prestazioni insufficienti sia sul Training Set sia sul Validation Set.

L'obiettivo del processo di validazione è individuare il modello che offre il miglior compromesso tra accuratezza e capacità di generalizzazione.

Indicatori e Strumenti di Analisi

Per comprendere il comportamento del classificatore durante l'addestramento vengono monitorati diversi indicatori e strumenti diagnostici.

  • Accuracy Plot. L'Accuracy Plot mostra l'andamento dell'accuratezza di classificazione nel corso delle epoche sia sul Training Set sia sul Validation Set.

L'analisi delle due curve permette di valutare:

  • velocità di apprendimento del modello;
  • raggiungimento della convergenza;
  • eventuale presenza di overfitting o underfitting.

  • Loss Plot. Il Loss Plot rappresenta l'evoluzione della funzione di errore (Loss Function) durante l'addestramento.

Un comportamento desiderabile è caratterizzato da una progressiva riduzione della loss sia sul Training Set sia sul Validation Set.

Divergenze significative tra le due curve rappresentano spesso un'indicazione precoce di overfitting.

  • Heatmap di Attenzione. Le Heatmap di Attenzione evidenziano le regioni dell'immagine che hanno maggiormente influenzato la decisione del classificatore.

Questi strumenti consentono di verificare se la rete neurale stia realmente osservando gli elementi significativi dell'oggetto di interesse oppure se stia basando le proprie decisioni su informazioni spurie o non pertinenti.

  • Matrice di Confusione. La Confusion Matrix rappresenta il numero di campioni classificati correttamente o erroneamente per ciascuna classe.

La matrice permette di identificare:

  • le classi maggiormente confuse tra loro;
  • la distribuzione degli errori;
  • eventuali squilibri prestazionali del classificatore.

  • Metriche di Classificazione. Dalla matrice di confusione possono essere derivate diverse metriche quantitative, tra cui:

  • Accuracy: percentuale complessiva di classificazioni corrette.
  • Precision: capacità di evitare falsi positivi.
  • Recall: capacità di rilevare correttamente tutti i campioni appartenenti a una determinata classe.
  • F1-Score: misura sintetica che combina Precision e Recall.

Risultato della Fase di Addestramento

Al termine del processo vengono confrontate le diverse configurazioni testate e selezionato il modello che presenta le migliori prestazioni sul Validation Set. Il risultato finale è un classificatore addestrato e validato, pronto per essere sottoposto alla successiva fase di test indipendente sul Test Set e, successivamente, all'impiego operativo sul campo.

Al termine di questa fase si ottiene il modello migliore tra quelli testati, ovvero il classificatore addestrato e validato.


🔗 Riferimenti per approfondire:
 
TILLL / 🏠 Home / 🎓 Learning 

1. 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html ; paragrafo §8.5.2. (2) Addestramento e validazione del classificatore.

2. 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale;  Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html 

 

~~~~~~~~~~=======(   v.2    24/8 2026   )=====~~~~~~~~~~
(c) Tateo’s Interdisciplinary & Lifelong Learning Lab (TILLL)

venerdì 28 agosto 2026

🧠 Produzione e Preparazione del Dataset

 TILLL / 🏠 HOME / ...
... ✍️ TateoBlog 👈 sei qui
... 🎓 Learning /  🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / architetture / classificazione / produzione / dataset 👈 sei qui


#AI #ArtificialIntelligence #IntelligenzaArtificiale #deepLearning #CNN #VisioneArtificiale #ComputerVision #classificatore #dataset #TateoBlog #TILL

L'efficacia di un classificatore di immagini dipende in larga misura dalla qualità del dataset utilizzato durante il processo di sviluppo. La costruzione del dataset rappresenta quindi una fase fondamentale del ciclo di vita del modello, poiché determina la capacità della rete neurale di apprendere correttamente le caratteristiche distintive delle diverse classi e di generalizzare il proprio comportamento su dati mai osservati in precedenza.

Acquisizione e Labeling

La prima fase consiste nella raccolta, organizzazione e preparazione delle immagini che costituiranno il dataset di addestramento. Le immagini vengono acquisite dai sistemi di misura o da archivi storici e successivamente sottoposte a verifica qualitativa, classificazione e annotazione (labeling). Ad ogni immagine viene associata una classe di appartenenza che rappresenta il risultato atteso del processo di classificazione. I campioni vengono inoltre rinominati e organizzati secondo convenzioni coerenti al fine di garantire tracciabilità, uniformità e facilità di gestione del dataset.

Suddivisione del Dataset

Una volta completata la preparazione dei campioni, il dataset viene suddiviso in tre insiemi distinti:

  • Training Set, utilizzato per l'apprendimento dei parametri della rete neurale;
  • Validation Set, utilizzato per monitorare il processo di addestramento e ottimizzare gli iperparametri del modello;
  • Test Set, utilizzato esclusivamente per la valutazione finale delle prestazioni.

Questa separazione è essenziale per ottenere una stima realistica delle capacità di generalizzazione del classificatore. L'utilizzo degli stessi dati sia per l'addestramento sia per la valutazione finale porterebbe infatti a risultati artificialmente ottimistici, fenomeno noto come overfitting.

Pre-processing.

Prima di essere utilizzate dalla rete neurale, le immagini vengono sottoposte a una serie di trasformazioni finalizzate a uniformare il formato dei dati di ingresso.

  • Ridimensionamento delle immagini (210 × 201 pixel): tutte le immagini vengono convertite a una risoluzione uniforme, compatibile con l'architettura della rete neurale utilizzata.
  • Normalizzazione Min-Max: i valori dei pixel vengono trasformati in un intervallo normalizzato, generalmente compreso tra 0 e 1, al fine di migliorare la stabilità numerica e favorire la convergenza del processo di addestramento.

Data Augmentation

In molti casi il numero di campioni disponibili non è sufficiente a rappresentare tutte le possibili variabilità osservabili durante l'esercizio. Per aumentare artificialmente la numerosità del dataset e migliorare la capacità di generalizzazione del classificatore vengono quindi applicate tecniche di data augmentation, che generano nuove immagini a partire dai campioni esistenti mediante trasformazioni geometriche controllate.

Nel caso in esame sono state adottate le seguenti tecniche:

  • Horizontal Flip: generazione di immagini speculari rispetto all'asse verticale;
  • Vertical Flip: generazione di immagini speculari rispetto all'asse orizzontale.

Queste trasformazioni consentono alla rete neurale di apprendere caratteristiche più robuste e meno dipendenti dall'orientamento specifico degli oggetti presenti nell'immagine, riducendo il rischio di overfitting e migliorando le prestazioni su dati reali non utilizzati durante l'addestramento.


🔗 Riferimenti per approfondire:
 
TILLL / 🏠 Home / 🎓 Learning 

1. 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html ; paragrafo §8.5.1. (1) Produzione e Preparazione del Dataset.

2. 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale;  Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html 


~~~~~~~~~~=======(   v.2    24/8 2026   )=====~~~~~~~~~~
(c) Tateo’s Interdisciplinary & Lifelong Learning Lab (TILLL)


mercoledì 26 agosto 2026

🧠 Architetture CNN specifiche per Segmentazione semantica

 TILLL / 🏠 HOME / ...
... ✍️ TateoBlog 👈 sei qui
... 🎓 Learning / 🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / architetture / segmentazione semantica 👈 sei qui

#AI #ArtificialIntelligence #IntelligenzaArtificiale #deepLearning #CNN #VisioneArtificiale #ComputerVision #SegmentatoreSemantico #encoder #decoder #downsampling #upsampling #skipConnections #uNet #TateoBlog #TILLL

La segmentazione semantica è un’applicazione della Visione Artificiale che assegna una classe a ciascun pixel dell’immagine, producendo una mappa semantica dettagliata della scena, nella quale ogni area è associata alla categoria corrispondente. Ad esempio, in una scena stradale, i pixel possono essere classificati come strada, veicolo, edificio, vegetazione o cielo.

A differenza della classificazione, che attribuisce un’unica etichetta all’intera immagine, la segmentazione identifica la categoria di appartenenza di ogni area visibile, senza distinguere necessariamente le singole istanze della stessa classe.

Le architetture dedicate utilizzano generalmente una struttura composta da due parti complementari: encoder e decoder.

L’encoder riceve l’immagine originale e la analizza attraverso una sequenza di livelli convoluzionali. Procedendo nella rete, la risoluzione dell’immagine viene progressivamente ridotta mediante operazioni di downsampling, mentre aumentano il livello di astrazione e la ricchezza delle caratteristiche estratte. I primi livelli rilevano elementi semplici, come bordi e variazioni locali; i livelli più profondi riconoscono forme, strutture e contesto. Alla fine dell’encoder si ottiene quindi una rappresentazione compatta dell’immagine, semanticamente ricca ma con una risoluzione spaziale ridotta.

Il decoder svolge il processo complementare: riceve la rappresentazione prodotta dall’encoder e ne aumenta gradualmente la risoluzione mediante operazioni di upsampling. L’obiettivo è ricostruire una mappa delle stesse dimensioni, o di dimensioni compatibili, con l’immagine originale, assegnando una classe a ogni pixel.

Durante la riduzione della risoluzione, tuttavia, alcune informazioni relative alla posizione degli oggetti, ai bordi e ai dettagli più piccoli possono andare perse. Per questo, architetture di segmentazione, come U-Net per esempio, utilizzano le skip connections, collegamenti diretti che trasferiscono al decoder le mappe delle caratteristiche generate nei corrispondenti livelli dell’encoder. Il decoder combina così:
  • le informazioni semantiche profonde, utili per capire che cosa è presente nell’immagine;
  • le informazioni spaziali ad alta risoluzione, utili per stabilire dove si trova ciascun elemento.
In termini semplici, l’encoder comprende il contenuto dell’immagine, mentre il decoder ricostruisce la posizione e l’estensione delle diverse classi. Tra le principali architetture per la segmentazione semantica figurano U-NetFCNSegNetDeepLabPSPNet e HRNet, che adottano strategie differenti per conservare i dettagli, recuperare la risoluzione e integrare il contesto locale e globale.

Queste reti trovano applicazione nella guida autonoma, nell’imaging medico, nell’agricoltura di precisione, nel telerilevamento e nell’ispezione industriale.


🔗 Riferimenti per approfondire:

TILLL / 🏠 Home / 🎓 Learning / ...

1. ... 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro; intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html; paragrafo  §8.6. Architetture specifiche per Segmentazione semantica

2. ... 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale;  Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html 

3.  ... 🧠 Intelligenza Artificiale (AI) / ⚙️ Applications (AI.8); Titolo: Le applicazioni dell’Intelligenza Artificialelink: https://tateoblog.blogspot.com/p/applications-ai8.html; 

Paragrafo: §5. Elaborazione di immagini. 
Paragrafo: §11.  Guida autonoma  (Autonomous Driving)

4. ... 🔧 Automazione (AU) / 🤖 Robotica (AU.9) / UAV (AU.9.8); Titolo: Veicoli autonomi aerei; Link: https://tateoblog.blogspot.com/2016/06/uav.html; Paragrafo: §5 Applicazioni dei droni

5. ...  👁️ Visione Artificiale (VS) / Applicazioni (VS.6); Titolo: Machine Vision: l'applicazione industriale della Visione ArtificialeLink: https://tateoblog.blogspot.com/2017/05/vs-10-machine-vision-la-visione.html; Paragrafo: §2. Artificial Vision industrial applications: the Machine Vision 


(c) Tateo’s Interdisciplinary & Lifelong Learning Lab (TILLL)
~~~~~~~~~~=======(   v.3   21/8 2026   )=====~~~~~~~~~~

venerdì 21 agosto 2026

🧠👁️ ResNet50: profondità efficace, by Microsoft Research

 TILLL / 🏠 HOME / ...
... ✍️ TateoBlog 👈 sei QUI
...🎓 Learning / 🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / architetture / classificazione / ResNet50 👈 sei QUI

#AI #ArtificialIntelligence #IntelligenzaArtificiale #deepLearning #CNN #visioneArtificiale #computerVision #classificatore #ResNet50 #TateoBlog #TILLL

ResNet50, sviluppata da Microsoft Research, è una delle reti neurali profonde più utilizzate al mondo per l’analisi delle immagini. Il suo successo deriva dalla capacità di mantenere elevate prestazioni anche con architetture molto profonde. Grazie alla sua efficienza e affidabilità, è oggi impiegata in numerosi settori, dalla diagnostica industriale alla guida autonoma, fino ai sistemi di ispezione automatica.

Se dovessimo descrivere ResNet50 con una metafora, potremmo paragonarla a un team di tecnici che si scambia continuamente informazioni per evitare che dati importanti vadano persi durante le successive fasi di elaborazione.

La caratteristica distintiva di ResNet50 è rappresentata dalle connessioni residue, o skip connections, che permettono all’informazione di oltrepassare alcuni livelli e di sommarsi al risultato delle elaborazioni successive. Questo meccanismo facilita la propagazione del gradiente e consente di addestrare reti più profonde limitando il problema del degrado delle prestazioni. Rispetto a VGG16, ResNet50 presenta una struttura più articolata, ma utilizza molti meno parametri grazie ai blocchi bottleneck e al global average pooling. È quindi preferibile quando sono richieste maggiore capacità di generalizzazioneefficienza e possibilità di riaddestramento mediante transfer learning, soprattutto per classificazione, riconoscimento di componenti, rilevamento di oggetti e ispezione automatica.

Le rappresentazioni residue profonde possono essere utilizzate non solo per la classificazione, ma anche come base per applicazioni di localizzazioneobject detection e segmentazione. ResNet50 costituisce pertanto un buon compromesso quando è necessario estrarre caratteristiche visive complesse senza raggiungere il peso computazionale e il numero di parametri tipici delle architetture VGG.

🔗 Riferimenti per approfondire:

TILLL / 🏠 Home / 🎓 Learning 

1. 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html 

2. 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale;  Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html 

🌐 Paper originale Deep Residual Learning for Image Recognition, Kaiming He et al. (Microsoft Research). https://arxiv.org/abs/1512.03385

🌐 Documentazione Keras, ResNet and ResNetV2 https://keras.io/api/applications/resnet/

🌐 Titolo: Deep Residual Learning for Image Recognition, Autore: Microsoft Research; Link: https://www.microsoft.com/en-us/research/publication/deep-residual-learning-for-image-recognition/ 

~~~~~~~~~~=======(   v.3  |  21/8 2026   )=====~~~~~~~~~~

giovedì 20 agosto 2026

🧠👁️ Come realizzare un classificatore di immagini

 TILLL / 🏠 HOME / ...
... ✍️ TateoBlog 👈 SEI QUI
 ... 🎓 Learning / 🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / architetture / classificazione / produzione 👈 SEI QUI

#AI #ArtificialIntelligence #IntelligenzaArtifiiciale #deepLearning #CNN #visioneArtifciale #computerVision #classificatore #TateoBlog #TILLL

Quando si parla di Intelligenza Artificiale, spesso si immagina che sia sufficiente fornire molte immagini a una rete neurale per ottenere automaticamente un classificatore accurato. La realtà è molto diversa.

Lo sviluppo di un sistema automatico di classificazione delle immagini è un processo ingegneristico iterativo, fatto di preparazione dei dati, addestramento, verifiche progressive, analisi degli errori e miglioramento continuo. In altre parole, il successo di un modello non dipende solamente dall'algoritmo utilizzato, ma dall'intero ciclo di sviluppo che lo accompagna.

L'infografica riassume le principali fasi di questo processo.

1. Tutto parte dal dataset

La qualità di un classificatore dipende innanzitutto dalla qualità dei dati utilizzati per costruirlo.

La prima fase consiste nella raccolta, preparazione e organizzazione delle immagini che costituiranno il dataset. I campioni vengono elaborati, verificati, classificati ed eventualmente rinominati secondo regole coerenti. Successivamente vengono suddivisi in tre insiemi distinti:

  • Training Set, utilizzato per addestrare il modello;
  • Validation Set, utilizzato per monitorare e ottimizzare l'addestramento;
  • Test Set, utilizzato esclusivamente per la valutazione finale.

Questa separazione è fondamentale: utilizzare gli stessi dati per addestrare e valutare il modello produrrebbe risultati ingannevolmente ottimistici.

2. Addestramento e validazione del classificatore

Una volta preparato il dataset, il modello viene addestrato utilizzando il Training Set.

Durante l'addestramento il Validation Set svolge un ruolo essenziale: permette di monitorare il comportamento della rete neurale e di individuare eventuali problemi come:

  • overfitting, quando il modello impara troppo bene i dati di addestramento ma fatica a generalizzare;
  • underfitting, quando il modello non riesce a catturare adeguatamente le caratteristiche del problema.

Per comprendere cosa sta accadendo vengono analizzati diversi indicatori:

  • accuracy plot;
  • loss plot;
  • heatmap di attenzione;
  • matrici di errore e metriche di classificazione.

Al termine di questa fase si ottiene il modello migliore tra quelli testati, ovvero il classificatore addestrato e validato.

3. Due livelli di verifica

Molte persone confondono validazione e test finale, ma si tratta di attività differenti.

Il modello selezionato viene infatti sottoposto a due verifiche successive.

Primo livello: valutazione offline sul Test Set

Il Test Set contiene immagini che il classificatore non ha mai visto durante addestramento e validazione.

Questa verifica rappresenta il primo vero test di generalizzazione del modello e consente di capire come il classificatore si comporterà su dati completamente nuovi.

È importante sottolineare che il Test Set non partecipa in alcun modo alla scelta del modello. Viene utilizzato solo dopo che tutte le decisioni di addestramento sono già state prese.

Secondo livello: test end-to-end nel processo reale

Un modello può ottenere ottimi risultati in laboratorio e mostrare prestazioni differenti una volta inserito nel processo operativo completo.

Per questo motivo il classificatore viene integrato nella pipeline applicativa finale e testato utilizzando dati grezzi rappresentativi del contesto reale.

In questa fase non si valuta soltanto la rete neurale, ma l'intera catena di elaborazione.

Le metriche diventano quindi più vicine agli obiettivi applicativi del sistema e consentono di misurare il reale valore prodotto dalla soluzione.

4. Le prestazioni sono sufficienti?

Al termine delle verifiche i risultati vengono confrontati con criteri minimi prestabiliti.

Se le prestazioni soddisfano i requisiti, il processo può considerarsi concluso.

Se invece i risultati non sono sufficienti, non è corretto limitarsi ad aggiungere nuove immagini al dataset. Occorre prima comprendere il motivo del problema.

Ed è qui che entra in gioco la fase successiva.

5. Analizzare gli errori per migliorare il sistema

La parte più interessante del processo è probabilmente l'analisi degli errori.

Prestazioni insufficienti possono dipendere da molte cause diverse:

  • dataset poco rappresentativo;
  • etichette errate;
  • classi sbilanciate;
  • assenza di particolari condizioni operative;
  • scelta dell'architettura neurale;
  • iperparametri non ottimali;
  • soglie decisionali inadeguate;
  • problemi nella pipeline applicativa.

Solo dopo aver identificato la causa reale è possibile definire un'azione correttiva efficace.

In alcuni casi sarà necessario tornare alla preparazione del dataset, in altri sarà sufficiente modificare l'architettura della rete o ripetere alcuni test.

La lezione più importante: l'Intelligenza Artificiale è un processo di apprendimento anche per chi la sviluppa

L'aspetto più interessante di questo ciclo è che non riguarda soltanto il modello.

Anche il team di sviluppo impara ad ogni iterazione.

Ogni errore individuato aumenta la comprensione del problema, ogni test fornisce nuove informazioni sui dati e ogni correzione migliora non solo il classificatore, ma anche la conoscenza del dominio applicativo.

Per questo motivo il vero valore di un progetto di Computer Vision non risiede esclusivamente nella rete neurale utilizzata, ma nella capacità di costruire un processo rigoroso di sperimentazione, misura e miglioramento continuo.

In fondo, proprio come accade nel lifelong learning, il successo non deriva dal raggiungere immediatamente il risultato perfetto, ma dalla capacità di imparare sistematicamente da ogni iterazione.

🔗 Riferimenti per approfondire:
 
TILLL / 🏠 Home / 🎓 Learning

1. 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html 

2. 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale;  Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html 

~~~~~~~~~~=======(   20/8 2026   )=====~~~~~~~~~~

🧠👁️ Principali applicazioni delle CNN nella visione artificiale

 TILLL / 🏠 HOME / ...
... ✍️ TateoBlog 👈 SEI QUI
 ... 🎓 Learning / 🧠 AI / Deep Learning / CNN / 👁️ visione artificiale / applicazioni 👈 SEI QUI

#AI #ArtificialIntelligence #DeepLearning #CNN #visioneArtificiale #ComputerVision #TateoBlog #TILLL

Le Reti Neurali Convoluzionali (CNN) rappresentano una delle tecnologie più importanti e versatili sviluppate nell'ambito dell'Intelligenza Artificiale. Sebbene siano spesso associate al riconoscimento delle immagini, il loro campo di applicazione è molto più ampio. Oggi le CNN costituiscono il motore di numerose applicazioni di Computer Vision, consentendo alle macchine non solo di identificare ciò che osservano, ma anche di localizzarlo, misurarlo, seguirne i movimenti nel tempo e persino migliorarne la rappresentazione visiva.

Le dodici applicazioni illustrate nella figura possono essere interpretate come dodici differenti modalità con cui una macchina può "comprendere" un'immagine.

(1) Classificazione delle immagini
La classificazione rappresenta la forma più semplice di comprensione visiva. Il sistema osserva l'immagine nel suo insieme e assegna un'etichetta che ne descrive il contenuto principale. Ad esempio, una fotografia può essere classificata come "cane", "gatto", "automobile" o "rotaia difettosa".
Domanda a cui risponde: Che cosa rappresenta l'immagine?
Output principale: Classe.
Esempio pratico: Classificazione di componenti ferroviari, riconoscimento di difetti o classificazione di specie animali.

(2) Object Detection
Il rilevamento degli oggetti aggiunge una nuova dimensione all'analisi: la localizzazione. Non basta più sapere che cosa è presente nell'immagine; occorre anche determinarne la posizione. Per questo motivo il sistema restituisce sia la classe dell'oggetto sia un rettangolo (bounding box) che ne indica la posizione.
Domanda a cui risponde: Che cosa è presente e dove?
Output principale: Classi e bounding box.
Esempio pratico: Rilevamento di veicoli, persone, segnali ferroviari o componenti dell'infrastruttura.
 
(3) Segmentazione Semantica
La segmentazione semantica porta il livello di comprensione dall'oggetto al singolo pixel. Ogni pixel dell'immagine viene classificato in una determinata categoria, consentendo di ottenere una mappa dettagliata della scena.
Domanda a cui risponde: A quale classe appartiene ogni pixel?
Output principale: Mappa delle classi.
Esempio pratico: Separazione automatica di rotaie, massicciata, traversine, vegetazione e manufatti ferroviari.
 
(4) Segmentazione delle Istanze
Quando nell'immagine sono presenti più oggetti appartenenti alla stessa categoria, è necessario distinguerli individualmente. La segmentazione delle istanze assegna quindi una maschera separata a ciascun oggetto rilevato.
Domanda a cui risponde: Quali oggetti sono presenti e quali pixel appartengono a ciascuno?
Output principale: Maschere separate.
Esempio pratico: Identificazione e separazione di singole persone, veicoli o componenti ferroviari simili.
 
(5) Localizzazione e Stima dei Punti Caratteristici
Molte applicazioni richiedono l'identificazione di punti di interesse specifici. Questa tecnica consente di individuare elementi caratteristici quali vertici, giunti, raccordi o articolazioni.
Domanda a cui risponde: Dove si trovano i punti caratteristici?
Output principale: Coordinate.
Esempio pratico: Individuazione di bulloni, attacchi ferroviari o articolazioni del corpo umano.
 
(6) Stima della Posa
Partendo dai punti caratteristici identificati, il sistema può determinare la posizione e l'orientamento spaziale di un oggetto. Si tratta di una funzione fondamentale nei sistemi di interazione uomo-macchina e nella robotica.
Domanda a cui risponde: Qual è la posizione e l'orientamento dell'oggetto?
Output principale: Posa 2D o 3D.
Esempio pratico: Analisi del movimento umano, robot collaborativi e veicoli autonomi.
 
(7) Stima di Proprietà Geometriche
Le CNN possono essere utilizzate come strumenti di misura. In questo caso l'obiettivo non è classificare o localizzare un oggetto, ma stimarne quantitativamente una caratteristica geometrica.
Domanda a cui risponde: Qual è il valore della grandezza osservata?
Output principale: Valore numerico.
Esempio pratico: Misura dell'usura di una rotaia, della lunghezza di una cricca o della distanza tra componenti.
 
(8) Stima della Profondità
Una delle applicazioni più avanzate consiste nella ricostruzione della dimensione tridimensionale della scena. Il sistema produce una mappa delle distanze che descrive quanto ogni punto dell'immagine sia distante dal sensore.
Domanda a cui risponde: Qual è la distanza degli elementi della scena rispetto al sistema di acquisizione?
Output principale: Mappa di profondità (depth map) o valori di distanza.
Esempio pratico: Guida autonoma, ricostruzione 3D di ambienti e navigazione robotica.
 
(9) Riconoscimento OCR
L'Optical Character Recognition (OCR) consente di trasformare testo presente in un'immagine in informazioni digitali immediatamente elaborabili da un computer.
Domanda a cui risponde: Quale testo, codice o sequenza di caratteri è presente nell'immagine?
Output principale: Testo, caratteri o numeri riconosciuti.
Esempio pratico: Lettura automatica di targhe, etichette, matricole o documenti tecnici.
 
(10) Rilevamento di Anomalie
In molte applicazioni industriali non è necessario sapere quale difetto sia presente, ma semplicemente stabilire se qualcosa si discosta dalla normalità. Le tecniche di anomaly detection sono progettate proprio per questo scopo.
Domanda a cui risponde: Il campione si discosta dalla normalità?
Output principale: Punteggio o mappa di anomalia.
Esempio pratico: Rilevamento automatico di difetti superficiali su rotaie, ruote, traversine o componenti meccanici.
 
(11) Object Tracking
Quando le immagini vengono acquisite nel tempo, ad esempio sotto forma di video, diventa possibile seguire il movimento degli oggetti all'interno della scena. L'object tracking mantiene l'identità dell'oggetto durante tutta la sequenza.
Domanda a cui risponde: Come si muove l'oggetto nel tempo?
Output principale: Identità e traiettoria.
Esempio pratico: Monitoraggio di veicoli, persone, treni o oggetti in movimento.
 
(12) Miglioramento e Ricostruzione delle Immagini
Le CNN non servono esclusivamente per interpretare le immagini. Possono anche migliorarne la qualità rimuovendo disturbi, aumentando la risoluzione o ricostruendo dettagli non chiaramente visibili.
Domanda a cui risponde: Come può essere migliorata l'immagine?
Output principale: Immagine elaborata.
Esempio pratico: Riduzione del rumore, incremento della risoluzione (super-resolution), correzione della sfocatura e restauro di immagini degradate.
 
Dall'identificazione alla comprensione completa della scena
Osservando l'insieme di queste dodici applicazioni emerge chiaramente come la moderna visione artificiale non si limiti a riconoscere oggetti. Una CNN può infatti classificare una scena, localizzarne gli elementi, segmentarli, misurarli, ricostruirne la geometria tridimensionale, seguirne l'evoluzione nel tempo e persino migliorare la qualità delle immagini disponibili.
In altre parole, le CNN rappresentano oggi una vera e propria piattaforma di elaborazione visiva che consente alle macchine di estrarre conoscenza dalle immagini con un livello di sofisticazione sempre più vicino a quello della percezione umana.

🔗 Riferimenti per approfondire:
 
TILLL / 🏠 Home / 🎓 Learning
1. 🧠 Intelligenza Artificiale (AI); Titolo: Come delegare alle macchine compiti che gli umani riescono a svolgere grazie alla loro intelligenza; Link: https://tateoblog.blogspot.com/p/artificial-intelligence.html 
2. 👁️ Visione Artificiale (VS); Titolo: La riproduzione della visione umana per mezzo di un sistema artificiale;  Link: https://tateoblog.blogspot.com/p/vs-visione-artificiale.html 

---------- 19/8 2026 ----------

Translate

🧠 Architetture CNN per la Visione Artificiale

  TILLL / 🏠 HOME / ... ... ✍️ TateoBlog / 11.09.2026 👈 sei qui. ... 🎓 Learning /   🧠 AI / Deep Learning / CNN / 👁️ visione ...

Most popular posts in the last week.