Il 63% delle imprese non ha (o non è certa di avere) processi e pratiche affidabili di data management (gestione dei dati) specifici per lo sviluppo di progetti di intelligenza artificiale. Sono i risultati di un sondaggio effettuato da Gartner su oltre mille data management leader, che dimostra come anche le organizzazioni più mature, tanto da disporre di processi di data management, stanno trascurando un aspetto fondamentale: la peculiarità nel trattamento dei dati per la realizzazione di progetti di AI.
La previsione di Gartner è molto pessimistica: il 60% dei progetti di AI saranno abbandonati perché non supportati da dati di qualità.
Indice degli argomenti:
Perché molte imprese non curano la qualità dei propri dati (sbagliando)
Nei progetti di data analytics, business intelligence e intelligenza artificiale, le organizzazioni meno mature e consapevoli tendono a trascurare un aspetto fondamentale: l’importanza della qualità dei dati su cui si basano la costruzione di impianti di intelligence, lo sviluppo di applicazioni di ML e in definitiva l’utilità e la qualità stessa di applicazioni e decisioni prese basandosi su questi dati.
Frequente, per fretta e obiettivi di risparmio, è la richiesta di tagliare tout-court le fasi di esplorazione e pulizia dei dati, passando direttamente a quello che si ritiene sia la vera creazione di valore, ovvero lo sviluppo delle applicazioni o la creazione di cruscotti e reportistica.
Esiste una correlazione inversa tra la conoscenza reale dei propri dati e la loro qualità: meno questi sono conosciuti più sono sopravvalutati per completezza, qualità, significatività.
Un altro aspetto poco compreso è che i dati sono uno dei fattori differenzianti e qualificanti in questi progetti e tra i fattori con cui costruire un vantaggio competitivo. Nell’attuale generazione tecnologica dei modelli di intelligenza artificiale diventano davvero uno dei pochi fattori su cui costruire qualcosa di distintivo: gli stessi modelli LLM sono accessibili nella stessa forma a tutti; in pratica, da questo punto di vista, il loro utilizzo costituisce un punto di parità, non certo di differenziazione.
Occorre ribadire un concetto fondamentale: ogni progetto di intelligenza artificiale, analytics o automazione deve poggiare su un presupposto fondamentale, ovvero che i dati alla base siano corretti, completi e affidabili. Se manca questa certezza, il costo non è solo tecnico: un sistema decisionale basato su dati incompleti e di scarsa qualità genera scelte sbagliate.
Peggio ancora con sistemi ad elevata automazione: se basati su dati errati, amplificano in maniera incontrollata i loro effetti negativi su larga scala, a volte all’insaputa dei decisori stessi.
Cosa è la Data quality: una definizione
Esistono diverse definizioni di Data quality. Una delle più condivise l’ha data Danette McGilvray, secondo cui la data quality è “il grado in cui informazioni e dati possono essere una fonte affidabile per tutti gli utilizzi richiesti”.
Il Dama Dictionary of Data Management afferma, in maniera meno diretta, che si definisce qualità del dato “nel contesto di un utilizzo specifico, il grado in cui le informazioni soddisfano i requisiti e le aspettative per tale utilizzo”.
La gestione della qualità dei dati (Data Quality Management) è un programma non un progetto
Appare ora chiaro che, l’assenza di processi, procedure e competenze di gestione della qualità dei dati rendono impossibile non tanto avere dati di qualità, quanto avere la consapevolezza sul grado di qualità dei propri dati.
Proprio pe questa ragione, la principale associazione internazionale che si occupa di Data Management, ovvero DAMA International, dedica al Data Quality Management un intero capitolo del proprio corpus di conoscenze di riferimento, il DAMA Data Management Body of Knolwedge (DMBOK).
Secondo il DMBOK il Data Quality Management consiste nella “pianificazione, l’implementazione e il controllo delle attività che applicano tecniche di gestione della qualità ai dati, per garantire che siano adatti al consumo e soddisfino le esigenze di chi li utilizza”.
Come si vede, è una definizione che sposta l’attenzione da un concetto astratto di correttezza a uno molto più pragmatico: la qualità esiste in funzione dell’uso. Un indirizzo e-mail può essere perfettamente valido per il marketing e del tutto inadeguato per una comunicazione legale che richiede un recapito legalmente riconosciuto e tracciabile; oppure una stima approssimata degli investimenti di un progetto è perfettamente adatta a un’attività di budget, ma totalmente non coerente con le esigenze fiscali di tracciamento di investimenti, costi e ricavi.
Come ricorda il DMBOK stesso, la qualità dei dati è sinonimo di qualità dell’informazione: dati scadenti producono inevitabilmente informazioni imprecise e, a cascata, decisioni di business peggiori.
La gestione della qualità dei dati
Occorre anche sfatare un equivoco comune: come si diceva sopra, non avere un programma strutturato di Data Quality Management non equivale automaticamente ad avere dati di scarsa qualità. Ma senza una gestione consapevole, il livello di qualità resta sconosciuto e il rischio per l’organizzazione cresce silenziosamente, fino a un punto di rottura.
Occorre anzitutto precisare che la gestione della qualità dei dati non è un progetto pensato e attuato una volta per tutte, ma un programma continuo di gestione e cura della qualità dei dati, che va pianificata, misurata e migliorata in modo continuo, nel tempo.
Il DMBOK inquadra la gestione della qualità dei dati come un ciclo continuo che riprende i principi del Deming Cycle, ma li adatta al contesto specifico, definendo un ciclo in 4 fasi: Plan-Deploy-Monitor-Act.
- Plan (Pianificare): capire quali problemi sui dati sono critici per gli obiettivi di business, definire requisiti, dimensioni di qualità e regole applicabili.
- Deploy (Distribuire): eseguire la profilazione dei dati (data profiling), individuare le anomalie, risalire alle cause originarie di scarsa qualità e intervenire il più vicino possibile alla fonte del dato.
- Monitor (Monitorare): applicare controlli statistici continui, osservare l’andamento dei difetti e programmare le azioni correttive.
- Act (Agire): implementare i rimedi identificati e chiudere il ciclo.
Non si tratta, come si vede, di un progetto con una data di fine, ma di un processo strutturale che richiede un impegno continuativo e responsabilità chiare, attribuite a un team di Data Quality con il coinvolgimento di figure con ruoli specifici e formalizzati, come i Data Owner, i Data Steward, gli analisti di qualità.
Sono inoltre necessari strutture organizzative come il Data Quality Oversight Board che svolge un ruolo di controllo. Sono infine fondamentali regole di qualità formalizzate, strumenti e processi adeguati a garantire in maniera continuativa il monitoraggio e il miglioramento continuo della qualità dei dati.
Le dimensioni di qualità dei dati
Se garantire che i dati siano della qualità giusta per le diverse applicazioni, diventa fondamentale misurarne la qualità. Un contributo importante offerto dal DMBOK è proprio la formalizzazione di 11 dimensioni oggettive di qualità, che possono essere rilevate e valutate puntualmente. Rimandando al corpus di conoscenze di DAMA per i dettagli, si riportano nel seguito le dimensioni da considerare:
- accuratezza (accuracy);
- completezza (completeness);
- coerenza (consistency);
- attualità (currency);
- precisione (precision);
- privatezza (privacy);
- ragionevolezza (reasonableness);
- integrità referenziale (referential integrity);
- tempestività (timeliness);
- unicità (unicity);
- validità (validity).
Una volta definite le dimensioni di qualità, è possibile determinare quali sono le regole di qualità e le soglie che permettono di ponderare la qualità effettiva del dato disponibile, sempre pesando e calibrando questa valutazione rispetto allo specifico utilizzo.
Il concetto di qualità
È importante sottolineare si ottengono dati di qualità attraverso un percorso e azioni che richiedono investimenti e costi operativi ed economici. Sforzi che hanno, come contropartita, la fiducia e l’affidamento che si può fare sui dati trattati in maniera adeguata.
Il concetto di qualità è molto ampio. Anzitutto, un dato deve essere corretto sintatticamente, ovvero rappresentato nell’unità di misura corretta e all’interno dell’intervallo possibile dei valori. Si tratta in questo caso di un dato valido. Pre-condizione fondamentale, ma che non assicura una vera utilizzabilità a livello business. Occorrono ulteriori investimenti per raggiungere la validità semantica, ovvero un dato che rappresenta correttamente il fenomeno che lo ha generato: è questo il passaggio dalla validità (validity) all’accuratezza (accuracy).
La misurazione della qualità: Data Quality Indicators (DQIs)
Le regole di qualità così definite devono essere misurate attraverso diverse tipologie di controlli. Per farlo occorre definire gli indicatori di qualità che possono essere misurati in maniera coerente nel tempo. I Data Quality Indicators (DQIs) per essere utili ed efficaci devono possedere 6 caratteristiche, sintetizzate dall’acronimo TARMAC, ovvero:
- T: tracciabilità (trackability);
- A: accettabilità (acceptability);
- R: rilevanza (relevance);
- M: misurabilità (measurability);
- A: accountability / stewardship;
- C: controllabilità (controllability).
La correzione degli errori: data cleansing
Quando l’attività di controllo rileva degli errori, si deve correggerli.
Non tutti gli errori sono uguali, in termini di complessità e di rilevanza e impatti. Importante sottolineare che la correzione degli errori rappresenta un costo e che è irrealistico porsi come obiettivo il raggiungimento di zero errori. Non è neppure la minimizzazione degli errori l’obiettivo complessivo, quanto la minimizzazione della somma del costo sofferto dal business a causa degli errori e del costo di correzione degli errori stessi. In altre parole: anche se è teoricamente possibile ottenere un’ulteriore riduzione degli errori e con questa la diminuzione ulteriore del costo associato, se lo si fa al prezzo di una crescita dei costi complessivi (costo errore + costo di correzione), si commette un errore. Meglio “accontentarsi” di un risultato meno accurato ma complessivamente meno costoso.
La minimizzazione del costo della correzione degli errori passa anche per l’utilizzo di automazioni, che riducano l’intervento umano, per definizione il più costoso quando si parla di data cleansing. Per questo motivo, si adottano procedure automatizzate di correzioni in tutti i casi privi di ambiguità e che non necessitano il controllo umano. Si adotta un approccio manuale, all’opposto, in tutti i casi più complessi e in cui il costo e il rischio associati a un’eventuale correzione sbagliata sono molto alti.
Esistono, nel mezzo, casi in cui gli errori sono individuati e corretti automaticamente, ma il valore modificato necessita dell’approvazione umana. In pratica, l’applicazione di una sorta di human-in-the-loop.
Strumenti e tecniche al servizio del Data Quality Management
Per garantire la qualità dei dati, le organizzazioni fanno una serie di attività, quali: la profilazione dei dati (data profiling), la standardizzazione, trasformazione, la risoluzione dell’identità (identity resolution), l’arricchimento (enrichment), ecc.
Molto utili risultano essere poi i data glossary, i cruscotti di monitoraggio, gli strumenti di analisi statistiche e visualizzazione in generale.
Tra tutte le tecniche, una delle più rilevanti è la Root Cause Analysis (RCA). La sua importanza risiede nel suo obiettivo: andando alla ricerca dell’origine prima dell’errore, permette non solo di correggere l’errore nella singola istanza, ma di eliminarlo anche gli utilizzi futuri.
Conclusioni
Come si è visto e dimostrato, la qualità dei dati è fondamentale. Ma soprattutto, è fondamentale conoscere la qualità dei propri dati. Cosa possibile solo se si sono adottate procedure di Data Quality Management e, parallelamente, costruite competenze e strutture organizzative e di governance, mettendo a disposizione di gruppi di lavoro e figure professionali codificate e riconosciute strumenti, tecnologie e supporto organizzativo.
Riferimenti bibliografici
- Gartner, “Lack of AI-Ready Data Puts AI Projects at Risk”, 26 febbraio 2025: https://www.gartner.com/en/newsroom/press-releases/2025-02-26-lack-of-ai-ready-data-puts-ai-projects-at-risk
- McGilvray, Danette. Executing Data Quality Projects: Ten Steps to Quality Data and Trusted Information. Morgan Kaufmann, 2008, p. 52.
- Dama Dictionary of Data Management: https://dama.org/learning-resources/dama-dictionary-of-data-management/
- DAMA International: https://dama.org/
- DAMA DMBOK: https://dama.org/learning-resources/dama-data-management-body-of-knowledge-dmbok/#






Partecipa alla community