Un modello può riassumere, estrarre o rispondere solo a partire dalle informazioni che riceve. Nelle aziende, queste informazioni sono distribuite tra cartelle condivise, applicazioni aziendali, database, email, intranet e documenti PDF. Esse hanno versioni, diritti e proprietari diversi. Il progetto IA rivela quindi problemi di dati che esistevano già.
La preparazione non consiste nel pulire tutta l'impresa prima di iniziare. Consiste nel costruire, per un caso d'uso definito, una catena di dati conosciuta, autorizzata, misurabile e mantenibile.
Partire dal caso d'uso
Un assistente documentale, un estrattore di fatture e un agente che modifica gli ordini non hanno gli stessi bisogni. Bisogna precisare:
- compito;
- utenti;
- fonti necessarie;
- freschezza ;
- qualità minima;
- dati vietati ;
- decisione o azione ;
- prova attesa.
Questa precisazione limita l'inventario e evita una piattaforma di dati astratta senza risultato.
Costruire un inventario utilizzabile
Per ogni fonte, raccogliere:
- nome e sistema;
- proprietario del mestiere;
- responsabile tecnico;
- tipo e volume;
- formato ;
- frequenza di aggiornamento;
- livello di sensibilità;
- popolazione autorizzata;
- qualità conosciuta ;
- modalità di accesso ;
- regola di conservazione;
- statuto di riferimento.
L'inventario deve essere mantenuto. Un foglio bloccato all'inizio del progetto non garantisce che la fonte utilizzata sei mesi dopo rimanga legittima.
Le dieci dimensioni della preparazione
1. Inventario
Le risorse necessarie sono identificate e il loro ambito compreso.
2. Proprietà
Una persona o funzione può convalidare il senso, la qualità, l’accesso e la durata della vita.
3. Accesso
L'estrazione è autenticata, documentata e sostenibile. Non si basa su una copia manuale né su un account personale.
4. Qualità
I campi essenziali sono completi, coerenti e rappresentativi. I difetti sono misurati rispetto al compito.
5. Struttura
Titoli, sezioni, tabelle, relazioni e identificativi possono essere preservati o ricostruiti.
6. Metadati
Lingua, data, versione, stato, tipo, autore, entità e diritti accompagnano il contenuto.
7. Versione e freschezza
Il sistema sa quale versione è in vigore, quando è cambiata e quando l’IA deve essere aggiornata.
8. Diritti e privacy
Le autorizzazioni possono essere riprodotte nella catena IA e revocate.
9. Tracciabilità
Un'uscita può essere collegata alla sorgente, alla sua trasformazione e alla versione dei componenti.
10. Ciclo di vita
La correzione, l'archiviazione e la cancellazione si propagano fino agli indici, alle cache e ai registri.
Tracciabilità di un dato dalla sua origine fino al suo utilizzo da parte dell’IA e alla sua cancellazione propagata.
Qualità relativa al compito
Un dato non è «buono» in assoluto. Per ritrovare una procedura, il titolo, la data e lo stato sono essenziali. Per estrarre un importo, la qualità della scansione, la valuta e la struttura della tabella predominano.
Le dimensioni possono includere completezza, accuratezza, coerenza, unicità, freschezza e rappresentatività. Ogni difetto è collegato al suo impatto sul caso d'uso.
Un campione annotato permette di misurare prima di trattare tutto il corpus.
Distinguere riferimento, copia e bozza
Più versioni di un documento possono circolare. Il flusso di lavoro deve sapere quale fa fede, quali copie sono archiviate e se una bozza può essere utilizzata. La data da sola non basta: un documento recente potrebbe non essere approvato.
Le regole di precedenza sono codificate e verificabili. In caso di conflitto, il sistema segnala piuttosto che scegliere silenziosamente.
Preservare la struttura
Convertire un PDF in testo semplice può mescolare colonne, note e intestazioni. Le tabelle perdono le loro relazioni e i titoli la loro gerarchia. L'estrazione deve produrre un formato strutturato con una qualità misurata.
Per i documenti complessi, conservare:
- pagina e coordinate;
- titoli e livelli ;
- celle e intestazioni;
- liste;
- leggende;
- collegamenti;
- identificativo del file.
Questa struttura migliora la ricerca, le citazioni e il controllo umano.
Metadati e contesto
I metadati permettono di filtrare e spiegare: entità, prodotto, paese, lingua, data, versione, stato, categoria e diritti. Devono provenire da una fonte affidabile o da un'estrazione il cui livello di fiducia è mantenuto.
Una classificazione generata dal modello non ha lo stesso status di un campo convalidato dal business. La provenienza dell'arricchimento è registrata.
Riprodurre i diritti
Copiare documenti in un indice unico senza autorizzazioni crea una potenziale perdita. Il modello di autorizzazione deve essere compreso: utente, gruppo, azienda, cartella, sito, ruolo o attributo.
I diritti possono essere materializzati nei metadati di indice, delle partizioni o in una verifica su richiesta. Le modifiche e le cancellazioni si propagano entro un periodo definito.
Gli account tecnici hanno il minimo accesso e le estrazioni sono registrate.
Minimizzare i dati
Un progetto non deve ingerire un intero fascicolo « nel caso in cui ». Selezionare i campi e i documenti necessari riduce rischio, costo e rumore. I dati personali o segreti possono essere oscurati, pseudonimizzati o esclusi.
La minimizzazione riguarda anche i prompt, i log, i feedback e i giochi di valutazione. Gli ambienti di sviluppo utilizzano dati sintetici o protetti.
Tracciabilità end-to-end
Ogni frammento o registrazione deve poter essere collegato a:
- fonte e versione ;
- data di estrazione ;
- trasformazione ;
- strumento e versione ;
- regole di arricchimento;
- indice ;
- uscite che lo hanno citato quando necessario.
Questa catena permette di indagare su un errore e di ricostruire dopo un aggiornamento.
Gestire le cancellazioni
Eliminare nella fonte non basta. È necessario eliminare o invalidare le copie, gli indici vettoriali, le cache, i file temporanei e i backup secondo la politica. Le uscite storiche e i registri seguono una regola distinta definita con i responsabili.
La pipeline di cancellazione è testata come quella di acquisizione. Un identificatore stabile facilita la propagazione.
Misurare la freschezza
Il bisogno varia: una politica può tollerare un giorno, uno stock pochi minuti. La freschezza è monitorata per fonte e visibile all’utente quando influisce sulla risposta.
Gli eventi o le estrazioni periodiche devono gestire i fallimenti. Un avviso segnala un ritardo invece di continuare silenziosamente con dati vecchi.
Preparare un gioco di riferimento
Prima dell’IA, selezionare esempi rappresentativi e documentare il risultato atteso. Per l’estrazione: campi e valori. Per il RAG: domande e fonti. Per l’agente: stati e azioni autorizzate.
Questo gioco serve a confrontare pipeline, modelli e correzioni. Include casi difficili, incompleti e vietati.
Industrializzare l'ingestione
La pipeline è :
- idempotente ;
- versionato ;
- osservabile ;
- riprendibile ;
- testato ;
- sicuro;
- capace di trattare gli errori in modo isolato.
I cambiamenti di formato o di fonte attivano un avviso. Una dashboard mostra volume, errori, ritardo, duplicati e copertura.
Governance leggera ma reale
Una governance utile non richiede un comitato per ogni file. Essa definisce proprietari, classi, controlli e una procedura d’eccezione. Le decisioni importanti sono tracciabili.
Il catalogo dei dati può iniziare con l'ambito del progetto e ampliarsi con gli usi. Deve rimanere collegato ai sistemi, non diventare una documentazione parallela obsoleta.
Costruire un backlog di preparazione
Le azioni si suddividono spesso in tre orizzonti:
30 giorni
Inventario, accesso, campione, classificazione e primi test.
90 giorni
Pipeline riproducibile, metadati, diritti, qualità misurata e cancellazione.
Fondazioni
Riferimenti, governance, automazione, osservabilità e condivisione tra casi d’uso.
Il pilota può iniziare quando i rischi sono gestiti su un corpus limitato, senza aspettare la perfezione globale.
I dati come prodotto di fiducia
Un'IA affidabile dipende da dati il cui significato, proprietario, diritti e versione siano conosciuti. Questa preparazione beneficia anche la ricerca, l'analisi e le integrazioni classiche.
Partitech può auditare le fonti, progettare le pipeline, strutturare i metadati e integrare i diritti fino al RAG o all’agente. L’obiettivo è una catena tracciabile e mantenibile, non una copia massiva di documenti in un nuovo indice.
Parliamo del tuo progetto
Valutare la preparazione dei vostri dati per un progetto di IA con Partitech. Contatta Partitech.