[nonimo]
IT
Scarica

Rimuovere i metadati da Word e PDF prima di usarli con l'IA

· Scritto e aggiornato da Nonimo

Rimuovere i metadati da un Word o da un PDF, prima di caricarlo in ChatGPT o in un altro assistente, significa togliere quello che il file racconta senza mostrarlo: chi lo ha scritto, chi lo ha salvato per ultimo, lo studio, il modello da cui è partito, le date, e perfino il punto in cui è stata scattata una foto incollata dentro. La pagina può essere pulita e il file no.

Questa guida mostra che cosa c’è, su un Word e su un PDF di prova con dati inventati, come si legge in pochi secondi con strumenti gratuiti e come si toglie con Word e con Acrobat, nei menu italiani. Poi spiega perché conta proprio quando il documento finisce in ChatGPT, in Claude o in Copilot.

Due confini, per non ripetere le guide vicine. L’elenco completo di ciò che viaggia con un allegato, nome del file compreso, è riassunto nella guida su cosa si porta dietro un allegato in chat. E il nero sul testo di un PDF, che copre senza cancellare, ha la sua guida per oscurare un PDF.

Rimuovere i metadati prima di aprire la chat: quello che il file dice senza mostrarlo

I metadati sono dati sul documento, non nel documento. Li scrive quasi sempre il programma da solo: il nome dell’utente a cui è intestata la licenza di Word diventa l’autore, l’ultima persona che preme Salva diventa l’ultimo a modificare, l’orologio del computer diventa la data di creazione. Nessuno li digita, e per questo nessuno li rilegge.

In pratica la risposta sta in quattro gesti, che la guida sviluppa uno per uno:

  1. Lavora su una copia. Il documento originale non si tocca e tiene i suoi metadati; all’assistente va un file preparato apposta.
  2. Pulisci il Word prima di esportarlo. Autore, titolo e parole chiave passano dal Word al PDF, e toglierli a monte evita di toglierli due volte.
  3. Guarda le immagini a parte. Le foto hanno metadati propri, anche quella della patente da inviare, e gli strumenti di pulizia dei documenti non sempre li considerano.
  4. Verifica sul file, non sulla finestra. Una finestra delle proprietà mostra alcuni campi, non tutti.

Il motivo per farlo è semplice. Se il testo è stato ripulito con cura e il titolo del file dice «Diffida Casagrande», il lavoro fatto sul testo si annulla in una riga. Chi lavora negli studi legali lo sa bene: spesso nomi dei file e titoli dei documenti seguono il cognome del cliente, perché è così che si ritrovano in archivio.

Dentro un .docx oltre al testo: autore, azienda, modello e percorsi

Sotto la pagina, un .docx è un pacchetto compresso, come uno .zip. Lo stabilisce lo standard su cui è costruito il formato, che dedica una parte intera a come i pezzi del documento stanno insieme in un unico pacchetto. Dentro ci sono file separati per il testo, per gli stili, per le immagini e, in una cartella che si chiama docProps, per le proprietà.

Per vedere che cosa c’è abbiamo preparato una lettera di tre righe con dati inventati: una cliente, Ornella Casagrande, una ditta, Idraulica Esempio S.r.l., e un’avvocata, Marta Gandolfetti, che la scrive. Sono nomi inventati per questa prova. Nel corpo della lettera compare solo il nome della cliente, una volta. Nelle proprietà, invece, 10 campi contenevano un nome, lo studio o il numero di pratica.

CampoDove sta nel fileChe cosa c’era nella prova
Autore, ultimo a modificaredocProps/core.xmlMarta Gandolfetti, Tommaso Garbuglia
Titolo, oggetto, parole chiavedocProps/core.xmlcognome della cliente e numero di pratica
Date di creazione e modifica, revisionedocProps/core.xml14 e 21 settembre, revisione 7
Azienda, responsabiledocProps/app.xmlStudio Legale Gandolfetti e Associati
ModellodocProps/app.xmlStudio Gandolfetti - Atti.dotm
Base dei collegamentidocProps/app.xmlun percorso di rete con la cartella Casagrande
Proprietà personalizzatadocProps/custom.xmlCliente: Casagrande Ornella

Fonte: nostra prova del 28 settembre 2026, file .docx con dati inventati letto parte per parte.

I campi che si riempiono da soli

Autore, ultimo salvataggio, date e numero di revisione non li scrive nessuno di proposito. Microsoft, nella sua pagina italiana sulle proprietà, li descrive come informazioni gestite automaticamente dai programmi, per esempio il nome della persona che ha salvato il documento più di recente e la data di creazione. Sono i campi più affidabili per risalire a chi ha lavorato su una pratica, e i più dimenticati.

La revisione 7 e il tempo di modifica totale, 94 minuti nel file di prova, sembrano innocui. Messi accanto alle date, però, raccontano quanto lavoro c’è dietro un atto e in quali giorni è stato fatto, cosa che in una trattativa può interessare alla controparte.

C’è poi un nome che nella lettera non compare mai. Nella prova l’ultimo a salvare il file è Tommaso Garbuglia, un collaboratore inventato che non firma e non viene citato. Sulla pagina non esiste; nelle proprietà sì, con giorno e ora. È il caso tipico del praticante o della segretaria che sistema l’impaginazione prima dell’invio, e che finisce così dentro ogni copia del documento, compresa quella che parte verso un assistente.

Il modello e il percorso di rete

Il campo che sorprende di più è il modello. Molti uffici hanno un modello per ogni tipo di atto, e lo chiamano con il nome dello studio o, peggio, con quello del cliente per cui è stato preparato la prima volta. Ogni documento nato da lì se lo porta dietro nelle proprietà estese.

Accanto c’è un campo che quasi nessuno conosce, la base dei collegamenti ipertestuali. Se qualcuno l’ha impostata, contiene un percorso, e nella prova quel percorso portava a una cartella del server intestata alla cliente. Per i commercialisti, che lavorano per cartelle intestate al cliente sul server dello studio, è un’abitudine comune.

Le foto nel documento: EXIF, coordinate GPS e il telefono che le ha scattate

Nella lettera di prova abbiamo inserito una foto, come si fa con un sopralluogo, un danno da documentare o la foto della patente. La foto è un file a sé, dentro la cartella media del .docx, e ha i suoi metadati nel formato EXIF, lo standard che le fotocamere usano da decenni per scrivere dentro l’immagine come e dove è stata scattata.

Letta con una libreria gratuita, la foto nel file di prova restituiva marca e modello della fotocamera, il programma, la data e l’ora dello scatto, il 14 settembre 2026 alle 10:42, e due coordinate. Le coordinate indicavano un punto di Padova scelto per la prova, 45,40780 nord e 11,87400 est. In un sopralluogo vero indicherebbero il portone del cliente; nella foto di una carta d’identità, spesso casa tua.

Rimuovere i metadati: che cosa porta con sé una foto dentro un file Word A sinistra la pagina del documento Word con la lettera e una fotografia. A destra i dati EXIF letti dalla stessa fotografia dentro il file: marca, modello, data e ora dello scatto, latitudine e longitudine. Quello che vedi Quello che la foto contiene Gentile signora Casagrande, le invio la foto del sopralluogo e la bozza della diffida. foto del sopralluogo Marca: Fotocamera di prova Modello: Modello X1 Scatto: 14 settembre 2026 ore 10:42 Latitudine: 45,40780 N Longitudine: 11,87400 E letti dal .docx, senza aprire Word
La foto del file di prova e i suoi dati EXIF, letti dentro il .docx. Dati inventati, 28 settembre 2026

Perché Controllo documento non basta per le immagini

Microsoft pubblica l’elenco di quello che Controllo documento trova e rimuove in Word: commenti, revisioni, versioni, proprietà del documento e informazioni personali, intestazioni e piè di pagina, testo nascosto, dati XML personalizzati, contenuto invisibile. I metadati EXIF delle immagini inserite non compaiono in quell’elenco.

Non vuol dire che restino per forza: dipende da come la foto è entrata nel documento e da che cosa ne fa il programma. Vuol dire che non puoi darlo per scontato. Chi lavora con fotografie tutti i giorni, come nelle agenzie immobiliari o fra i broker assicurativi che documentano un sinistro, fa prima a inserire una copia della foto già ripulita, oppure uno screenshot della sola parte che serve.

Quando la foto va caricata da sola in una chat, quello che i fornitori dicono dei suoi metadati è nella guida sulle foto caricate su ChatGPT.

I metadati di un PDF stanno in due posti: il dizionario Info e l’XMP

Un PDF ha due modi di descrivere se stesso. Il più vecchio è un piccolo dizionario con titolo, autore, oggetto, parole chiave, programma di origine e date. Il più recente è un blocco XMP, un pezzo di testo strutturato che può ripetere gli stessi campi e aggiungerne altri. Molti PDF li hanno tutti e due, e non sempre dicono la stessa cosa.

Abbiamo costruito un PDF di prova con gli stessi dati della lettera, e scritto i metadati in entrambi i posti. Poi abbiamo fatto quello che fa chi pulisce in fretta: abbiamo svuotato autore, titolo, oggetto e parole chiave nel dizionario, cioè i campi che mostra una normale finestra delle proprietà, e abbiamo letto di nuovo il file.

Metadati di un PDF: il dizionario svuotato e il blocco XMP che resta Due riquadri affiancati dello stesso PDF di prova dopo una pulizia a metà. A sinistra il dizionario delle informazioni, con autore, titolo e parole chiave vuoti. A destra il blocco XMP, che contiene ancora il nome dell'autrice, il titolo con il cognome della cliente e la data di creazione. Dizionario Info, svuotato Blocco XMP, stesso file Autore: (vuoto) Titolo: (vuoto) Parole chiave: (vuoto) Oggetto: (vuoto) Autore: Marta Gandolfetti Titolo: Diffida Casagrande c. Idraulica Esempio Creato: 14 settembre 2026 la finestra delle proprietà mostra la colonna di sinistra
Il PDF di prova dopo aver svuotato solo il dizionario Info. Letto con pypdf e PyMuPDF, 28 settembre 2026

Due librerie diverse, pypdf e PyMuPDF, hanno dato lo stesso risultato: nel dizionario i campi erano vuoti, nel blocco XMP c’erano ancora l’autrice, il titolo con il cognome della cliente e la data di creazione. Chi guarda le proprietà del file conclude che è pulito, e un programma che legge l’XMP trova tutto.

Il PDF eredita dal Word

La maggior parte dei PDF di ufficio nasce da un Word, e i campi passano da uno all’altro con l’esportazione. Il PDF dell’AgID che vedremo più avanti lo mostra da solo: nelle sue proprietà ci sono autore, commenti e parole chiave che con ogni probabilità arrivano dal Word di partenza, e il programma di origine è dichiarato come un componente di Acrobat per Word.

Per questo l’ordine conta. Si pulisce il Word, poi si esporta, poi si controlla il PDF. Un rogito che in uno studio notarile passa per tre bozze e due esportazioni porta nel PDF finale le proprietà dell’ultima bozza, non quelle che ti aspetti. Se nel PDF c’è anche del testo coperto con un riquadro, quello è un problema diverso, che riguarda la pagina e non le proprietà, e si affronta togliendo il testo sotto il nero.

ChatGPT e i metadati: che cosa dice OpenAI dell’estrazione

Si potrebbe pensare che un assistente legga il testo e ignori il resto. Per ChatGPT non serve supporlo, perché lo scrive OpenAI nella sua guida ai caricamenti di file. Fra gli esempi di che cosa si può chiedere a un documento, nella parte sull’estrazione, c’è proprio questo:

OpenAI Help Center, File Uploads FAQ, esempi di estrazione «Extract metadata (author, creation date, etc.) from a document.»

Cioè: estrarre i metadati di un documento, come autore e data di creazione. E nella parte sull’analisi dei dati la stessa guida aggiunge che, per alcune attività, ChatGPT scrive ed esegue codice Python. Un programma in Python apre un .docx o un PDF come abbiamo fatto noi, e legge core.xml, app.xml, il blocco XMP e i dati EXIF con poche righe. Da un .xlsx, allo stesso modo, legge anche i fogli che avevi nascosto.

Che cosa cambia per chi carica documenti di lavoro

Cambia il modo di pensare ai metadati. Non sono più un dettaglio tecnico che vede solo chi apre le proprietà: sono testo a disposizione dell’assistente, che può riportarlo in una risposta, usarlo per un riassunto o conservarlo con il resto del file, secondo le regole del servizio e del piano.

Quelle regole cambiano parecchio da un fornitore all’altro, e fra un account privato e uno di lavoro. Per OpenAI sono raccolte in una guida dedicata a ChatGPT; per gli altri due assistenti più usati negli uffici, in quelle su Claude e i dati e su Copilot di Microsoft. La regola pratica non dipende da quale scegli: quello che non deve arrivare al fornitore si toglie prima.

In Italia i metadati sono anche un obbligo: l’Allegato 5 dell’AgID

C’è un motivo tutto italiano per non togliere i metadati alla cieca. Le linee guida dell’AgID sulla formazione, gestione e conservazione dei documenti informatici hanno un allegato, il numero 5, dedicato proprio ai metadati. Per il documento informatico e per quello amministrativo fissano un insieme di campi, con la loro obbligatorietà, e fra questi c’è il metadato Soggetti.

Per quel metadato l’allegato scrive che è obbligatorio indicare almeno l’autore o il mittente. Chi forma e conserva documenti secondo quelle linee guida, come un ente pubblico, deve quindi tenere quei dati attaccati al documento conservato. Il lato dei Comuni, dove documenti e intelligenza artificiale si incontrano ogni giorno, ha una sua guida per le amministrazioni comunali.

Il PDF dell’allegato e le sue proprietà

Abbiamo scaricato l’Allegato 5 dal sito dell’AgID il 28 settembre 2026 e ne abbiamo letto le proprietà. Il documento sui metadati porta i suoi: autore «Agenzai per l’Italia Digitale», con un refuso, commenti e parole chiave coerenti con il contenuto, il programma di origine indicato come Acrobat PDFMaker 21 per Word e una data di creazione del 12 maggio 2021.

Documento dei requisiti - Bilancio
è l'oggetto scritto nelle proprietà del PDF dell'AgID sui metadati. Letto con pypdf il 28 settembre 2026

Il campo oggetto, invece, dice «Documento dei requisiti - Bilancio», che con un allegato sui metadati non c’entra. Da dove venga non lo sappiamo; sembra il residuo di un altro documento o del modello da cui questo è partito. Non c’è niente di riservato, ma è l’esempio perfetto di come un campo sopravviva a chi lo ha scritto e finisca in un file pubblicato da chi i metadati li conosce meglio di tutti.

Due documenti diversi, due regole diverse

La conciliazione è semplice. Il documento conservato resta intatto, con i metadati che la norma richiede. Quello che prepari per l’assistente è una copia, con uno scopo diverso, che non entra nel sistema di conservazione e da cui si toglie tutto ciò che all’assistente non serve.

Nella pratica aiuta dare alla copia un nome neutro fin dall’inizio, per esempio con la data e un numero, e tenerla in una cartella separata da quella della pratica. Così non si rischia di rimettere in conservazione il file ripulito al posto dell’originale, né di caricare per errore l’originale al posto della copia. Sono due sbagli opposti, e capitano per lo stesso motivo: due file quasi uguali, con lo stesso nome, nella stessa cartella.

Un’ultima nota, per evitare confusioni. Metadati e Garante, messi insieme, fanno pensare ai log della posta elettronica e al documento di indirizzo del giugno 2024: è un altro tema, e la differenza la chiarisce la guida sugli allegati da mandare in chat.

Come rimuovere i metadati da Word: Controllo documento e proprietà

In Word lo strumento principale si chiama Controllo documento. Microsoft, nel suo supporto in italiano, elenca questi passaggi, e raccomanda di usarlo su una copia, perché non sempre si possono recuperare i dati rimossi:

  1. Apri il documento e, con File e Salva con nome, crea una copia dal nome diverso. Da qui in poi lavori sulla copia.
  2. In File scegli Informazioni, poi Verifica documento, che in alcune versioni si chiama Verifica della presenza di problemi, e infine Controlla documento.
  3. Lascia spuntate le caselle che ti interessano, almeno Proprietà del documento e informazioni personali, e premi Controlla.
  4. Accanto a ogni risultato che vuoi eliminare premi Rimuovi tutto, poi Chiudi.
  5. Salva la copia e riaprila, per controllare che cosa è rimasto.

Microsoft precisa che la voce Proprietà del documento e informazioni personali comprende le schede Riepilogo, Statistiche e Personalizza della finestra delle proprietà, il nome utente e il nome modello. È quindi la voce che riguarda autore, titolo, azienda, modello e proprietà personalizzate come quelli della prova. Revisioni e commenti hanno una voce loro, ma Microsoft propone Controllo documento come verifica finale, dopo averli chiusi a mano, come spiega la guida per eliminare revisioni e commenti in Word.

Le proprietà una per una

Se preferisci vedere che cosa togli, puoi farlo campo per campo. In File, Informazioni, la colonna di destra mostra le proprietà principali; per alcune, come l’autore, Microsoft indica di fare clic con il pulsante destro e scegliere Rimuovi. Con Proprietà e poi Proprietà avanzate si apre la finestra completa, dove nella scheda Riepilogo stanno titolo, oggetto, autore, responsabile, azienda, categoria, parole chiave e commenti.

Questo sistema ha un limite: vedi solo i campi che la finestra mostra. La base dei collegamenti ipertestuali, che nella prova conteneva il percorso della cartella, non compare nell’elenco di Microsoft di ciò che Controllo documento trova, quindi dopo la pulizia vale la pena guardare anche lì. Le revisioni e i commenti, che portano nomi e date dentro il corpo del file, sono un capitolo a parte e si trattano prima, accettando le prime ed eliminando i secondi.

L’opzione che pulisce a ogni salvataggio

Nel Centro protezione di Office c’è un’impostazione che Microsoft descrive nella pagina sulle opzioni di privacy: Rimuovi le informazioni personali dalle proprietà del file al momento del salvataggio. In Word è disattivata per impostazione predefinita, e si attiva documento per documento. In LibreOffice ce n’è una quasi omonima, che però per ripulire un documento .odt di Writer non basta: sostituisce i nomi degli autori e lascia intatto il testo dei commenti.

Utile per un modello che gira in tutto lo studio, meno come abitudine generale, perché si dimentica facilmente di averla accesa o spenta. Se in ufficio i documenti li prepara più di una persona, conviene scrivere quale delle due strade si segue, e dove, nella regola interna sull’uso dell’IA.

Come rimuovere i metadati da un PDF con Acrobat e senza

In Acrobat Pro la pulizia dei metadati è legata allo strumento Redigi un PDF. Nel tutorial in italiano di Adobe, dopo aver contrassegnato e applicato le redazioni con Applica, la finestra successiva propone Continua per eliminare le informazioni nascoste, e Adobe spiega che fra quelle informazioni non visibili ci sono commenti, metadati e livelli nascosti. Il risultato viene salvato in un nuovo file.

Il passaggio va fatto anche quando nel testo non c’è niente da oscurare. Se il tuo obiettivo sono solo i metadati, è comunque la strada più completa che Acrobat offre, perché lavora sul file intero e non su una finestra di campi. Dopo, il file nuovo si controlla come descritto più sotto.

StradaChe cosa toglieA che cosa stare attenti
Acrobat Pro, Redigi un PDF e poi Continuainformazioni nascoste, metadati compresirichiede Acrobat Pro, Premium o Studio
Svuotare i campi nelle proprietàsolo i campi mostratinella prova il blocco XMP è rimasto intero
PDF nuovo con il solo testotutto ciò che non è testosi perdono impaginazione, tabelle e immagini
Pulire il Word e poi esportarei metadati prima che nascano nel PDFvale solo se il Word ce l’hai

Fonti: Adobe, tutorial «Rimuovi informazioni riservate», per la prima riga; nostra prova del 28 settembre 2026 per la seconda e la terza.

Il PDF rifatto da zero

La strada più radicale è non conservare il PDF di partenza. Nella prova abbiamo estratto il testo dal PDF con i metadati e l’abbiamo scritto in un PDF nuovo. Il file ottenuto non aveva nessun blocco XMP, e nel dizionario solo i valori generici che la libreria mette da sé, senza autrice, senza cliente, senza date del 14 settembre.

Il prezzo è l’aspetto: tabelle, loghi e impaginazione spariscono. Per un assistente a cui chiedi di riassumere o di rispondere a una domanda sul contenuto, di solito non è un problema. Per i documenti sanitari, dove intestazione e piè di pagina ripetono i dati del paziente, è anzi un vantaggio, e lo sa chi lavora negli studi medici.

Come verificare che i metadati siano spariti: proprietà e archivio

La verifica è la parte che quasi tutti saltano, ed è quella che la prova giustifica di più. Una finestra delle proprietà vuota non dimostra che il file sia vuoto.

Per un Word la verifica si fa in due tempi. Prima riapri la copia e guarda File, Informazioni, e le proprietà avanzate: autore, ultimo salvataggio, azienda e modello devono essere vuoti o generici. Poi, se vuoi andare fino in fondo, fai una copia del file, cambiale l’estensione da .docx a .zip e aprila come una cartella. Con un .pptx lo stesso trucco mostra anche le cartelle delle note e dei commenti.

Che cosa cercare nell’archivio

Dentro la cartella docProps trovi i tre file della prova: core.xml, app.xml e, se esiste, custom.xml. Si aprono con il Blocco note e si leggono. Cerca il cognome del cliente, il nome dello studio e il nome del modello; poi apri la cartella word, sottocartella media, e guarda quante immagini ci sono. Nella prova, in docProps, c’era anche una miniatura ereditata dal modello da cui era partito il file, che nessuno aveva chiesto.

Per un PDF il gesto equivalente è leggerlo con un programma che mostri anche l’XMP, oppure aprirlo con un editor di testo e cercare il cognome: nei PDF non compressi il blocco XMP è testo leggibile. Se il cognome compare, il file non è pronto.

10campi delle proprietà del Word con un nome, lo studio o la pratica
2coordinate GPS nella foto inserita
1blocco XMP rimasto dopo la pulizia a metà
Nostra prova su un Word e un PDF con dati inventati, 28 settembre 2026

Tutto questo richiede pochi minuti a documento. Se i documenti che escono verso un assistente sono decine al giorno, la verifica non può dipendere dalla memoria di chi li carica: per impostarla in un ufficio c’è la sezione dedicata alle organizzazioni, mentre che cosa rischia chi sbaglia è nella guida sul GDPR e l’intelligenza artificiale.

Nonimo con un Word o un PDF: il testo coperto e la copia

L’app di Nonimo tratta il testo. Trascini il file nella sua finestra e si apre un’anteprima del testo con nomi e codici sostituiti da etichette: da lì lo copi per incollarlo nell’assistente o scarichi una copia coperta del file.

Nella copia di un Word autore, ultimo salvataggio, azienda e responsabile vengono svuotati; titolo, oggetto, descrizione, parole chiave, categoria e proprietà personalizzate vengono coperti; spariscono miniatura e dati XML personalizzati, e le immagini escono senza EXIF. Un PDF torna come un PDF nuovo con il solo testo, senza i metadati dell’originale.

Questo è il testo della lettera di prova, prima e dopo Nonimo:

PRIMA
Oggetto: pratica 2026/0318, infiltrazioni al secondo piano
Gentile signora Ornella Casagrande,
le invio la foto scattata durante il sopralluogo del 14 settembre
e la bozza della diffida a Idraulica Esempio S.r.l.
La signora Casagrande può rispondermi a marta.gandolfetti@example.com.

DOPO (Nonimo)
Oggetto: pratica [RIFERIMENTO_1], infiltrazioni al secondo piano
Gentile signora [PERSONA_1],
le invio la foto scattata durante il sopralluogo del 14 settembre
e la bozza della diffida a [AZIENDA_1]
La signora [PERSONA_2] può rispondermi a [EMAIL_1].

Per nome del modello e date basta un passaggio di Controllo documento. Che cosa conserva l’app sul computer, e che cosa ne esce, lo spiega la sezione sicurezza.

La regola da tenere: il file parla anche quando la pagina tace

Rimuovere i metadati non è un gesto da esperti. È lo stesso controllo che faresti su una busta prima di spedirla, guardando il mittente oltre alla lettera. La differenza è che la busta di un file non si vede, e va aperta apposta.

Le revisioni, i commenti e il testo nascosto dentro il corpo di un Word sono un altro strato ancora, che si toglie con i comandi di revisione prima di tutto il resto. E quello che resta nel testo, nomi e codici, è la parte che richiede più attenzione: sostituirli con segnaposto e tenere da parte la chiave per tornare indietro è pseudonimizzazione, e i dati restano personali: il perché lo trovi nella guida sulla pseudonimizzazione.

La regola breve sta in una riga: prima di caricare un file, guarda chi dice di essere, oltre a che cosa dice. Il resto, cioè quali campi e quali voci di un documento italiano meritano attenzione, lo trovi nella guida su quali dati anonimizzare in un documento.

Fonti

Nonimo è il software che lo fa sul tuo computer: maschera i nomi dei clienti e i codici prima che il testo arrivi a ChatGPT. Senza account, e con l’app i dati dei tuoi clienti non escono dal tuo computer.

Domande frequenti

Come rimuovere i metadati da un file Word prima di caricarlo in un'IA?

Si lavora su una copia. In Word si apre File, Informazioni, Verifica documento, Controlla documento, si spunta Proprietà del documento e informazioni personali e si sceglie Rimuovi tutto. Poi si guardano le proprietà avanzate e le immagini inserite, che Controllo documento non elenca fra ciò che trova. L'app di Nonimo, se la usi, ti dà anche una copia del Word con autore e azienda svuotati.

Quali metadati contiene un PDF e come si leggono?

Di solito titolo, autore, oggetto, parole chiave, programma di origine e date di creazione e modifica. Stanno in due posti: il dizionario delle informazioni del documento, che mostra la finestra delle proprietà, e un blocco XMP, che molti visualizzatori non fanno vedere. Nella prova di questa guida una libreria gratuita li ha letti tutti e due senza nemmeno aprire la pagina.

Cancellare l'autore dalle proprietà del PDF è sufficiente?

Non sempre. Nella prova di questa guida abbiamo svuotato autore, titolo e parole chiave nel dizionario delle informazioni, e il blocco XMP dello stesso file conservava ancora il nome dell'autrice e il titolo con il cognome della cliente. Per togliere davvero i metadati serve una funzione che pulisca tutto il file, come Continua in Acrobat dopo Applica, oppure un PDF nuovo con il solo testo.

Una foto inserita in Word può portarsi dietro le coordinate GPS?

Sì, se la foto le aveva. Nel file di prova la fotografia dentro il .docx conservava marca, modello, data e coordinate del punto in cui era stata scattata. Microsoft non elenca i dati EXIF delle immagini fra quelli che Controllo documento trova e rimuove, quindi conviene inserire una copia della foto senza posizione, oppure uno screenshot della parte che serve all'assistente.

Il nome del modello dello studio resta dentro il file Word?

Sì, fra le proprietà estese del documento, e se il modello si chiama con il nome dello studio o del cliente lo dice a chiunque apra il file come archivio. Microsoft elenca il nome modello fra le informazioni che Controllo documento trova e rimuove, alla voce Proprietà del documento e informazioni personali. Dopo la pulizia conviene comunque controllare, perché i campi estesi sono parecchi.

ChatGPT può leggere autore e data di creazione di un allegato?

Può farlo, e lo scrive OpenAI: nella sua guida sui caricamenti di file, fra gli esempi di estrazione, compare proprio estrarre i metadati di un documento, come autore e data di creazione. Per alcune analisi, aggiunge, ChatGPT scrive ed esegue codice Python sul file. Quindi i metadati vanno trattati come testo che l'assistente riceve, e tolti prima di caricare.

Si possono togliere i metadati da un documento da conservare a norma?

Dall'originale no, o non senza pensarci. Le linee guida dell'AgID sul documento informatico, nell'Allegato 5, rendono obbligatori alcuni metadati, fra cui almeno l'autore o il mittente. Il documento conservato resta com'è: si toglie dalla copia che prepari per l'assistente, che è un file diverso e con uno scopo diverso, e che non entra nel sistema di conservazione.

Nonimo toglie i metadati da Word e PDF?

Sì. L'app, nella copia di un Word, svuota autore, ultimo salvataggio, azienda e responsabile, copre titolo, oggetto, descrizione, parole chiave, categoria e proprietà personalizzate, e le immagini escono senza EXIF. Un PDF torna come un PDF nuovo con il solo testo, senza i metadati dell'originale. Per nome del modello e date basta un passaggio di Controllo documento.