· Atualizado a · Escrito e mantido por Nonimo
Ocultar dados num PDF com um retângulo preto não os tira de lá. O preto é uma forma desenhada por cima da página, e o texto continua por baixo, inteiro, à espera de quem o copie. Uma IA que recebe o ficheiro não olha para o retângulo: extrai o texto, e o texto traz o IBAN, o número fiscal e o nome que julgava ter tapado.
Para os dados saírem, o texto tem de ser removido do ficheiro, e isso confirma-se em dois minutos antes de carregar o documento. Este guia mostra a diferença num PDF de teste, com o texto que sai de cada versão, explica como remover os dados no Acrobat e sem ele, e o que fazer com um documento digitalizado.
Está escrito para quem trabalha com papel que já chega em PDF: o gabinete de contabilidade, o escritório de advogados, a secção de recursos humanos, a câmara municipal. O que acontece à conversa depois de enviada, nas contas pessoais e nas de empresa, tem um guia dedicado ao assistente da OpenAI.
Ocultar dados num PDF: o retângulo preto não apaga o texto
Um PDF não é uma folha de papel. É um ficheiro com várias camadas: o texto, guardado como texto, as imagens, os desenhos e as anotações. Quando se desenha um retângulo preto, com a ferramenta de formas do leitor, com o marcador em preto ou numa caixa de comentário cheia, acrescenta-se uma camada. Nenhuma das outras muda.
No ecrã, o resultado parece definitivo. Impresso, também o é, porque a impressora só vê o desenho final. A diferença aparece quando alguém faz o que um programa faz sempre: ler o texto do ficheiro em vez de olhar para a página. Numa folha de cálculo passa-se o mesmo com a coluna oculta e a célula que parece vazia.
A própria Adobe o diz na sua página em português sobre como ocultar texto: métodos como o marcador preto ou a mudança da cor da letra «não são infalíveis». O guia para gabinetes que já usam IA com a papelada dos clientes já avisava do mesmo numa linha. Aqui fica a demonstração.
Um caso de 2009, e o memorando que se seguiu
Em 2009, a agência norte-americana de segurança nos transportes publicou num site de contratação pública um manual de procedimentos com partes tapadas a preto. Segundo a Nextgov, de 9 de dezembro de 2009, bastava copiar o documento e colá-lo no Word ou no Bloco de Notas para ler o que estava por baixo.
Em maio de 2010, o Departamento de Segurança Interna dos Estados Unidos mandou a todos os serviços seguir o guia técnico da NSA para ocultar documentos e fazer uma verificação independente de cada ocultação antes de publicar. O memorando fala de tentativas falhadas de ocultar de vez informação publicada num site aberto ao público.
Um PDF de teste: tapado à vista, inteiro por dentro
Para não depender de casos contados por terceiros, fizemos a prova. Criámos um PDF com uma reclamação inventada, dirigida aos recursos humanos, com o nome de quem reclama, um NIF, a morada, o telemóvel, o email, o IBAN e o nome de uma chefe de divisão. Tapámos esses sete dados com retângulos pretos desenhados por cima, como faria qualquer editor de PDF comum.
Depois extraímos o texto do ficheiro com duas bibliotecas livres, a pypdf e a PyMuPDF. São o tipo de componente que lê um PDF por trás de muitos programas, incluindo os serviços que recebem ficheiros para os resumir ou traduzir.
As duas bibliotecas devolveram o texto completo, com os sete dados no sítio. A pesquisa do leitor pelo apelido encontrou-o três vezes: no campo do nome, na frase final e dentro do endereço de email. Nada no ecrã deixava adivinhar que o ficheiro ainda os tinha.
A mesma página, com a ocultação aplicada
Repetimos a prova com uma ocultação verdadeira, feita com a função própria da PyMuPDF, que marca as zonas e depois apaga o que está por baixo. À vista, o documento ficou igual: sete barras pretas. Por dentro, ficou diferente, e é essa a diferença que interessa a quem o vai carregar numa IA.
A extração devolve os sete dados, do nome ao IBAN, por extenso. A pesquisa pelo apelido encontra três ocorrências.
A extração devolve «Nome:» e o campo vazio. A pesquisa pelo apelido encontra zero ocorrências.
Na versão ocultada a sério, a extração devolve as etiquetas dos campos seguidas de nada: «Nome:», «NIF:», «IBAN:». O resto do texto, o assunto e a reclamação, continua legível, que é o que uma IA precisa para ajudar. É esse o objetivo, tanto num contrato como numa peça processual que um advogado quer rever com uma IA.
Porque é que o PDF guarda o texto debaixo do preto
O formato PDF foi pensado para que um documento se veja igual em qualquer computador, e para isso guarda o texto como texto, com a letra e a posição de cada palavra. É isso que permite selecionar, copiar, pesquisar e ler em voz alta. Uma forma desenhada por cima não mexe nessa informação, porque não tem de mexer: só acrescenta tinta.
Há quatro maneiras frequentes de tapar sem remover, e todas deixam o texto no ficheiro:
| como se tapou | o que fica no ficheiro |
|---|---|
| retângulo ou forma preta do leitor | o texto inteiro, debaixo da forma |
| marcador ou realce em preto | o texto inteiro, com um comentário por cima |
| letra pintada de branco ou de preto sobre preto | o texto inteiro, com outra cor |
| retângulo desenhado sobre um digitalizado | a imagem inteira, debaixo do desenho |
Os quatro casos deixam os dados legíveis para quem os extrai. Critério deste guia, confirmado nos PDF de teste para o primeiro e o último caso.
E se a tarja foi feita no Word antes de gerar o PDF, o problema começa no documento de origem, e é lá que se resolve.
Uma anotação apaga-se com dois cliques
Quando o preto é uma anotação, como um comentário em forma de retângulo, há ainda um problema mais simples: qualquer pessoa a pode selecionar e apagar, e o texto reaparece no ecrã. Não é preciso nenhum programa especial, basta o leitor de PDF que já tem no computador.
É o mesmo erro, em ponto pequeno, que o papel do escritório repete todos os dias: o documento parece limpo e não está. Que papéis desses trazem categorias especiais de dados sem ninguém reparar é assunto de outro guia.
O que uma IA recebe quando lhe carrega um PDF
Os fornecedores descrevem o que fazem a um PDF na documentação para programadores, e as duas descrições coincidem. A Anthropic escreve que o sistema converte cada página numa imagem e que o texto de cada página é extraído e fornecido ao lado dessa imagem. A OpenAI diz que, nos modelos com visão, a API extrai o texto e imagens das páginas e envia os dois ao modelo.
| fornecedor | o que diz que faz a um PDF | onde |
|---|---|---|
| Anthropic | converte cada página numa imagem e extrai o texto de cada página | documentação da API, «PDF support» |
| Anthropic, no Claude | analisa texto e elementos visuais até 100 páginas; acima disso, só texto | centro de ajuda, «Upload files to Claude» |
| OpenAI | nos modelos com visão, extrai o texto e imagens das páginas | documentação da API, «File inputs» |
Resumo do que cada fornecedor escreve, lido a 28 de setembro de 2026. Não descreve o funcionamento interno de nenhum produto.
O centro de ajuda da Anthropic acrescenta um pormenor para quem usa o Claude no navegador: até 100 páginas, analisa texto e elementos visuais; entre 101 e 1000 páginas, só o texto. Em qualquer dos casos, o texto extraído faz parte do que chega ao modelo.
O texto extraído é o que o teste mostrou
Juntando as duas coisas, a conclusão é direta. Se o fornecedor extrai o texto do PDF, extrai o texto que está debaixo do retângulo, porque é esse o texto que o ficheiro contém. A imagem da página pode mostrar preto; a camada de texto que segue ao lado não.
O que cada serviço faz depois com a conversa, quanto tempo a guarda e se treina com ela, varia de produto para produto, e tem guias próprios, um sobre o Claude e outro sobre as várias versões do Copilot.
Como ocultar dados num PDF a sério no Acrobat
No Adobe Acrobat Pro, a ferramenta chama-se Ocultar, e é a que remove o conteúdo em vez de o tapar. A página da Adobe em português de Portugal descreve os passos: abrir o PDF, escolher Ferramentas e depois Ocultar, e marcar o que se quer remover, com um duplo clique numa palavra ou arrastando sobre uma linha ou uma área.
Marcar ainda não remove nada. Depois de marcar, clica-se em Aplicar, e a Adobe é clara num ponto que muita gente salta: os itens só são removidos permanentemente do documento quando o guardar. Até lá, a marca é só uma marca.
- Abra uma cópia e guarde o original noutro sítio; o Acrobat propõe um nome novo com o sufixo «_Ocultado».
- Marque tudo antes de aplicar: nome, números, moradas, assinaturas e carimbos, em todas as páginas.
- Aplique e guarde. Sem guardar, a remoção não acontece.
Pesquisar e ocultar, para o nome que se repete
Num documento de várias páginas, o mesmo nome aparece muitas vezes, no cabeçalho, no corpo, na assinatura. A Adobe descreve uma opção para isso, em Ocultar, Redigir Textos e Imagens e Localizar o Texto e Redigir, que procura uma palavra ou um padrão em todo o documento e marca cada ocorrência.
Mesmo assim, reveja à mão. Um apelido escrito com e sem acento, um NIF partido por espaços ou um nome que muda de linha podem escapar a uma pesquisa exata. O papel do escritório de advogados está cheio destes casos, e a pesquisa só encontra o que se lhe pede.
O interruptor que vale a pena ligar
Ao aplicar, a caixa de diálogo Aplicar Ocultações oferece a opção Limpar e Remover Informações Ocultas. Remove mais do que o texto marcado, e o que um PDF conta sobre quem o fez e quando merece um guia próprio. Aqui basta ligá-la. O cartório conhece bem esta disciplina, porque o segredo do notário não admite documentos meio limpos.
Sem Acrobat: tirar o texto em vez de tapar a página
Nem toda a gente tem o Acrobat Pro, e nem sempre é preciso. Para quem vai pedir ajuda a uma IA, o caminho mais seguro muitas vezes nem passa pelo PDF: é copiar só o texto de que a IA precisa, tirar-lhe os dados e colar esse texto na conversa. Se o PDF nasceu de um Word revisto por vários, volte à origem e aceite as alterações e elimine os comentários antes de exportar.
Parece um desvio, e é o contrário. A IA raramente precisa do documento inteiro. Para rever uma cláusula, precisa da cláusula; para responder a uma reclamação, precisa da reclamação; para resumir uma ata, precisa do que se decidiu, não de quem votou. Para melhorar um diapositivo, precisa do diapositivo, e não das notas que o orador deixou por baixo.
Três caminhos, do mais seguro ao menos seguro
| caminho | o que chega à IA | o que verificar |
|---|---|---|
| colar só o excerto, já sem dados | o parágrafo que interessa | o contexto que identifica sem nome |
| PDF com ocultação aplicada e guardada | o documento sem os dados marcados | a prova de copiar e pesquisar |
| PDF convertido em imagem, com o preto já na imagem | fotografias das páginas | que o preto foi aplicado antes da conversão |
Critério deste guia. Em todos os casos, o que sai do computador deve ser só o necessário.
A conversão em imagem, a opção de imprimir para PDF como imagem que muitos leitores têm, apaga a camada de texto, mas tem um custo: os modelos com visão leem imagens, por isso o preto tem de estar já na imagem, como na cópia traçada da carta de condução, e o documento perde a pesquisa e a seleção para toda a gente.
Ocultar ou rasurar um PDF online: o que confirmar antes de o carregar
Há dezenas de serviços na Internet que prometem ocultar um PDF sem instalar nada. Alguns removem mesmo o texto, outros convertem as páginas em imagem, e pelo resultado não se distingue uns dos outros. Quase todos começam por receber o ficheiro original. A ferramenta acima deste guia tapa o documento e descarta-o assim que lhe entrega o resultado.
O que separa um serviço de outro são três respostas, que estão nas condições de cada um: o que se envia, se o ficheiro fica guardado e quem o pode ver. Com um documento abrangido pelo sigilo profissional ou com dados de saúde, a app do Nonimo trata-o no seu computador, e o ficheiro não sai de lá. Seja qual for o caminho, a prova de copiar e pesquisar descrita mais abaixo confirma o resultado.
O que se põe no lugar do dado
Tirar não é o mesmo que deixar um buraco. Numa carta sem nome, a IA não percebe quem escreve a quem. Trocar o nome por uma etiqueta, CLIENTE ou TRABALHADORA, mantém o sentido e deixa a resposta utilizável. É isso a pseudonimização, e o guia dedicado a esse conceito do RGPD explica porque um texto assim continua a ser de dados pessoais.
Nos recibos e declarações de um gabinete, a regra é a mesma: o NISS e o NIF saem, o valor e a pergunta ficam, como mostra a página para contabilistas certificados.
Copiar, colar e pesquisar: a prova que qualquer pessoa faz
Antes de carregar um PDF tapado, seja qual for a ferramenta que usou, faça duas provas. Não pedem nenhum programa novo e demoram menos do que escrever a pergunta à IA.
A primeira é copiar. Selecione a zona tapada, ou a página toda, copie e cole num editor de texto simples, como o Bloco de Notas no Windows ou o TextEdit no Mac. Se aparecer o nome, o número ou a morada, o dado está no ficheiro, por muito preta que esteja a barra. O mesmo editor serve para rever um CSV ou um ficheiro .txt antes de o carregar, porque mostra o ficheiro sem conversões.
A segunda é pesquisar. Abra a pesquisa do leitor, com Ctrl+F no Windows ou Cmd+F no Mac, e procure um apelido ou quatro algarismos seguidos de um número que tapou. No PDF de teste, a pesquisa pelo apelido deu três ocorrências na versão tapada por cima e zero na versão ocultada a sério.
Quando o texto colado sai baralhado
Às vezes, o que se cola não é o nome, mas uma fila de símbolos sem sentido. Isso acontece com alguns tipos de letra embutidos, e não quer dizer que o dado saiu: quer dizer que aquele programa não o soube converter. Outro programa, ou uma IA, pode convertê-lo sem dificuldade. Nesse caso, confie mais na pesquisa do que na cópia, e procure também por um número.
O zero do digitalizado não é boa notícia
O terceiro resultado engana. Uma pesquisa que não encontra nada num PDF digitalizado não prova que os dados saíram: prova que o ficheiro não tem texto nenhum para pesquisar. Nesse caso, a prova de copiar e pesquisar não serve, e a pergunta passa a ser o que mostra a imagem.
Estas duas provas cabem numa regra interna de uma linha. Se o escritório ainda não tem uma, pode partir das regras escritas para um gabinete de contabilidade e acrescentar-lhes estas duas.
PDF digitalizado: a imagem também se lê
Um PDF digitalizado é, na maior parte dos casos, uma fotografia de cada página embrulhada num ficheiro PDF, como a carta de condução digitalizada que se envia. Não tem camada de texto, e por isso a prova de copiar não devolve nada. Mas isso não quer dizer que a IA não o leia: os fornecedores enviam imagens das páginas ao modelo, e os modelos com visão leem texto em imagens.
Depois de carregado, o ficheiro fica guardado com os prazos que o guia sobre o que as IA guardam das fotos e dos ficheiros junta para os quatro assistentes.
Tapar um digitalizado tem ainda uma armadilha própria. Se o preto for desenhado por cima da imagem, com a ferramenta de formas do leitor, a imagem original continua dentro do ficheiro, inteira. Fizemos também essa prova: convertemos a reclamação, ainda sem tarjas, numa imagem, como faria um digitalizador, desenhámos os retângulos por cima e extraímos a imagem embutida.
A imagem extraída mostrava tudo, do nome da reclamante ao IBAN, sem uma única barra. No ecrã, o documento parecia igual à versão tapada. O que a IA vê da página renderizada depende de cada fornecedor; o que o ficheiro contém não depende de ninguém, e carregar o ficheiro é entregá-lo com esse conteúdo.
Como tapar um digitalizado sem deixar a imagem por baixo
No digitalizado, a ocultação tem de apagar os próprios pixéis da imagem, não pôr-lhes um desenho por cima, como ao traçar a cópia do Cartão de Cidadão. Segundo a Adobe, a ferramenta Ocultar também deixa marcar imagens e áreas da página. A alternativa mais simples continua a ser a da secção anterior: transcrever para texto só o parágrafo de que precisa, sem os dados, e deixar o documento digitalizado onde está.
Nas clínicas, onde chegam análises e relatórios em papel digitalizado, esta é a regra mais útil, e a página sobre IA para clínicas mostra o texto que pode seguir. E que parte de um relatório clínico é dado de saúde tem resposta noutro texto.
O que a CNPD pede a quem expurga documentos
A CNPD não publicou, que tenhamos encontrado até 28 de setembro de 2026, uma decisão sobre um PDF mal tapado. Publicou, em abril de 2023, duas orientações que usam a palavra certa para este guia: expurgar. E as duas assentam no mesmo princípio do RGPD, que no artigo 5.º quer os dados «adequados, pertinentes e limitados ao que é necessário».
A orientação de 11 de abril de 2023, sobre a disponibilização de dados em procedimentos administrativos, pede que os dados não pertinentes sejam expurgados dos documentos no momento da consulta. Em procedimentos de contratação, nomeia a morada, os contactos e o número de identificação civil como dados a ocultar ou expurgar.
Um expurgo que se desfaz com copiar e colar não é expurgo
A mesma orientação diz que as plataformas digitais devem ser desenhadas de raiz para ocultar automaticamente os dados não pertinentes, por força do artigo 25.º do RGPD, a proteção de dados desde a conceção. Um retângulo que se tira com copiar e colar não cumpre esse fim: o dado continua disponível para quem recebe o ficheiro.
A orientação de 18 de abril de 2023, sobre a publicação de atas na Internet, acrescenta uma frase que convém guardar: a anonimização «não se realiza por mero expurgo ou ocultação do nome». Que outros dados identificam alguém, para além do nome, é a lista de outro guia.
As câmaras municipais são o público natural destas orientações, e o que um serviço autárquico pode levar a uma IA tem análise própria. Para escolher a ferramenta, ver que assistentes aguentam uma leitura à luz do RGPD.
O Nonimo com um PDF: o texto limpo e uma cópia nova
A app do Nonimo funciona no seu computador, em Mac e em Windows, e o documento não sai dele. Entrega-se um documento na janela da app e ela mostra o texto com os dados trocados por etiquetas, pronto a colar na IA, e deixa descarregar uma cópia tapada. De um PDF, a cópia é um PDF novo só com esse texto, sem os metadados do original. A ferramenta desta página dá os mesmos dois resultados a partir de um PDF e descarta o documento assim que lhos entrega.
Como trata o texto, e não o desenho da página, o retângulo preto deixa de ser o problema. Foi assim que o Nonimo tratou o texto extraído do PDF de teste:
ANTES (texto extraído do PDF tapado por cima)
Nome: Leonor Abrantes Quintela
NIF: 999999990
Morada: Rua das Tílias Imaginárias, n.º 12, 3.º esq., 4000-000 Porto
Telemóvel: 000 000 001
Email: leonor.quintela@example.com
IBAN: PT50 0000 0000 0000 0000 0000 0
Eu, Leonor Abrantes Quintela, venho reclamar da nota atribuída
pela chefe de divisão, Dra. Olímpia Bravo Cerqueira.
DEPOIS (saída real do Nonimo · exemplo inventado)
Nome: [PESSOA_1]
NIF: [REFERENCIA_1]
Morada: [CAMPO_FICHA_1]
Telemóvel: [TELEFONE_1]
Email: [E-MAIL_1]
IBAN: [CAMPO_FICHA_2]
Eu, [PESSOA_1], venho reclamar da nota atribuída
pela chefe de divisão, Dra. [PESSOA_2].
Nomes, morada e email inventados. O número fiscal, o telemóvel e o IBAN não pertencem a ninguém.
A mesma pessoa recebe sempre a mesma etiqueta. Na app, a ligação entre etiqueta e nome guarda-se cifrada no seu computador, e é com ela que a app repõe os nomes na resposta da IA. A ferramenta desta página tapa os dados e deixa copiar ou descarregar o resultado. Num PDF só de imagem, a app lê o texto no próprio computador, no Mac e no Windows, e devolve-o já tapado. A página de segurança explica como a app trabalha no seu computador, e há instruções para instalar em equipa.
Lista de verificação antes de dar um PDF a uma IA
Antes de carregar um PDF numa IA, ou de copiar texto dele, seis perguntas bastam. Cabem num papel ao lado do ecrã.
- A IA precisa do ficheiro? Se precisa de um parágrafo, cole o parágrafo.
- O preto foi aplicado ou só desenhado? No Acrobat, só conta a ocultação aplicada e guardada.
- Copiar devolve o dado? Cole a zona tapada num editor simples e veja o que aparece.
- A pesquisa encontra o apelido? Se encontra, o ficheiro ainda o tem.
- Há páginas digitalizadas? Aí a prova de copiar não serve: olhe para a imagem.
- O que fica no lugar do dado? Uma etiqueta mantém o sentido para a IA.
Ocultar dados num PDF é um passo de dois minutos, e a prova de copiar e pesquisar é o que distingue um documento limpo de um documento que só parece limpo.
Se um PDF com dados já seguiu para uma IA, o guia sobre quando se comunica um incidente à CNPD mostra os passos e os prazos. E um seguro de riscos cibernéticos pode cobrir parte do problema, conforme a apólice.
Fontes
Verificadas a 28 de setembro de 2026.
- Adobe, Como ocultar texto em ficheiros PDF?, página em português de Portugal. Os métodos como o marcador preto ou a mudança da cor da letra «não são infalíveis»; Ferramentas e Ocultar; Aplicar; a opção Limpar e Remover Informações Ocultas; Localizar o Texto e Redigir; os itens só são removidos permanentemente quando se guarda; o sufixo «_Ocultado»; a ferramenta no Acrobat Pro.
- Adobe, Ocultar conteúdo confidencial em PDFs no Acrobat Pro, ajuda do Acrobat em português, atualizada a 14 de setembro de 2026. Os passos Ocultar texto e imagens, aplicar e guardar o documento sanitizado.
- Anthropic, PDF support, documentação da API. O sistema converte cada página numa imagem e extrai o texto de cada página, fornecido ao lado da imagem.
- Anthropic, Upload files to Claude, centro de ajuda, 23 de julho de 2026. Texto e elementos visuais em PDFs até 100 páginas; entre 101 e 1000 páginas, só texto.
- OpenAI, File inputs, documentação da API. Nos modelos com visão, a API extrai o texto e imagens das páginas de um PDF e envia os dois ao modelo.
- CNPD, Orientação relativa à disponibilização de dados pessoais tratados no âmbito de procedimentos administrativos, aprovada a 11 de abril de 2023. Pontos 12, 17 e 19: expurgar os dados não pertinentes, a morada, os contactos e o número de identificação civil, e plataformas desenhadas para ocultar automaticamente.
- CNPD, Orientação relativa à publicação na Internet das atas das reuniões de órgãos colegiais, aprovada a 18 de abril de 2023. Ponto 16: a anonimização não se faz por mero expurgo ou ocultação do nome.
- Regulamento (UE) 2016/679, versão portuguesa, na Procuradoria-Geral Regional de Lisboa. Artigo 5.º, n.º 1, alínea c), minimização dos dados; artigo 25.º, proteção de dados desde a conceção e por defeito.
- Departamento de Segurança Interna dos EUA, Redacting Sensitive Information, memorando de maio de 2010. Seguir o guia da NSA e verificar cada ocultação de forma independente antes de publicar, depois de tentativas falhadas num site público.
- Nextgov, In wake of TSA breach, a refresher on redacting PDFs, 9 de dezembro de 2009. O manual da TSA publicado num site de contratação pública e lido copiando e colando o texto tapado.
- Teste próprio, 28 de setembro de 2026: PDF gerado com a reportlab 4.5.0, texto extraído com a pypdf 6.10.2 e a PyMuPDF 1.26.5; ocultação aplicada com a função de ocultação da PyMuPDF. Dados inventados.
O Nonimo é o software que faz isto no seu próprio computador: oculta nomes de clientes e números de identificação antes de o texto chegar ao ChatGPT. Sem conta, e com a app os dados dos seus clientes não saem do seu computador.
Perguntas frequentes
Como ocultar dados num PDF sem que a IA os consiga ler?
Para ocultar dados num PDF de forma a que a IA não os leia, o texto tem de ser removido do ficheiro; tapá-lo não chega. No Acrobat Pro, a ferramenta Ocultar só remove os itens quando se aplica e se guarda o documento, segundo a própria Adobe. Depois, confirme copiando e pesquisando. O Nonimo devolve o texto já com etiquetas no lugar dos dados e um PDF novo só com esse texto.
Um retângulo preto por cima do texto esconde-o de verdade?
Esconde-o dos olhos, não do ficheiro. Num PDF de teste com sete dados tapados a preto, duas bibliotecas de extração devolveram tudo por extenso, do nome ao IBAN, porque o retângulo é desenhado por cima e o texto continua por baixo. Uma IA que extrai o texto recebe exatamente isso. O Nonimo trabalha sobre o texto, por isso não depende do preto.
Como sei se um PDF tapado ainda guarda o texto por baixo?
Faça duas provas antes de o carregar. Selecione a zona tapada, copie e cole num editor de texto simples: se aparecer o nome, o dado está lá. Depois pesquise no leitor de PDF um apelido ou um algarismo que tapou. Se a pesquisa o encontrar, o ficheiro ainda o tem. O Nonimo mostra cada troca marcada, o que ajuda a rever antes de enviar.
E se o PDF for digitalizado, a IA consegue lê-lo?
Pode conseguir, porque os fornecedores enviam ao modelo imagens das páginas. A documentação da Anthropic diz que cada página é convertida numa imagem, com o texto extraído ao lado, e a da OpenAI descreve o mesmo para modelos com visão. A app do Nonimo lê o digitalizado no próprio computador, no Mac e no Windows, e devolve o texto já tapado.
Imprimir o PDF como imagem apaga os dados?
Apaga a camada de texto, mas só funciona se os retângulos já estiverem na imagem gerada. O documento passa a ser uma fotografia das páginas, e os modelos com visão leem imagens. Se, depois disso, alguém desenhar o preto por cima, a imagem inteira continua dentro do ficheiro e extrai-se sem ele. O Nonimo trabalha sobre o texto, e a app, no Mac e no Windows, lê também os PDF digitalizados no próprio computador. A app tapa também a fotografia de um documento de identificação, no próprio computador, e devolve uma cópia com os dados tapados.
As ferramentas online para ocultar PDF são uma boa opção?
Algumas removem o texto de facto, e para isso recebem o ficheiro inteiro. Antes de usar uma, veja nas condições o que recebe, se o conserva e quem lhe pode aceder. A ferramenta no topo desta página tapa o documento e descarta-o assim que lhe entrega o resultado. No resultado, faça a prova de copiar e pesquisar. Para um documento sensível, a app do Nonimo tapa-o no seu computador, e o ficheiro não sai de lá.
É melhor carregar o PDF inteiro ou colar só o excerto necessário?
Quase sempre o excerto. Uma IA precisa do parágrafo que tem a dúvida, não do anexo com a morada, o NIF e as assinaturas. Colar texto também evita o que o ficheiro traz sem se ver, como a camada de texto por baixo das tarjas. O Nonimo ajuda nos dois casos: devolve o texto com etiquetas, pronto a colar, e uma cópia tapada do documento.
Que cópia devolve o Nonimo quando recebe um PDF?
Devolve dois resultados: o texto com os dados substituídos por etiquetas, pronto a colar na IA, e um PDF novo só com esse texto, sem os metadados do original. Num documento só de imagem, a app lê o texto no computador, no Mac e no Windows, e devolve-o já tapado.