[nonimo]
DE
Herunterladen

PDF schwärzen, ohne dass Text darunter bleibt

· Aktualisiert am · Geschrieben und gepflegt von Nonimo

Eine geschwärzte PDF sichtbar machen ist oft keine Kunst: Markieren, kopieren, einfügen, und der Text unter dem schwarzen Balken steht wieder da. Der Grund ist, dass ein Balken, den jemand mit einem Zeichen- oder Kommentarwerkzeug über eine Zeile legt, nur das Bild der Seite verändert. Die Textebene darunter bleibt vollständig erhalten. Und genau diese Textebene geben OpenAI und Anthropic nach ihren eigenen Dokumentationen an ihre Modelle weiter, wenn jemand ein PDF hochlädt.

Für Kanzleien, Steuerkanzleien und Personalabteilungen, die Schriftsätze, Bescheide, Abrechnungen oder eine Führerscheinkopie als PDF in einen KI-Chat geben, heißt das: Was optisch geschwärzt ist, ist für das Modell nicht unbedingt weg. Dieser Leitfaden zeigt an einer Testdatei mit erfundenen Daten, was ein Programm aus einem überdeckten, einem richtig geschwärzten und einem gescannten PDF herausliest. Danach folgen die Wege, ein PDF wirklich zu schwärzen, und ein Test, den jeder in einer Minute machen kann.

Geschwärzte PDF sichtbar machen: warum der Balken den Text nicht löscht

Ein PDF ist kein Foto einer Seite. Es ist eine Beschreibung, die ein Betrachter bei jedem Öffnen neu zusammensetzt: Hier steht dieses Wort in dieser Schrift, dort liegt ein Bild, darüber ein Rechteck in Schwarz. Jedes dieser Elemente ist ein eigenes Objekt in der Datei. Legt man ein schwarzes Rechteck über ein Wort, kommt ein Objekt hinzu, aber keines verschwindet.

Beim Anzeigen gewinnt, was zuletzt gezeichnet wurde, und deshalb wirkt der Balken am Monitor wie auf Papier überzeugend. Beim Kopieren, Durchsuchen oder Vorlesen fragt das Programm dagegen nicht, was oben liegt, sondern welche Zeichen an dieser Stelle stehen. Die Antwort ist dieselbe wie vor dem Balken.

Geschwärzte PDF sichtbar machen: drei Schichten einer PDF-Seite Eine PDF-Seite als drei Schichten: oben das schwarze Rechteck, in der Mitte die Textebene mit dem Namen, unten der Seitenhintergrund. Der Betrachter zeigt das Rechteck, das Kopieren liest die Textebene. Zeichnung: schwarzes Rechteck das sieht der Betrachter Mandantin: Frau Mareike Tannhaus Textebene: die Zeichen das liest Kopieren, Suche, KI Seite Hintergrund, Bilder bei einem Scan: das ganze Blatt
Aufbau einer PDF-Seite, vereinfacht. Ein Balken kommt als Zeichnung hinzu; die Textebene darunter bleibt unverändert.

Die Sächsische Datenschutz- und Transparenzbeauftragte hat das im August 2024 in einem Satz zusammengefasst: Überdeckt ist nicht gleich anonymisiert. Wer die geschwärzte Stelle markiert und in einen Texteditor einfügt, bekommt den verdeckten Inhalt zurück. Der Landesbeauftragte für den Datenschutz Niedersachsen zählt schwarze Kästen und geänderte Schriftfarben in seinen Hinweisen vom Juli 2025 ausdrücklich zu den Methoden, die nicht geeignet sind.

Rechtlich ordnet der Landesbeauftragte das Schwärzen als technische und organisatorische Maßnahme nach Art. 32 DSGVO ein, die dem Grundsatz der Datenminimierung dient, geregelt in Art. 5 Abs. 1 Buchstabe c. Ein Balken ohne Wirkung erfüllt keine der beiden Aufgaben.

Ob selbst ein sauber entfernter Name genügt, solange Umstände und Zusammenhang noch auf jemanden zeigen, ist eine andere Frage; die DSGVO beantwortet sie mit der Unterscheidung, die unser Text zur Pseudonymisierung von Mandantendaten erklärt.

Was ein Sprachmodell aus einem hochgeladenen PDF bekommt

Die großen Anbieter beschreiben in ihren Entwicklerdokumentationen recht genau, was mit einem PDF geschieht, bevor das Modell es sieht. Das sind Primärquellen, und für die Frage, um die es hier geht, genügen sie.

OpenAI schreibt in seinem Leitfaden zu Dateieingaben, dass die Schnittstelle bei Modellen mit Bildverarbeitung, etwa gpt-4o und neueren, aus einem PDF sowohl den Text als auch Bilder der Seiten extrahiert und beides an das Modell schickt. Anthropic beschreibt in der deutschen Dokumentation zur PDF-Unterstützung denselben Ablauf in drei Schritten: Die Inhalte werden extrahiert, jede Seite wird in ein Bild umgewandelt, und der Text jeder Seite wird zusammen mit ihrem Bild bereitgestellt.

Was ein Sprachmodell aus einem hochgeladenen PDF bekommt Das PDF wird in zwei Spuren zerlegt: die extrahierte Textebene, in der der Name noch steht, und das Seitenbild, auf dem der Balken zu sehen ist. Beide Spuren gehen an das Modell. PDF mit Balken Textebene, extrahiert „Frau Mareike Tannhaus“ steht noch da Bild der Seite zeigt den Balken Modell
Verarbeitung eines PDF laut den Entwicklerdokumentationen von OpenAI (Dateieingaben) und Anthropic (PDF-Unterstützung), September 2026.

Für ein überdecktes PDF bedeutet das: Das Seitenbild zeigt den Balken, die mitgelieferte Textebene enthält den Namen. Das Modell bekommt beides. Ob es den Namen in seiner Antwort wiederholt, hängt von der Frage ab, aber beim Anbieter angekommen ist er in jedem Fall.

Beide Beschreibungen betreffen die Programmierschnittstellen der Anbieter. Für das Chatfenster Ihres Tarifs ist die sichere Annahme dieselbe: Was in der Textebene steht, kommt an. Was der Anbieter danach mit hochgeladenen Dateien macht, wie lange er sie speichert und wer darauf zugreifen kann, beschreiben unsere Beiträge zu ChatGPT und Datenschutz und zu Claude und der DSGVO.

Ein Versuch mit erfundenen Daten: Balken, Schwärzung, Scan

Behauptungen über PDF-Dateien lassen sich leicht prüfen, und deshalb haben wir es getan. Die Testdatei ist ein kurzer Vermerk aus einer erfundenen Kanzlei: Aktenzeichen, Name der Mandantin, Anschrift, Geburtsdatum, Telefonnummer, IBAN und ein Satz zum Sachverhalt. Alle Angaben sind ausgedacht, und als Kontonummer dient die bekannte Muster-IBAN.

Aus diesem Vermerk entstanden vier Dateien. In der ersten liegen schwarze Rechtecke über Name, Anschrift, Geburtsdatum, Telefonnummer und IBAN, gezeichnet wie mit einem Rechteckwerkzeug. In der zweiten wurde dieselbe Schwärzung angewendet, also der Text unter den Feldern entfernt. Die dritte ist ein Bild der ersten Seite, wie es ein Scanner liefert. Die vierte ist ein Scan des ungeschwärzten Vermerks mit Texterkennung, über den nachträglich Balken gezeichnet wurden.

Was man sieht · Datei mit Balken

Kanzlei Musterfeld · Aktenzeichen 3 O 118/26
Mandantin: Frau ██████████████
Anschrift: ██████████████████████
Geburtsdatum: ██████ · Telefon ████████
Erstattung auf IBAN ██████████████████

Was die Textebene liefert · dieselbe Datei

Kanzlei Musterfeld · Aktenzeichen 3 O 118/26
Mandantin: Frau Mareike Tannhaus
Anschrift: Birkenweg 7, 12345 Musterstadt
Geburtsdatum: 14.03.1981 · Telefon 0152 28817386
Erstattung auf IBAN DE89 3704 0044 0532 0130 00

Testdatei mit erfundenen Daten, Text ausgelesen mit der Python-Bibliothek pypdf 6.10.2, 28. September 2026.

Ausgelesen haben wir alle Dateien mit pypdf, einer verbreiteten freien Bibliothek, die genau das tut, was jedes Programm beim Hochladen eines PDF zuerst tut: die Textebene lesen. Die Ergebnisse:

Dateiauf dem Bildschirmin der Textebene
Balken gezeichnetfünf schwarze Felderalle fünf Angaben im Klartext
Schwärzung angewendetfünf schwarze Felderkeine der fünf Angaben
Scan ohne Texterkennungfünf schwarze Felderkein einziges Zeichen
Scan mit Texterkennung, Balken danachfünf schwarze Felderalle fünf Angaben im Klartext

Quelle: eigener Versuch mit erfundenen Daten, 28. September 2026. Skript und Dateien liegen bei uns vor.

Auf dem Bildschirm sehen alle vier Dateien gleich aus. Das ist der eigentliche Befund. Man kann einem PDF nicht ansehen, ob es richtig geschwärzt ist, und die Person, die es in den Chat zieht, sieht dasselbe wie jeder andere: schwarze Felder.

Das Aktenzeichen stand in allen vier Dateien

Ein zweiter Befund kam ungeplant. Beim Anlegen der Balken haben wir das Aktenzeichen in der Kopfzeile nicht geschwärzt, und es steht deshalb in allen vier Fassungen, auch in der richtig geschwärzten. Genau so entstehen Lücken in der Praxis: Die auffälligen Angaben verschwinden, und die unscheinbare Nummer, über die jede Akte zu finden ist, bleibt. Welche Angaben in einem Kanzleientwurf typischerweise zusammenstehen, zeigt die Seite für Kanzleien.

Wie falsche Schwärzungen entstehen

Kaum jemand zeichnet absichtlich einen Balken, der nichts schwärzt. Die falschen Schwärzungen entstehen, weil die Werkzeuge dafür griffbereit sind und das Ergebnis richtig aussieht. Die häufigsten Wege sind schnell aufgezählt, und keiner davon entfernt Text aus der Datei:

Wegwo er vorkommtwas in der Datei bleibt
Rechteck aus den Kommentar- oder Zeichenwerkzeugenkostenlose PDF-BetrachterText unter dem Rechteck
Schwarze Hervorhebung oder schwarze Schrift auf SchwarzTextverarbeitung vor dem ExportText in der Textebene
Schwärzung nur markiert, nicht angewendetAcrobat ProText und Markierung
Balken über einen durchsuchbaren ScanScanner mit Texterkennungunsichtbare Textebene
Filzstift auf dem PapierAkte vor dem ScannenSpuren, die durchscheinen können

Quelle: Hinweise des Landesbeauftragten für den Datenschutz Niedersachsen, Juli 2025; Sächsische Datenschutz- und Transparenzbeauftragte, 30. August 2024; eigener Versuch.

Der zweite Weg beginnt nicht im PDF, sondern in der Textverarbeitung. Wer dort eine Zeile schwarz hinterlegt und das Dokument dann als PDF speichert, bekommt eine Datei, deren Textebene die Zeile vollständig enthält. Wie man ein Word-Dokument vorher sauber bereinigt, gehört in einen eigenen Leitfaden.

Der dritte Weg ist der tückischste, weil er in einem Programm passiert, das richtig schwärzen kann. Wer in Acrobat Pro Stellen markiert und die Datei speichert, ohne die Schwärzung anzuwenden, hat rote Rahmen oder Balken in der Datei, aber keinen entfernten Text. Wer im Büro welche Dateien in welchen Dienst hochladen darf, regelt man am besten schriftlich, etwa mit einer KI-Richtlinie nach unserem Muster.

Das PDF, das schon geschwärzt ankommt

Nicht jedes überdeckte PDF entsteht im eigenen Büro. Mandanten schicken Kontoauszüge, auf denen sie einzelne Buchungen abgedeckt haben, Arbeitgeber schicken Zeugnisse oder Abmahnungen mit geschwärzten Passagen, und nach einer Akteneinsicht kommen Blätter mit Balken von der Behörde. Wie dort geschwärzt wurde, lässt sich der Datei nicht ansehen.

Solche Dokumente gehören deshalb durch denselben Test wie die eigenen, bevor sie in einen Chat gehen. Dazu kommt eine unangenehme Folge: Was ein Absender abgedeckt hat, wollte er nicht weitergeben, oft nicht einmal an Sie. Liest die KI es trotzdem aus der Textebene, landet beim Anbieter genau die Information, die schon beim Absender als vertraulich galt.

Der Fall, über den ganz Europa las

Dass auch Profis diese Fehler machen, zeigte die EU-Kommission am 29. Januar 2021. Sie veröffentlichte ihren Vertrag mit AstraZeneca über den Coronaimpfstoff in geschwärzter Fassung, und das Deutsche Ärzteblatt berichtete noch am selben Tag, dass geschwärzte Passagen mithilfe der Lesezeichenfunktion verschiedener PDF-Programme lesbar waren, darunter ein Warenwert von 870 Millionen Euro. Geschwärzt war auf den Seiten, ausgelesen wurde über die Lesezeichen: eine Stelle, an die beim Schwärzen kaum jemand denkt.

PDF schwärzen in Acrobat Pro: markieren, anwenden, speichern

Das Werkzeug, mit dem sich ein PDF zuverlässig schwärzen lässt, heißt in der aktuellen Oberfläche von Adobe Acrobat schlicht PDF schwärzen. Es gibt es nur in Acrobat Pro, Premium und Studio, nicht im kostenlosen Reader. Adobe beschreibt den Ablauf in seiner deutschen Anleitung Vertrauliche Informationen entfernen, zuletzt aktualisiert am 3. Mai 2026, so:

  1. Werkzeug öffnen. Datei öffnen, in der Symbolleiste Alle Tools wählen und dann PDF schwärzen.
  2. Stellen markieren. Mit Text und Bilder schwärzen die Stellen markieren, mit Text suchen und schwärzen nach Wörtern oder Mustern suchen, mit Seiten schwärzen ganze Seiten erfassen.
  3. Anwenden. Im Bedienfeld PDF schwärzen auf Anwenden klicken. Erst jetzt wird der Text unter den Feldern entfernt.
  4. Bereinigen. Mit Weiter die ausgeblendeten Informationen entfernen lassen. Adobe speichert das Ergebnis dauerhaft in einer neuen Datei.

Der dritte Schritt ist der heikle. Solange nur markiert ist, zeigt Acrobat Rahmen oder eine Vorschau, und die Datei sieht beinahe fertig aus. Die markierte Fassung ist ein Arbeitsstand, kein Ergebnis. In den Chat gehört ausschließlich die neue Datei, die nach dem Bereinigen entsteht.

Die Mustersuche ersetzt nicht das Lesen

Die Suche nach Mustern ist praktisch, weil sie Telefonnummern, E-Mail-Adressen oder Kreditkartennummern in einem langen Dokument auf einmal findet. Sie findet aber nur, was dem Muster entspricht. Ein Name im Fließtext, eine Anschrift ohne Postleitzahl oder eine Personalnummer mit hauseigenem Aufbau fallen durch. Am Ende steht deshalb immer ein Durchgang mit den Augen, Seite für Seite, und danach der Test weiter unten.

Das Bereinigen in Schritt 4 entfernt außerdem, was nicht auf der Seite steht, nach Adobe etwa Kommentare, ausgeblendete Ebenen und Metadaten; was Metadaten über Sie verraten, ist ein eigenes Thema. Ist eine Datei mit Balken schon hochgeladen worden, stellt sich die Frage, ob das meldepflichtig ist; wie man das prüft, steht in unserem Text zur Meldung einer Datenpanne.

PDF schwärzen ohne Acrobat: an der Quelle ersetzen oder redigieren

Nicht jedes Büro hat eine Lizenz für Acrobat Pro, und für viele Fälle braucht es sie auch nicht. Es gibt zwei andere Wege, die ohne Kaufprogramm auskommen, und einen dritten, der fast immer funktioniert, aber etwas kostet.

Der Weg über das Ausgangsdokument

Viele PDF, die in einem Büro entstehen, haben eine Quelle: einen Schriftsatz in Word, eine Tabelle, einen Brief. Der Landesbeauftragte in Niedersachsen empfiehlt für solche Dokumente, eine Kopie anzulegen, die sensiblen Angaben darin durch XXX oder etwas Ähnliches zu ersetzen, Bilder auszutauschen statt sie zu überdecken und erst diese bereinigte Kopie als PDF zu speichern. Was im Ausgangsdokument nicht mehr steht, kann im PDF nicht auftauchen. Bei einer Präsentation gilt das auch für ausgeblendete Folien und Kommentare.

Dieser Weg ist der sauberste, weil er das Problem gar nicht erst entstehen lässt. Er setzt allerdings voraus, dass man die Quelle hat. Bei einem Bescheid, einem gegnerischen Schriftsatz oder einem Kontoauszug hat man sie nicht. Hat man sie, etwa als Dokument aus LibreOffice Writer, beginnt die Arbeit beim Bereinigen der .odt-Datei, die neben dem Text auch Kommentare und nachverfolgte Änderungen speichert.

Redigieren mit LibreOffice

Das kostenlose LibreOffice hat eine eigene Funktion unter Extras, Redigieren. Nach der Hilfe von LibreOffice wird das Dokument dabei in eine Zeichnung überführt, die man in Draw mit Rechtecken oder Freiformen markiert. Der Befehl Redigierter Export (schwarz) macht die Markierungen deckend schwarz und speichert ein PDF aus Pixelseiten, aus dem sich der ursprüngliche Inhalt nicht mehr kopieren lässt.

Daneben steht in derselben Symbolleiste Direktes Exportieren als PDF. Dieser Befehl erzeugt nach der Hilfe eine Arbeitskopie zur Prüfung, keine redigierte Fassung. Wer die beiden verwechselt, hat wieder ein PDF mit Text unter den Balken.

WegVoraussetzungTextebene danach
Ersetzen im AusgangsdokumentQuelldatei vorhandenvorhanden, ohne die Angaben
Acrobat Pro, Schwärzung angewendetLizenzvorhanden, ohne die Angaben
LibreOffice, redigierter Exportkostenloskeine, nur Pixelseiten
Ausdrucken, abdecken, kopieren, scannenKopiererkeine, bis zur Texterkennung

Quelle: LfD Niedersachsen, Juli 2025; Adobe, Stand 3. Mai 2026; Hilfe von LibreOffice; Sächsische Datenschutz- und Transparenzbeauftragte, 30. August 2024.

Der Umweg über Papier

Der dritte Weg ist der älteste. Niedersachsen rät für Papier dazu, die Stellen komplett zu überkleben oder auszuschneiden und dann eine Kopie zu machen, die man weitergibt.

Sachsen nennt das Ausdrucken, analoge Schwärzen und erneute Einscannen als Alternative und warnt zugleich, dass ein schwarzer Stift auf Papier nicht genügt, weil sich die Stelle unter einer Lampe oder mit Bildbearbeitung oft rekonstruieren lässt. Für die Steuerkanzlei mit Belegen in Papierform ist das oft der pragmatische Weg; was dort sonst vor der KI herausmuss, zeigt die Seite für Steuerberater.

Geschwärzte PDF sichtbar machen, bevor es die KI tut: der Test

Welcher Weg auch immer gewählt wurde: Bevor ein geschwärztes PDF in einen Chat geht, lohnt ein kurzer Test mit dem eigenen PDF-Betrachter. Er dauert eine Minute und prüft genau das, was ein Programm beim Hochladen als Erstes liest. Die Sächsische Datenschutzbeauftragte schließt ihre Hinweise mit derselben Empfehlung: zum Schluss auf Schwärzungslücken prüfen.

  1. Kopieren. Einen Bereich über einen Balken hinweg markieren, kopieren und in einen leeren Texteditor einfügen. Erscheint der verdeckte Text, ist nichts geschwärzt.
  2. Suchen. Mit der Suchfunktion des Betrachters nach einem Wort suchen, das unter einem Balken stand, etwa dem Nachnamen. Ein Treffer an der geschwärzten Stelle heißt: Der Text ist noch da.
  3. Lesezeichen öffnen. Die Seitenleiste mit Lesezeichen, Kommentaren und Anlagen aufklappen. Dort steht mitunter, was auf der Seite verschwunden ist, wie im Fall des AstraZeneca-Vertrags.
  1. Lässt sich über einen Balken hinweg Text markieren und kopieren?

    JaNicht geschwärzt. Neu schwärzen, dann erneut testen.

    NeinWeiter zur nächsten Frage.

  2. Findet die Suche ein Wort, das unter einem Balken stand?

    JaNicht geschwärzt, auch wenn das Kopieren nichts ergab.

    NeinWeiter zur nächsten Frage.

  3. Stehen in Lesezeichen, Kommentaren oder Anlagen Teile der geschwärzten Stellen?

    JaBereinigen oder die Seiten in eine neue Datei übernehmen.

Dreimal nein: Die Textebene enthält die geschwärzten Angaben nicht mehr.

Prüffolge vor dem Hochladen, abgeleitet aus unserem Versuch und den Hinweisen der Datenschutzaufsicht in Sachsen und Niedersachsen.

Findet keiner der drei Schritte etwas, ist die Textebene sauber. Das ist die Frage, die für den Chat zählt, aber nicht die einzige. Ein Scan ohne Textebene besteht jeden dieser Tests und kann trotzdem alles zeigen, was auf dem Papier stand, dazu mehr im nächsten Abschnitt. Stammt das PDF aus einem eigenen Word-Entwurf, räumen Sie vor dem Export auch den Korrekturmodus auf, denn nicht angenommene Änderungen können im PDF wieder auftauchen.

Der Test ersetzt außerdem nicht den Blick auf den Rest der Seite. Eine Schwärzung, die technisch sitzt, hilft wenig, wenn Aktenzeichen, Arbeitgeber und Wohnort daneben stehen bleiben. Welche Anforderungen an den KI-Dienst selbst zu stellen sind, damit ein Rest an Angaben vertretbar bleibt, haben wir in der Übersicht DSGVO-konforme KI zusammengestellt.

Original, Arbeitsfassung, Dateiname

Damit der Test nicht vom Zufall abhängt, hilft eine feste Reihenfolge im Büro. Das Original bleibt unverändert in der Akte. Geschwärzt wird immer eine Kopie, die einen erkennbaren Zusatz im Namen trägt, und nur diese Kopie wird getestet und hochgeladen. So kann niemand versehentlich die falsche Fassung in den Chat ziehen, weil beide in derselben Ansicht nebeneinander liegen.

Beim Namen der Kopie lohnt ein zweiter Blick. Eine Datei, die Tannhaus_Nebenkosten_geschwaerzt.pdf heißt, trägt den Namen der Mandantin im Dateinamen, und der erscheint im Chatfenster neben dem Anhang. Ein neutraler Name wie Vermerk_Nebenkosten.pdf verrät nichts. Dasselbe gilt für den Betreff einer E-Mail, aus der das PDF stammt, wenn jemand beides zusammen in den Chat kopiert.

Das gescannte PDF: eine Bildseite, die trotzdem gelesen wird

Ein gescanntes PDF ist ein Stapel Fotos in einem PDF-Umschlag. In unserem Versuch lieferte der Scan ohne Texterkennung kein einziges Zeichen, und wer nur die Textebene betrachtet, könnte ihn für harmlos halten. Das wäre ein Fehlschluss, denn die Programme, um die es hier geht, lesen nicht nur Text.

Nach den Dokumentationen von OpenAI und Anthropic wird jede Seite eines PDF auch als Bild an das Modell gegeben, wenn das Modell Bilder verarbeitet. Ein Sprachmodell mit Bildverarbeitung liest den Inhalt eines Scans ungefähr so, wie ein Mensch ihn liest. Name, Anschrift und Unterschrift auf einem eingescannten Mietvertrag sind für das Modell damit lesbar, obwohl kein Programm eine Textebene findet.

Beim Scan zählt, was auf dem Bild zu sehen ist

Daraus folgt eine einfache Regel. Bei einem Scan entscheidet allein, was auf dem Bild zu sehen ist. Ein Balken, der vor dem Scannen auf dem Papier war oder mit dem redigierten Export ins Bild eingebrannt wurde, verdeckt die Stelle auch für das Modell. Ein Filzstrich, durch den die Schrift noch schimmert, verdeckt sie für das Modell womöglich nicht, denn was sich nach der Sächsischen Datenschutzbeauftragten mit einfacher Bildbearbeitung sichtbar machen lässt, steckt auch im gescannten Bild.

Der vierte Fall aus unserem Versuch zeigt die zweite Falle. Viele Scanner und PDF-Programme bieten eine Texterkennung an, die dem Scan eine unsichtbare Textebene hinterlegt, damit er durchsuchbar wird. Wer danach Balken über das Bild zeichnet, hat dasselbe Problem wie beim überdeckten Text: In unserer Datei standen alle fünf Angaben wieder im Klartext.

Das Foto vom Smartphone

Dasselbe gilt für Fotos. Viele Mandanten fotografieren einen Bescheid, eine Rechnung oder ihren Personalausweis mit dem Handy und schicken das Bild oder ein PDF daraus. Für ein Modell mit Bildverarbeitung ist das ein Scan wie jeder andere, und alles, was auf dem Foto lesbar ist, ist auch für das Modell lesbar. Gespeichert wird das Foto obendrein, in ChatGPT sogar über das Löschen des Chats hinaus: was KI-Dienste mit hochgeladenen Fotos machen.

Wer ein solches Bild vor dem Hochladen bearbeitet, sollte die Stellen nicht verpixeln oder weichzeichnen. Niedersachsen und Sachsen warnen beide, dass sich unscharf gemachte Stellen mit KI rekonstruieren lassen. Niedersachsen empfiehlt stattdessen Balken mit voller Deckkraft und den Export als JPG, also als flaches Bild ohne Ebenen, wie bei einer geschwärzten Führerscheinkopie.

Für Arztpraxen, in denen Befunde und Überweisungen oft als Scan vorliegen, ist das der Normalfall. Was vor einem Chat aus einem Arztbrief herausmuss, steht Zeile für Zeile im Leitfaden Arztbriefe mit ChatGPT; warum schon eine Ausweiskopie mehr enthält als ein Foto, steht in unserem Leitfaden zu besonderen Kategorien.

Schwarzes Loch oder Platzhalter: was der Chat noch versteht

Wer ein PDF für eine Veröffentlichung schwärzt, will, dass an der Stelle nichts mehr steht. Wer ein PDF für einen KI-Chat vorbereitet, hat ein anderes Ziel: Das Modell soll mit dem Text arbeiten können, ohne zu erfahren, um wen es geht. Diese beiden Ziele vertragen sich schlechter, als es scheint.

Ein Schriftsatz, in dem Klägerin, Beklagte und Zeugin als drei gleiche Balken erscheinen, ist für ein Sprachmodell ein Rätsel. Es weiß nicht mehr, wer wem gekündigt hat und wessen Aussage gegen wessen steht, und seine Zusammenfassung wird entsprechend unscharf. Mit Platzhaltern wie Person 1, Person 2 und Person 3 bleibt die Zuordnung erhalten, und die Antwort bezieht sich auf die richtigen Beteiligten.

Ein Beispiel aus dem Alltag zeigt den Unterschied. Die Frage an den Chat lautet: Welche Frist hat die Beklagte versäumt, und was folgt daraus für die Klägerin? Stehen im Schriftsatz an beiden Stellen nur Balken, kann das Modell die Parteien nicht auseinanderhalten und antwortet allgemein oder verwechselt die Rollen. Stehen dort Person 1 und Person 2, bekommt man eine Antwort, die sich auf die richtige Partei bezieht, und setzt die Namen danach selbst wieder ein.

Was die Anwaltschaft dazu schreibt

Die Bundesrechtsanwaltskammer warnt auf Seite 4 ihres KI-Leitfadens, Stand Dezember 2024: Wer nur Klarnamen und Adressen tilgt, hat das Mandat noch nicht geschützt, sobald der Sachverhalt selbst auf den Mandanten schließen lässt. Das gilt für Balken wie für Platzhalter. Eine Schwärzung, die technisch einwandfrei ist, macht aus einem erkennbaren Fall keinen anonymen.

Platzhalter sind deshalb Pseudonymisierung und keine Anonymisierung. Pseudonymisiert sind Daten nach der Begriffsbestimmung in Art. 4 Nr. 5 DSGVO, wenn sie ohne Zusatzwissen keiner Person mehr zuzuordnen sind; personenbezogen bleiben sie trotzdem, solange sich die Zuordnung mit zusätzlichen Informationen wiederherstellen lässt, und diese Zuordnung behalten Sie. Wie der Anbieter die Platzhalter rechtlich einordnen muss, hängt vom Kontext ab; die Rechtsprechung dazu ordnet unser Text über den Unterschied von Pseudonymisierung und Anonymisierung ein.

Manchmal ist die beste Schwärzung gar keine. Wer nur wissen will, wie eine Frist zu berechnen ist oder wie ein Einwand gegen eine Nebenkostenabrechnung üblicherweise aufgebaut wird, braucht das PDF nicht. Die abstrakte Frage, in eigenen Worten und ohne Anhang, verrät nichts über den Fall, und die Antwort überträgt man anschließend selbst. Das kostet ein paar Minuten mehr und erspart jede Prüfung der Textebene.

Was Nonimo aus einem PDF macht

Die Nonimo-App setzt vor dem Chat an, auf Ihrem Rechner, und das PDF bleibt dort. Das Werkzeug über diesem Leitfaden ersetzt die Angaben ebenfalls und gibt Ihnen das Ergebnis; danach wird das Dokument verworfen. In der App legen Sie das PDF in ihrem Fenster ab und erhalten zwei Dinge: den Text mit ersetzten Angaben, fertig zum Einfügen in die KI, und eine ersetzte Kopie des Dokuments. Aus einem PDF wird dabei ein neues PDF mit dem ersetzten Text, ohne die Metadaten des Originals. Unter einem Platzhalter steht nichts, weil der Name im Text selbst ersetzt ist.

So sah der Vermerk aus unserem Versuch in Nonimo aus:

VORHER                                         NACHHER
Kanzlei Musterfeld · Aktenzeichen 3 O 118/26   Kanzlei Musterfeld · Aktenzeichen [AKTENZEICHEN_1]
Mandantin: Frau Mareike Tannhaus               Mandantin: [PERSON_1]
Anschrift: Birkenweg 7, 12345 Musterstadt      Anschrift: [ADRESSE_1]
Geburtsdatum: 14.03.1981                       Geburtsdatum: [GEBURTSDATUM_1]
Telefon 0152 28817386                          Telefon [TELEFON_1]
Erstattung auf IBAN                            Erstattung auf IBAN
DE89 3704 0044 0532 0130 00                    [IBAN_1]
Sachverhalt: Die Mandantin rügt die            Sachverhalt: Die Mandantin rügt die
Nebenkostenabrechnung 2025.                    Nebenkostenabrechnung 2025.

Erfundene Angaben; als IBAN dient die bekannte Musternummer der Banken.

An das Modell gehen nur die Platzhalter, und die Namen setzt die App wieder ein, sobald Sie die Antwort dort einfügen. Das ist Pseudonymisierung: Die Zuordnung bleibt bei Ihnen. Auch einen reinen Scan liest die Nonimo-App per Texterkennung auf Ihrem Rechner, auf Mac und Windows. Welche Daten die App auf Ihrem Rechner behält und welche sie überträgt, beschreibt unsere Seite zur Sicherheit.

Quellen

Die Nonimo-App erledigt das auf Ihrem eigenen Rechner: Sie maskiert Mandantennamen und Ausweisnummern, bevor Ihr Text bei ChatGPT ankommt. Ohne Konto, und sie maskiert auch ohne Internetverbindung.

Häufige Fragen

Kann man eine geschwärzte PDF sichtbar machen?

Oft ja. Eine geschwärzte PDF sichtbar machen gelingt immer dann, wenn der Balken nur über den Text gezeichnet wurde: Markieren und Kopieren reicht, und genau diese Textebene geben OpenAI und Anthropic nach eigener Dokumentation an ihre Modelle weiter. Wurde die Schwärzung dagegen angewendet, ist der Text aus der Datei entfernt und nicht wiederherzustellen. Nonimo ersetzt Namen und Kennungen im Text durch Platzhalter, bevor etwas in den Chat geht.

Liest ChatGPT den Text unter einem schwarzen Balken?

Wenn der Text noch in der Datei steht, bekommt ihn das Modell. OpenAI beschreibt für seine Programmierschnittstelle, dass bei Modellen mit Bildverarbeitung aus einem PDF der Text und ein Bild jeder Seite extrahiert und beide an das Modell geschickt werden. Der Balken verdeckt nur das Bild, nicht die Textebene. Nonimo nimmt die Kennungen vorher aus dem Text und gibt Ihnen eine Fassung mit Platzhaltern zum Einfügen.

Wie prüfe ich, ob ein PDF wirklich geschwärzt ist?

Mit drei Handgriffen in einem gewöhnlichen PDF-Betrachter: die geschwärzte Stelle markieren, kopieren und in einen Texteditor einfügen; mit der Suche nach einem Wort suchen, das unter dem Balken stand; und die Lesezeichenleiste öffnen. Taucht der Text an einer der drei Stellen auf, ist nichts entfernt. Nonimo ersetzt die Angaben im Text selbst, deshalb gibt es dort keinen Balken, unter dem etwas stehen bleibt.

Reicht es, das PDF auszudrucken und wieder einzuscannen?

Für die Textebene ja, denn ein Scan besteht aus Bildseiten ohne Text. Die Sächsische Datenschutzbeauftragte nennt das Ausdrucken, analoge Schwärzen und Einscannen als Weg, warnt aber, dass Filzstift auf Papier unter Licht oder mit Bildbearbeitung durchscheinen kann. Wer den Scan danach durch eine Texterkennung schickt, hat wieder eine Textebene. Auf dem Mac liest die Nonimo-App, die es für Mac und Windows gibt, einen reinen Scan per Texterkennung auf Ihrem Rechner und gibt den Text mit Platzhaltern zurück.

Welche Programme schwärzen ein PDF dauerhaft?

Adobe Acrobat Pro, Premium und Studio haben das Werkzeug PDF schwärzen; dauerhaft wird die Schwärzung erst mit Anwenden und der neuen Datei. LibreOffice bietet unter Extras, Redigieren einen redigierten Export, der ein PDF aus Bildseiten erzeugt. Entscheidend ist nicht der Name des Programms, sondern dass der Text aus der Datei verschwindet. Nonimo geht einen anderen Weg: Es ersetzt Kennungen durch Platzhalter, damit die KI weiter mit dem Text arbeiten kann.

Kann eine KI ein gescanntes PDF lesen?

Ja, wenn sie Bilder verarbeitet. Anthropic beschreibt für seine Programmierschnittstelle, dass jede Seite eines PDF in ein Bild umgewandelt und der Text zusätzlich extrahiert wird; OpenAI beschreibt für Modelle mit Bildverarbeitung dasselbe. Was auf dem Scan zu sehen ist, kann das Modell also lesen, auch ohne Textebene. Ein vollständig gescanntes PDF liest die Nonimo-App auf dem Mac per Texterkennung und gibt Ihnen statt des Scans den Text mit Platzhaltern; die App gibt es für Mac und Windows.

Warum nicht einfach alles schwärzen, bevor das PDF in die KI geht?

Weil ein Modell mit Lücken schlechter arbeitet. Wo drei Personen vorkommen und alle drei als Balken erscheinen, weiß es nicht mehr, wer wem geschrieben hat, und die Antwort wird ungenau. Platzhalter wie Person 1 und Person 2 halten die Zuordnung, ohne die Namen zu verraten. Genau das macht die Nonimo-App: Sie ersetzt die Kennungen durch nummerierte Platzhalter und setzt die Namen wieder ein, wenn Sie die Antwort in die App kopieren.

Was macht Nonimo mit einem PDF?

Sie legen das PDF im Fenster der Nonimo-App ab und sehen eine Vorschau des Textes mit ersetzten Namen, Anschriften, Geburtsdaten, Telefonnummern, IBAN und Aktenzeichen; von dort kopieren Sie ihn in die KI oder laden eine ersetzte Kopie herunter. Das PDF kommt als neues PDF mit dem ersetzten Text zurück, ohne die Metadaten des Originals. Einen reinen Scan liest die Nonimo-App per Texterkennung, auf Mac und Windows, bis zu 50 Seiten, und gibt Ihnen den Text mit Platzhaltern.