Eingeordnet

Daten anonymisieren, bevor sie an die KI gehen – reicht das?

Kurz gesagt

Teilweise. Eingaben vor dem Versand zu schwärzen senkt das Risiko spürbar und ist besser als gar nichts. Rechtlich bleibt es aber in aller Regel eine Pseudonymisierung und keine Anonymisierung – denn irgendwo existiert die Zuordnung, sonst käme die Antwort nicht lesbar zurück. Damit bleiben die Daten personenbezogen, die DSGVO gilt weiter, und die Verarbeitung findet weiterhin beim externen Anbieter statt. Wer das vermeiden will, muss die Daten nicht besser maskieren, sondern das Haus gar nicht erst verlassen lassen.

Was Maskierung tatsächlich leistet

Das Verfahren ist schnell erklärt: Bevor ein Text an ein Sprachmodell geht, sucht eine Erkennung nach personenbezogenen Angaben – Namen, Adressen, Geburtsdaten, IBANs, Aktenzeichen – und ersetzt sie durch Platzhalter. Das Modell arbeitet mit dem maskierten Text, und in der Antwort werden die Originalwerte wieder eingesetzt. Für die Nutzerin sieht es aus, als hätte die KI den echten Vorgang gelesen.

Der Gewinn ist real und soll hier nicht kleingeredet werden. Ein Klarname weniger im Prompt ist ein Klarname weniger in den Protokollen des Anbieters. Gegen den häufigsten Fehler im Alltag – jemand kopiert ein vollständiges Kundenschreiben in ein Chatfenster – hilft eine automatische Maskierung zuverlässiger als jede Schulung.

Die entscheidende Frage ist aber nicht, ob es hilft. Sie lautet: Reicht es, um die Pflichten zu erfüllen, die einen überhaupt erst zum Nachdenken gebracht haben? Und da wird die Antwort unübersichtlicher.

Wo die Grenze verläuft

Eine Erkennung, die Personenbezug in freiem Text findet, arbeitet mit Wahrscheinlichkeiten. Sie ist nicht deshalb unvollkommen, weil sie schlecht gebaut wäre, sondern weil die Aufgabe selbst keine eindeutige Lösung hat: Ob eine Zeichenfolge identifizierend wirkt, hängt vom Kontext ab, nicht von ihrer Form.

Deshalb nennen Anbieter solcher Verfahren auch Erkennungsraten und keine Garantien. Eine Rate von 95 Prozent klingt hoch – sie bedeutet aber, dass jede zwanzigste Fundstelle nicht als solche erkannt wird. Bei tausend Seiten Schriftverkehr im Monat ist das keine theoretische Größe mehr.

Was maskiert wird Was das löst Was offen bleibt
Namen, Adressen, Geburtsdaten Die offensichtlichen Direktangaben verschwinden aus dem Prompt. Formvariationen, Schreibfehler, Spitznamen und fremdsprachige Namen werden schlechter erkannt als der Normalfall.
Aktenzeichen, Kundennummern, IBANs Strukturierte Kennungen lassen sich zuverlässig über Muster finden. Hausinterne Kennungen ohne festes Format – Projektkürzel, Vorgangsnamen – fallen durch das Raster.
Einzelne Angaben im Fließtext Jede für sich betrachtet ist nach der Maskierung nicht mehr zuordenbar. Die Kombination bleibt: seltene Diagnose plus Ort plus Zeitraum identifiziert eine Person auch ohne Namen.
Der Text als Ganzes Der Anbieter sieht keinen Klartext mehr. Er sieht weiterhin den Sachverhalt – und die Zuordnungstabelle existiert, sonst käme die Antwort nicht lesbar zurück.

Die letzte Zeile ist die wichtigste, und sie führt direkt zum rechtlichen Kern.

Pseudonymisierung ist nicht Anonymisierung

Die DSGVO unterscheidet beides scharf. Anonym sind Daten nur dann, wenn sich der Bezug zu einer Person mit verhältnismäßigem Aufwand von niemandem mehr herstellen lässt – solche Daten fallen nach Erwägungsgrund 26 gar nicht mehr unter die Verordnung. Pseudonymisiert sind Daten, die sich mithilfe zusätzlicher Informationen wieder zuordnen lassen (Art. 4 Nr. 5 DSGVO). Pseudonyme Daten bleiben personenbezogen, und alle Pflichten gelten unverändert weiter.

Ein Verfahren, das Platzhalter setzt und sie in der Antwort wieder auflöst, ist definitionsgemäß das Zweite. Die Zuordnung muss existieren, sonst funktioniert das Produkt nicht. Damit bleibt es eine Verarbeitung personenbezogener Daten – mit Auftragsverarbeitungsvertrag, Verzeichnis von Verarbeitungstätigkeiten, Rechtsgrundlage und gegebenenfalls Datenschutz-Folgenabschätzung.

Für Berufsgeheimnisträger nach § 203 StGB – Kanzleien, Praxen, Beratungsberufe – verschiebt das die Frage noch einmal. Dort ist bereits das Offenbaren gegenüber einem Dritten der kritische Schritt, unabhängig davon, wie gut der Name geschwärzt war. Maskierung kann diesen Schritt abmildern, aber sie macht ihn nicht ungeschehen.

Wann Maskierung trotzdem die richtige Wahl ist

Nichts davon heißt, dass das Verfahren untauglich wäre. Es gibt Fälle, in denen es genau passt:

  • Wenn ein bestimmtes externes Modell gebraucht wird. Manche Aufgaben laufen heute am besten auf einem der großen Anbietermodelle. Wer darauf angewiesen ist, fährt mit Maskierung deutlich besser als ohne.
  • Als Netz gegen menschliche Fehler. Auch neben einer internen Lösung bleibt die Versuchung, schnell etwas ins private Chatfenster zu kippen. Eine erzwungene Maskierung fängt das ab.
  • Bei Material ohne Personenbezug. Für technische Dokumentation, Marketingtexte oder öffentliche Ausschreibungsunterlagen ist die ganze Diskussion gegenstandslos.

Der Fehler liegt nicht darin, zu maskieren. Er liegt darin, Maskierung für eine Standortentscheidung zu halten. Sie verändert, was hinausgeht – nicht, ob etwas hinausgeht und wohin.

Die Alternative: gar nicht erst senden

Der zweite Weg dreht die Reihenfolge um. Statt Daten zu maskieren, bevor sie das Haus verlassen, verlässt nichts das Haus. Das Modell läuft dort, wo die Dokumente ohnehin liegen – on-premise auf eurer eigenen Infrastruktur oder in einem deutschen Rechenzentrum.

Damit lösen sich mehrere Fragen gleichzeitig auf, statt beantwortet werden zu müssen. Es gibt keine Erkennungsrate, weil nichts erkannt werden muss. Es gibt keine Drittlandübermittlung und keine CLOUD-Act-Frage, weil kein Drittland beteiligt ist. Und die Antwortqualität leidet nicht unter der Maskierung: Das Modell sieht den vollständigen Vorgang, weil es ihn sehen darf.

Genau so ist KOSMO gebaut. Der Assistent arbeitet auf euren eigenen Quellen, nennt zu jeder Antwort die Fundstelle, und mit euren Inhalten wird kein Modell trainiert. Wie das im Alltag aussieht, steht unter Anwendung & Funktionen; die rechtliche Einordnung zu Cloud-Diensten unter ChatGPT, Claude & Co. mit Kundendaten.

ⓘ

Hinweis: Diese Seite ordnet ein technisches und rechtliches Muster ein und ersetzt keine Rechtsberatung. Ob ein konkreter Einsatz zulässig ist, hängt von der Branche, den verarbeiteten Daten und der Ausgestaltung im Einzelfall ab – im Zweifel gemeinsam mit dem eigenen Datenschutzbeauftragten oder einer spezialisierten Kanzlei zu klären.

FAQ

Häufige Fragen

Reicht Anonymisierung, um ChatGPT DSGVO-konform zu nutzen?

Sie hilft, genügt aber allein meist nicht. Verfahren, die Platzhalter in der Antwort wieder auflösen, sind rechtlich eine Pseudonymisierung – die Daten bleiben personenbezogen, und die Verarbeitung findet weiterhin beim externen Anbieter statt. Auftragsverarbeitungsvertrag, Rechtsgrundlage und die Frage der Drittlandübermittlung bleiben bestehen.

Was ist der Unterschied zwischen Anonymisierung und Pseudonymisierung?

Anonyme Daten lassen sich von niemandem mehr mit verhältnismäßigem Aufwand einer Person zuordnen; sie fallen nach Erwägungsgrund 26 nicht mehr unter die DSGVO. Pseudonyme Daten lassen sich mit zusätzlichen Informationen wieder zuordnen (Art. 4 Nr. 5 DSGVO) und bleiben vollständig geschützt. Wer Platzhalter in der Antwort zurückübersetzt, hält diese Zusatzinformation zwangsläufig vor.

Wie zuverlässig erkennen solche Verfahren personenbezogene Daten?

Gut, aber nicht vollständig. Strukturierte Angaben wie IBANs oder Geburtsdaten sind über Muster sicher zu finden. Schwieriger sind hausinterne Kennungen ohne festes Format und vor allem Kombinationen: Eine seltene Diagnose zusammen mit Ort und Zeitraum identifiziert eine Person auch ohne Namen.

Leidet die Antwortqualität unter der Maskierung?

Das ist eine Abwägung. Je gründlicher maskiert wird, desto weniger Zusammenhang bleibt dem Modell. Bei juristischen oder medizinischen Texten, in denen Beziehungen zwischen Beteiligten die eigentliche Information sind, kann das spürbar werden.

Gilt das auch für Berufsgeheimnisträger nach § 203 StGB?

Dort ist die Lage strenger. Kritisch ist bereits das Offenbaren gegenüber einem Dritten, unabhängig von der Qualität der Schwärzung. Maskierung mildert das Risiko, beseitigt den Schritt aber nicht. Wer Mandanten-, Patienten- oder Beratungsdaten verarbeitet, sollte diesen Punkt ausdrücklich prüfen lassen.

Braucht KOSMO eine Anonymisierung?

Nein. KOSMO läuft on-premise oder in einem deutschen Rechenzentrum – die Daten verlassen eure Infrastruktur nicht, es gibt also keinen Empfänger, vor dem etwas zu maskieren wäre. Mit euren Inhalten wird auch kein Modell trainiert.

Kann man beides kombinieren?

Ja, und in größeren Organisationen ist das oft sinnvoll. Der interne Assistent deckt den Alltag mit echten Daten ab; für die wenigen Fälle, in denen ein bestimmtes externes Modell gebraucht wird, bleibt Maskierung das Mittel der Wahl.

Der andere Weg

Ein Assistent, bei dem sich die Frage nicht stellt

KOSMO arbeitet auf euren eigenen Quellen – on-premise oder im deutschen Rechenzentrum. Nichts wird nach außen gegeben, nichts wird zum Training verwendet.

So funktioniert KOSMO Demo anfragen

Partner & Förderer