Persoonsgegevens in vectordatabases beheersen: waarom embeddings geen anonieme opslag zijn
Embeddings kunnen herleidbare persoonsgegevens bevatten. Lees welke controles u nodig heeft om vectordatabases te scannen, te beperken en aantoonbaar op te schonen.
U moet embeddings behandelen als een verwerking van persoonsgegevens met eigen controles, niet als anonieme opslag. Scan vectordatabases op verborgen persoonsgegevens, beperk wat u embedt, controleer toegang en bewaartermijnen, en leg verwijdering aantoonbaar vast.
De aanleiding is concreet. Een analyse van 16 september 2026 van hoe embeddings herleidbaar zijn naar brontekst en welke controles nodig zijn stelt dat vectoren via embedding inversion kunnen worden teruggerekend naar originele tekst, en dat onderzoekers aantonen dat dit corpus-poisoning-aanvallen tegen dense retrievers kan versterken. Een beveiligingstool die geëxporteerde embeddings lokaal kan scannen op verborgen persoonsgegevens illustreert dat vectordatabases niet automatisch veilig zijn. In onze beoordeling betekent dit dat u de embeddinglaag niet kunt behandelen als een afgesloten fase waarin gegevens verdwijnen. Het is een verwerking met eigen risico's, en u moet kunnen aantonen wat erin zit, wie erbij kan en hoe u het verwijdert.
Waarom embeddings geen anonieme opslag zijn
Een embedding is een numerieke weergave van tekst, maar die weergave is geen willekeurige hash. Onderzoekers tonen aan dat embeddings via embedding inversion kunnen worden teruggerekend naar de oorspronkelijke tekst. Dit betekent twee dingen voor uw praktijk: als de brontekst persoonsgegevens bevat, kan de embedding een benaderende kopie daarvan bevatten. En een vectordatabase is niet alleen een privacyrisico bij lekken, maar ook een aanvalsoppervlak dat kan worden gemanipuleerd. De meest voorkomende denkfout is dat teams embeddings als anonieme afgeleiden beschouwen, terwijl ze feitelijk een gecomprimeerde versie van de inhoud zijn.
Wat de EDPB nu van u verlangt
De European Data Protection Board stelt in Opinion 28/2024 dat de ontwikkeling en inzet van AI-modellen persoonsgegevens kan omvatten, dat verwerkingsverantwoordelijken rechtmatige verwerking en verantwoording moeten kunnen aantonen, en dat anonimiteit per geval moet worden bewezen in plaats van aangenomen. Doorgetrokken naar embeddings betekent dit: u kunt niet stellen dat vectoren automatisch anoniem zijn. Als brontekst met persoonsgegevens in de vectordatabase belandt, valt die verwerking binnen de reikwijdte die de EDPB beschrijft. Dat vraagt om aantoonbaarheid: kunt u laten zien wat er is geëmbed, waar het staat en of het herleidbaar is? De opinie trekt de vectordatabase feitelijk in de AVG-levenscyclus, ook al noemt het document embeddings niet met zoveel woorden.
Welke controles moet u kunnen aantonen?
- Inventariseer welke gegevens u embedt — documenteer welke bronteksten in welke vectordatabases belanden en of zij persoonsgegevens bevatten.
- Scan geëxporteerde vectoren op herleidbaarheid — voer regelmatig controles uit op vectoren die uit uw systemen zijn geëxporteerd of achtergebleven.
- Beperk toegang tot vectorstores — zorg dat alleen geautoriseerde systemen en gebruikers vectordatabases kunnen raadplegen of aanpassen.
- Leg bewaartermijnen vast en handhaaf ze — definieer hoe lang vectoren mogen blijven staan en verwijder ze automatisch na afloop.
- Documenteer verwijdering of her-embedding — zorg dat u kunt aantonen wanneer en hoe u vectoren hebt verwijderd of opnieuw gegenereerd.
Waar u embeddings genereert en bewaart
Een aanvullende beslissing is of u embeddings lokaal of in de cloud genereert. Een tweede beslissing zit aan de bron: als gevoelige waarden nooit in leesbare vorm de embeddinglaag bereiken, verkleint u het inversierisico structureel. Een architectuur die sensitieve documentwaarden vóór AI-verwerking vervangt door synthetische, sessiegebonden equivalenten kan dit bereiken. Dat verkleint wat er te embedden en te reconstrueren valt, maar het eindoordeel over welke gegevens gevoelig zijn, blijft bij u.
Hoe embeddings in uw aanvalsoppervlak passen
Embeddings staan niet los van de rest van uw pijplijn. Zwakke plekken in datasets en verwerkingslagen kunnen aanvallers toegang geven tot interne systemen. Een vectorstore vol herleidbare persoonsgegevens is precies zo'n artefact. Zodra AI-verwerkingslagen interne gegevens blootleggen, kunnen aanvallers erdoorheen bewegen. Dit maakt de vectordatabase niet alleen een privacyrisico, maar ook een onderdeel van uw beveiligingsmodel dat moet worden beheerd.
De vectordatabase laat privacy niet verdwijnen; ze comprimeert die alleen. De juiste vraag is niet of embeddings persoonsgegevens bevatten, maar of u kunt aantonen wat erin zit, wie erbij kan en hoe u het verwijdert. De controles hierboven zijn geen sluitende garantie, maar wel de basis om de embeddinglaag beheersbaar en aantoonbaar te maken. Tooling kan u helpen scannen en monitoren, maar het eindoordeel over welke gegevens gevoelig zijn en hoe lang ze mogen blijven, blijft uw professionele verantwoordelijkheid.
Bronnen: Dit artikel is gebaseerd op berichtgeving en richtlijnen van European Data Protection Board, arXiv, IronCore Labs, Hugging Face en Anthropic.
Geschreven door
Noor El Amrani
Gegevensbescherming, anonimisering in de praktijk, en wat toezichthouders daadwerkelijk als bewijs accepteren.