24 september 2026

Wie weet nog wat er in de kelder ligt?

In mijn vorige blog ‘De digitale tijdbom van vergeten data’ schreef ik over bestanden die allang niet meer actief worden gebruikt, maar die ergens blijven bestaan. Op oude netwerkschijven, in backups, in legacy-systemen, op vergeten fileservers of als kopie van een kopie in een map waarvan niemand meer weet waarom die ooit is aangemaakt. Dat klinkt misschien als een theoretisch risico. Dat is het niet meer.

Wie weet nog wat er in de kelder ligt? image

Afgelopen jaren waren diverse voorbeelden waarbij organisaties werden geconfronteerd met gevoelige informatie waarvan ze zelf niet meer wisten dat die nog bestond. Soms kwam die informatie boven bij een hack. Soms werd een oude database door een derde gevonden. En soms ontdekte de organisatie zelf pas veel later dat er een enorme hoeveelheid historische informatie ergens was blijven liggen. De interessante vraag is daarom niet alleen meer: hoe beveiligen we onze data? De eerste vraag zou moeten zijn: ‘Weten we eigenlijk wel welke data we nog hebben?’

Een vergeten database bij de migratie

Een van de meest sprekende voorbeelden is Eatigo, een platform voor restaurant-reserveringen. In 2018 migreerde het bedrijf naar een nieuw platform. Daarbij werd een oude database nog tijdelijk bewaard om de migratie te ondersteunen. Daarna was die database niet meer bedoeld voor gebruik. Maar hij werd ook niet verwijderd. En erger: na de migratie wist de nieuwe technische organisatie niet meer van het bestaan van de database.

In 2020 bleek dat juist deze oude database toegankelijk vanaf internet en werd informatie over ongeveer 2,8 miljoen gebruikers op een online forum te koop aangeboden. Het ging onder meer om namen, e-mailadressen, telefoonnummers, wachtwoordgegevens en gegevens waarmee accounts konden worden gekoppeld. De Singaporese privacy-toezichthouder legde een boete op. Dit zijn precies de incidenten die ik bedoel. Er was geen ingewikkelde aanval nodig op het nieuwe platform. Het probleem zat in iets dat eigenlijk al had moeten worden opgeruimd: een oude database die na een migratie was achtergebleven. De data was oud. Maar het risico bleek springlevend.

Een vergeten oude back-up

Ook Reddit ontdekte in 2018 dat oude data een onverwacht lange levensduur kan hebben. Aanvallers kregen toegang tot een database-backup uit 2007. Die bevatte gegevens uit de eerste jaren van Reddit, waaronder gebruikersnamen, e-mailadressen, wachtwoord-hashes en oude inhoud, inclusief privéberichten. Voor Reddit was die informatie inmiddels meer dan tien jaar oud en niet meer relevant Voor de aanvaller was dat nog steeds interessante informatie.

Dat is een belangrijk onderscheid. Vanuit een organisatie bekeken, kan informatie verouderd zijn omdat het bedrijfsproces waarvoor zij ooit werd gebruikt niet meer bestaat. Maar dat betekent niet dat de informatie haar waarde heeft verloren. Een oude klantenlijst kan nog steeds persoonsgegevens bevatten. Een oude e-mail kan een besluit of toezegging aantonen. Een oud contract kan juridische betekenis hebben. Een oude database kan wachtwoordgegevens bevatten. En een oude interne presentatie kan informatie bevatten die een organisatie liever niet opnieuw op straat ziet liggen. Oud betekent niet ongevaarlijk.

Vier terabyte aan vergeten data

Het wordt nog interessanter wanneer een derde de data vindt voordat de organisatie zelf weet dat er iets mis is. In 2026 werd een publiek toegankelijke SQL Server-backup van ongeveer vier terabyte ontdekt, die aan EY bleek gekoppeld. Onderzoekers vonden de backup tijdens netwerkonderzoek; dit werd vervolgens verantwoord gemeld en EY kon maatregelen nemen.

Vier terabyte. Dat is geen vergeten Word-document op een bureaublad. Dat is een enorme hoeveelheid informatie die ergens staat en blijkbaar toegankelijk is zonder dat de eigenaar dat zo bedoeld heeft. En precies daar verandert het karakter van het probleem. Een organisatie hoeft niet te worden aangevallen om een informatieprobleem te hebben. Iemand hoeft de informatie alleen maar te vinden.

De vergeten datakluis bij de belasting

Nog een voorbeeld dat misschien nog ongemakkelijker is. De Belastingdienst ontdekte in 2026 dat een afgesloten bewaaromgeving, de zogenoemde datakluis, jarenlang buiten beeld was gebleven. In 2019 waren daar ten minste 64 miljoen ongesorteerde bestanden in geplaatst. De omgeving was ingericht als onderdeel van de verplichtingen rond onder meer AVG en archiefwetgeving. Het bijzondere is dat dit geen klassieke cyberaanval was. Niemand hoefde de beveiliging te kraken. De informatie was er gewoon. Maar omdat de omgeving buiten beeld was geraakt, werd de inhoud jarenlang niet meegenomen bij belangrijke informatieverzoeken en parlementaire onderzoeken.

De bestanden worden inmiddels alsnog beoordeeld. Dat maakt deze zaak voor mij juist zo relevant. Want informatie kan verloren raken zonder dat er ook maar één bit verloren gaat. Ik vergelijk het wel eens met een huis. Stel dat een organisatie twintig jaar lang een kelder gebruikt. Elke afdeling zet er dozen neer. Sommige voorzien van keurige labels. Andere hebben alleen een datum. Ook dozen van medewerkers die al jaren vertrokken zijn. Er ‘verhuisdozen’ die bij een reorganisatie zijn blijven staan. En achterin staan dozen waarvan niemand zelfs meer weet wie ze daar heeft neergezet. 

Wat staat er eigenlijk in de kelder?

Op een dag vraagt iemand: “Wat hebben we eigenlijk allemaal in die kelder?” Het antwoord is verrassend vaak: “Dat weten we niet precies.” Digitaal is dat probleem alleen veel groter. Een organisatie heeft niet één kelder, maar tientallen. Netwerkschijven. SharePoint. Mailarchieven. Oude fileservers. Backups. Cloudopslag. Applicatiedatabases. Testomgevingen. Migratiekopieën. Persoonlijke opslag. Exports naar Excel. Oude systemen die officieel zijn uitgefaseerd. En vervolgens zijn er vaak nog kopieën van die kopieën. En daar weer back-ups van. De organisatie denkt dat zij één dossier heeft. De werkelijkheid kan zijn dat hetzelfde document op vijf, tien of twintig plaatsen voorkomt.

Tot voor kort was de enorme omvang van die informatie nog enigszins een bescherming. Wie vier terabyte aan documenten vindt, heeft immers nog geen idee wat erin staat. Maar dat verandert. AI maakt het steeds eenvoudiger om grote hoeveelheden ‘black data’ te doorzoeken, patronen te herkennen en verbanden te leggen. Het verschil tussen “Ik heb vier miljoen bestanden gevonden” en “Ik heb 3.200 documenten gevonden waarin dit onderwerp wordt besproken, 417 documenten met persoonsgegevens en 28 documenten die mogelijk vertrouwelijke informatie bevatten” wordt steeds kleiner. 

Een groeiend, onzichtbaar risico

Dat is voor organisaties een enorme kans, maar ook een fiks risico. Want dezelfde techniek die een organisatie kan helpen om haar vergeten informatie eindelijk te vinden, kan ook een aanvaller helpen om sneller waardevolle informatie uit een enorme dataset te halen. Daarmee verandert de vraag van cybersecurity opnieuw. Niet alleen: kan iemand bij mijn data? Maar ook: als iemand erbij kan, hoe snel kan diegene begrijpen wat hij aan uniek materiaal heeft gevonden?

Daarom begint het probleem van vergeten data wat mij betreft niet met vernietigen. Het begint met kijken. Wat staat er werkelijk? Welke bestanden zijn er? Welke documenten horen bij elkaar? Welke kopieën bestaan er? Waar zitten persoonsgegevens? Welke informatie is gevoelig? Welke dossiers zijn versnipperd? Welke bestanden hebben archiefwaarde? Welke informatie mag worden vernietigd? En misschien wel de belangrijkste vraag: welke verrassingen liggen er nog tussen onze miljoenen bestanden? Dat is precies het soort vraag waarvoor we Archon hebben ontwikkeld.

Een datastofzuiger voor zwarte data

Archon is geen nieuw systeem maar een gereedschap voor informatieprofessionals. Je kunt het zien als een digitale stofzuiger voor grijze en zwarte data. Archon kan – geïnstalleerd op een eigen server – snel grote hoeveelheden bestaande informatie onderzoeken: oude netwerkschijven, fileservers, SharePoint-omgevingen, historische opslag en andere plaatsen waar in de loop der jaren informatie is achtergebleven. Het maakt documenten waar nodig leesbaar, bijvoorbeeld met OCR, en analyseert vervolgens inhoud, documenttypen, relaties, versies, dossiers en context.

Daarmee kan zichtbaar worden wat er werkelijk in zo’n vergeten informatieberg zit. Niet alleen wat een bestand heet, maar ook wat het betekent. Waar staan persoonsgegevens? Welke documenten zijn dubbel? Welke documenten vormen samen één dossier? Welke informatie is gevoelig? Welke metadata ontbreken? Welke documenten horen ergens anders thuis? En welke informatie komt mogelijk in aanmerking voor archivering, vernietiging of nader onderzoek? Archon ondersteunt daarbij de professional. Het systeem analyseert, ordent, classificeert en adviseert; de informatieprofessional blijft degene die beoordeelt en beslist. En helpt zelfs bij het zwartlakken bij WOO-verzoeken.

Archon een gereedschap voor tijdelijk als permanent gebruik

Archon is geen nieuwe digitale kelder waarin alle informatie voortaan permanent moet worden opgeslagen. Het kan tijdelijk worden ingezet voor een grote opschoningsactie. Periodiek om de kwaliteit van informatie te controleren. Of structureel wanneer een organisatie voortdurend zicht wil houden op haar informatiehuishouding. Na afloop kan het weer worden uitgeschakeld zonder dat bestaande systemen hoeven te worden aangepast. De gedachte daarachter is eenvoudig: Archon onderzoekt de informatie, maar wordt niet de nieuwe eigenaar ervan.

De organisatie houdt haar eigen systemen en haar eigen informatiearchitectuur. Archon helpt de informatieprofessional om te zien wat daar werkelijk aanwezig is. En juist dat kan het verschil maken tussen denken dat je je informatie beheerst en het daadwerkelijk kunnen aantonen. De digitale tijdbom waarover ik in mijn vorige blog schreef, is geen theoretisch gevaar. Soms ligt de informatie in een oude database. Soms in een backup. Soms op een vergeten netwerkschijf. Soms in een migratieomgeving die niemand meer beheert. En soms blijkt een organisatie miljoenen bestanden te bezitten waarvan zij niet meer precies weet wat erin staat.

Het gevaarlijkste is misschien niet eens dat die informatie bestaat. Het gevaarlijkste is dat de eigenaar niet meer weet dat zij bestaat, terwijl een ander haar wel kan vinden. Daarom begint informatiebeveiliging soms op een onverwachte plek. Niet met een firewall. Niet met een wachtwoord. Niet met een nieuw informatiesysteem. Maar met een simpele vraag: “Wat staat er eigenlijk nog bij ons?” Want voordat je een digitale tijdbom kunt ontmantelen, moet je eerst weten waar hij ligt.

Door: Hans Timmerman (foto)

ALSO BW + BN Axians banner september 2026
PQR IT op 't Slot BN