Welkom bij alweer blog nummer 26 in onze reeks over grip krijgen op je informatie. Voordat we verder de diepte induiken stellen we ons graag nog even voor.
Wij zijn Willem Jonkers (Solution Engineer bij AvePoint) en Jeroen Bijdevier (Security Architect bij AVK Training & Coaching). Samen bundelen we onze kennis vanuit de techniek en de beveiliging om organisaties te helpen grip te krijgen op hun Microsoft 365-omgeving.
In eerdere blogs kwamen gevoeligheidslabels steeds even voorbij: bij DAG-rapporten, bij ROT-content, bij de Copilot Health Check. Tijd om er een keer echt induiken. In deze blog nemen we gevoeligheidslabels, de onderliggende classificatiemethoden en auto-labeling uitgebreid door en we laten zien waarom dit fundament direct bepaalt hoe veilig Copilot met je data omgaat. Ik ben een Microsoft trainer (MCT) en dit kwam ter sprake tijdens mijn sessie. Deze kennis is ook handig als je het SC-401 examen wilt gaan doen.
Classificatie is wat het is, labels zijn hoe je het behandelt
Een onderscheid dat vaak wordt vergeten: classificatie en labels zijn niet hetzelfde. Classificatie is het herkennen wat content is. Een label bepaalt hoe je die content vervolgens behandelt met encryptie, watermerken, toegangsbeperkingen of gewoon een visuele markering. Microsoft Purview kent drie manieren om content te classificeren:
- Sensitive Information Types (SIT’s) – patroonherkenning op basis van reguliere expressies, checksums en keywords. Denk aan creditcardnummers, IBAN’s of BSN-nummers. Microsoft levert een uitgebreide bibliotheek met kant-en-klare SIT’s, en je kunt eigen SIT’s toevoegen.
- Exact Data Match (EDM) – matcht exacte waarden uit een gehashte referentiedataset (bijvoorbeeld je eigen klantnummers) tegen content in SharePoint, OneDrive en Exchange. Dit levert veel minder false positives op dan generieke patroonherkenning, omdat het niet raadt of iets een klantnummer is, maar het daadwerkelijk vergelijkt met je eigen data.
- Trainable classifiers – herkennen concepten die niet in een patroon te vangen zijn, zoals ‘offertes’ of ‘notulen van de directie’. Je trained een classifier door twee sets voorbeelden aan te leveren: content die wel in de categorie hoort, en content die daar nadrukkelijk niet in hoort. Microsoft levert ook vooraf getrainde classifiers.
Deze drie classificatiemethoden zijn de bouwstenen die je vervolgens gebruikt in gevoeligheidslabels, én in DLP-beleid, én in retentiebeleid, én in Communication Compliance. Deze laatste hebben we ook besproken tijdens de DDSCC podcast van juli.
Auto-labeling: client-side versus service-side
Zodra je labels hebt gedefinieerd, is de volgende vraag: wie past ze toe? Handmatig labelen werkt, maar leunt volledig op de discipline van de gebruiker. Microsoft biedt twee automatische methoden, met een fundamenteel verschil in werking. Zelf ben ik voorstander van om te beginnen met handmatig labelen. Daarna pas automatisch labelen en alles op de menselijke maat. Dit zijn geen IT feestjes.
Client-side auto-labeling
Dit gebeurt in de Office-app zelf (Word, Excel, PowerPoint, Outlook), op het moment dat een gebruiker een document bewerkt of een e-mail opstelt, beantwoordt of doorstuurt. Detecteert de app een SIT of trainable classifier, dan krijgt de gebruiker een melding en suggestie om een label toe te passen. Of het label wordt direct toegepast, afhankelijk van je configuratie.
Service-side auto-labeling
Dit gebeurt op contentniveau, in SharePoint, OneDrive (data at rest) en Exchange Online (data in transit, niet in rust), zonder dat de gebruiker er iets van merkt of iets moet doen. Omdat de service dit zelf uitvoert, ben je niet afhankelijk van welke Office-versie een gebruiker heeft. Het werkt direct, organisatie breed. Een beheerder beoordeelt de resultaten in simulatiemodus voordat het beleid daadwerkelijk labels begint toe te passen.
De link met Copilot: labels als grens voor grounding
Dit is de reden waarom deze blog in onze reeks hoort. Wanneer Copilot een vraag beantwoordt, doorzoekt het SharePoint en OneDrive om relevante content te vinden. Dit heet grounding. Copilot respecteert daarbij bestaande rechten én bestaande labels. Is een bestand versleuteld met een gevoeligheidslabel, dan houdt Copilot zich aan die versleuteling: een gebruiker zonder toegangsrecht op dat label krijgt de inhoud niet te zien via Copilot, ook niet indirect via een samenvatting of citaat.
Wil je dit nog verder aanscherpen, dan biedt Microsoft Purview DLP een specifieke locatie voor Microsoft 365 Copilot en Copilot Chat. Hiermee stel je een regel in op basis van de voorwaarde ‘Content contains > Sensitivity labels’, met als actie het voorkomen dat Copilot de inhoud van items met bepaalde labels gebruikt in zijn antwoorden. Zelfs als het item nog wel als citaat/bronvermelding verschijnt. Dit is dus fijnmaziger dan alleen encryptie: je kunt specifiek bepalen dat Copilot een ‘Vertrouwelijk’-gelabeld bestand niet mag samenvatten, zonder de rest van de site te blokkeren.
Zelf ben ik voorstaander van een label “Niet voor Copilot”. Dit geeft expliciet aan dat de inhoud niet toegankelijk is voor Copilot en is door de medewerker zelf in te stellen. Zeker wanneer de rechten nog niet helemaal op orde zijn, kan dit gewenst zijn. Zie ook eerdere blog over rechten op orde krijgen.
Praktische randvoorwaarde: schakel gevoeligheidslabels voor Office-bestanden in SharePoint en OneDrive in, zodat deze diensten versleutelde bestanden nog steeds kunnen indexeren en co-auteren in de browser met behoud van de labelbeperkingen. Schakel ook co-auteren voor versleutelde bestanden in, zodat realtime samenwerken en AutoSave blijven werken op beschermde documenten. Overweeg daarnaast een standaardlabel per documentbibliotheek in te stellen, zodat nieuwe of bewerkte bestanden niet ongelabeld blijven staan.

Trainable classifiers in de praktijk: klein beginnen, goed testen
Een eigen trainable classifier maken doe je via Purview-portal > Data loss prevention > Data classification > Classifiers > Trainable classifiers, met de rol Compliance Administrator of Security Administrator. Je levert twee sets voorbeelden aan: content die zeker in de categorie hoort, en content die zeker niet in de categorie hoort. Purview bouwt op basis daarvan een voorspellingsmodel en test dat model tegen nieuwe content. Vervolgens beoordeel je zelf de voorspellingen: correct, incorrect of onzeker, om de nauwkeurigheid te verbeteren.
Let op: classifiers werken alleen op onversleutelde items. Een bestand dat al is versleuteld met een label, kan een classifier niet meer beoordelen. Zorg dus dat je classificatie plaatsvindt vóórdat encryptie in beeld komt, niet erna.
Eenmaal gepubliceerd, is een trainable classifier bruikbaar als voorwaarde in maar liefst drie plekken: Office auto-labeling met gevoeligheidslabels, auto-apply retentiebeleid op basis van een voorwaarde, en Communication Compliance.
Voorbeeld van een minimale label set van vertrouwelijkheidslabels als startpunt.

Conclusie
Gevoeligheidslabels zijn meer dan alleen een tag op een bestand. Ze zijn het scharnierpunt tussen classificatie (wat is dit), bescherming (encryptie, watermerken, toegang) en governance (DLP, retentie, en tegenwoordig ook Copilot). Zonder een doordachte labelstructuur blijft elke andere maatregel, van DAG-rapporten tot Copilot-DLP, bouwen op los zand.
Mijn advies begin klein: kies een beperkte set labels die aansluit op hoe de organisatie al over informatie praat. Labels die niemand begrijpt of die te vaak verkeerd worden toegepast, doen meer kwaad dan goed. Ze geven een vals gevoel van controle, terwijl de daadwerkelijke bescherming ontbreekt.

