Découverte et classification des données sensibles
La détection et la classification des données sensibles constituent un processus permettant d'identifier et de catégoriser les informations sensibles ou confidentielles au sein des actifs numériques d'une organisation. Ces informations peuvent inclure des données personnelles identifiables. PII, les informations relatives aux cartes de paiement (PCI), les données financières, les dossiers médicaux, la propriété intellectuelle, les secrets commerciaux et d'autres types de informations sensibles qui doivent être protégés contre tout accès ou divulgation non autorisés.
Forrester La découverte et la classification des données sont définies comme suit : « La capacité à identifier l’emplacement des données sensibles, à déterminer leur nature et les raisons de leur sensibilité, et à les étiqueter en fonction de leur niveau de sensibilité. La découverte et la classification des données sensibles sont précieuses car elles permettent d’identifier les données à protéger et facilitent la mise en place de contrôles de sécurité. Grâce à cette visibilité et à cette compréhension des données, les organisations optimisent leurs politiques d’utilisation et de gestion des données et identifient les contrôles appropriés en matière de sécurité, de confidentialité et de gouvernance des données. Elles peuvent automatiser les processus de remédiation pour protéger les données et obtenir des informations précieuses pour éclairer les décisions relatives aux politiques, à la gestion des données et à leur cycle de vie. »
Selon Gartner« Les solutions de découverte de données permettent de découvrir, d'analyser et de classer les données structurées et non structurées afin de générer des résultats concrets pour le renforcement de la sécurité et la gestion du cycle de vie des données. En utilisant des métadonnées, du contenu et des informations contextuelles, combinés à des modèles de données basés sur l'expression et l'apprentissage automatique, les solutions de découverte de données fournissent des conseils et des processus exploitables pour faire progresser les initiatives de gestion et de sécurité des données. »
Le processus de découverte et de classification des données est essentiel pour garantir leur sécurité, leur confidentialité et leur conformité. En identifiant et en catégorisant les informations sensibles, les organisations peuvent prendre les mesures appropriées pour les protéger, réduire les risques de violation de données et maintenir la confiance de leurs clients, partenaires et organismes de réglementation. Compte tenu des volumes considérables de données générées et stockées par les organisations, des outils et technologies automatisés sont souvent utilisés pour rationaliser et optimiser ce processus.
Dans cet article, vous découvrirez la découverte et la classification des données sensibles : leur définition, leur origine et leur mise en œuvre. Nous identifierons les principaux défis rencontrés par les équipes de sécurité avec les méthodes traditionnelles de découverte et de classification, et comment les outils de nouvelle génération, basés sur le cloud et l’IA, innovent dans ce domaine. Vous découvrirez également leur relation avec… gestion de la posture de sécurité des données (DSPM) et comment cela s'inscrit dans la tendance aux pratiques de sécurité « zéro confiance ».
Histoire de la classification des données
La classification des données a une longue histoire, qui remonte aux systèmes de données gouvernementaux et militaires utilisant des étiquettes comme confidentiel, secret et top secret, afin de contrôler l'accès aux informations critiques. À la fin des années 1970 et dans les années 1980, avec la popularisation des ordinateurs, la nécessité de protéger les données sensibles contre les accès non autorisés a conduit au développement de systèmes de contrôle d'accès, tels que les noms d'utilisateur et les mots de passe.
Avec l'essor d'Internet et des plateformes de communication dans les années 1990, la protection des données lors de leur transmission est devenue essentielle, donnant naissance à des méthodes de chiffrement comme Couche de sockets sécurisée (SSL)Au début des années 2000, des réglementations gouvernementales, telles que Loi sur la portabilité et la responsabilité en matière d'assurance maladie (HIPAA) en 2003 et le Norme de sécurité des données de l'industrie des cartes de paiement (PCI DSS) En 2004, la classification et la protection des données ont été rendues obligatoires dans les secteurs de la santé et de la finance.
Plus récemment, des réglementations strictes en matière de protection des données, telles que Règlement général sur la protection des données (RGPD) Les violations de données ont mis en lumière l'importance de la détection et de la classification des données sensibles. Bien que le concept de base existe depuis les débuts de l'informatique, sa formalisation et son adoption généralisée ont évolué pour répondre à la complexité numérique et aux enjeux de confidentialité.
Nécessité de la découverte et de la classification des données sensibles
En termes simples, les données sensibles sont des données qui doivent être protégées contre tout accès non autorisé.
Les données sensibles peuvent être classées en plusieurs catégories, dont certaines ont déjà été mentionnées.
Informations personnelles identifiables
PII Il s'agit de données permettant d'identifier une personne. Ces données comprennent généralement Numéros de sécurité sociale (SSN); les données biométriques, comme les empreintes digitales ou les scans faciaux ; ou toute combinaison de données qui, ensemble, pourraient permettre d’identifier un individu.
Informations personnelles
Les renseignements personnels (RP) constituent une classification plus générale des données. Les RP peuvent inclure les informations personnelles identifiables (IPI), mais aussi d'autres données clairement liées à une personne, sans pour autant permettre son identification. Cette classification est beaucoup plus large et peut inclure des données telles que :
- Informations sur l'emplacement
- Photographies
- Origine raciale
- casier judiciaire
- Informations sanitaires ou génétiques
Informations non publiques sur le matériel
Les informations privilégiées (IP) sont des données relatives à une entreprise, notamment ses participations, ses filiales et toute autre information susceptible d'influencer le cours de son action. Ces informations comprennent notamment les éléments suivants :
- Rapports sur les résultats
- Les prochaines actions de l'entreprise, comme introductions en bourse (IPO)
- Les résultats des procédures judiciaires
Chacune de ces informations pourrait avoir un impact sur le cours des actions d'une entreprise et, par conséquent, ces informations peuvent être utilisées pour obtenir un avantage lors de transactions boursières, qui sont très réglementées et généralement illégales.
Informations de santé protégées
Informations de santé protégées (ISP) est un type de données sensibles spécifiquement réglementé par la loi HIPAA et comprend dix-huit identifiants, y compris, mais sans s'y limiter, les éléments suivants :
- Noms
- numéros de téléphone
- Informations sur l'emplacement
- Numéros de compte
- numéros de dossier médical
Autres types de données
Il existe de nombreux autres types de données non abordés dans ce guide, mais comme vous pouvez le constater, la classification des données est importante, surtout si elle est soumise à une réglementation nationale ou internationale, comme le RGPD.
Impact de la migration vers le cloud sur la découverte et la classification des données sensibles
Dans l'informatique moderne, de plus en plus d'entreprises et de services migrent leurs données vers le cloud. Cette transition simplifie l'évolution de votre solution, car il n'est plus nécessaire d'investir dans du matériel supplémentaire. De plus, les fournisseurs d'hébergement cloud offrent une redondance, une fiabilité et une sauvegarde automatiques. La reprise après sinistre peut également être automatisée et intégrée à votre plan de stockage.
Cependant, cela ne signifie pas nécessairement qu'identifier, classer et protéger les données sensibles soit plus facile avec le stockage cloud. Dans un modèle de centre de données traditionnel, l'entreprise est responsable de la sécurité de l'ensemble de son environnement d'exploitation, y compris ses applications, ses serveurs physiques, les contrôles d'accès et même la sécurité physique du bâtiment. Dans un environnement cloud, le fournisseur de solutions cloud (CSP) apporte un soulagement considérable en prenant en charge une partie des charges opérationnelles, notamment la sécurité. Afin de clarifier la répartition des responsabilités, les CSP ont introduit le concept de modèle de responsabilité partagéeCe modèle définit les responsabilités respectives du fournisseur de services cloud (CSP) et de l'équipe de sécurité de l'entreprise lors de la migration des applications, des données, des conteneurs et des charges de travail vers le cloud. Il est impératif de bien délimiter vos responsabilités et celles du CSP afin de réduire le risque d'introduction de vulnérabilités dans vos environnements cloud publics, hybrides et multicloud.

Aujourd'hui, une entreprise gère en moyenne au moins dix environnements cloud, répartis entre les modèles de déploiement IaaS (Information as a Service), PaaS (Platform as a Service) et SaaS (Software as a Service). Comme l'illustre l'image, un point commun à ces environnements est que la responsabilité de la sécurité des données incombe à l'entreprise, et non au fournisseur de services cloud (CSP). Ceci met en lumière une difficulté majeure pour les équipes de sécurité lors de la migration des données des entreprises qu'elles accompagnent vers le cloud. La nature permissive du cloud, notamment dans les environnements SaaS, facilite la prolifération et le partage des données, et complexifie la gestion et le contrôle de ces données par les équipes informatiques et de sécurité.
Historiquement, les outils qui combinaient les capacités de découverte et de classification des données nécessitaient une intervention humaine pour fonctionner. Afin de découvrir un entrepôt de données, des outils comme catalogues de données, systèmes de gestion de l'information, et outils de prévention des pertes de données (DLP), nécessitent une intervention humaine pour connecter manuellement l'outil à la base de données. Ceci est généralement réalisé à l'aide d'un JDBC ou ODBC Une connexion, une API ou un proxy réseau permet de détecter le trafic entrant et sortant d'une base de données. Par conséquent, les personnes chargées de la mise en œuvre et de l'administration des systèmes doivent connaître l'existence de la base de données, son emplacement et la procédure de connexion de l'outil à ce système.
De même, en matière de classification, les humains supportent une charge initiale importante pour établir les métadonnées et balisage nécessaire à l'efficacité d'un outil de classification. Définition des métadonnées, notamment Étiquettes de sensibilité de Microsoft Information Protection (MIP) Dans les environnements Microsoft 365, il est nécessaire de créer manuellement des classificateurs pour définir le mécanisme de détection de la classe de données. Cette dernière étape requiert expressions régulières (RegEx)L'outil utilise des exemples de données et d'objets pour faire correspondre le modèle fourni aux données de l'environnement connecté. De nombreuses entreprises gèrent encore manuellement leurs inventaires de données selon ces méthodes et souffrent du manque d'automatisation offert par leurs outils d'exploration de données.
La plupart des outils nécessitent une exploration manuelle des données
Aujourd'hui, les outils modernes natifs du cloud mettent en œuvre des processus automatisés pour s'adapter à l'évolution de la manière dont les entreprises créent, consomment et utilisent les données. Auparavant, les administrateurs devaient acquérir manuellement les compétences nécessaires pour découvrir et organiser les données dans différents entrepôts de données. Cette procédure, extrêmement chronophage, était généralement effectuée en plus des tâches habituelles des employés.
Les processus manuels ont conduit à ce que 74 % des décideurs en matière de sécurité estiment que… Les données sensibles de leur organisation ont été compromises au moins une fois en 2022.D'après une étude récente commandée par Cyera et réalisée en collaboration avec Forrester Consulting, 59 % des responsables de la sécurité admettent avoir des difficultés à maintenir un inventaire détaillé des données. La recherche et la classification manuelles des données sont souvent sources d'erreurs et nécessitent une connaissance approfondie de l'organisation par chaque employé pour être menées à bien.
Il existe plusieurs autres complexités à prendre en compte, notamment les suivantes :
- localisation et résidence des donnéesCertaines réglementations (comme le RGPD) encadrent précisément le lieu de stockage des données, notamment celles des résidents de l'Union européenne (UE). Avec le stockage cloud, il est possible que vous ignoriez dans quels centres de données se trouvent les données de vos clients.
- Chiffrement des donnéesBien que le stockage cloud offre le chiffrement, il peut être difficile de garantir une politique de chiffrement cohérente pour tous vos différents types de données.
- Intégration avec les outils de découverte de données : Il est fort probable que des configurations et des adaptations supplémentaires soient nécessaires si vous souhaitez intégrer vos outils de découverte de données à votre stockage cloud.
En général, l'ingénierie du stockage des données est plus simple, mais la sécurité des données est exponentiellement plus complexe. Il est plus difficile de localiser (géographiquement et informatiquement) et de sécuriser différents types d'informations sensibles présentes dans toute l'organisation. De plus, les classificateurs statiques, qui visent au mieux à définir une classe de données individuelle, mais ne peuvent identifier le rôle, la région, l'identifiabilité ou le niveau de sécurité qui fournissent un contexte essentiel sur les données, ont historiquement ajouté de la complexité et du travail manuel supplémentaires pour rendre les classifications exploitables par les équipes de sécurité et de protection de la vie privée.
Rôle de la découverte et de la classification des données dans la sécurité et la conformité
Les différents types de données soulignent également la nécessité de découvrir et de classer les données, notamment en ce qui concerne votre niveau de sécurité et votre conformité réglementaire.
Il existe une tendance émergente en matière de sécurité appelée DSPM qui vise à répondre à quelques questions concernant vos données et leur sécurité, notamment les suivantes :
- Où sont stockées mes données sensibles ?
- Quelles données sensibles sont menacées ?
- Que peut-on faire pour atténuer ou corriger ce risque ?
La découverte et la classification des données sensibles font partie intégrante de votre stratégie DSPM, comme illustré dans ce diagramme :

Comme vous pouvez le constater, disposer d'une stratégie DSPM est important si votre organisation traite des données sensibles, et des outils de découverte et de classification des données, tels que Cyera, constituent une partie importante de cette stratégie.
Cas d'utilisation concrets pour la découverte et la classification des données sensibles
Il existe de nombreux cas d'utilisation pour la découverte de données sensibles dans le monde réel. Quelques exemples courants sont présentés dans les sections suivantes.
Conformité
Vos outils d'exploration de données doivent tenir compte du fait que différents types de données doivent se conformer à différentes réglementations et normes de sécurité. Si vous êtes traitement des données de type HIPAA Si vous exercez une activité commerciale dans l'UE, votre solution de découverte de données doit garantir que vos pratiques en matière de données sont conformes aux dispositions de cette réglementation.
Certaines juridictions et certains pays, comme l'UE et les Philippines, accordent à leurs utilisateurs un meilleur contrôle sur leurs données personnelles. Les lois et les directives publiées dans ces régions permettent de mieux contrôler ces données. personnes concernées un certain pouvoir d'exercer leur « le droit à l'oubli », du moins dans une certaine mesure.
En vertu du RGPD, et plus précisément, les personnes concernées disposent également des « le droit à l'information », qu'un utilisateur peut utiliser pour interroger un tiers sur l'emplacement de ses données personnelles que ce tiers pourrait stocker.
Un bon outil de découverte de données doit connaître ces normes et droits et s'efforcer de découvrir et de classer en conséquence toutes les données trouvées.
Fusions et acquisitions
L'acquisition ou la fusion d'une entreprise avec une autre peut engendrer de nombreuses complexités au sein de votre DSPM. Rien ne garantit que l'entreprise que vous envisagez d'acquérir respecte les pratiques réglementaires.
Un outil de découverte et de classification des données est essentiel pour évaluer le niveau de sécurité de l'entreprise que vous envisagez d'acquérir ou avec laquelle vous souhaitez fusionner.
Au-delà de la sécurité, vous finirez probablement par hériter des données de l'autre entreprise, y compris de toutes les informations sensibles qu'elle pourrait détenir concernant ses clients ou partenaires.
Le processus de découverte et de classification de ces données est essentiel, non seulement pour leur intégration dans les bases de données de votre entreprise, mais aussi pour identifier les éventuelles lacunes en matière de risques.
Intervention en cas d'incident
En cas de fuite de données, une partie de la réponse à l'incident consiste à identifier et à classer les types de données qui ont fuité lors de cette fuite.
Ce processus détermine la manière dont vous devez réagir à la violation, concernant tous ses aspects, y compris les obligations de divulgation de la violation et la communication à vos clients et/ou partenaires commerciaux.
Autres approches de découverte et de classification des données
Dans une grande organisation, différentes stratégies permettent de localiser et de classer les données sensibles. Chaque approche présente ses propres avantages et inconvénients.
Approche cloisonnée
En adoptant une approche cloisonnée, vous confiez à chaque département la responsabilité d'identifier, de gérer et de localiser les différentes parties des données sensibles dont il est responsable.
Cette approche est considérée comme décentralisée et présente plusieurs avantages :
- Chaque équipe comprend mieux ses propres données que celles qui tentent de comprendre les données de tout le monde.
- Cela permet une meilleure personnalisation des outils utilisés, en les adaptant aux types de données spécifiques qu'ils traitent.
Cependant, cette approche présente aussi des inconvénients. Par exemple, les silos peuvent entraver la collaboration entre les services et ne pas respecter les bonnes pratiques de l'entreprise. De plus, le risque que vos équipes dupliquent des tâches qui pourraient être gérées plus efficacement par un service dédié augmente. Le plus préoccupant est sans doute que la gestion cloisonnée des données masque la dérive des données, leur prolifération (via les données fantômes et les copies), les accès trop permissifs et les utilisations abusives. Dans tous ces cas, lorsque les données circulent au sein d'une organisation, elles traversent des silos de visibilité et de gestion, ce qui accroît la probabilité que les erreurs de configuration, les utilisations abusives et les activités malveillantes passent inaperçues. Cela augmente, par conséquent, le risque de violation de données.
Approche en étoile
En mettant en œuvre une approche en étoile, la responsabilité de la découverte, de la classification et de la gestion de vos données sensibles repose sur une équipe centrale dédiée à cette fonction.
Là encore, cette approche présente des avantages et des inconvénients. Du point de vue de la supervision, il est plus facile pour une équipe centrale de s'assurer que toutes les données sont couvertes par les politiques d'entreprise en matière de classification et de sécurité des données. De plus, une équipe centralisée peut plus facilement élaborer une méthode et/ou des critères standardisés pour la classification. Enfin, cette approche est plus efficace, car le risque que d'autres équipes effectuent le même travail sur les mêmes ensembles de données est quasi nul.
Toutefois, si une équipe centralisée ne dispose pas de ressources suffisantes, elle risque de constituer un goulot d'étranglement pour l'intégration ou la classification de nouvelles sources de données, notamment au sein d'une organisation vaste et complexe. De plus, une équipe centralisée ne peut appliquer que les règles que l'entreprise lui confère. Si la politique officielle ne lui accorde pas le pouvoir d'appliquer ses politiques de classification aux autres services, elle risque d'être ignorée ou perçue comme une source de problèmes.
L'avenir de la découverte et de la classification des données sensibles
Bien que le DSPM soit une tendance relativement nouvelle et émergente, il est clair que l'industrie en aura besoin à l'avenir.
Il existe déjà des plateformes de sécurité des données, comme CyeraCes solutions intègrent des algorithmes d'apprentissage automatique pour analyser les types de données spécifiques à l'environnement client. Leurs logiciels peuvent également se connecter à l'infrastructure cloud de l'entreprise via un rôle IAM unique, permettant ainsi une analyse continue et sans agent des données hébergées dans le cloud. Ce point est particulièrement important, car de plus en plus d'organisations migrent leurs données vers le cloud.
Conclusion
La découverte et la classification des données sensibles sont des processus essentiels qui permettent d'identifier les données sensibles présentes dans votre environnement et, par conséquent, de définir votre stratégie de sécurité des données. Elles font également partie intégrante du cadre DSPM, qui vous aide à identifier et à atténuer les risques associés aux données sensibles que vous gérez. Les responsables de la sécurité espèrent tirer des bénéfices transformationnels majeurs de l'amélioration de la sécurité des données grâce à l'automatisation intelligente. Pour ce faire, ils investissent dans la détection des expositions en temps réel et la gestion de la posture de sécurité des données.
Cette évolution promet d'améliorer l'automatisation et l'orchestration des politiques de sécurité, avec des impacts tangibles dans les domaines suivants :
Délai de rentabilisation réduit
78 % des responsables de la sécurité estiment qu'accélérer le retour sur investissement de leurs solutions de sécurité des données est essentiel, voire primordial. Cyera s'intègre avec un rôle IAM unique qui permet la découverte dynamique des datastores, quel que soit le modèle de déploiement. Ainsi, la solution détecte en continu les datastores nouveaux et modifiés, sans intervention humaine, et s'adapte ainsi à l'évolution rapide des environnements cloud.
Amélioration de la précision de la classification et de la détection
74 % des responsables de la sécurité investissent dans la création et la maintenance automatisées d'inventaires de données, et 71 % privilégient l'amélioration de la précision de la classification des données. La plateforme de sécurité des données de Cyera, basée sur l'IA, automatise entièrement la classification et utilise le ML et l'IA pour atteindre une précision supérieure à 95 % sans intervention humaine.
Activation des contrôles de sécurité dynamiques
81 % des responsables de la sécurité souhaitent activer des contrôles de sécurité dynamiques. Afin de permettre aux équipes de sécurité de mettre en œuvre les contrôles appropriés en toute confiance, Cyera utilise des modèles de langage (LLM) pour détecter les entités nommées et extraire des sujets des environnements afin d'obtenir un contexte détaillé des données, notamment en identifiant leur rôle, leur région, leur identifiabilité et leur niveau de sécurité, et ainsi définir des contrôles spécifiques et adaptés.
Voyez comment Cyera Plateforme de sécurité des données basée sur l'IA applique ces fonctionnalités à toutes les données de l'entreprise, où qu'elles se trouvent.
Si vous souhaitez en savoir plus sur la gestion de la posture de sécurité des données, consultez ce document. glossaire pour plus d'informations.
Auteur: Thinus Swart