Prolifération des données
La prolifération des données désigne les quantités importantes de données que de nombreuses organisations créent quotidiennement. La prolifération des données peut être définie comme la génération de données, ou information numériqueLes données, créées par les entreprises, constituent une ressource précieuse car elles permettent aux dirigeants de prendre des décisions éclairées sur la meilleure façon de servir leurs clients, de développer leur activité et d'améliorer leurs processus. Cependant, la gestion de volumes considérables de données provenant de sources multiples peut représenter un défi de taille.
Les grandes entreprises, en particulier les grandes sociétés, génèrent une quantité impressionnante de données en raison de la grande variété de logiciels utilisés, des nouveaux formats de données, des multiples systèmes de stockage dans le cloud et sur site, et des énormes volumes de données de journalisation générées par les applications. une quantité massive de données générés et stockés dans le monde moderne.
D'où proviennent les données ?
À mesure que les organisations se développent et utilisent de plus en plus les données à des fins d'analyse et d'investigation, ces données sont stockées dans des systèmes d'exploitation, des serveurs, des applications, des réseaux et d'autres technologies. De nombreuses organisations génèrent quotidiennement d'énormes quantités de nouvelles données, notamment :
- données financières, y compris des types de données tels que les transactions bancaires, les données Web, les données de géolocalisation, les données de cartes de crédit et les données de transactions aux points de vente provenant des fournisseurs.
- Données de vente, qui peuvent inclure le chiffre d'affaires par vendeur, le taux de conversion, la durée moyenne d'un cycle de vente, la taille moyenne des transactions, le nombre d'appels passés, l'âge et le statut des prospects, les taux de perte et le nombre d'e-mails envoyés.
- Données transactionnelles, qui peuvent inclure des données clients, des informations sur les bons de commande, les heures travaillées des employés, les coûts d'assurance, les demandes d'indemnisation, le statut des expéditions, les dépôts et retraits bancaires.
- réseaux sociaux, courriel et SMS communications, qui peuvent inclure des indicateurs de performance des médias sociaux, des données démographiques, les heures de la journée, les hashtags, les sujets abordés et les types de contenu.
- Données d'événement décrit les actions effectuées par les entités (essentiellement des données comportementales) ; il comprend l'action, l'horodatage et l'état (informations sur les entités liées à l'événement). Données d'événement est essentiel pour effectuer des analyses.
Ces fichiers et enregistrements sont dispersés sur plusieurs sites, ce qui rend l'inventaire, la sécurisation et l'analyse de toutes ces données extrêmement difficiles.
Comment se produit la prolifération des données ?
La prolifération des données désigne la quantité toujours croissante de données produites quotidiennement par les organisations. Amplifiée par le passage au cloud, cette prolifération permet aux organisations d'évoluer plus rapidement et de produire toujours plus de données. De nouvelles utilisations émergent pour mégadonnées Ces technologies continuent d'évoluer, nécessitant une augmentation de la quantité de données stockées dans les systèmes d'exploitation, les serveurs, les réseaux, les applications et autres technologies.
Pour compliquer encore les choses, les bases de données, les pipelines analytiques et les flux de travail métier migrent rapidement vers le cloud, passant d'un fournisseur de services cloud (CSP) à un autre, structuré et distribué. non structuré Ce passage au cloud est en cours et de nouveaux espaces de stockage de données sont créés en permanence. Les responsables de la sécurité et de la gestion des risques (SRM) peinent à identifier et à déployer ces espaces de stockage. contrôles de sécurité des données de manière constante dans cet environnement.
« …la prolifération des données non structurées (sur site et hybrides/multicloud) est difficile à détecter et à contrôler par rapport aux données structurées. »
Gartner, Cycle de vie des technologies émergentes en matière de sécurité des données, 2022
Les organisations génèrent de nouvelles données à chaque heure de chaque jour. Les données clients dans les systèmes de gestion de la relation client (CRM) peuvent également inclure des données financières, qui se trouvent également dans une base de données comptable ou un système de planification des ressources de l'entreprise (ERP).système ERPLes données de vente et les données transactionnelles peuvent également se trouver dans ces systèmes, cloisonnées par différents services, succursales et appareils. Pour bénéficier des avantages promis par analyse de donnéesLes analystes de données doivent recouper de multiples sources et peuvent donc avoir des difficultés à prendre des décisions précises et éclairées.
En définitive, les organisations ont besoin de données pour faciliter leurs activités quotidiennes et générer des analyses permettant une prise de décision plus éclairée. Le problème, c'est que la quantité de données produites par les organisations devient incontrôlable. Selon une étude récente d'IDC, la sphère de données mondiale devrait atteindre… plus du double entre 2022 et 2026La DataSphere mondiale mesure la quantité de nouvelles données créées, capturées, répliquées et consommées chaque année, et sa croissance est deux fois plus rapide dans la DataSphere d'entreprise que dans la DataSphere grand public.
Les défis de la prolifération des données
À mesure que les organisations génèrent des données de plus en plus rapidement, leur gestion devient complexe. Les données peuvent être stockées à divers endroits, ce qui complique l'accès aux informations stratégiques et la production d'analyses précises. Les membres des équipes doivent recouper des données provenant de sources et de formats multiples, ce qui rend difficile leur gestion. analytique La gestion d'informations dispersées dans différents silos est complexe et coûteuse en temps et en argent. Les données peuvent être corrompues lors de leur transmission, de leur stockage et de leur traitement. Cette corruption compromet leur valeur et le risque de corruption augmente avec la prolifération des données.
De plus, les efforts sont vains lorsque des données sont dupliquées par des employés qui n'ont pas réussi à les trouver à l'endroit prévu, ce qui peut engendrer des données fantômes. Ces données dupliquées sont considérées comme redondantes. D'autres données peuvent être obsolètes (périmées) ou sans intérêt (sans valeur ajoutée pour l'analyse des données). Cet excès de données entraîne une surutilisation des ressources et une augmentation des coûts de stockage dans le cloud.
Les employés peuvent manipuler les données avec négligence, sans se rendre compte des risques liés à leur partage et à leur traitement. Des utilisateurs non autorisés peuvent également accéder à des informations sensibles, notamment lorsque les données produites et stockées ne sont pas gérées correctement. Le classement manuel des données est fastidieux et source d'erreurs, et peut accroître le risque de divulgation de données sensibles. Il est donc essentiel de trouver des solutions automatisées pour gérer de grands volumes de données.
Prolifération des données compromet la valeur des données et présente des risques importants pour la sécurité. Il existe également sécurité Les préoccupations sont liées à la difficulté de contrôler un volume excessif de données. Cela accroît les risques de violations de données et autres risques de sécurité. De plus, les organisations qui ne maîtrisent pas la prolifération des données risquent de compromettre la confiance de leurs clients et de s'exposer à de lourdes sanctions en vertu du Règlement général sur la protection des données (RGPD).RGPD), la loi californienne sur la protection de la vie privée des consommateurs (CCPA), ou autres législation sur la protection des données pour non-respect des règles.
Gérer la prolifération des données
Pour maîtriser la prolifération des données, une approche structurée de leur gestion est indispensable. Il est essentiel de mettre en place une solution pour découvrir et classer les donnéesÉtant donné que les données sont réparties entre les environnements sur site et le cloud, il est essentiel d'identifier ces environnements afin de garantir leur identification et leur gestion complètes. Les outils capables de découvrir et de classifier les données dans les environnements SaaS, IaaS et PaaS sont importants, de même que ceux qui peuvent identifier et classifier les données structurées et non structurées. L'objectif de ces outils est de créer une vue unifiée de l'environnement.
Identifier un emplacement central pour stocker les données est une façon de gérer la prolifération des données. normes de sécurité du cloud Les technologies de stockage cloud continuent de s'améliorer, faisant d'un référentiel cloud centralisé une option attrayante pour de nombreuses organisations. Les plateformes de stockage cloud constituent une excellente méthode pour stocker les données de manière à créer une source unique de vérité, plus accessible aux employés situés dans différents endroits. Parallèlement, les entreprises doivent établir des politiques de gouvernance des accès aux données (DAG) définissant la manière dont les données doivent être collectées, traitées et stockées. Ces politiques doivent également prévoir des mécanismes de gouvernance des données, notamment le contrôle d'accès, la conservation, la gestion des risques, la conformité et la suppression des données (leur élimination en fin de cycle de vie). Les politiques DAG complètent les programmes de prévention des pertes de données (DLP). Gestion de la posture de sécurité des données (DSPM) combine la découverte et la classification des données, la prévention des pertes de données et la gouvernance de l'accès aux données pour créer une approche de nouvelle génération de la sécurité des données dans le cloud.
Solutions pour la prolifération des données
Pour les organisations soucieuses de maîtriser la prolifération des données, il est impératif de connaître les données présentes dans leur environnement, leur emplacement et les personnes y ayant accès. Différents outils permettent de gérer l'ensemble des données stockées par les organisations, mais rares sont ceux qui permettent d'empêcher leur prolifération.
Les solutions automatisées de découverte et de classification des données doivent être capables d'identifier et de classer les données sensibles. Intelligence artificielle (IA) et apprentissage automatique (AA) permet de classer avec plus de précision les données difficiles à identifier, telles que la propriété intellectuelle et les données d'entreprise sensibles.
Les solutions de gestion des données pléthoriques peuvent également renforcer la sécurité globale des données en aidant à localiser et à identifier les données dupliquées et redondantes. Une fois les données pléthoriques identifiées et classées, leur suppression devient plus aisée. données obsolètes ou des données superflues. Cela permet de réduire les coûts de stockage et d'éliminer les données dupliquées et non pertinentes.
Les entreprises collectent quotidiennement des données et il est facile d'en créer de multiples copies. La première étape pour les entreprises qui souhaitent gérer l'accès aux données et prévenir les pertes de données consiste à bien comprendre leurs données : où elles se trouvent actuellement, et si les équipes informatiques ou de sécurité en sont conscientes. magasins de données ou non, et pour toutes les bases de données qui seront créées ultérieurement. Identifier les données sensibles et les personnes y ayant accès permet de prévenir les violations de données en garantissant la mise en œuvre de mesures de sécurité appropriées.