Expansión de datos
La proliferación de datos se refiere a las cantidades significativas de datos que muchas organizaciones crean diariamente. La proliferación de datos se puede definir como la generación de datos o información digitalLos datos son un recurso valioso, ya que permiten a los líderes empresariales tomar decisiones basadas en datos sobre cómo atender mejor a sus clientes, hacer crecer su negocio y optimizar sus procesos. Sin embargo, gestionar grandes cantidades de datos y tantas fuentes de datos puede ser un desafío considerable.
Las grandes empresas, en particular las corporaciones, generan una cantidad asombrosa de datos debido a la amplia variedad de productos de software en uso, así como a los formatos de datos recientemente introducidos, los múltiples sistemas de almacenamiento en la nube y en entornos locales, y las enormes cantidades de datos de registro generados por las aplicaciones. Existe una cantidad abrumadora de datos se generan y almacenan en el mundo moderno.
¿De dónde provienen los datos?
A medida que las organizaciones crecen y utilizan cada vez más datos para análisis e investigación, estos se almacenan en sistemas operativos, servidores, aplicaciones, redes y otras tecnologías. Muchas organizaciones generan enormes cantidades de datos nuevos a diario, entre los que se incluyen:
- Datos financieros, incluyendo tipos de datos como transacciones bancarias, datos web, datos de geolocalización, datos de tarjetas de crédito y datos de transacciones en puntos de venta de proveedores.
- Datos de ventas, que pueden incluir los ingresos por vendedor, la tasa de conversión, la duración media de un ciclo de ventas, el tamaño medio de las transacciones, el número de llamadas realizadas, la antigüedad y el estado de los clientes potenciales, las tasas de pérdida y el número de correos electrónicos enviados.
- Datos transaccionales, que pueden incluir datos de clientes, información de órdenes de compra, horas trabajadas por los empleados, costos de seguros, reclamaciones de seguros, estado de envío, depósitos y retiros bancarios.
- Redes sociales, correo electrónico y SMS comunicaciones, que pueden incluir métricas de redes sociales, datos demográficos, horas del día, hashtags, temas y tipos de contenido.
- Datos del evento Describe las acciones realizadas por las entidades (esencialmente, datos de comportamiento); incluye la acción, la marca de tiempo y el estado (información sobre las entidades relacionadas con el evento). Datos del evento es fundamental para realizar análisis.
Estos archivos y registros están dispersos en múltiples ubicaciones, lo que dificulta enormemente el inventario, la seguridad y el análisis de todos esos datos.
¿Cómo se produce la proliferación de datos?
La proliferación de datos se describe como la cantidad cada vez mayor de datos que producen las organizaciones a diario. Amplificada por el cambio a la nube, las organizaciones pueden escalar más rápidamente, produciendo cada vez más datos. Nuevos usos para macrodatos El desarrollo continúa, lo que requiere un aumento en la cantidad de datos que se almacenan en sistemas operativos, servidores, redes, aplicaciones y otras tecnologías.
Para complicar aún más las cosas, las bases de datos, las canalizaciones analíticas y los flujos de trabajo empresariales han estado migrando rápidamente a la nube, pasando por múltiples proveedores de servicios en la nube (CSP) y por estructuras y no estructurado formatos. Este cambio a la nube está en curso y se crean nuevos almacenes de datos constantemente. Los líderes de seguridad y gestión de riesgos (SRM) están luchando por identificar e implementar controles de seguridad de datos de forma constante en este entorno.
"...la proliferación de datos no estructurados (tanto en las instalaciones como en entornos híbridos/multinube) es difícil de detectar y controlar en comparación con los datos estructurados."
Gartner, Ciclo de Hype para la Seguridad de Datos, 2022
Las organizaciones generan nuevos datos cada hora de cada día. Los datos de los clientes en los sistemas de gestión de relaciones con el cliente (CRM) también pueden incluir datos financieros, que también se encuentran en una base de datos contable o en un sistema de planificación de recursos empresariales (sistema ERP)Los datos de ventas y los datos transaccionales también pueden estar en esos sistemas, y aislados por diferentes departamentos, sucursales y dispositivos. Para obtener los beneficios prometidos por análisis de datosLos analistas de datos necesitan contrastar múltiples fuentes y, por lo tanto, pueden tener dificultades para tomar decisiones precisas e informadas.
En última instancia, las organizaciones necesitan datos para facilitar los flujos de trabajo diarios y generar información analítica para una toma de decisiones más inteligente. El problema es que la cantidad de datos que generan las organizaciones está creciendo descontroladamente. Según un estudio reciente de IDC, se espera que la Esfera de Datos Global Más del doble entre 2022 y 2026.La DataSphere mundial es una medida de la cantidad de datos nuevos que se crean, capturan, replican y consumen cada año, y crece el doble de rápido en la DataSphere empresarial en comparación con la DataSphere de consumo.
Desafíos de la proliferación de datos
A medida que las organizaciones generan datos a un ritmo más rápido, resulta más difícil gestionar esta información. Las organizaciones pueden tener datos almacenados en diversas ubicaciones, lo que dificulta el acceso a información crítica para el negocio y la generación de información precisa. Los miembros del equipo deben cotejar datos en múltiples formatos y de múltiples fuentes, lo que dificulta... analítica Es difícil. Gestionar información dispersa en distintos sistemas supone una pérdida de tiempo y dinero. Los datos pueden corromperse durante la transmisión, el almacenamiento y el procesamiento. La corrupción de datos compromete su valor, y la probabilidad de que ocurra aumenta a medida que crece la cantidad de datos almacenados.
Además, se desperdicia el esfuerzo cuando los empleados duplican datos al no encontrarlos donde se esperaban, lo que puede generar datos fantasma. Estos datos duplicados se consideran redundantes. Otros datos pueden estar obsoletos o ser irrelevantes para la toma de decisiones empresariales. Este exceso de datos conlleva un uso excesivo de recursos y aumenta los costos de almacenamiento en la nube.
Es posible que los empleados manejen los datos de forma negligente, sin comprender cómo la manera en que los comparten y manejan puede generar riesgos. Los usuarios no autorizados también pueden acceder a información confidencial, especialmente cuando los datos generados y almacenados no se gestionan adecuadamente. La clasificación manual de datos consume mucho tiempo y es propensa a errores, lo que puede aumentar el riesgo de exposición de datos confidenciales; por lo tanto, encontrar soluciones automatizadas es fundamental para gestionar grandes volúmenes de datos.
Expansión de datos compromete el valor de los datos y presenta riesgos de seguridad significativos. También existen seguridad preocupaciones porque demasiados datos pueden ser difíciles de controlar. Esto aumenta las posibilidades de filtraciones de datos y otros riesgos de seguridad. Además, las organizaciones que no gestionan la proliferación de datos pueden poner en peligro la confianza de los clientes y enfrentarse a sanciones estrictas debido al Reglamento General de Protección de Datos (RGPD), Ley de Privacidad del Consumidor de California (CCPA), u otro legislación de protección de datos por incumplimiento.
Gestionar la proliferación de datos
Controlar la proliferación de datos requiere un enfoque estructurado para la gestión de datos. Es esencial contar con una solución para descubrir y clasificar datosDado que los datos se encuentran distribuidos entre entornos locales y en la nube, es fundamental identificar dónde se almacenan para garantizar su correcta identificación y gestión. Son importantes las herramientas que permiten descubrir y clasificar datos en entornos SaaS, IaaS y PaaS, así como aquellas que pueden encontrar y clasificar datos estructurados y no estructurados. El objetivo de estas herramientas es crear una visión unificada de todo el entorno.
Identificar un lugar centralizado para almacenar datos es una forma de gestionar la proliferación de datos. estándares de seguridad en la nube Las tecnologías de almacenamiento en la nube siguen mejorando, lo que convierte a los repositorios centralizados en una opción atractiva para muchas organizaciones. Estas plataformas son un método excelente para almacenar datos, creando una única fuente de información fiable y más accesible para los empleados en diferentes ubicaciones. Al mismo tiempo, las empresas deben establecer políticas de gobernanza del acceso a los datos (DAG) que definan cómo se deben recopilar, procesar y almacenar los datos. Estas políticas también deben establecer procedimientos para la gestión de los datos, incluyendo controles de acceso, retención, gestión de riesgos, cumplimiento normativo y disposición final de los datos (cómo se eliminan al final de su ciclo de vida). Las políticas DAG complementan los programas de prevención de pérdida de datos (DLP). Gestión de la postura de seguridad de los datos (DSPM) combina el descubrimiento y la clasificación de datos, la prevención de la pérdida de datos y la gobernanza del acceso a los datos para crear un enfoque de próxima generación para la seguridad de los datos en la nube.
Soluciones para la proliferación de datos
Para las organizaciones que desean gestionar la proliferación de datos, es fundamental saber qué datos existen en su entorno, dónde se encuentran y quién tiene acceso a ellos. Existen diversas herramientas para gestionar todos los datos que almacenan las organizaciones, pero pocas pueden evitar la proliferación de datos.
Las soluciones automatizadas de descubrimiento y clasificación de datos deben ser capaces de identificar y clasificar datos confidenciales. Inteligencia artificial (IA) y aprendizaje automático (AA) Puede clasificar con mayor precisión datos difíciles de identificar, como la propiedad intelectual y los datos corporativos confidenciales.
Las soluciones para la dispersión de datos también pueden aumentar la seguridad general de los datos al ayudar a localizar e identificar datos duplicados y redundantes. Una vez que los datos dispersos se han identificado y clasificado, resulta más fácil deshacerse de ellos. datos obsoletos o datos superfluos. Esto puede ahorrar en costos de almacenamiento, además de eliminar datos duplicados e irrelevantes.
Las empresas recopilan datos diariamente y es fácil crear múltiples copias. El primer paso para las empresas que desean administrar el acceso a los datos y prevenir la pérdida de datos es comprender completamente sus datos, tanto dónde se encuentran ahora como si los equipos de TI o de seguridad están al tanto de ellos. almacenes de datos o no, y cualquier almacén de datos que se cree en el futuro. Identificar los datos confidenciales y quién tiene acceso a ellos puede ayudar a prevenir filtraciones de datos al garantizar que se apliquen los controles de seguridad adecuados.