Descubrimiento y clasificación de datos sensibles
El descubrimiento y la clasificación de datos sensibles es un proceso utilizado para identificar y categorizar información sensible o confidencial dentro de los activos digitales de una organización. Esta información puede incluir [información de identificación personal]. Información de identificación personal, información de tarjetas de pago (PCI), datos financieros, registros de atención médica, propiedad intelectual, secretos comerciales y otros tipos de información confidencial que deben protegerse del acceso o la divulgación no autorizados.
Forrester Define el descubrimiento y la clasificación de datos como «la capacidad de proporcionar visibilidad sobre la ubicación de los datos confidenciales; identificar qué son los datos confidenciales y por qué se consideran confidenciales; y etiquetar los datos según su nivel de confidencialidad. El descubrimiento y la clasificación de datos confidenciales son valiosos porque identifican qué se debe proteger y facilitan el siguiente paso: la implementación de controles de seguridad de datos. Las organizaciones utilizan esta visibilidad y comprensión de los datos para optimizar las políticas de uso y manejo de datos e identificar los controles adecuados de seguridad, privacidad y gobernanza de datos. Pueden automatizar las capacidades de remediación para proteger los datos y obtener información valiosa que sirva de base para las decisiones sobre políticas, manejo de datos y ciclo de vida de los datos».
De acuerdo a GartnerLas soluciones de descubrimiento de datos descubren, analizan y clasifican datos estructurados y no estructurados para generar resultados prácticos que faciliten la aplicación de la seguridad y la gestión del ciclo de vida de los datos. Mediante el uso de metadatos, contenido e información contextual, combinados con modelos de datos basados en expresiones y aprendizaje automático, estas soluciones proporcionan orientación y procesos prácticos para impulsar las iniciativas de gestión y seguridad de datos.
El proceso de descubrimiento y clasificación de datos es fundamental para mantener la seguridad, la privacidad y el cumplimiento normativo. Al identificar y categorizar la información sensible, las organizaciones pueden adoptar las medidas adecuadas para protegerla, reducir el riesgo de filtraciones de datos y mantener la confianza con clientes, socios y organismos reguladores. Con frecuencia, se emplean herramientas y tecnologías automatizadas para optimizar y mejorar la eficiencia de este proceso, dada la enorme cantidad de datos que generan y almacenan las organizaciones.
En este artículo, obtendrá una descripción general del descubrimiento y la clasificación de datos confidenciales, incluyendo qué es, cómo surgió y cómo se lleva a cabo normalmente. Identificaremos algunos de los principales desafíos que enfrentan los equipos de seguridad con los enfoques tradicionales de descubrimiento y clasificación, y cómo las herramientas de próxima generación están utilizando enfoques nativos de la nube y basados en IA para innovar en el espacio. También aprenderá sobre su relación con Gestión de la postura de seguridad de los datos (DSPM) y cómo se relaciona con la tendencia hacia las prácticas de seguridad de confianza cero.
La historia de la clasificación de datos
La clasificación de datos tiene una larga historia, que comienza con los esquemas de datos gubernamentales y militares que utilizan etiquetas como confidencial, secreto y ultrasecretopara controlar el acceso a información crítica. A finales de la década de 1970 y durante la década de 1980, con la popularización de las computadoras, la necesidad de proteger los datos confidenciales del acceso no autorizado condujo al desarrollo de controles de acceso, como nombres de usuario y contraseñas.
Con el auge de Internet y las plataformas de comunicación en la década de 1990, la protección de datos durante la transmisión se volvió esencial, dando lugar a métodos de cifrado como Capa de sockets seguros (SSL)A principios de la década de 2000, las regulaciones gubernamentales, como la Ley de Portabilidad y Responsabilidad del Seguro Médico (HIPAA) en 2003 y el Estándar de seguridad de datos de la industria de tarjetas de pago (PCI DSS) En 2004, se impuso la clasificación y protección de datos en los sectores sanitario y financiero.
Más recientemente, regulaciones estrictas de privacidad de datos como la Reglamento General de Protección de Datos (RGPD) Se ha destacado la importancia del descubrimiento y la clasificación de datos sensibles debido a las filtraciones de datos. Si bien el concepto fundamental existe desde los inicios de la informática, su formalización y adopción generalizada han evolucionado para abordar la complejidad digital y las preocupaciones sobre la privacidad.
La necesidad de descubrir y clasificar datos sensibles
En su forma más simple, los datos sensibles son aquellos que deben protegerse del acceso no autorizado.
Los datos confidenciales se pueden clasificar en varios de los siguientes tipos, algunos de los cuales ya se han mencionado anteriormente.
Información de identificación personal
Información de identificación personal son datos que pueden conducir a la identificación de la identidad personal de alguien. Los datos de este tipo generalmente incluyen: Números de Seguro Social (SSN); datos biométricos, como huellas dactilares o escaneos faciales; o cualquier combinación de datos que, en conjunto, puedan conducir a la identificación de un individuo.
Información personal
La información personal (IP) es una clasificación de datos más general. La IP puede incluir información de identificación personal (IIP), pero también otros datos que están claramente relacionados con una persona, pero que no necesariamente la identifican. Esta clasificación es mucho más amplia y puede incluir datos como los siguientes:
- Información de ubicación
- Fotografías
- Origen racial
- Antecedentes penales
- Información sobre salud o genética
Información no pública relevante
La información material no pública (IMNP) son datos relacionados con una empresa, incluyendo sus participaciones, subsidiarias y cualquier otra información que pueda tener un impacto en el precio de sus acciones. Esta información incluye aspectos como los siguientes:
- Informes de ganancias
- Próximas acciones corporativas, como ofertas públicas iniciales (OPI)
- Los resultados de los procedimientos judiciales
Cualquiera de estas informaciones podría afectar al precio de las acciones de una empresa y, por lo tanto, esta información puede utilizarse para obtener una ventaja al negociar acciones, lo cual está altamente regulado y suele ser ilegal.
Información sanitaria protegida
Información de salud protegida (PHI) es un tipo de datos sensibles regulado específicamente por HIPAA e incluye dieciocho identificadores, incluyendo, pero sin limitarse a, lo siguiente:
- Nombres
- Números de teléfono
- Información de ubicación
- Números de cuenta
- números de historial médico
Otros tipos de datos
Existen muchos otros tipos de datos que no se tratan en esta guía, pero como puede ver, la clasificación de datos es importante, especialmente si está regulada por una normativa nacional o internacional, como el RGPD.
Impacto de la migración a la nube en el descubrimiento y la clasificación de datos sensibles
En la informática moderna, cada vez más empresas y servicios migran sus datos a la nube. Esta transición simplifica el escalado de la solución, ya que no es necesario invertir en hardware adicional. Además, los proveedores de alojamiento en la nube ofrecen redundancia, fiabilidad y copias de seguridad automáticas. La recuperación ante desastres también puede automatizarse e integrarse en el plan de almacenamiento.
Sin embargo, esto no significa necesariamente que identificar, clasificar y proteger datos confidenciales sea más fácil con el almacenamiento en la nube. En un modelo de centro de datos tradicional, la empresa es responsable de la seguridad en todo su entorno operativo, incluidas sus aplicaciones, servidores físicos, controles de usuario e incluso la seguridad del edificio físico. En un entorno de nube, el proveedor de soluciones en la nube (CSP) ofrece un alivio valioso al asumir una parte de muchas cargas operativas, incluida la seguridad. Para aclarar cómo se dividen las responsabilidades, los CSP introdujeron el concepto de modelo de responsabilidad compartidaEste modelo establece las responsabilidades que recaen sobre el proveedor de servicios en la nube (CSP) y el equipo de seguridad de la empresa a medida que las aplicaciones, los datos, los contenedores y las cargas de trabajo se trasladan a la nube. Definir claramente las responsabilidades de la empresa y las del CSP es fundamental para reducir el riesgo de introducir vulnerabilidades en los entornos de nube pública, híbrida y multinube.

Actualmente, la empresa promedio gestiona diez o más entornos en la nube, bajo modelos de implementación de Información como Servicio (IaaS), Plataforma como Servicio (PaaS) y Software como Servicio (SaaS). Como ilustra la imagen, un factor común en estos entornos es que la responsabilidad de la seguridad de los datos recae en la empresa, no en el proveedor de servicios en la nube (CSP). Esto pone de manifiesto una complejidad clave para los equipos de seguridad a medida que las empresas a las que dan soporte migran sus datos a la nube. La naturaleza permisiva de la nube, especialmente en entornos SaaS, facilita la proliferación y el intercambio de datos, y dificulta que los equipos de TI y seguridad gestionen, mantengan la visibilidad y el control sobre dichos datos.
Históricamente, las herramientas que combinaban capacidades de descubrimiento y clasificación de datos dependían de la interacción humana para funcionar. Para descubrir un almacén de datos, se necesitaban herramientas como catálogos de datos, sistemas de gestión de la información, y herramientas de prevención de pérdida de datos (DLP), requieren que los humanos conecten manualmente la herramienta al almacén de datos. Esto normalmente se logra utilizando un JDBC o ODBC Se requiere una conexión, una API o un proxy de red para detectar el tráfico hacia y desde un almacén de datos. Esto significa que quienes implementan y administran los sistemas deben conocer la existencia del almacén de datos, su ubicación y cómo conectar la herramienta a dicho sistema.
De manera similar, para la clasificación, los humanos soportan una carga inicial significativa al establecer la metadatos y etiquetado necesario para que una herramienta de clasificación sea eficaz. Definir metadatos, incluyendo Etiquetas de confidencialidad de Microsoft Information Protection (MIP). En entornos de Microsoft 365, se requiere la creación manual de clasificadores para definir el mecanismo de detección de la clase de datos. Esto último requiere expresiones regulares (RegEx), datos de muestra y objetos de muestra que la herramienta puede comparar con el patrón proporcionado y los datos del entorno conectado. Un gran número de empresas aún gestionan manualmente sus inventarios de datos mediante estos métodos y se ven perjudicadas por la falta de automatización que ofrecen sus herramientas de descubrimiento de datos.
La mayoría de las herramientas requieren la recopilación manual de datos.
Actualmente, las herramientas modernas nativas de la nube implementan procesos automatizados para adaptarse a la forma en que las empresas crean, consumen y utilizan los datos. Históricamente, los administradores debían desarrollar manualmente las habilidades necesarias para descubrir y organizar los datos en diferentes almacenes de datos. Este era un procedimiento increíblemente laborioso que, muy probablemente, se realizaba además de las responsabilidades laborales habituales del empleado.
Los procesos manuales han llevado a que un asombroso 74 por ciento de los responsables de la toma de decisiones en materia de seguridad estimen que Los datos confidenciales de su organización fueron vulnerados al menos una vez en 2022.En un estudio reciente encargado por Cyera a Forrester Consulting, el 59 % de los responsables de seguridad admiten tener dificultades para mantener un inventario de datos detallado. La búsqueda y clasificación manual de datos suele ser muy propensa a errores, y los empleados necesitan un amplio conocimiento institucional para poder desempeñar esta función a un nivel aceptable.
Existen varias complejidades adicionales que debe tener en cuenta, entre ellas las siguientes:
- Ubicación y residencia de los datosAlgunas normativas (como el RGPD) regulan específicamente dónde se pueden almacenar los datos, especialmente los de los residentes de la Unión Europea (UE). Con el almacenamiento en la nube, es posible que ni siquiera sepa en qué centros de datos se encuentran los datos de sus clientes.
- Cifrado de datosSi bien el almacenamiento en la nube ofrece cifrado, garantizar una política de cifrado coherente en todos los diferentes tipos de datos puede resultar difícil.
- Integración con herramientas de descubrimiento de datos: Lo más probable es que se requiera configuración y adaptación adicionales si desea integrar sus herramientas de descubrimiento de datos con su almacenamiento en la nube.
En general, la ingeniería del almacenamiento de datos es más sencilla, pero la seguridad de los datos es exponencialmente más compleja. Resulta más difícil localizar (tanto geográficamente como computacionalmente) y proteger los distintos tipos de información sensible que pueda existir en toda la organización. Además, los clasificadores estáticos, que en el mejor de los casos pretenden definir una clase de datos individual, pero no pueden identificar la función, la región, la identificabilidad ni la seguridad que proporcionan el contexto crítico de los datos, históricamente han añadido complejidad y procesamiento manual a la hora de que las clasificaciones sean útiles para los equipos de seguridad y privacidad.
Función del descubrimiento y la clasificación de datos en la seguridad y el cumplimiento normativo.
Los diferentes tipos de datos también ponen de manifiesto la necesidad de descubrir y clasificar los datos, especialmente en lo que respecta a la seguridad y el cumplimiento normativo.
Existe una tendencia de seguridad emergente llamada DSPM que tiene como objetivo responder algunas preguntas sobre sus datos y su seguridad, incluidas las siguientes:
- ¿Dónde se encuentran mis datos confidenciales?
- ¿Qué datos confidenciales están en riesgo?
- ¿Qué se puede hacer para mitigar o remediar ese riesgo?
El descubrimiento y la clasificación de datos sensibles forman parte de su estrategia DSPM, como se ilustra en este diagrama:

Como puede ver, tener una estrategia DSPM es importante si su organización maneja cualquier tipo de datos sensibles y herramientas de descubrimiento y clasificación de datos, como Cyerason una parte importante de esa estrategia.
Casos de uso reales para el descubrimiento y la clasificación de datos confidenciales.
En el mundo real, existen numerosos casos de uso para el descubrimiento de datos confidenciales. Algunos de los más comunes se analizan en las siguientes secciones.
Cumplimiento
Sus herramientas de descubrimiento de datos deben reconocer que los diferentes tipos de datos deben cumplir con diferentes regulaciones y estándares de seguridad. Si usted está manejo de datos tipo HIPAA Si realiza negocios en la UE, su solución de descubrimiento de datos debe garantizar que sus prácticas de datos se ajusten a las prácticas establecidas por estas regulaciones.
Algunas jurisdicciones y países, como la UE y Filipinas, otorgan a sus usuarios un mayor control sobre sus datos personales. Las leyes y directrices publicadas en estas áreas otorgan sujetos de datos algún poder para ejercer su "derecho al olvido", al menos en cierta medida.
En virtud del RGPD, específicamente, los interesados también tienen derecho a: "derecho a estar informado", que un usuario puede utilizar para consultar a cualquier tercero sobre la ubicación de sus datos personales que dicho tercero pueda estar almacenando.
Una buena herramienta de descubrimiento de datos debe conocer estas normas y derechos, y debe intentar descubrir y clasificar cualquier dato encontrado en consecuencia.
Fusiones y adquisiciones
La compra o fusión de una empresa con otra puede generar todo tipo de complejidades en su DSPM. No tiene garantía de que la empresa que desea adquirir haya estado cumpliendo con las prácticas regulatorias.
Una herramienta de descubrimiento y clasificación de datos es esencial para evaluar la postura de seguridad de la empresa que se desea adquirir o con la que se desea fusionar.
Más allá de la seguridad, es probable que acabes heredando el conjunto de datos de la otra empresa, incluida cualquier información confidencial que puedan tener sobre sus clientes o socios.
El proceso de descubrimiento y clasificación de estos datos es esencial, no solo para su integración en las bases de datos de su empresa, sino también para identificar cualquier deficiencia en términos de riesgo.
Respuesta ante incidentes
En caso de una violación de datos, parte de la respuesta al incidente consiste en identificar y clasificar los tipos de datos que se filtraron en la violación.
Este proceso determina cómo debe responder ante la violación de seguridad, en lo que respecta a todas sus facetas, incluidos los requisitos de divulgación de la violación y la comunicación a sus clientes y/o socios comerciales.
Otros enfoques para el descubrimiento y la clasificación de datos
En una organización grande, existen diferentes estrategias para localizar y clasificar datos confidenciales. Cada enfoque tiene sus propias ventajas y desventajas.
Enfoque aislado
Al adoptar un enfoque fragmentado, se asigna a los diferentes departamentos la responsabilidad de identificar, gestionar y localizar las distintas partes de los datos confidenciales de los que son responsables.
Esto se considera un enfoque descentralizado y tiene algunas ventajas:
- Cada equipo entiende mejor sus propios datos que si intentara entender los datos de todos.
- Esto conlleva una mejor personalización de las herramientas que utilizan, adaptándolas a los tipos de datos específicos que manejan.
Sin embargo, también existen desventajas. Por ejemplo, los silos pueden obstaculizar la colaboración entre departamentos y podrían no ajustarse a las mejores prácticas de la empresa. Además, aumenta la probabilidad de que los equipos dupliquen esfuerzos que podrían gestionarse de forma más eficiente por un departamento especializado. Quizás lo más preocupante sea que la visibilidad y la gestión de datos aisladas ocultan la deriva de datos, la proliferación de datos mediante copias y copias, el acceso excesivamente permisivo y el uso indebido de datos. En todos estos casos, a medida que los datos se mueven por la organización, atraviesan silos de visibilidad y gestión, lo que aumenta la probabilidad de que las configuraciones incorrectas, el uso indebido y las actividades maliciosas pasen desapercibidas. Esto, a su vez, incrementa la probabilidad de una brecha de seguridad.
Enfoque de red radial
Al implementar un enfoque de centro y ramificaciones, la responsabilidad del descubrimiento, la clasificación y la gestión de sus datos confidenciales recae sobre un equipo central dedicado a esta función.
Una vez más, este enfoque tiene sus ventajas y desventajas. Desde la perspectiva de la supervisión, es más fácil para un equipo central garantizar que todos los datos cumplan con las políticas corporativas de clasificación y seguridad de datos. Además, un equipo centralizado puede crear con mayor facilidad un método o criterios estandarizados para las tareas de clasificación. También es más eficiente, ya que prácticamente no existe riesgo de que otros equipos realicen el mismo trabajo con los mismos conjuntos de datos superpuestos.
Sin embargo, si un equipo centralizado no cuenta con los recursos suficientes, podría convertirse en un cuello de botella para la incorporación o clasificación de nuevas fuentes de datos, especialmente si la organización es grande y compleja. Además, un equipo centralizado solo puede hacer cumplir las normas que la empresa le otorga. Si la política oficial no estipula que el equipo tenga la autoridad para hacer cumplir sus políticas de clasificación en otros departamentos, podrían ser ignorados o percibidos como un inconveniente.
El futuro del descubrimiento y la clasificación de datos sensibles
Si bien la tecnología DSPM es una tendencia relativamente nueva y emergente, está bastante claro que la industria la necesita para el futuro.
Ya existen plataformas de seguridad de datos, como CyeraEstas soluciones implementan algoritmos de aprendizaje automático para identificar los tipos de datos específicos del entorno del cliente. Su software también permite conectarse a la infraestructura en la nube de la organización mediante un único rol de IAM, lo que posibilita el escaneo continuo y sin agentes de los datos almacenados en la nube. Este es un factor especialmente importante, ya que cada vez más organizaciones migran sus datos a la nube.
Conclusión
El descubrimiento y la clasificación de datos sensibles son procesos importantes que ayudan a identificar qué datos sensibles existen en su entorno, lo que a su vez le permite definir su estrategia de seguridad de datos. También forman parte integral del marco DSPM, que ayuda a identificar y mitigar los riesgos asociados con cualquier dato sensible que gestione. Los responsables de seguridad esperan obtener los mayores beneficios transformadores al mejorar la seguridad de los datos mediante la automatización inteligente. Para lograrlo, están invirtiendo en la detección de exposiciones en tiempo real y la gestión de la postura de seguridad de los datos.
Este cambio promete mejorar la automatización y la orquestación de las políticas de seguridad, con impactos demostrables en:
Disminución del tiempo para obtener valor
El 78 % de los responsables de seguridad afirma que acelerar el retorno de la inversión de sus soluciones de seguridad de datos es fundamental o muy importante. Cyera se implementa con un único rol de IAM que permite el descubrimiento dinámico de almacenes de datos en todos los modelos de implementación. Esto significa que detecta continuamente almacenes de datos nuevos y modificados sin intervención humana, lo que le permite seguir el ritmo acelerado de los cambios en los entornos de nube.
Mayor precisión en la clasificación y detección.
El 74 % de los responsables de seguridad invierten en la creación y el mantenimiento automáticos del inventario de datos, y el 71 % priorizan la mejora de la precisión en la clasificación de datos. La plataforma de seguridad de datos de Cyera, impulsada por IA, automatiza completamente la clasificación, utilizando aprendizaje automático e inteligencia artificial para lograr una precisión superior al 95 % sin intervención humana.
Habilitación de controles de seguridad dinámicos
El 81 % de los responsables de seguridad desean habilitar controles de seguridad dinámicos. Para garantizar que los equipos de seguridad puedan implementar los controles adecuados con confianza, Cyera implementa modelos de lógica descriptiva (LLM) para detectar entidades nombradas y extraer temas de los entornos, lo que permite obtener un contexto profundo de los datos. Esto incluye la identificación del rol, la región, la identificabilidad y la seguridad de los datos, lo que a su vez permite definir controles específicos y adecuados.
Mira cómo Cyera Plataforma de seguridad de datos impulsada por IA Aplica estas capacidades a todos los datos de una empresa, en cualquier lugar.
Si desea obtener más información sobre la gestión de la postura de seguridad de los datos, consulte esto. glosario Para obtener más información.
Autor: Thinus Swart