Proliferação de dados
A proliferação de dados refere-se à quantidade significativa de dados que muitas organizações criam diariamente. A proliferação de dados pode ser definida como a geração de dados, ou informação digitalOs dados são um recurso valioso, pois permitem que os líderes empresariais tomem decisões baseadas em dados sobre a melhor forma de atender seus clientes, expandir seus negócios e aprimorar seus processos. No entanto, gerenciar grandes volumes de dados e tantas fontes diferentes pode ser um grande desafio.
Grandes empresas, especialmente corporações, estão gerando uma quantidade impressionante de dados devido à ampla variedade de softwares em uso, bem como aos formatos de dados recém-introduzidos, aos múltiplos sistemas de armazenamento na nuvem e em ambientes locais, e às enormes quantidades de dados de log gerados por aplicativos. Há um quantidade esmagadora de dados sendo gerados e armazenados no mundo moderno.
De onde vêm os dados?
À medida que as organizações crescem e utilizam cada vez mais dados para análise e investigação, esses dados são armazenados em sistemas operacionais, servidores, aplicativos, redes e outras tecnologias. Muitas organizações geram quantidades massivas de novos dados todos os dias, incluindo:
- Dados financeiros, incluindo tipos de dados como transações bancárias, dados da web, dados de geolocalização, cartões de crédito e dados de transações em pontos de venda de fornecedores.
- Dados de vendas, que podem incluir receita por vendedor, taxa de conversão, duração média do ciclo de vendas, valor médio do negócio, número de ligações realizadas, idade e status dos leads de vendas, taxas de perda e número de e-mails enviados.
- Dados transacionais, que podem incluir dados de clientes, informações de pedidos de compra, horas trabalhadas de funcionários, custos de seguro, sinistros, status de envio, depósitos bancários e saques.
- Mídias sociais, e-mail e SMS comunicações, que podem incluir métricas de mídias sociais, dados demográficos, horários do dia, hashtags, assuntos abordados e tipos de conteúdo.
- Dados do evento Descreve ações realizadas por entidades (essencialmente, dados de comportamento); inclui a ação, o registro de data e hora e o estado (informações sobre as entidades relacionadas ao evento). Dados do evento É fundamental para a realização de análises.
Esses arquivos e registros estão dispersos em vários locais, o que torna o inventário, a segurança e a análise de todos esses dados extremamente difíceis.
Como ocorre a proliferação de dados?
A proliferação de dados é descrita como a quantidade cada vez maior de dados produzidos pelas organizações diariamente. Amplificada pela migração para a nuvem, essa situação permite que as organizações escalem mais rapidamente, produzindo cada vez mais dados. Novos usos para big data continuam a se desenvolver, exigindo um aumento na quantidade de dados armazenados em sistemas operacionais, servidores, redes, aplicativos e outras tecnologias.
Para complicar ainda mais as coisas, bancos de dados, pipelines de análise e fluxos de trabalho de negócios têm migrado rapidamente para a nuvem, passando por vários provedores de serviços em nuvem (CSPs) e por ambientes estruturados e... não estruturado formatos. Essa migração para a nuvem está em andamento, e novos armazenamentos de dados são criados o tempo todo. Os líderes de segurança e gerenciamento de riscos (SRM) estão com dificuldades para identificar e implantar controles de segurança de dados consistentemente neste ambiente.
"...a proliferação de dados não estruturados (tanto em infraestruturas locais quanto em ambientes híbridos/multicloud) é difícil de detectar e controlar quando comparada aos dados estruturados."
Gartner, Ciclo de Hype para Segurança de Dados, 2022
As organizações geram novos dados a cada hora de cada dia. Os dados do cliente em sistemas de gestão de relacionamento com o cliente (CRM) também podem incluir dados financeiros, que também estão em um banco de dados contábil ou em um sistema de planejamento de recursos empresariais (ERP).Sistema ERP)Os dados de vendas e os dados transacionais também podem estar nesses sistemas, isolados em diferentes departamentos, filiais e dispositivos. Para obter os benefícios prometidos por análise de dadosOs analistas de dados precisam cruzar informações de diversas fontes e, portanto, podem ter dificuldade em tomar decisões precisas e bem fundamentadas.
Em última análise, as organizações precisam de dados para facilitar os fluxos de trabalho diários e gerar insights analíticos para uma tomada de decisão mais inteligente. O problema é que a quantidade de dados que as organizações geram está saindo do controle. De acordo com um estudo recente da IDC, espera-se que a Esfera de Dados Global... mais que dobrar entre 2022 e 2026A DataSphere mundial é uma medida da quantidade de novos dados criados, capturados, replicados e consumidos a cada ano, crescendo duas vezes mais rápido na DataSphere corporativa em comparação com a DataSphere do consumidor.
Desafios da Propagação Excessiva de Dados
À medida que as organizações geram dados em um ritmo cada vez mais acelerado, torna-se mais difícil gerenciar essas informações. As organizações podem ter dados armazenados em vários locais, dificultando o acesso a informações críticas para os negócios e a geração de insights precisos. Os membros da equipe precisam cruzar dados em vários formatos e de diversas fontes, o que torna o gerenciamento complexo e complexo. análises É difícil. Gerenciar informações dispersas em diferentes silos desperdiça tempo e dinheiro. Os dados podem ser corrompidos durante a transmissão, o armazenamento e o processamento. A corrupção de dados compromete o valor dos dados, e a probabilidade de corrupção pode aumentar com a crescente dispersão dos dados.
Além disso, o esforço é desperdiçado quando os dados são duplicados por funcionários que não conseguiram encontrar as informações necessárias onde deveriam, o que também pode resultar em dados fantasmas. Esses dados duplicados são considerados redundantes. Outros dados podem estar obsoletos (desatualizados) ou serem triviais (sem valor para insights de negócios). Esse excesso de dados resulta em utilização excessiva de recursos e aumenta os custos de armazenamento em nuvem.
Os funcionários podem estar lidando com dados de forma descuidada, sem entender como a maneira como compartilham e manipulam os dados pode representar um risco. Usuários não autorizados também podem ter acesso a informações confidenciais, principalmente quando os dados produzidos e armazenados não são gerenciados adequadamente. A classificação manual de dados é demorada, propensa a erros e pode aumentar o risco de exposição de dados sensíveis; portanto, encontrar soluções automatizadas é essencial para o gerenciamento de grandes volumes de dados.
Proliferação de dados Compromete o valor dos dados e apresenta riscos de segurança significativos. Existem também segurança A preocupação surge porque o excesso de dados pode ser difícil de controlar. Isso aumenta as chances de violações de dados e outros riscos de segurança. Além disso, as organizações que não gerenciam a proliferação de dados podem comprometer a confiança dos clientes e enfrentar penalidades severas devido ao Regulamento Geral de Proteção de Dados (RGPD).RGPD), Lei de Privacidade do Consumidor da Califórnia (CCPA), ou outro legislação de proteção de dados por descumprimento.
Gerenciando a Proliferação de Dados
Controlar a proliferação de dados exige uma abordagem estruturada para a gestão de dados. É essencial ter uma solução implementada para Descobrir e classificar dadosComo os dados estão distribuídos entre ambientes locais e na nuvem, é fundamental identificar os ambientes onde os dados são armazenados para garantir que todos os dados sejam identificados e gerenciados. Ferramentas capazes de descobrir e classificar dados em ambientes SaaS, IaaS e PaaS são importantes, assim como aquelas que conseguem encontrar e classificar dados estruturados e não estruturados. O objetivo dessas ferramentas é criar uma visão unificada de todo o ambiente.
Identificar um local central para armazenar dados é uma forma de gerenciar a dispersão de dados. Padrões de segurança na nuvem A melhoria contínua torna um repositório centralizado na nuvem uma opção atraente para muitas organizações. As plataformas de armazenamento em nuvem são um excelente método para armazenar dados de forma a criar uma única fonte de verdade, mais acessível aos funcionários em diversas localidades. Ao mesmo tempo, as empresas devem estabelecer políticas de governança de acesso a dados (DAG) que definam como os dados devem ser coletados, processados e armazenados. Essas políticas também devem estabelecer diretrizes para governar os dados, incluindo controles de acesso, retenção, gerenciamento de riscos, conformidade e descarte de dados (como os dados são descartados ao final de seu ciclo de vida). As políticas de DAG complementam os programas de prevenção contra perda de dados (DLP). gerenciamento da postura de segurança de dados O DSPM (Defensive Security Platform Methodology) combina descoberta e classificação de dados, prevenção contra perda de dados e governança de acesso a dados para criar uma abordagem de próxima geração para segurança de dados na nuvem.
Soluções para a dispersão de dados
Para organizações que desejam gerenciar a proliferação de dados, é imprescindível saber quais dados existem no ambiente, onde estão localizados e quem tem acesso a eles. Existem diversas ferramentas para gerenciar todos os dados armazenados pelas organizações, mas poucas conseguem impedir a proliferação de dados.
As soluções automatizadas de descoberta e classificação de dados devem ser capazes de identificar e classificar dados sensíveis. Inteligência artificial (IA) e aprendizado de máquina (ML) Pode classificar com mais precisão dados difíceis de identificar, como propriedade intelectual e dados corporativos sensíveis.
As soluções para lidar com a dispersão de dados também podem aumentar a segurança geral dos dados, ajudando a localizar e identificar dados duplicados e redundantes. Uma vez que os dados dispersos tenham sido identificados e classificados, torna-se mais fácil descartá-los. dados obsoletos ou dados estranhos. Isso pode economizar custos de armazenamento, além de eliminar dados duplicados e irrelevantes.
As empresas coletam dados diariamente e é fácil criar várias cópias. O primeiro passo para as empresas que desejam gerenciar o acesso aos dados e evitar a perda de dados é compreender plenamente seus dados — onde eles estão agora, se as equipes de TI ou de segurança estão cientes deles, armazenamentos de dados ou não, e quaisquer repositórios de dados que sejam criados no futuro. Identificar dados sensíveis e quem tem acesso a eles pode ajudar a prevenir violações de dados, garantindo que os controles de segurança adequados sejam aplicados.