Aprenda sobre os tipos de informações confidenciais

Identificar e classificar itens confidenciais que estão sob o controle da sua organização é a primeira etapa na disciplina de Proteção de Informações. O Microsoft Purview fornece três maneiras de identificar itens para que eles possam ser classificados:

  • manualmente, por usuários
  • por meio do reconhecimento automatizado de padrões, como acontece com os tipos de informações confidenciais
  • por meio de aprendizado de máquina

Os tipos de informações confidenciais (SITs) são classificadores baseados em padrões. Eles detectam informações confidenciais, como números de previdência social, card de crédito ou contas bancárias, para identificar itens confidenciais. Consulte Definições de entidade de tipo de informação confidencial para obter uma lista completa de todos os SITs.

A Microsoft fornece um grande número de SITs pré-configurados ou você pode criar seus próprios.

Licenciamento

A licença E5 é necessária para usar os SITs de verificação de credenciais. Para obter uma lista de todos os SITs de verificação de credenciais, consulte Todos os tipos de informações confidenciais de credenciais. Esse SIT contém todos os SITs de verificação de credenciais disponíveis no portal. Cada membro deste SIT é um SIT de verificação de credenciais e pode ser usado como autônomo. Para obter uma lista de muitos SITs criados pela Microsoft, consulte Definições de entidade de tipo de informação confidencial.

Os tipos de informações confidenciais são usados em

Categorias de tipos de informações confidenciais

Tipos de informação confidenciais internos

A Microsoft criou esses SITs e eles aparecem no portal do Purview por padrão. Esses SITs não podem ser editados, mas você pode usá-los como modelos copiando-os para criar tipos de informações confidenciais personalizados. Consulte Definições de entidade de tipo de informação confidencial para obter uma lista completa de todos os SITs.

Tipos de informações confidenciais de entidade nomeada

Os SITs de entidade nomeada também aparecem no portal do Purview por padrão. Eles detectam nomes de pessoas, endereços físicos e termos e condições médicos. Eles não podem ser editados ou copiados. Para obter mais informações, consulte Saiba mais sobre entidades nomeadas.

Os SITs de entidade nomeada vêm em dois tipos:

desempacotado

Esses SITs de entidade nomeada têm um foco mais restrito, como um único país ou região ou uma única classe de termos. Use-as quando precisar de uma política DLP (prevenção contra perda de dados) com um escopo de detecção mais restrito. Consulte Exemplos de SITs de entidade nomeados.

empacotado

Os SITs de entidade nomeada agrupados detectam todas as correspondências possíveis em uma classe, como Todos os endereços físicos. Use-os como critérios amplos em suas políticas DLP para detectar itens confidenciais. Consulte Exemplos de SITs de entidade nomeados.

Dica

Você deve habilitar a verificação e a proteção de classificação avançadase quiser usar um SIT empacotado em uma política DLP de ponto de extremidade. Esse requisito é específico para a combinação de SITS agrupados e políticas DLP de endpoint.

Tipos de informações confidenciais personalizadas

Se os tipos de informações confidenciais pré-configurados não atenderem às suas necessidades, você poderá criar seus próprios tipos de informações confidenciais personalizados que você definir totalmente ou copiar um dos tipos internos e modificá-lo. Para obter mais informações, confira

Crie um tipo de informação confidencial personalizado no portal do Microsoft Purview.

Os dados exatos correspondem aos tipos de informações confidenciais

Todos os SITs baseados em correspondência exata de dados (EDM) são criados do zero. Você os usa para detectar itens que têm valores exatos, que você define em um banco de dados de informações confidenciais. Para obter mais informações, consulte Saiba mais sobre tipos de informações confidenciais baseados em correspondência exata de dados.

Partes fundamentais de um tipo de informação confidencial

Cada entidade de tipo de informação confidencial (SIT) consiste nos seguintes campos:

  • Nome: Indica como o tipo de informação confidencial é referido.
  • Descrição: Explicação do que o tipo de informação confidencial está procurando.
  • Padrão: Define o que um SIT detecta. Consiste nos seguintes componentes: elemento primário, elementos de suporte, nível de confiança e proximidade.

A tabela a seguir descreve cada componente dos padrões usados na definição de tipos de informações confidenciais.

Componente padrão Descrição
Elemento primário O elemento principal que o tipo de informação confidencial está procurando. Pode ser uma expressão regular com ou sem uma validação de soma de verificação, uma lista de palavras-chave, um dicionário de palavras-chave ou uma função. Cada um desses tipos de elementos pode ser selecionado na lista de SITs existentes ou pode ser definido de forma personalizada por um usuário com permissões de administrador. Depois que um elemento é definido, ele aparece na lista de elementos existentes, juntamente com aqueles que vêm integrados.
Elemento de suporte Um elemento que atua como evidência corroborativa. Quando incluídos, os elementos de suporte ajudam a aumentar o nível de confiança em relação à precisão das correspondências detectadas. Por exemplo, se o elemento primário for definido como SSN (composto por nove dígitos) e a palavra-chave Número do Seguro Social (SSN) for usada como um elemento de suporte quando encontrada próxima a SSN, a confiança de que o detectado SSN é realmente um número do Seguro Social será maior do que se a palavra-chave do Número do Seguro Social (SSN) não estiver presente.

Um elemento de suporte pode ser uma expressão regular (com ou sem uma validação de soma de verificação), uma lista de palavras-chave ou um dicionário de palavras-chave.
Nível de confiança Há três níveis de confiança em relação às correspondências detectadas: alto, médio e baixo. O nível de confiança reflete quanta evidência de apoio é detectada junto com o elemento primário. Quanto mais evidências de suporte um item detectado contiver, maior será a confiança de que um item correspondido contém as informações confidenciais que você está procurando. Para obter mais informações sobre os níveis de confiança, consulte o vídeo incluído posteriormente neste artigo.
Proximidade Especifica a proximidade de um elemento de suporte a um elemento primário, em termos do número de caracteres entre eles.

Noções básicas sobre proximidade

O diagrama a seguir mostra como a detecção de correspondência funciona em relação à proximidade. Neste exemplo, o elemento primário é o SSN campo e a definição de SIT exige que cada instância de um SSN valor esteja dentro de uma proximidade especificada de pelo menos um dos seguintes elementos:

  • AccountNumber
  • Name
  • DateOfBirth

No diagrama, vemos que os dados que estão sendo verificados incluem três instâncias diferentes do SSN campo: SSN1, SSN2, SSN3, e SSN4.

Diagrama de evidência comprobatória e janela de proximidade .

Para entender como funciona a proximidade, vamos começar dando uma olhada em alguns critérios de detecção de exemplo. Aqui, foram querem detectar números de segurança social de nove dígitos. Os critérios de detecção exigem que uma expressão regular de nove dígitos (elemento primário) seja encontrada em conjunto com evidências de suporte (entre os AccountNumbercampos , Name, e DateOfBirth ) que aparece dentro de 250 caracteres (a proximidade).

Conforme ilustrado no diagrama, somente os elementos SSN1 primários e SSN4 atendem aos critérios de detecção descritos. Vamos dar uma olhada mais de perto.

  • No caso de SSN1, o AccountNumber valor está dentro da janela de proximidade especificada de 250 caracteres, portanto, uma correspondência é detectada.
  • Nos casos de SSN2 e SSN3, nenhum dos elementos de suporte ocorre dentro de 250 caracteres do elemento primário, portanto, esses valores não são detectados como uma correspondência. No entanto, ao examinar a janela SSN2 de proximidade no diagrama, você pode perguntar: Por que não há uma correspondência para SSN2? A janela de SSN2 proximidade não se estende ao Name elemento? Esta é uma boa pergunta. A resposta é: não exatamente. Embora a janela de proximidade se estenda até o Name valor, ela não inclui o valor inteiro , portanto, o padrão não corresponde.
  • Finalmente, no caso de , existem dois elementos de suporte dentro da janela de SSN4proximidade, ambos Name e DateOfBirth, então esse padrão também corresponde.

Saiba mais sobre os níveis de confiança neste breve vídeo.

Exemplo de tipo de informação confidencial

Número de identidade nacional da Argentina (DNI)

Formatar

Oito dígitos separados por pontos

Padrão

Oito dígitos:

  • dois dígitos
  • um ponto
  • três dígitos
  • um ponto
  • três dígitos
Soma de verificação

Não

Definição

Uma política DLP tem confiança média de que detectou esse tipo de informação confidencial se, dentro de uma proximidade de 250 caracteres:

  • A expressão regular Regex_argentina_national_id localiza conteúdo que corresponde ao padrão.
  • Um palavra-chave de Keyword_argentina_national_id foi encontrado.
<!-- Argentina National Identity (DNI) Number -->
<Entity id="00aa00aa-bb11-cc22-dd33-44ee44ee44ee" recommendedConfidence="75" patternsProximity="250">
   <Pattern confidenceLevel="75">
      <IdMatch idRef="Regex_argentina_national_id"/>
      <Match idRef="Keyword_argentina_national_id"/>
  </Pattern>
</Entity>
Palavras-chave
Keyword_argentina_national_id
  • Número de Identidade Nacional da Argentina
  • Identidade
  • Identificação Bilhete de Identidade Nacional
  • DNI
  • Registo Nacional de Pessoas (NIC)
  • Documento Nacional de Identidad
  • Registro Nacional de las Personas
  • Identidade
  • Identificación

Mais sobre níveis de confiança

Em uma definição de entidade de tipo de informação confidencial, o nível de confiança reflete quanta evidência de suporte é detectada além do elemento primário. Quanto mais evidências de suporte um item contiver, maior será a confiança de que um item correspondido contém as informações confidenciais que você está procurando. Por exemplo, correspondências com alto nível de confiança contêm mais evidências de apoio nas proximidades do elemento primário, enquanto correspondências com baixo nível de confiança conteriam pouca ou nenhuma evidência de apoio nas proximidades.

Um nível de confiança alto retorna o menor número de falsos positivos, mas pode resultar em mais falsos negativos. Níveis de confiança baixos ou médios retornam mais falsos positivos, mas poucos ou nenhum falso negativo.

  • Baixa confiança: os itens correspondentes contêm o menor número de falsos negativos, mas o maior número de falsos positivos. A baixa confiança retorna todas as correspondências de baixa, média e alta confiança. O nível de confiança baixo tem um valor de 65.
  • confiança média: os itens correspondentes contêm um número médio de falsos positivos e falsos negativos. A confiança média retorna todas as correspondências de confiança média e alta. O nível de confiança médio tem um valor de 75.
  • alta confiança: os itens correspondentes contêm o menor número de falsos positivos, mas o maior número de falsos negativos. Alta confiança só retorna correspondências de alta confiança e tem um valor de 85.

Você deve usar padrões de alto nível de confiança com contagens baixas, digamos de cinco a 10, e padrões de baixa confiança com contagens mais altas, digamos 20 ou mais.

Observação

Se você tiver políticas existentes ou tipos de informações confidenciais personalizados (SITs) definidos usando níveis de confiança baseados em números (também conhecidos como precisão), eles serão mapeados automaticamente para os três níveis de confiança discretos; confiança baixa, confiança média e alta confiança, na interface do usuário do Security @ Centro de Conformidade.

  • Todas as políticas com precisão mínima ou padrões SIT personalizados com níveis de confiança entre 76 e 100 serão mapeadas para alta confiança.
  • Todas as políticas com precisão mínima ou padrões SIT personalizados com níveis de confiança entre 66 e 75 serão mapeadas para confiança média.
  • Todas as políticas com precisão mínima ou padrões SIT personalizados com níveis de confiança menores ou iguais a 65 serão mapeadas para baixa confiança.

Criando tipos de informações confidenciais personalizadas

Você pode escolher entre várias opções para criar tipos de informações confidenciais personalizados.

Ajustando classificadores treináveis

A DLP do Ponto de extremidade classifica arquivos com base em todos os tipos de informações confidenciais disponíveis no locatário, incluindo tipos de informações confidenciais personalizados, independentemente de sua utilização em qualquer política DLP. Isso pode causar tráfego de classificação excessivo se os tipos de informações confidenciais não estiverem bem ajustados e acabarem correspondendo a muitos arquivos. Você deve otimizar todos os tipos de informações confidenciais personalizadas. Para fazer isso, remova os tipos de informações confidenciais não utilizados e recrie os SITs, caso correspondam à maioria dos arquivos da sua organização. Para obter orientação sobre como utilizar os validadores SIT Regex para ajustar os SITs, consulte: Tipo de informações confidenciais Validadores REGEX e marca adicional

Suporte ao conjunto de caracteres de byte duplo

Níveis de confiança aprimorados estão disponíveis para uso imediato nos serviços de Prevenção Contra Perda de Dados do Microsoft Purview, proteção de informações, Conformidade de Comunicação, gerenciamento do ciclo de vida de dados e gerenciamento de registros.

  • A Proteção de Informações agora oferece suporte a idiomas de conjunto de caracteres de byte duplo para:
  • Chinês (simplificado)
  • Chinês (tradicional)
  • Coreano
  • Japonês

Este suporte está disponível para tipos de informações confidenciais. Para obter mais informações, consulte Suporte à proteção de informações para notas de versão de conjuntos de caracteres de byte duplo.

Suporte a conjunto de caracteres de byte único

Para detectar padrões que contêm caracteres chineses/japoneses e caracteres de byte único ou para detectar padrões que contenham chinês/japonês e inglês, defina duas variantes da palavra-chave ou regex.

Por exemplo, para detectar uma palavra-chave como "机的document", use duas variantes da palavra-chave; um com um espaço entre o texto japonês e o inglês e outro sem um espaço entre o texto japonês e o inglês. Portanto, as palavras-chave a serem adicionadas no SIT devem ser "机密的 document" e "机密的document". Da mesma forma, para detectar uma frase "東京オリンピック2020", duas variantes devem ser usadas; "東京オリンピック 2020" e "東京オリンピック2020".

Juntamente com caracteres chineses/japoneses/de byte duplo, se a lista de palavras-chave/frases também contiver palavras não chinesas/japonesas (por exemplo, somente inglês), você deverá criar dois dicionários/listas de palavras-chave. Uma para palavras-chave que contenham caracteres chineses/japoneses/de byte duplo e outra para palavras-chave somente em inglês. Por exemplo, se você deseja criar um dicionário/lista de palavras-chave com três frases "Altamente confidencial", "機密性が高い" e "机密的document", você deve criar duas listas de palavras-chave.

  • Altamente confidencial
  • 機密性が高い, 机密的document e 机密的 document Ao criar um regex usando um hífen de byte duplo ou um ponto final de byte duplo, certifique-se de escapar de ambos os caracteres como se você escapasse de um hífen ou ponto final em um regex. Aqui está um exemplo de regex para referência: (?<!\d)([4][0-9]{3}[\-?\-\t]*[0-9]{4}

Recomendamos usar a correspondência de cadeia de caracteres em vez da correspondência de palavras em uma lista de palavras-chave.

Diferenças de detecção entre cargas de trabalho

O mesmo tipo de informação confidencial pode produzir resultados diferentes dependendo de onde o conteúdo é avaliado - por exemplo, email em trânsito (Exchange), arquivos em repouso (SharePoint e OneDrive) e arquivos em dispositivos gerenciados (Endpoint DLP). A DLP do ponto de extremidade classifica arquivos em relação a todos os tipos de informações confidenciais disponíveis no locatário e o uso de um SIT agrupado em uma política de DLP de ponto de extremidade requer verificação e proteção de classificação avançadas.

Antes de confiar em um SIT personalizado na produção, teste-o e valide a detecção em cada carga de trabalho em que você pretende usá-lo - por exemplo, uma regra de fluxo de email, uma política do SharePoint ou do OneDrive e uma política de ponto de extremidade. A detecção também pode ser afetada por limites de extração de conteúdo, como tamanho máximo do arquivo e número de caracteres verificados; consulte Considerações sobre a plataforma DLP.

Testar o tipo de informações confidenciais

Você pode testar o SIT carregando um arquivo de amostra. Os resultados do teste mostram o número de correspondências para cada nível de confiança. Você pode testar SITs integrados, SITs personalizados, classificadores treináveis e correspondência exata de dados.

Testar o tipo de informação confidencial interno e personalizado

Teste os dados exatos que correspondem ao tipo de informações confidenciais.

Para testar qualquer locatário SIT personalizado ou padrão, deve haver pelo menos uma licença do Exchange Online adicionada ao locatário. Caso contrário, a opção Testar SIT ficará esmaecida quando qualquer SIT for selecionado.

Fornecer comentários de precisão de correspondência/não correspondência em tipos de informações confidenciais

Você pode exibir o número de correspondências de um SIT em Tipos de informações confidenciais e Explorador de conteúdo. Você também pode fornecer comentários sobre se um item é realmente uma correspondência ou não usando o mecanismo de comentários Corresponder, não é uma correspondência e usar esses comentários para ajustar seus SITs. Para obter mais informações, consulte Aumentar a precisão do classificador.

Para mais informações

Para saber como usar tipos de informações confidenciais para cumprir os regulamentos de privacidade de dados, consulte Implantar proteção de informações para regulamentos de privacidade de dados com o Microsoft 365 (aka.ms/m365dataprivacy).