Analisar dados estruturados pode auxiliar em melhores diagnósticos e cuidados com o paciente. No entanto, analisar dados não estruturados pode alimentar descobertas e avanços médicos revolucionários.
Essa é a essência do tópico que discutiremos hoje. É muito interessante observar que tantos avanços radicais no espaço da tecnologia de saúde aconteceram com apenas 10-20% dos dados de saúde utilizáveis.
Estatísticas revelam que mais de 90% dos dados neste espectro são desestruturados, o que se traduz em dados menos utilizáveis e mais difíceis de entender, interpretar e aplicar. De dados analógicos, como uma prescrição médica, a dados digitais na forma de imagens médicas e dados audiovisuais, os dados não estruturados são de diferentes tipos.
Esses pedaços enormes de dados não estruturados abrigam insights incríveis que podem acelerar os avanços da saúde em décadas. Seja auxiliando na descoberta de medicamentos para doenças autoimunes críticas que consomem vidas, seja dados que podem auxiliar as empresas de seguro saúde em avaliações de risco, dados não estruturados podem abrir caminho para possibilidades desconhecidas.
Quando tais ambições se concretizam, a interpretabilidade e a interoperabilidade dos dados de saúde tornam-se cruciais. Com diretrizes rigorosas e a aplicação de regulamentações como o GDPR e o HIPAA, a desidentificação dos dados de saúde torna-se inevitável.
Já publicamos um artigo extenso sobre como desmistificar dados estruturados e não estruturados na área da saúde . Há também um artigo dedicado (e bastante completo) sobre a desidentificação de dados na área da saúde . Recomendamos a leitura desses artigos para obter uma visão mais abrangente, pois utilizaremos esse conteúdo em uma matéria especial sobre a desidentificação de dados não estruturados.
Desafios na desidentificação de dados não estruturados
Como o próprio nome sugere, os dados não estruturados não são organizados. Eles estão dispersos em termos de formatos, tipos de arquivo, tamanhos, contexto e muito mais. O simples fato de os dados não estruturados existirem em formatos como áudio, texto, imagens médicas, registros analógicos e outros torna ainda mais desafiador compreender os Identificadores de Informação Pessoal (PII), que são essenciais na desidentificação de dados não estruturados.
Para lhe dar uma ideia dos desafios fundamentais, aqui está uma lista rápida:

- Compreensão contextual – onde é difícil para um stakeholder de IA entender o contexto específico por trás de uma porção ou aspecto particular de dados não estruturados. Por exemplo, entender se um nome é o nome de uma empresa, o nome de uma pessoa ou o nome de um produto pode trazer um dilema sobre se ele deve ser desidentificado.
- Dados não textuais – onde identificar pistas auditivas ou visuais para nomes ou PIIs pode ser uma tarefa assustadora, pois uma parte interessada pode ter que assistir horas e horas de filmagem ou gravação tentando desidentificar aspectos críticos.
- Ambiguidade – isso é especialmente verdadeiro no contexto de dados analógicos, como uma prescrição médica ou uma entrada hospitalar em um registro. Da caligrafia às limitações de expressão em linguagem natural, isso pode tornar a desidentificação de dados uma tarefa complexa.
Melhores práticas de desidentificação de dados não estruturados
O processo de remoção de informações pessoais identificáveis (PII) de dados não estruturados é bastante diferente da desidentificação de dados estruturados , mas não é impossível. Por meio de uma abordagem sistemática e contextual, o potencial dos dados não estruturados pode ser explorado de forma integrada. Vejamos as diferentes maneiras pelas quais isso pode ser alcançado.

Redação de imagens: Refere-se a dados de imagens médicas e envolve a remoção de identificadores do paciente e o desfoque de referências e partes anatômicas das imagens. Estes são substituídos por caracteres especiais para manter a funcionalidade diagnóstica e a utilidade dos dados de imagem.
Reconhecimento de padrões: Algumas das informações pessoais mais comuns, como nomes, detalhes de contato e endereços, podem ser detectadas e removidas com o auxílio do estudo de padrões predefinidos.
Privacidade Diferencial ou Perturbação de Dados: Isso envolve a inclusão de ruído controlado para ocultar dados ou atributos que podem ser rastreados até um indivíduo. Esse método ideal não apenas garante a desidentificação dos dados, mas também a retenção das propriedades estatísticas do conjunto de dados para análises.
Desidentificação de dados: Esta é uma das maneiras mais confiáveis e eficazes de remover informações pessoais identificáveis (PII) de dados não estruturados. Isso pode ser implementado de duas maneiras:
- Aprendizagem supervisionada – onde um modelo é treinado para classificar texto ou dados como PII ou não PII
- Aprendizagem não supervisionada – onde um modelo é treinado para aprender autonomamente a detectar padrões na identificação de PIIs
Este método garante a proteção da privacidade do paciente , mantendo a intervenção humana apenas para os aspectos mais redundantes da tarefa. As partes interessadas e os fornecedores de dados de saúde que utilizam técnicas de aprendizado de máquina para desidentificar dados não estruturados podem simplesmente contar com um processo de garantia de qualidade com intervenção humana para assegurar a imparcialidade, a relevância e a precisão dos resultados.
Mascaramento de dados: Mascaramento de dados é um termo técnico usado para descrever a desidentificação de dados de saúde, onde identificadores específicos são tornados genéricos ou vagos por meio de técnicas específicas, como:
- Tokenização – envolvendo a substituição de PIIs por caracteres ou tokens
- Generalização – substituindo valores PII específicos por valores genéricos/vagos
- Embaralhamento – misturando PIIs para torná-los ambíguos
No entanto, este método apresenta uma limitação: com um modelo ou abordagem sofisticados, os dados podem ser reidentificáveis.
Terceirização para participantes do mercado
A única abordagem correta para garantir que o processo de desidentificação de dados não estruturados seja infalível, à prova de falhas e esteja em conformidade com as diretrizes da HIPAA é terceirizar as tarefas para um provedor de serviços confiável como a Shaip . Com modelos de ponta e protocolos rigorosos de garantia de qualidade, garantimos que a supervisão humana na privacidade dos dados seja minimizada em todos os momentos.
Sendo uma empresa dominante no mercado há anos, entendemos a criticidade dos seus projetos. Então, entre em contato conosco hoje mesmo para otimizar suas ambições de assistência médica com dados de assistência médica desidentificados pela Shaip.