Anotação de imagens médicas: os desafios de compliance e LGPD que sua equipe de IA precisa conhecer Anderson Lima 05/10/2026

Anotação de imagens médicas: os desafios de compliance e LGPD que sua equipe de IA precisa conhecer

anotação de imagens médicas

A Lei Geral de Proteção de Dados (Lei nº 13.709/2018) estabelece, no artigo 5º, inciso II, que qualquer dado pessoal referente à saúde de uma pessoa é considerado dado sensível. Isso inclui diagnósticos, resultados de exames, prontuários eletrônicos, históricos clínicos, prescrições e — de forma explícita — imagens médicas. Não existe zona cinzenta aqui: uma radiografia, uma tomografia ou uma ressonância associada a um paciente identificável é, por definição legal, dado sensível de saúde.

Essa classificação importa porque a LGPD trata dados sensíveis de forma estruturalmente diferente de dados pessoais comuns. O artigo 11 da lei restringe as bases legais que autorizam esse tipo de tratamento — o legítimo interesse, por exemplo, previsto no artigo 7º para dados comuns, não está disponível como base legal para dados sensíveis. As hipóteses de tratamento incluem consentimento específico e destacado do titular, cumprimento de obrigação legal ou regulatória, tutela da saúde em procedimento realizado por profissionais ou serviços de saúde, e realização de estudos por órgão de pesquisa — este último sempre que possível com garantia de anonimização dos dados.

Além disso, o artigo 46 da LGPD exige medidas de segurança proporcionais ao risco do tratamento — e dados sensíveis, por definição, representam risco elevado. Na prática, isso se traduz em exigências concretas: criptografia forte para dados em repouso e em trânsito, controle de acesso por perfil com registro de auditoria, políticas de retenção mais curtas com eliminação segura ao final da finalidade, e processos de anonimização ou pseudonimização sempre que a finalidade puder ser cumprida sem identificação direta do titular.

A base legal não é opcional — e nem sempre é o consentimento

Antes mesmo de pensar em ferramentas de anotação, o primeiro passo de qualquer projeto de IA com imagens médicas é identificar qual base legal do artigo 11 sustenta o uso daquele dado para aquela finalidade específica. Um hospital que usa imagens de seus próprios pacientes para treinar um modelo de apoio diagnóstico pode se apoiar em bases diferentes de uma empresa de tecnologia que compra ou licencia um dataset de imagens de terceiros para treinar um produto comercial. Essa definição não é uma formalidade jurídica desconectada do trabalho técnico — ela determina, por exemplo, se é necessário buscar consentimento específico dos titulares, e até que ponto a anonimização precisa ser completa antes de qualquer anotador (interno ou terceirizado) ter acesso à imagem.

Anonimizar a imagem não é só apagar o nome do paciente

Mesmo depois de um processo de anonimização bem executado, o controle de quem tem acesso ao dado durante a anotação continua sendo uma exigência da LGPD, não uma boa prática opcional. Isso significa: contratos de confidencialidade específicos para quem lida com esse tipo de dado, trilhas de auditoria sobre quem acessou e anotou cada item, e — de forma coerente com o regime mais restritivo dos dados sensíveis — preferência estrutural por equipes dedicadas e rastreáveis em vez de modelos de crowdsourcing anônimo, onde a identidade e a responsabilidade individual de quem manipula o dado são muito mais difíceis de auditar

Quem pode ver o dado importa tanto quanto onde ele é armazenado

Mesmo depois de um processo de anonimização bem executado, o controle de quem tem acesso ao dado durante a anotação continua sendo uma exigência da LGPD, não uma boa prática opcional. Isso significa: contratos de confidencialidade específicos para quem lida com esse tipo de dado, trilhas de auditoria sobre quem acessou e anotou cada item, e — de forma coerente com o regime mais restritivo dos dados sensíveis — preferência estrutural por equipes dedicadas e rastreáveis em vez de modelos de crowdsourcing anônimo, onde a identidade

DICOM: o desafio técnico específico da imagem médica

O DICOM é o padrão internacional usado por praticamente todo equipamento de imagem médica — tomógrafos, aparelhos de ressonância, raio-X digital — e cada arquivo nesse formato carrega, além da imagem em si, um conjunto extenso de metadados. Isso cria um desafio técnico de anonimização em duas frentes distintas, que a literatura especializada trata separadamente.

Metadados do cabeçalho (header)

O cabeçalho de um arquivo DICOM pode conter dezenas de campos com potencial de identificação: nome do paciente, data de nascimento, número de identificação do exame, nome da instituição, e até informações sobre o equipamento e o profissional responsável. Ferramentas de anonimização de DICOM tratam esses campos de formas diferentes — algumas substituem os valores por dados fictícios, outras os removem por completo — e comparativos técnicos já mostraram que ferramentas gratuitas variam bastante em confiabilidade, incluindo casos de arquivos corrompidos após o processo de anonimização mal executado.

Informação de identificação dentro da própria imagem (pixel data)

A segunda camada, mais frequentemente esquecida, é o risco de identificação a partir da própria imagem — não do metadado, mas do conteúdo visual. Exames de crânio ou de face, por exemplo, podem conter informação suficiente para reconstruir os traços faciais do paciente, mesmo com o cabeçalho completamente anonimizado. Desafios técnicos internacionais como o MIDI-B (Medical Image De-Identification Benchmark), promovido em conferências acadêmicas de referência em imagem médica, existem justamente para avaliar e comparar algoritmos capazes de lidar com as duas frentes — mascaramento de pixels, ajuste de datas, remoção e substituição de texto embutido na imagem — de forma consistente com padrões como o HIPAA americano e as diretrizes técnicas do próprio padrão DICOM (DICOM PS3.15).

O que perguntar a um fornecedor de anotação antes de compartilhar imagens médicas

As perguntas de um checklist geral de seleção de fornecedor de anotação de dados continuam válidas aqui — qualidade, piloto, SLA, segurança —, mas o contexto de saúde exige adicionar perguntas específicas:

  • Qual base legal o fornecedor entende sustentar o tratamento daquele dataset específico, e essa análise foi feita em conjunto com a área jurídica do contratante, ou apenas assumida pelo fornecedor?
  • Como o fornecedor lida com anonimização de metadados DICOM — usa ferramentas próprias, de terceiros, ou espera que a anonimização já chegue pronta antes do dado ser compartilhado?
  • O fornecedor trata separadamente o risco de identificação por pixel data, além dos metadados de cabeçalho, em casos onde isso é relevante (exames de crânio, por exemplo)?
  • Existe rastreabilidade individual de quem acessou e anotou cada imagem, com contrato de confidencialidade específico, ou o modelo operacional dificulta essa auditoria?
  • Como funciona a retenção e eliminação do dado depois que o projeto termina ou o contrato encerra — existe uma polí

Erros comuns que colocam projetos de IA em saúde em risco

  1. Assumir que “remover o nome do arquivo” é suficiente para considerar uma imagem médica anonimizada, ignorando os demais campos de metadados DICOM e o risco de identificação pela própria imagem.
  2. Compartilhar dados com um fornecedor sem confirmar a base legal que sustenta esse compartilhamento, transferindo uma decisão jurídica relevante para um fornecedor técnico sem esse mandato.
  3. Usar modelos de crowdsourcing anônimo para dados sensíveis de saúde, dificultando o controle de acesso e a rastreabilidade que o regime mais restritivo da LGPD para dados sensíveis pressupõe.
  4. Não ter uma política clara de retenção e eliminação do dado anonimizado depois que o projeto termina, mantendo exposição de risco por tempo indefinido.
  5. Tratar compliance como responsabilidade exclusiva do fornecedor, sem envolver a área jurídica interna na definição da base legal e na revisão do contrato de tratamento de dados antes de qualquer compartilhamento.

Perguntas frequentes

Toda imagem médica é considerada dado sensível pela LGPD?
Sim, sempre que estiver associada a uma pessoa identificável. O artigo 5º, inciso II, da LGPD classifica como sensível qualquer dado que revele informação sobre a saúde de uma pessoa, o que inclui explicitamente imagens de exames e procedimentos médicos.
É possível usar imagens médicas para treinar IA sem consentimento do paciente?
Em alguns casos, sim — a LGPD prevê outras bases legais além do consentimento no artigo 11, como tutela da saúde em procedimento realizado por profissionais de saúde, cumprimento de obrigação legal, ou realização de estudos por órgão de pesquisa, com garantia de anonimização sempre que possível. Qual base se aplica depende do contexto específico do projeto e deve ser avaliada com apoio jurídico.
Remover o cabeçalho DICOM é suficiente para anonimizar uma imagem médica?
Não necessariamente. Além dos metadados do cabeçalho, algumas imagens (como exames de crânio ou face) podem conter informação suficiente na própria imagem para permitir identificação, o que exige tratamento técnico adicional além da remoção dos metadados.
Um fornecedor de anotação de dados pode ser responsabilizado por falha de compliance, mesmo que a empresa contratante tenha enviado o dado?
A responsabilidade pode ser compartilhada entre controlador e operador de dados, dependendo do contrato e da forma como o tratamento foi definido — por isso é essencial ter cláusulas contratuais específicas de tratamento de dados, e não apenas um contrato comercial genérico, sempre com revisão jurídica.
Equipe dedicada é sempre melhor do que crowdsourcing para dados médicos?
Para dados sensíveis de saúde, uma equipe dedicada e rastreável tende a ser estruturalmente mais compatível com as exigências de controle de acesso e auditoria da LGPD do que um modelo de crowdsourcing anônimo, onde a identidade de cada anotador individual é mais difícil de verificar e responsabilizar. Anotar imagens médicas para treinar modelos de IA não é apenas um desafio técnico de qualidade de rótulo — é um processo que carrega, desde o primeiro dado compartilhado, exigências legais específicas da LGPD para dados sensíveis de saúde. Isso significa definir a base legal correta antes de começar, tratar a anonimização de DICOM em suas duas camadas (metadados e imagem), e escolher um fornecedor capaz de garantir rastreabilidade e controle de acesso compatíveis com o regime mais restritivo que a lei exige para esse tipo de dado. Ignorar qualquer uma dessas etapas não é apenas um risco técnico — é um risco jurídico que recai sobre o projeto de IA como um todo. Precisa de um fornecedor de anotação de imagens médicas com processo documentado de compliance e conformidade com a LGPD? Fale com a Data Quality Solution.

Quer entender como a Stringhini pode ajudar sua operação?