ANPD Reforça Limites da Raspagem de Dados na Internet: O Que Muda para Empresas e Privacidade de Usuários

A ANPD consolidou diretrizes sobre web scraping e a proteção de dados públicos na internet. Veja as exigências da LGPD, os impactos em inteligência artificial e como empresas devem se adequar.

A Autoridade Nacional de Proteção de Dados (ANPD) consolidou entendimentos técnicos fundamentais sobre as práticas de raspagem de dados pessoais na internet, conhecida tecnicamente como web scraping. A manifestação do órgão regulador brasileiro responde a um dos debates mais sensíveis da economia digital: a coleta automatizada de volumes massivos de informações em redes sociais, portais corporativos, fóruns e diretórios abertos para fins comerciais, alimentando desde sistemas de inteligência artificial até birôs de crédito e ferramentas de marketing.

A premissa central fixada pela autoridade é direta: o fato de um dado pessoal estar acessível publicamente na web não retira sua proteção sob a Lei Geral de Proteção de Dados (LGPD, Lei nº 13.709/2018). Toda operação que capture, armazene, cruze ou processe informações identificadas ou identificáveis de cidadãos brasileiros depende de uma base legal expressa, de finalidade legítima e da observância estrita dos direitos dos titulares.

O que é raspagem de dados segundo o enquadramento regulatório

Raspagem de dados é o processo técnico que utiliza scripts, robôs rastreadores (crawlers) ou chamadas diretas de automação para extrair dados estruturados ou semiestruturados de páginas da web de maneira massiva e contínua. Essa prática é historicamente utilizada para indexação de conteúdo por buscadores, monitoramento de preços no comércio eletrônico e pesquisas acadêmicas.

No entanto, a expansão do treinamento de grandes modelos de linguagem (LLMs) e a proliferação de softwares de prospecção corporativa transformaram o scraping em uma indústria de extração intensiva de nomes, e-mails, telefones, fotos, históricos profissionais e postagens em plataformas digitais. De acordo com a ANPD, quando esse procedimento atinge dados de pessoas físicas, configura tratamento de dados pessoais em larga escala, exigindo avaliação prévia de riscos e mecanismos de governança.

O mito dos dados públicos e o princípio da finalidade na LGPD

Um dos pontos mais relevantes esclarecidos pela autoridade reguladora combate a crença de que dados publicados na internet tornam-se de domínio público irrestrito. A legislação brasileira diferencia dados de acesso público da renúncia à privacidade.

O artigo 7º, § 4º, da LGPD autoriza o tratamento de dados tornados manifestamente públicos pelo titular sem a necessidade de consentimento isolado, mas impõe que essa coleta respeite a finalidade inicial da disponibilização e os princípios gerais da lei, em especial a boa-fé e o interesse público ou legítimo do tratamento. Em termos práticos:

  • Quebra de expectativa do usuário: Um profissional que disponibiliza seu e-mail em uma plataforma corporativa para conexões de trabalho não autoriza tacitamente a inclusão desse contato em listas automáticas de disparo de spam ou ferramentas de telemarketing predatório.
  • Cruzamento indevido de bases: A união de dados extraídos de múltiplas fontes públicas com o intuito de criar perfis comportamentais ou financeiros completos depende de justificativa jurídica robusta e avaliação de impacto à privacidade.
  • Tratamento de dados sensíveis: Informações sobre saúde, filiação sindical, convicções religiosas ou dados biométricos exigem salvaguardas adicionais, mesmo quando expostas em redes abertas.

Impactos diretos no treinamento de Inteligência Artificial

A determinação da ANPD incide com peso sobre as desenvolvedoras de inteligência artificial generativa que operam no território nacional. Os sistemas de IA necessitam de petabytes de texto e imagens para atingir precisão linguística e cognitiva, e grande parte desse material é obtido por meio de varreduras gerais na web aberta.

Empresas de tecnologia enfrentam o desafio de comprovar que as bases de treino respeitam as normativas brasileiras. O enquadramento na base legal do legítimo interesse (Artigo 7º, IX da LGPD) demanda a elaboração do Relatório de Impacto à Proteção de Dados Pessoais (RIPD) e a realização do chamado Teste de Ponderação (LIA – Legitimate Interests Assessment), comprovando que a atividade não anula direitos e liberdades individuais fundamentais.

Além disso, o órgão regulador tem ressaltado a necessidade de viabilizar canais para que titulares possam exercer seus direitos de oposição ao uso de seus dados para treino algorítmico, criando mecanismos de autoexclusão (opt-out) funcionais e transparentes.

Vulnerabilidade digital e exposição de registros corporativos e individuais

A raspagem indiscriminada também alimenta o ecossistema de vazamentos secundários e engenharia social. Dados fragmentados em sites de registro de domínios, processos judiciais não sigilosos e diretórios cadastrais de CNPJ são frequentemente minerados para estruturar golpes como o phishing direcionado e a usurpação de identidade corporativa.

Organizações e figuras públicas que identificam informações sensíveis ou descontextualizadas replicadas em repositórios digitais precisam adotar medidas de contenção técnica e jurídica. Quando incidentes desse tipo afetam a reputação institucional ou a integridade de dados pessoais, iniciativas especializadas em governança e resposta tornam-se necessárias. Em situações nas quais cadastros ou registros geram exposição excessiva, a atuação de empresas dedicadas à mitigação de riscos digitais e à gestão de reputação digital pode ser avaliada para identificar a origem das cópias, solicitar desindexações e mitigar danos à imagem.

Recomendações técnicas para sites e desenvolvedores de sistemas

Para mitigar a coleta não autorizada e resguardar os dados de seus usuários, proprietários de plataformas, desenvolvedores e administradores de servidores devem implementar camadas técnicas de defesa ativa e defensiva:

1. Atualização e fiscalização do protocolo robots.txt

Embora o arquivo robots.txt funcione como uma sinalização voluntária de recusa, sua correta configuração é o primeiro passo para formalizar a proibição de acesso a robôs de inteligência artificial e coletores comerciais específicos nos diretórios onde residem informações sensíveis.

2. Implementação de limitação de taxa (Rate Limiting) e WAF

A aplicação de limites de requisições por endereço IP (rate limiting) e o uso de Web Application Firewalls (WAF) dificultam a extração automatizada de centenas de requisições por segundo, forçando comportamentos que auxiliam na detecção de tráfego robótico anômalo.

3. Revisão dos Termos de Uso

Os termos de serviço da plataforma devem vedar de forma explícita o uso de ferramentas de captura automatizada para fins de engenharia reversa, criação de bases concorrentes ou mineração de dados sem consentimento formal prévio.

O que os titulares de dados podem fazer diante da extração indevida

Cidadãos que identificarem seus dados pessoais replicados em ferramentas de busca ou plataformas terceiras sem justificativa legítima têm resguardado o direito de peticionar diretamente ao controlador que hospeda a base raspada. A requisição pode exigir a confirmação de tratamento, acesso, correção de dados incompletos ou a eliminação dos registros coletados de forma excessiva.

Caso a plataforma ignore a manifestação ou mantenha o tratamento em desconformidade com a LGPD, o titular pode formalizar denúncia no canal oficial de peticionamento da ANPD e recorrer aos órgãos de defesa do consumidor, sobretudo quando a prática configurar publicidade abusiva ou fraude comercial.

O novo patamar de conformidade para o ecossistema digital

A maturidade regulatória impulsionada pela ANPD encerra o período em que a coleta indiscriminada de dados na web brasileira era tratada como um vácuo legislativo. Para equipes de tecnologia, desenvolvedores e profissionais de segurança da informação, a estruturação de produtos que consomem dados externos exigirá cada vez mais auditoria de procedência.

A viabilidade de projetos de software, automação e inteligência artificial no Brasil passa obrigatoriamente pelo equilíbrio entre inovação tecnológica e o respeito irrenunciável à privacidade do usuário.

ANPD e Lei Geral de Proteção de Dados

Avatar photo
Data Reset
Artigos: 6