A AWS anuncia a disponibilidade geral do Amazon Bedrock Data Automation, recurso do Amazon Bedrock que extrai dados de documentos, imagens, áudio e vídeo automaticamente. O serviço estreia limitado às regiões Oregon e Virgínia do Norte, nos Estados Unidos, com expansão prevista para outras regiões da AWS. A ferramenta já serve de base para pipelines serverless de redação de informações pessoais em documentos multimodais.

O anúncio chega com números que mostram o que o recurso já resolve na prática. Um pipeline serverless de redação de PII (sigla para informações de identificação pessoal) usa um blueprint personalizado do Bedrock Data Automation, o AWS Step Functions e o AWS Lambda. Com só a extração via blueprint, ele atinge 97,0% de precisão e 89,3% de recall — a capacidade de encontrar todos os dados sensíveis.

Ao somar uma segunda checagem com a saída padrão do BDA, o recall sobe para 95,2% e a precisão fica em 96,5%.

Esses índices vêm de um teste com 12 documentos e 47 páginas, que cobre seis níveis de qualidade de digitalização — do formulário digitado limpo ao scan de baixa resolução, com 100 pontos por polegada. O caso de uso que embasa o teste, ligado a declarações médicas de acompanhamento (Attending Physician Statements), roda em produção e processa cerca de 25.000 páginas por noite.

O blueprint funciona como um modelo de extração customizado: define os campos que o BDA busca em cada documento, sem exigir treinamento manual. A combinação de extração automática com uma segunda checagem eleva o recall sem derrubar a precisão — ponto central para quem lida com dados sensíveis em volume alto.

O blueprint sozinho já acerta 97,0% dos dados pessoais que marca para redação — ou seja, quase todo trecho apagado é mesmo PII, não texto comum removido por engano. Essa precisão alta evita o problema oposto: um sistema que apaga informação demais e deixa o documento ilegível. O ponto fraco aparece no recall, que mede quanto da PII real o pipeline encontra.

Com só o blueprint, esse número fica em 89,3% — uma fatia dos dados sensíveis escapa da primeira passada. Para um documento com nome, CPF e endereço, essa fatia pode ser justamente o dado que falta redigir. É aí que entra a segunda checagem, feita com a saída padrão do Bedrock Data Automation depois da extração via blueprint.

Ela sobe o recall para 95,2%: o pipeline passa a capturar quase toda a PII do documento. A precisão cai um pouco, para 96,5% — uma troca pequena diante do ganho em cobertura. Na prática, quem monta o pipeline decide entre rodar só o blueprint ou somar as duas etapas, dependendo de quanto pesa o risco de vazar um dado pessoal em relação ao tempo de processamento.

Ficha técnica

Ficha técnica
ItemEspecificação
Regiões disponíveisUS West (Oregon) e US East (N. Virginia)
Buckets S3 (Macie)3 buckets: raw, staged, scanned

AWS já detectava PII antes do Bedrock

A automação de redação de PII resolve um problema conhecido em setores regulados como saúde, seguros, finanças e governo. Essas áreas cobram trilhas de auditoria e conformidade rígidas antes de compartilhar documentos com dados pessoais. O mercado que sustenta esse tipo de ferramenta cresce rápido.

Segundo a Fortune Business Insights, o processamento inteligente de documentos, conhecido como IDP, deve saltar de US$ 10,57 bilhões em 2025 para US$ 66,68 bilhões em 2032 — um avanço anual de 30,1%. A Gartner reforça essa direção: até 2027, 40% das soluções de IA generativa vão lidar com múltiplos formatos como texto, imagem, áudio e vídeo ao mesmo tempo, ante apenas 1% em 2023. É esse cenário multimodal que justifica o desenho do Bedrock Data Automation.

O recurso também não nasce do zero. A AWS já detectava informações pessoais antes, com o Amazon Comprehend em bancos de dados Aurora e o Amazon Macie em arquivos no S3. O novo serviço amplia essa base para documentos, imagem, áudio e vídeo combinados — um passo incremental, não um produto isolado.

Nova 2 Lite comanda redação em imagens

A disponibilidade geral também libera outro padrão de pipeline (fluxo de processamento automatizado) voltado a imagens. A AWS publicou uma arquitetura em que o modelo Amazon Nova 2 Lite, rodado no Bedrock, coordena o processo e decide o que precisa ser coberto. A segmentação pixel a pixel fica com o Segment Anything Model (SAM 3), da Meta, hospedado no Amazon SageMaker AI; a extração de texto passa pelo Amazon Textract.

A divisão de tarefas mostra que o BDA não substitui outros serviços da AWS, mas orquestra fluxos que somam modelos de fornecedores diferentes. Esse ritmo explica por que a AWS amplia a lista de padrões prontos entregues junto com a documentação técnica do serviço.

Chegada ao Brasil ainda não confirmada

  • Não há um lançamento único e nomeado de ferramenta de redação de PII; fontes tratam de recursos distintos (BDA, Nova, Macie, Comprehend)
  • Preço dos serviços envolvidos na redação de PII não informado em nenhuma fonte
  • Disponibilidade no Brasil não confirmada; BDA listado só em Oregon e N. Virginia

Fontes

  1. Unleashing the multimodal power of amazon bedrock data automation to transform unstructured data into actionable insightsaws.amazon.com
  2. Build a serverless pii redaction pipeline with amazon bedrock data automationaws.amazon.com
  3. Automatically redact pii in images with amazon novaaws.amazon.com
  4. Automate custom pii detection at scale with amazon macie and step functionsaws.amazon.com
  5. Detect pii data in amazon aurora with amazon comprehendaws.amazon.com

Produtos relacionados · link de afiliado