A AWS anuncia a disponibilidade geral do Amazon Bedrock Data Automation, recurso do Amazon Bedrock que extrai dados de documentos, imagens, áudio e vídeo automaticamente. O serviço estreia limitado às regiões Oregon e Virgínia do Norte, nos Estados Unidos, com expansão prevista para outras regiões da AWS. A ferramenta já serve de base para pipelines serverless de redação de informações pessoais em documentos multimodais.
O anúncio chega com números que mostram o que o recurso já resolve na prática. Um pipeline serverless de redação de PII (sigla para informações de identificação pessoal) usa um blueprint personalizado do Bedrock Data Automation, o AWS Step Functions e o AWS Lambda. Com só a extração via blueprint, ele atinge 97,0% de precisão e 89,3% de recall — a capacidade de encontrar todos os dados sensíveis.
Ao somar uma segunda checagem com a saída padrão do BDA, o recall sobe para 95,2% e a precisão fica em 96,5%.
Esses índices vêm de um teste com 12 documentos e 47 páginas, que cobre seis níveis de qualidade de digitalização — do formulário digitado limpo ao scan de baixa resolução, com 100 pontos por polegada. O caso de uso que embasa o teste, ligado a declarações médicas de acompanhamento (Attending Physician Statements), roda em produção e processa cerca de 25.000 páginas por noite.
O blueprint funciona como um modelo de extração customizado: define os campos que o BDA busca em cada documento, sem exigir treinamento manual. A combinação de extração automática com uma segunda checagem eleva o recall sem derrubar a precisão — ponto central para quem lida com dados sensíveis em volume alto.
O blueprint sozinho já acerta 97,0% dos dados pessoais que marca para redação — ou seja, quase todo trecho apagado é mesmo PII, não texto comum removido por engano. Essa precisão alta evita o problema oposto: um sistema que apaga informação demais e deixa o documento ilegível. O ponto fraco aparece no recall, que mede quanto da PII real o pipeline encontra.
Com só o blueprint, esse número fica em 89,3% — uma fatia dos dados sensíveis escapa da primeira passada. Para um documento com nome, CPF e endereço, essa fatia pode ser justamente o dado que falta redigir. É aí que entra a segunda checagem, feita com a saída padrão do Bedrock Data Automation depois da extração via blueprint.
Ela sobe o recall para 95,2%: o pipeline passa a capturar quase toda a PII do documento. A precisão cai um pouco, para 96,5% — uma troca pequena diante do ganho em cobertura. Na prática, quem monta o pipeline decide entre rodar só o blueprint ou somar as duas etapas, dependendo de quanto pesa o risco de vazar um dado pessoal em relação ao tempo de processamento.
Ficha técnica
| Item | Especificação |
|---|---|
| Regiões disponíveis | US West (Oregon) e US East (N. Virginia) |
| Buckets S3 (Macie) | 3 buckets: raw, staged, scanned |
AWS já detectava PII antes do Bedrock
A automação de redação de PII resolve um problema conhecido em setores regulados como saúde, seguros, finanças e governo. Essas áreas cobram trilhas de auditoria e conformidade rígidas antes de compartilhar documentos com dados pessoais. O mercado que sustenta esse tipo de ferramenta cresce rápido.
Segundo a Fortune Business Insights, o processamento inteligente de documentos, conhecido como IDP, deve saltar de US$ 10,57 bilhões em 2025 para US$ 66,68 bilhões em 2032 — um avanço anual de 30,1%. A Gartner reforça essa direção: até 2027, 40% das soluções de IA generativa vão lidar com múltiplos formatos como texto, imagem, áudio e vídeo ao mesmo tempo, ante apenas 1% em 2023. É esse cenário multimodal que justifica o desenho do Bedrock Data Automation.
O recurso também não nasce do zero. A AWS já detectava informações pessoais antes, com o Amazon Comprehend em bancos de dados Aurora e o Amazon Macie em arquivos no S3. O novo serviço amplia essa base para documentos, imagem, áudio e vídeo combinados — um passo incremental, não um produto isolado.
Nova 2 Lite comanda redação em imagens
A disponibilidade geral também libera outro padrão de pipeline (fluxo de processamento automatizado) voltado a imagens. A AWS publicou uma arquitetura em que o modelo Amazon Nova 2 Lite, rodado no Bedrock, coordena o processo e decide o que precisa ser coberto. A segmentação pixel a pixel fica com o Segment Anything Model (SAM 3), da Meta, hospedado no Amazon SageMaker AI; a extração de texto passa pelo Amazon Textract.
A divisão de tarefas mostra que o BDA não substitui outros serviços da AWS, mas orquestra fluxos que somam modelos de fornecedores diferentes. Esse ritmo explica por que a AWS amplia a lista de padrões prontos entregues junto com a documentação técnica do serviço.
Chegada ao Brasil ainda não confirmada
- Não há um lançamento único e nomeado de ferramenta de redação de PII; fontes tratam de recursos distintos (BDA, Nova, Macie, Comprehend)
- Preço dos serviços envolvidos na redação de PII não informado em nenhuma fonte
- Disponibilidade no Brasil não confirmada; BDA listado só em Oregon e N. Virginia
Fontes
- Unleashing the multimodal power of amazon bedrock data automation to transform unstructured data into actionable insightsaws.amazon.com
- Build a serverless pii redaction pipeline with amazon bedrock data automationaws.amazon.com
- Automatically redact pii in images with amazon novaaws.amazon.com
- Automate custom pii detection at scale with amazon macie and step functionsaws.amazon.com
- Detect pii data in amazon aurora with amazon comprehendaws.amazon.com
Produtos relacionados · link de afiliado



