A AWS lança o AgentCore Optimization, recurso do Amazon Bedrock AgentCore que reescreve prompts de sistema com traces (registros de execução) de produção do Observability. No benchmark AppWorld, o Single Agent Reflector chega a 81,55% de sucesso em 20 turns (interações do agente), 18 vezes mais rápido que o método GEPA. Um sinal de recompensa orienta as sugestões, que passam por guardrails (barreiras de segurança) antes de qualquer atualização no agente.

A gigante de nuvem apresenta o AgentCore Optimization como parte do Amazon Bedrock AgentCore, sua plataforma para construir e conectar agentes de IA. O recurso nasce de um post técnico que detalha o system prompt optimizer, ferramenta que lê os traces coletados pelo AgentCore Observability e cruza esse histórico com um sinal de recompensa para sugerir ajustes no prompt de sistema. No benchmark AppWorld, a versão Sub-Agent Reflector — recurso experimental de código aberto liberado no repositório Strands — chega a 95,83% de sucesso, 23 pontos acima da linha de base do teste.

O Single Agent Reflector completa o mesmo desafio em 6 minutos, tempo que sustenta o ganho de velocidade sobre o método concorrente GEPA. Os testes usam dois modelos com papéis distintos: o Opus 4.6 funciona como reflector, responsável por analisar os traces e formular as recomendações, enquanto o Sonnet 4.5 executa as tarefas avaliadas no benchmark. Antes de qualquer prompt revisado chegar a um agente em produção, o sistema aplica guardrails que barram candidatos com crescimento acima de 20% em relação à versão anterior e proíbem o reaproveitamento literal de frases extraídas dos traces originais.

Ficha técnica

Ficha técnica
ItemEspecificação
Benchmark AppWorld (Single Agent Reflector)81,55% de sucesso em 6 minutos e 20 turns, 18x mais rápido que o GEPA
Benchmark AppWorld (Sub-Agent Reflector)95,83% de sucesso, 23 pontos acima da baseline
Guardrail de crescimentoCandidatos que cresçam mais de 20% em relação à versão anterior são rejeitados
Telemetria suportadaOpenTelemetry (OTEL) seguindo convenções GenAI ou especificação OpenInference
Frameworks compatíveisStrands Agents, LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK
Ferramenta Web SearchConstruída sobre a infraestrutura de busca usada por Alexa+, Amazon Quick Suite e Kiro
DatasetsPreview público para versionar conjuntos de teste como fixtures imutáveis

Guardrail trava prompts que crescem demais

A regra evita que o otimizador infle o prompt com instruções redundantes só para ganhar pontos no benchmark.

Outra trava bloqueia o reaproveitamento literal de trechos extraídos dos traces de produção, o que evita vazamento de dados sensíveis de usuários no prompt final. As duas camadas mantêm o processo auditável: cada sugestão nasce de registros reais de uso, mas só chega ao agente depois de passar por limites numéricos e regras de reformulação, nunca de cópia direta.

A AWS já tinha apresentado a otimização de prompts em um post de lançamento anterior. O texto mais recente detalha a técnica como system prompt optimizer (otimizador de prompts de sistema).

O AgentCore compete com frameworks como LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK e Strands Agents, que disputam espaço entre desenvolvedores de agentes de IA. A AWS também tornou o AgentCore Evaluations disponível de forma geral, depois de um período de teste apresentado no re:Invent 2025.

O recurso avalia agentes sem depender do framework escolhido. Paralelamente, a AWS amplia o acesso a conhecimento externo com a ferramenta Web Search e com o Bedrock Managed Knowledge Base, além de gerir datasets (conjuntos de dados) versionados para testes. Outros usos do AgentCore já apareceram em publicações da empresa: o Code Interpreter, ambiente de execução de código usado como espaço de trabalho para agentes, e integrações de autenticação OAuth que vinculam permissões de usuários a sessões de agentes.

Knowledge Base leva agentes a fontes externas

Depois de ajustar como o agente pensa, a AWS amplia o que ele acessa. O Bedrock Managed Knowledge Base chega ao AgentCore e assume a parte pesada de conectar um agente a documentos reais.

Ele cuida do vector store (banco que guarda representações numéricas de texto), dos embeddings e do re-ranking, que reordena resultados por relevância. Com isso, o agente passa a buscar informação direto no SharePoint, no Google Drive, no Confluence ou em buckets do Amazon S3, sem que o time monte essa infraestrutura à mão.

A Sony Group Corporation já usa essa conexão como exemplo de aplicação prática, segundo a AWS.

Do lado da avaliação, o AgentCore Evaluations soma três formas de medir um agente: comparação por LLM-as-a-Judge com rubricas estruturadas, checagem contra Ground Truth em datasets fixos e avaliadores de código customizado rodando em funções AWS Lambda, sem servidor dedicado.

AWS não informa data nem preço da otimização

  • Data exata de disponibilidade geral da otimização de prompts (AgentCore Optimization) não é informada
  • Preço ou custo de uso do AgentCore Optimization, Evaluations, Web Search ou Datasets não é mencionado
  • Disponibilidade por país ou região da AWS para esses recursos não é especificada

Fontes

  1. Optimizing agent system prompts with amazon bedrock agentcoreaws.amazon.com
  2. Build reliable ai agents with amazon bedrock agentcore evaluationsaws.amazon.com
  3. Evaluate any agent framework with amazon bedrock agentcore evaluationsaws.amazon.com
  4. New in amazon bedrock agentcore build agents with broader knowledge and continuous learningaws.amazon.com
  5. Build a test suite that grows with your agent with dataset management in amazon bedrock agentcoreaws.amazon.com

Produtos relacionados · link de afiliado