View a markdown version of this page

AgentCore insights: faça a triagem de falhas do agente com análise de padrões - Amazon Bedrock AgentCore

AgentCore insights: faça a triagem de falhas do agente com análise de padrões

nota

AgentCore O Insights está em pré-visualização pública. Os recursos e as APIs podem mudar antes da disponibilidade geral.

nota

Ao usar AgentCore insights no ap-south-1, o serviço usa perfis de inferência entre regiões do Bedrock APAC. Ao usar AgentCore insights no ap-northeast-2, o serviço usa perfis globais de inferência entre regiões da Bedrock. Em ambos os casos, sua solicitação pode ser encaminhada para qualquer uma das regiões de destino no perfil. Esse roteamento pode ocorrer mesmo que você não tenha optado por essas regiões ou tenha políticas de controle de serviço negando explicitamente a inferência nelas. As solicitações de entrada e os resultados de saída podem ser armazenados nessas regiões de destino para fins de detecção de abusos.

O Amazon Bedrock AgentCore Insights analisa as sessões do seu agente para identificar padrões de falha, extrair as intenções do usuário e resumir o comportamento de execução. O Insights amplia AgentCore as avaliações fornecendo uma análise de triagem que vai além da pontuação — ela explica por que seu agente falha e o que seus usuários estão tentando realizar.

AgentCore O Insights fornece três tipos de análise:

  • Análise de falhas: identifica falhas nas sessões do agente, as categoriza usando uma taxonomia detalhada (erros de ferramentas, alucinações, raciocínio incorreto, comportamento repetitivo e muito mais), rastreia as causas-raiz até períodos específicos e fornece recomendações de correção.

  • Extração da intenção do usuário: extrai o que os usuários estavam tentando realizar em cada sessão e, em seguida, agrupa intenções semelhantes para mostrar os casos de uso mais comuns que seu agente trata.

  • Resumo da execução: resume a abordagem adotada pelo agente e o resultado de cada sessão e, em seguida, agrupa padrões de execução semelhantes para revelar como seu agente normalmente resolve problemas.

Após a análise por sessão, o serviço agrupa os resultados em todas as sessões para revelar padrões recorrentes. Para análise de falhas, isso produz uma hierarquia de três níveis: categorias de falhas → subcategorias → clusters de causa raiz, cada um com sessões afetadas, explicações e recomendações de remediação.

Como os insights são acionados

A análise de insights pode ser acionada de duas maneiras:

  • Uma vez por meio de avaliação em lote: ligue StartBatchEvaluation insights para realizar análises em um intervalo de tempo de sessões. Os resultados são retornados por meio deGetBatchEvaluation.

  • Recorrente por meio de agendamento de agrupamento: configure um ClusteringConfig em sua configuração de avaliação on-line com uma ou mais frequências (DAILY,WEEKLY, ou). MONTHLY O serviço aciona automaticamente os trabalhos de avaliação em lote na cadência configurada. Você também pode criar um relatório personalizado na agenda recorrente para fixar em uma data e hora específicas.

Per-session a análise de insights é executada automaticamente quando os insights são configurados via CreateOnlineEvaluationConfig, mas o agrupamento resulta em que os padrões de superfície são gerados somente durante trabalhos de avaliação em lote.

Da triagem à otimização

AgentCore O Insights trabalha em conjunto com a AgentCore otimização para fechar o ciclo de melhoria. Depois que o Insights identifica os padrões de falha e as causas-raiz, você pode inserir essas descobertas na API de Recomendações para gerar um prompt aprimorado do sistema que resolva os problemas triados. Isso transforma a saída de diagnóstico em mudanças de configuração acionáveis:

  1. Triagem: execute insights para identificar categorias de falhas recorrentes e causas-raiz.

  2. Gere recomendação: ligue StartRecommendation com o prompt atual do sistema e direcione-o para os mesmos rastreamentos do agente. O serviço produz um prompt de sistema recomendado com uma explicação do que foi alterado.

  3. Validar: use A/B testes para comparar as configurações originais e recomendadas com o tráfego ao vivo.