visualização
Ainda estamos trabalhando nesse recurso, mas adoraríamos que você experimentasse!
Atualmente, esse recurso é fornecido como parte de um programa de visualização de acordo com nossas políticas de pré-lançamento.
Quando um alerta é acionado por um pico de latência ou aumento de erros, seu primeiro desafio é descobrir onde o problema reside. Em vez de manter seu contexto investigativo, o fluxo de trabalho padrão o coloca em uma lista não filtrada de milhares de traces — forçando você a reconstruir filtros manualmente e vasculhar os dados para encontrar o único trace que mostra o problema.
Intelligent Exemplar (IE) elimina essa busca. Ele preserva o contexto exato do seu clique, exibe de forma algorítmica os trace que melhor representam a anomalia e direciona você diretamente para o span com falha — para que você vá do pico ao span raiz em cliques em vez de horas.
Depois de identificar o span com falha, use a Análise de Correlação de Atributos para responder por que ele está falhando — comparando estatisticamente seus traces anômalos com uma baseline saudável e revelando os atributos específicos que estão causando o problema.
Como o Exemplar Inteligente Funciona
O IE combina três comportamentos para preencher a lacuna entre uma métrica de alto nível e o trace exato no nível do código de que você precisa:
Preservação de contexto Quando você clica em uma janela de tempo em um gráfico de erros ou latência compatível, Intelligent Exemplar captura tudo no escopo naquele momento: a entidade, o intervalo de tempo exato, quaisquer filtros ativos, como transaction.name ou error.class, e as facetas selecionadas. Eles são passados nativamente para o backend. Você nunca é direcionado para uma lista de traces genérica e não filtrada.
Priorização algorítmica de trace Em vez de mostrar uma amostra aleatória ou ordenada cronologicamente, Intelligent Exemplar avalia o conjunto de dados completo de trace e exibe uma lista selecionada de até 500 trace que melhor representam a anomalia. Os trace fragmentados são filtrados automaticamente. Os trace são ponderados em relação às ocorrências que se enquadram na janela de pico. Se uma única variável — como um único nome de transação, host ou versão de implantação — for responsável por mais de 60% dos trace anômalos, ela será exibida automaticamente como o ponto de partida sugerido.
Navegação de span anômalo Quando você seleciona um trace na lista, a interface navega diretamente para o span anômalo — não o span raiz, não o span mais lento no geral, mas o span que mais se desvia do comportamento da baseline para essa operação. Em uma cascata de 200 spans que cruza vários serviços downstream, isso elimina a travessia manual necessária para localizar onde as coisas deram errado.
Requisitos
Antes de usar Intelligent Exemplar:
- Distributed tracing deve estar ativado para seus serviços.
- Quanto mais serviços no caminho do seu trace forem instrumentados, mais completo será o mapa de dependência downstream. Serviços não instrumentados criam lacunas no caminho causal.
Iniciar Uma Investigação
Intelligent Exemplar está disponível em gráficos de erros e latência em três locais:
- APM & Services > Summary: gráfico de tempo de transação da web e o gráfico de taxa de erros
- Errors Inbox: gráficos de erro e latência na página inicial do Errors Inbox
- Transactions: gráficos de erro e latência na página inicial do Transactions
As etapas são as mesmas em todos os três locais:
- Clique na janela de tempo no gráfico de erros ou latência que corresponde ao pico que você deseja investigar.
- Na dica de ferramenta que aparece, selecione Intelligent Traces.
Revisar a Página de Destino
Após selecionar a janela de pico, a página de destino Intelligent Exemplar é aberta com uma visão completa do comportamento anômalo para esse serviço e intervalo de tempo. Nenhuma criação de consulta ou configuração manual de filtro é necessária — o contexto do seu clique já foi aplicado.
A página inicial possui quatro componentes:
Barra de Resumo
Exibe o intervalo de tempo, o tipo de anomalia (latência ou erros) e o número de traces outlier identificados para essa janela.
Padrões que detectamos
Sinais categorizados que identificam onde a anomalia está ocorrendo e o que pode estar causando isso. Você pode selecionar um ou mais padrões para focar a lista de traces outlier em um sinal específico.
Padrão | O que ele significa |
|---|---|
Latência Downstream | A latência p95 ou p99 de uma dependência se correlaciona com o pico da entidade focal. A causa raiz provavelmente reside em um serviço downstream daquele em que você começou. |
Erros downstream | Uma taxa de erros em um serviço downstream aumentou durante a janela de pico. A anomalia está se propagando de uma dependência. |
Latência da Entidade Focal | O serviço de onde você começou é a própria fonte de latência — o problema não está sendo causado por uma dependência downstream. |
Aumento nas taxas de transferência | Um aumento acentuado no volume de solicitações na entidade focal ou em uma entidade downstream se correlaciona com o pico de latência ou de erros. A anomalia pode ser induzida por carga em vez de uma falha de código ou infraestrutura. |
Dica
Se um único padrão for responsável por mais de 60% dos traces anômalos, o Intelligent Exemplar o seleciona automaticamente como o ponto de partida sugerido. Você pode desmarcá-lo e escolher um padrão diferente para explorar hipóteses alternativas.
Traces outlier
A lista classificada de trace que exibem comportamento anômalo dentro da janela selecionada. Os trace são classificados por sua contribuição para o pico. Selecione qualquer trace para abri-lo e navegar diretamente para o span anômalo.
Gráfico de dispersão
Uma comparação visual de trace outlier em relação a todos os outros trace na janela de tempo.
- X-axis: tempo dentro da janela selecionada
- Y-axis: duração do trace (para investigações de latência) ou contagem de erros
- Outlier traces são plotados de forma distinta da série de baseline do All Traces
Use o gráfico de dispersão para confirmar que os traces outlier formam um cluster ao redor da janela de pico, em vez de serem distribuídos aleatoriamente por todo o intervalo de tempo. Um cluster estreito confirma que a anomalia é limitada no tempo e que os traces selecionados são genuinamente representativos do pico.
Inspecionar o span anômalo
Selecionar um trace da lista de outliers abre o painel de detalhes do trace. Intelligent Exemplar não leva você ao span raiz — ele navega diretamente para o span que mais se desvia do comportamento de baseline esperado para essa operação.
Isso é mais importante em traces profundos e de vários serviços. Em uma cascata de 200 spans que cruza cinco serviços downstream, o span anômalo pode estar enterrado a várias camadas de profundidade em uma dependência da qual você não suspeitava inicialmente. O Intelligent Exemplar navega você até lá automaticamente.
A partir do span anômalo, você pode:
- Revise os atributos de span para ver os valores que se desviam do baseline
- Navegar até a entidade proprietária do span para ver seu resumo do APM
- Visualize os spans ao redor no waterfall para contexto adicional
- Execute a Análise de Correlação de Atributo para identificar os pares específicos de atributo-valor que estão impulsionando a anomalia — como uma versão de implantação, host ou classe de erro
Para um guia completo sobre como trabalhar com detalhes de trace e atributos de span, consulte Entenda a página da interface de detalhes de trace.
Entender a correlação downstream
Quando a anomalia se origina em uma dependência downstream, Intelligent Exemplar mapeia o caminho de propagação causal em todo o seu gráfico de dependência de serviço.
O sistema analisa automaticamente os padrões de latência e erros correlacionados nas entidades downstream e calcula a contribuição de cada caminho para a falha agregada.
Dica
Uma instrumentação mais completa em todo o caminho do seu trace produz uma atribuição downstream mais precisa. Se um serviço downstream não estiver instrumentado, sua contribuição não aparecerá no mapa de correlação.
Qual é o próximo
- Identifique a causa raiz: execute a Análise de Correlação de Atributos para identificar os pares de atributo-valor específicos — como uma versão de implantação, host, região ou classe de erro — responsáveis pela anomalia.
- Gerenciar volume de trace: consulte Controlar a ingestão de dados de distributed tracing para gerenciar os custos de ingestão de trace durante e após um incidente.
- Ajuste a amostragem: consulte Configurar amostragem para ajustar as taxas de amostragem para o serviço afetado.