A biblioteca de templates Scorecards fornece uma maneira simplificada de abordar casos de uso de engenharia e negócios. Ao usar as práticas recomendadas de grandes empresas, a biblioteca oferece soluções para desafios comuns de engenharia.
Cada template na biblioteca é totalmente personalizável para atender aos padrões da sua organização. Você pode modificar consultas, regras e limites para adaptar o Scorecards às suas necessidades.
Alguns templates rotulam suas regras com níveis de maturidade (L0 a L3).
Modelos de scorecard
Finalidade: Valida se seus serviços estão prontos para implantação de produção, verificando objetivos definidos, configuração de alerta e atividade de implantação recente.
Importância: ajuda a encontrar lacunas de prontidão antes de implantar em produção.
Pré-requisitos:
Regras principais:
Defined SLOs: estabelece destinos claros para desempenho e confiabilidade.
APM service alerts configuration: verifica se os alertas estão configurados para detecção de problemas de prompt.
Recent deployments: verifica implantações bem-sucedidas no último mês.
Runbook availability: confirma que existem runbooks para as condições do alerta acionadas no último mês.
Objetivo: avalia a confiabilidade em relação aos padrões da AWS para segurança e redundância em operações na cloud.
Importância: ajuda você a encontrar lacunas de confiabilidade e segurança em sua infraestrutura de nuvem.
Pré-requisitos: Monitoramento de AWS de New Relic
Regras principais:
- EFS Encrypted check: confirma a criptografia de volumes do Elastic File System (EFS).
- RDS Instance check retention period: verifica os períodos de retenção de backup para o serviço de banco de dados relacional (RDS).
- RDS DeletionProtection check: Verifica a proteção contra exclusão.
- RDS MultiAZ presence check: verifica a implantação em várias zonas de disponibilidade (MultiAZ).
- RDS AutoMinorVersionUpgrade check: confirma as atualizações automáticas de versão secundária.
Objetivo: Avaliar a alocação de recursos e melhorias de processos utilizando os principais indicadores de desempenho.
Importância: Quantifica o desempenho de entrega de software, auxiliando na tomada de decisões estratégicas.
Pré-requisitos:
Regras principais:
Deployment frequency: rastreia as taxas de implantação bem-sucedidas.
Mean time to recovery: mede o tempo de recuperação de falhas.
Change failure rate: Rastreia a porcentagem de alterações que resultam em falhas.
Lead time for changes: mede o tempo gasto do commit do código até a implantação.
Objetivo: estabelece e aplica práticas consistentes de tag para recursos em sua organização.
Importância: tags consistentes ajudam você a filtrar e agrupar serviços em visualizações como mapas e catálogos.
Pré-requisitos: APM
Regras principais:
- Team Tag Exists: verifica se os serviços carregam uma tag de equipe proprietária para propriedade e responsabilidade claras.
- Environment Tag Exists: verifica se os serviços carregam uma tag de ambiente consistente para filtragem e agrupamento.
- APM Criticality is set: verifica se os serviços têm uma tag de criticidade para priorizar por importância de negócios.
Objetivo: estabelece uma estratégia abrangente de tag e visibilidade completa das dependências e dos relacionamentos do serviço.
Importância: destaca lacunas em tags, relacionamentos, trace e cobertura de Sintético para que você possa resolvê-las.
Pré-requisitos:
Regras principais:
(L0) Team Tag Coverage: identifica entidades sem uma tag
team.(L0) Environment Tag Coverage: identifica entidades sem uma tag
environment.(L0) Uninstrumented Entities: sinaliza entidades de serviço HTTP e banco de dados com relacionamentos desconhecidos que precisam de instrumentação suplementar.
(L0) Distributed Trace Coverage: mede a porcentagem de entidades do APM emitindo dados de distributed trace.
(L0) Synthetic Coverage: mede a porcentagem de entidades do APM cobertas por monitores Sintéticos.
Objetivo: Desenvolve uma estratégia abrangente de alertas e uma abordagem de gerenciamento de incidentes para a confiabilidade do serviço.
Importância: destaca lacunas de alerta, ruído e cobertura de SLI para que você possa priorizar serviços críticos.
Pré-requisitos:
Gerenciamento do nível de serviço
Regras principais:
(L1) Infrastructure Alert Coverage: identifica hosts e pods do Kubernetes que não têm cobertura de alerta.
(L1) Service Delivery Alert Coverage: identifica serviços, browser, mobile e monitores Sintéticos que não têm cobertura de alerta.
(L1) Critical Alert Coverage: sinaliza a dependência excessiva de condições do alerta crítico que podem causar excesso de alertas.
(L1) Alert Noise: identifica políticas que geram um alto volume de incidentes.
(L2) Service Level Coverage: verifica se as entidades têm um indicador de nível de serviço (SLI) definido.
(L2) Alerts Mean Time To Close: avalia o tempo gasto para fechar incidentes, visando a resolução em 30 minutos.
(L2) APM Criticality Tag Coverage: identifica entidades sem uma tag
criticality.(L3) Service Level Attainment: avalia a pontuação de conformidade para cada SLI definido, usando um limite padrão de 95%.
Objetivo: enfatiza o uso eficiente de recursos e práticas de segurança robustas por meio do monitoramento do uso de CPU e memória, integrando o Monitoramento de Alterações e detectando vulnerabilidades.
Importância: aderir aos padrões de recursos, Monitoramento de Alterações e segurança ajuda você a executar uma infraestrutura eficiente e segura.
Pré-requisitos:
Regras principais:
(L1) CPU Utilization: verifica o 95º percentil de uso de CPU para entidades de infraestrutura em relação às práticas recomendadas de eficiência.
(L1) Memory Utilization: verifica o 95º percentil de uso de memória para entidades de infraestrutura em relação às práticas recomendadas de eficiência.
(L2) Change Tracking: Verifica eventos de Monitoramento de Alterações em suas entidades do APM.
(L3) Service Vulnerabilities: verifica a porcentagem de entidades do APM com vulnerabilidades detectadas.
Objetivo: monitora o desempenho do frontend e a interação do usuário por meio de erros de JavaScript, erros HTTP 5xx e métricas do core web vitals.
Importância: aderir aos padrões de erros de frontend e do Core Web Vitals ajuda você a manter uma forte experiência do usuário.
Pré-requisitos:
Gerenciamento do nível de serviço
Regras principais:
(L1) JS Error Rate: verifica a porcentagem de entidades de navegador com erros de JavaScript.
(L1) Service Error Rate: verifica a porcentagem de serviços do APM relatando erros 5xx em requests HTTP.
(L2) Core Web Vitals: Largest Contentful Pane (LCP): sinaliza entidades cujo LCP do 75º percentil excede 2,5 segundos.
(L2) Core Web Vitals: Interaction to Next Paint (INP): sinaliza entidades cujo INP do 75º percentil excede 200 milissegundos.
(L2) Core Web Vitals: Cumulative Layout Shift (CLS): sinaliza entidades cujo CLS do percentil 75 excede 0,1.
(L3) Service Level Attainment: avalia a pontuação de conformidade para cada SLI definido, usando um limite padrão de 95%.
Objetivo: avalia o risco de vulnerabilidades em serviços de APM e infraestrutura.
Importância: destacar vulnerabilidades críticas e de alta gravidade, CVEs de ransomware ativas e a probabilidade de exploração ajuda a priorizar a remediação.
Pré-requisitos:
Monitoramento de infraestrutura
Regras principais:
APM: Under 3 Critical Severity: verifica se um serviço APM tem menos de 3 vulnerabilidades de gravidade crítica.
APM: Under 5 High Severity: Verifica se um serviço do APM tem menos de 5 vulnerabilidades de alta gravidade.
APM: Active Ransomware: sinaliza CVEs relatadas que têm uma campanha de ransomware ativa.
APM: Exploit Probability: sinaliza vulnerabilidades críticas ou de alta gravidade com probabilidade de serem exploradas (EPSS do percentil 95+).
INFRA: Under 3 Critical Severity: verifica se um host ou contêiner tem menos de 3 vulnerabilidades de gravidade crítica.
INFRA: Under 5 High Severity: Verifica se um host ou contêiner tem menos de 5 vulnerabilidades de alta gravidade.
INFRA: Active Ransomware: sinaliza CVEs relatadas que têm uma campanha de ransomware ativa.
INFRA: Exploit Probability: sinaliza vulnerabilidades críticas ou de alta gravidade com probabilidade de serem exploradas (EPSS do percentil 95+).
Objetivo: Mede a qualidade operacional e a governança das respostas de IA em termos de segurança, eficiência de custos e conformidade do modelo.
Importância: Aderir aos padrões de qualidade e governança de IA ajuda você a manter o uso da IA responsável e econômico.
Pré-requisitos: AI Monitoring
Regras principais:
- LLM Runtime Error Rate: verifica se os aplicativos habilitados para LLM mantêm uma baixa taxa de erros operacionais.
- Cost Efficiency - Average tokens per assistant response: verifica se a contagem média de tokens por resposta do assistente permanece dentro do orçamento.
- Model Governance - Approved model usage for assistant responses: verifica se apenas modelos aprovados são usados para respostas do assistente em produção.