Scorecards 템플릿 라이브러리는 엔지니어링 및 비즈니스 사용 사례를 해결할 수 있는 간소화된 방법을 제공합니다. 대기업의 모범 사례를 활용하여 라이브러리는 일반적인 엔지니어링 과제에 대한 솔루션을 제공합니다.
라이브러리의 각 템플릿은 조직의 표준을 충족하도록 완벽하게 사용자 정의할 수 있습니다. 쿼리, 규칙 및 임계값을 수정하여 요구 사항에 맞게 Scorecards 을(를) 조정할 수 있습니다.
일부 템플릿은 성숙도 수준(L0 - L3)으로 규칙에 레이블을 지정합니다.
스코어카드 템플릿
목적: 정의된 목표, 공지 설정, 최근 구현, 배포 활동을 확인하여 서비스가 프로덕션 구현, 배포 준비가 되었는지 확인합니다.
중요: 프로덕션 환경에 배포하기 전에 준비 상태의 격차를 찾는 데 도움이 됩니다.
필수 조건:
주요 규칙:
Defined SLOs: 성능 및 안정성에 대한 명확한 목표를 설정합니다.
APM service alerts configuration: 프롬프트 문제 감지를 위해 알림이 설정되어 있는지 확인합니다.
Recent deployments: 지난 한 달 동안의 성공적인 배포를 확인합니다.
Runbook availability: 지난달에 트리거된 공지 조건에 대한 런북이 존재하는지 확인합니다.
목적: cloud 운영의 보안 및 이중화에 대한 AWS 표준을 기준으로 안정성을 평가합니다.
중요성: 클라우드 인프라에서 안정성 및 보안 공백을 찾는 데 도움이 됩니다.
전제 조건: 뉴렐릭 AWS 모니터링
주요 규칙:
- EFS Encrypted check: Elastic File System(EFS) 볼륨의 암호화를 확인합니다.
- RDS Instance check retention period: 관계형 데이터베이스 서비스(RDS)의 백업 보존 기간을 확인합니다.
- RDS DeletionProtection check: 삭제 보호를 확인합니다.
- RDS MultiAZ presence check: 여러 가용 영역(MultiAZ)에 걸친 배포를 확인합니다.
- RDS AutoMinorVersionUpgrade check: 자동 마이너 버전 업그레이드를 확인합니다.
목적: 핵심 성과 지표(KPI)를 활용하여 자원 배분 및 프로세스 개선 사항을 평가합니다.
중요성: 소프트웨어 제공을 정량화하고, 전략적 의사 결정을 지원합니다.
필수 조건:
주요 규칙:
Deployment frequency: 성공적인 배포 비율을 추적합니다.
Mean time to recovery: 장애로부터의 복구 시간을 측정합니다.
Change failure rate: 실패를 초래한 변경의 비율을 추적합니다.
Lead time for changes: 코드 커밋부터 배포까지 걸리는 시간을 측정합니다.
목적: 조직 내 리소스에 대한 일관된 태그 관행을 설정하고 시행합니다.
중요성: 일관된 태그는 맵 및 카탈로그와 같은 뷰에서 서비스를 필터링하고 그룹화하는 데 도움이 됩니다.
전제 조건: APM
주요 규칙:
- Team Tag Exists: 명확한 소유권과 책임 소재를 위해 서비스에 소유 팀 태그가 있는지 확인합니다.
- Environment Tag Exists: 필터링 및 그룹화를 위해 서비스에 일관된 환경 태그가 있는지 확인합니다.
- APM Criticality is set: 비즈니스 중요도에 따라 우선순위를 지정하기 위해 서비스에 중요도 태그가 있는지 확인합니다.
목적: 포괄적인 태그 전략을 수립하고 서비스 종속성 및 관계에 대한 완전한 가시성을 확보합니다.
중요도: 태그, 관계, 트레이스 및 신세틱 커버리지의 격차를 강조하여 이를 해결할 수 있도록 합니다.
필수 조건:
주요 규칙:
(L0) Team Tag Coverage:
team태그가 누락된 엔티티를 식별합니다.(L0) Environment Tag Coverage:
environment태그가 누락된 엔티티를 식별합니다.(L0) Uninstrumented Entities: 추가 계측이 필요한 알 수 없는 관계를 가진 HTTP 서비스 및 데이터베이스 엔티티를 표시합니다.
(L0) Distributed Trace Coverage: 분산 트레이스 데이터를 전송하는 APM 엔티티의 비율을 측정합니다.
(L0) Synthetic Coverage: 신세틱 모니터가 적용되는 APM 엔티티의 비율을 측정합니다.
목적: 서비스 안정성을 위한 포괄적인 알림 전략 및 인시던트 관리 접근 방식을 개발합니다.
중요도: 중요한 서비스의 우선순위를 지정할 수 있도록 공지 격차, 노이즈 및 SLI 커버리지를 강조합니다.
필수 조건:
주요 규칙:
(L1) Infrastructure Alert Coverage: 공지 커버리지가 부족한 호스트 및 Kubernetes 파드를 식별합니다.
(L1) Service Delivery Alert Coverage: 공지 커버리지가 부족한 서비스, 브라우저, 모바일 및 신세틱 모니터를 식별합니다.
(L1) Critical Alert Coverage: 공지 피로를 유발할 수 있는 중요 알림 공지 조건에 대한 과도한 의존을 표시합니다.
(L1) Alert Noise: 대량의 인시던트를 생성하는 정책을 식별합니다.
(L2) Service Level Coverage: 엔티티에 정의된 서비스 수준 지표(SLI)가 있는지 확인합니다.
(L2) Alerts Mean Time To Close: 인시던트를 종료하는 데 걸리는 시간을 평가하여 30분 이내에 해결하는 것을 목표로 합니다.
(L2) APM Criticality Tag Coverage:
criticality태그가 누락된 엔티티를 식별합니다.(L3) Service Level Attainment: 95%의 기본 임계값을 사용하여 정의된 각 SLI에 대한 규정 준수 점수를 평가합니다.
목적: CPU 및 메모리 사용량을 모니터링하고, 변경 추적을 통합하며, 취약점을 탐지하여 효율적인 리소스 사용과 강력한 보안 관행을 강조합니다.
중요성: 리소스, 변경 추적 및 보안 표준을 준수하면 효율적이고 안전한 인프라를 운영하는 데 도움이 됩니다.
필수 조건:
목적: JavaScript 오류, HTTP 5xx 오류 및 코어 웹 바이탈 메트릭을 통해 프런트엔드 성능 및 사용자 상호작용을 모니터링합니다.
중요도: 프런트엔드 오류 및 Core Web Vitals 표준을 준수하면 강력한 사용자 경험을 유지하는 데 도움이 됩니다.
필수 조건:
주요 규칙:
(L1) JS Error Rate: JavaScript 오류가 있는 브라우저 엔티티의 비율을 확인합니다.
(L1) Service Error Rate: HTTP requests에서 5xx 오류를 보고하는 APM 서비스의 비율을 확인합니다.
(L2) Core Web Vitals: Largest Contentful Pane (LCP): 75번째 백분위수 LCP가 2.5초를 초과하는 엔티티를 표시합니다.
(L2) Core Web Vitals: Interaction to Next Paint (INP): 75번째 백분위수 INP가 200밀리초를 초과하는 엔티티를 표시합니다.
(L2) Core Web Vitals: Cumulative Layout Shift (CLS): 75번째 백분위수 CLS가 0.1을 초과하는 엔티티를 표시합니다.
(L3) Service Level Attainment: 95%의 기본 임계값을 사용하여 정의된 각 SLI에 대한 규정 준수 점수를 평가합니다.
목적: APM 서비스 및 인프라 전반의 취약점 위험을 평가합니다.
중요도: 심각 및 높은 심각도의 취약점, 활성 랜섬웨어 CVE, 익스플로잇 가능성을 표면화하면 문제 해결의 우선순위를 정하는 데 도움이 됩니다.
필수 조건:
주요 규칙:
APM: Under 3 Critical Severity: APM 서비스에 심각한 취약점이 3개 미만인지 확인합니다.
APM: Under 5 High Severity: APM 서비스에 심각도가 높은 취약점이 5개 미만인지 확인합니다.
APM: Active Ransomware: 활성 랜섬웨어 캠페인이 있는 보고된 CVE를 표시합니다.
APM: Exploit Probability: 악용될 가능성이 있는 심각하거나 심각도가 높은 취약점을 표시합니다(95번째 백분위수 이상 EPSS).
INFRA: Under 3 Critical Severity: 호스트 또는 컨테이너에 심각한 수준의 취약점이 3개 미만인지 확인합니다.
INFRA: Under 5 High Severity: 호스트 또는 컨테이너에 심각도가 높은 취약점이 5개 미만인지 확인합니다.
INFRA: Active Ransomware: 활성 랜섬웨어 캠페인이 있는 보고된 CVE를 표시합니다.
INFRA: Exploit Probability: 악용될 가능성이 있는 심각하거나 심각도가 높은 취약점을 표시합니다(95번째 백분위수 이상 EPSS).
목적: 안전, 비용 효율성 및 모델 규정 준수 전반에 걸쳐 AI 응답의 운영 품질 및 거버넌스를 측정합니다.
중요성: AI 품질 및 거버넌스 표준을 준수하면 AI 사용을 책임감 있고 비용 효율적으로 유지하는 데 도움이 됩니다.
전제 조건: AI 모니터링
주요 규칙:
- LLM Runtime Error Rate: LLM 지원 애플리케이션이 낮은 운영 오류율을 유지하는지 확인합니다.
- Cost Efficiency - Average tokens per assistant response: 어시스턴트 응답당 평균 토큰 수가 예산 내에 유지되는지 확인합니다.
- Model Governance - Approved model usage for assistant responses: 프로덕션 환경에서 어시스턴트 응답에 승인된 모델만 사용되는지 확인합니다.