AWS Observability Architect (Senior Specialist - Architecture)
NewyorkOn-siteFull-timeSoftware Development
Description
Title: AWS Observability Architect Role Overview We are seeking an experienced Modernization Senior Consultant with strong expertise in Site Reliability Engineering SRE Cloud Observability Monitoring and Application Performance Management APM The ideal candidate will lead observability modernization initiatives drive migration from legacy monitoring platforms and implement scalable monitoring solutions across cloudnative environments Key Responsibilities · Design and implement enterprisescale observability solutions using AWS CloudWatch Metrics V2 CloudWatch Dashboards CloudWatch Alarms and Application Signals App Signals · Lead migration and modernization initiatives from Datadog Splunk and other monitoring platforms to AWSnative observability services · Develop and maintain end-to-end monitoring strategies leveraging ·� Amazon CloudWatch
·� AWS XRay
·� ADOT AWS Distro for Open Telemetry
· App Signals · Custom Metrics and Distributed Tracing · Build operational dashboards and SRE scorecards using Zeus Horizon metrics and CloudWatch observability frameworks · Configure proactive ing incident detection and automated remediation workflows · Integrate observability solutions with Cloud Formation Templates CFT and Infrastructure as Code IaC practices · Define and implement SLIs SLOs and error budgets to improve application reliability
·� Collaborate with application platform DevOps and cloud engineering teams to establish observability standards and best practices
·� Conduct root cause analysis RCA and performance troubleshooting across distributed systems
· Drive monitoring governance operational excellence and continuous improvement initiatives · Required Skills · Core Observability SRE · Strong experience in Site Reliability Engineering SRE principles · Deep expertise in · AWS CloudWatch Metrics V2 · CloudWatch Dashboards · CloudWatch Alarms · Application Signals App Signals ·� AWS XRay
·� ADOT AWS Distro for Open Telemetry
·� Experience with Zeus Horizon metrics and observability frameworks
· Knowledge of distributed tracing telemetry collection and log analytics · Monitoring Migration · Hands-on experience migrating workloads from · Datadog CloudWatch · Splunk CloudWatch Open Telemetry · Expertise in observability modernization and monitoring transformation programs · Cloud Automation · AWS Cloud architecture and services · Infrastructure as Code Cloud Formation Terraform preferred ·� CICD integration for monitoring deployments
·� Automation and scripting using Python Shell or similar technologies
·� Reliability Engineering
· SLASLISLO management · Incident management and problem management · Performance tuning and capacity planning · Production support and operational excellence Preferred Qualifications · AWS Certified Solutions Architect DevOps Engineer certification · Experience with Kubernetes EKS ECS and container observability ·� Exposure to enterprise modernization and cloud transformation programs
·� Knowledge of FinOps and Cloud Operations practices
·� Strong stakeholder management and consulting skills Key Competencies · SRE Reliability Engineering · AWS Observability Stack · CloudWatch Metrics V2 · App Signals · ADOT Open Telemetry · AWS XRay · Datadog Splunk Migration · Dashboarding ing · Cloud Formation CFT ·� Incident Response RCA
·� Cloud Modernization Consulting
·� Designation Senior Consultant Modernization Consultant SRE Observability Workstream
Requirements
Mandatory Skills : DATA Dog, Splunk