Skip To Main ContentBack to SearchRemote in United States of America: New YorkSite Reliability Engineering& 4 othersLooking for something else?Find a vacancy that works for you. Send us your CV to receive a personalized offer.Find me a jobWe are seeking a specialized Observability & Infrastructure Engineer to lead the monitoring, telemetry, and platform-as-code initiatives critical to our multi-region disaster recovery roadmap. You will architect and implement robust observability pipelines, ensure deep visibility across our distributed AWS footprint, and codify our monitoring infrastructure using modern tools like Terraform, AWS CDK, and TypeScript.Req.# Disaster Recovery Observability: Design, deploy, and validate monitoring and telemetry strategies supporting our transition from single-region (us-east-1) to multi-region (us-east-2 pilot-light and future Active-Active) architecturesPlatform-as-Code (PaC): Manage and automate Datadog configurations (Monitors, Dashboards, Synthetics, SLOs, and composite alerts) and AWS infrastructure using Terraform, AWS CDK, and TypeScriptTelemetry & Ingestion Pipelines: Architect and scale high-throughput telemetry ingest pipelines utilizing AWS Lambda, Amazon S3, Amazon Kinesis, and FirehoseObservability Pipelines & Routing: Implement and maintain log routing, enrichment, and redaction workflows using OP2 / Vector (Observability Pipelines Worker) alongside Splunk, GCP Pub/Sub sinks, and OpenTelemetry (OTel)AWS-Native Monitoring & Incident Response: Configure comprehensive CloudWatch metrics and alarms for edge, ALB, CloudFront, Route 53, and VPC Lattice, alongside Lambda runtime monitoring and Datadog-to-PagerDuty alert routingAWS CDK & TypeScript for infrastructure provisioning and automationAgent & Cluster Agent deployment/managementMonitors, Dashboards, Synthetics, and SLOs managed via TerraformAdvanced constructs: Composite monitors, cardinality management, and retention controlsOP2 / Vector (Observability Pipelines Worker)Log routing, enrichment, and redactionSplunk & GCP Pub/Sub sinks; OpenTelemetry standardsCloudWatch metrics and alarms (Edge, ALB, CloudFront, Route 53, VPC Lattice)AWS Lambda runtime monitoring & performance tuningPagerDuty integration and alert-to-page wiring from Datadog
Lead Site Reliability Engineer in new york at Unknown Company
This position is listed as full time and able to be worked remotely.