Role: Site Reliability Engineer
Experience: Min 10 Years
Locations: Jersey City, NJ & Dallas, TX
Work mode: Hybrid
Employment: W2
The Application Support Engineering roleadvancesSite Reliability Engineering (SRE) practicesforapplications running inproduction. Therole scope includesApplication Support Engineers, SDETs, Software Engineers, and SREsfocused on improving reliability, observability, recovery, automation, and operational readiness.
This role brings production supportexpertiseand engineering discipline earlier in the lifecycle to influence design,validatereliability requirements, reduce production risk, and drive measurable operational improvement.
Your Primary Responsibilities
- Participate in design reviews, sprint zero, and delivery planning todefine andvalidatereliabilityrequirements,including resiliency, observability, fault tolerance,performance, scalability,holiday and special-day processing,and disaster recovery.
- Collaborate with Major Release Management to ensure each release meets SRE standards for observability, resiliency,and reliability requirements, support readiness, and knowledge base coverage.
- Define and improve monitoring,observability, dashboards, telemetry coverage, and alertstrategyto strengthen outage detection, reduce noise, improve signal quality, andaccelerateincident response.
- Assistin major incident response and root cause analysis byidentifyingobservability gaps, improvingtelemetryandknowledge articles, and drivingactions that reduce repeat incidents.
- Drive automation, intelligent tooling, and AI-assisted remediationto reduce manual toil, improve consistency, accelerate recovery, andscaleoperationalsupport.
- Serve as theoperational readinessauthority before production releases byvalidatingreliability requirements,assessing support readiness, surfacingproductionrisks, andconfirming releasesupportability.
- Lead capacity, performance, workload trend, and resiliencyanalysisto ensure applications scale reliably under normal, peak, and stress conditions.
- Establishand track reliabilitymetrics such as availability, incident volume,MTTx, alert quality, automation coverage,reliability requirementcompliance, change failure rate, and repeat incident reduction.
- Participate in application reliability governance and service reviews by presenting incident trends,compliance metrics, operational risks, improvement actions, and readiness gaps.
- Prepare executive reporting on reliability posture, release readiness, observability maturity, alert quality, incident trends, automation progress,risks, andimprovement outcomes.
- PromoteSREpracticesthrough mentoring,standardsadoption, best-practice sharing, andapproved AI toolsthat improveknowledge, observability, performance, security, and maintainability.
Qualifications
- Minimum of10+years of related technicalexperience acrossapplication support engineering, software engineering,sitereliability engineering,production support,or application operations.
- Bachelor’s degree preferred or equivalent practical experience.
- Experience supporting business-critical applications in production environments.
- SRE,observability,automation,or ITIL certifications are a plus.
Talents Needed for Success
- Proven experiencein one or more in-scope roles includingApplication SupportEngineer, SDET, SoftwareEngineer, or SRE, with responsibility for improvingreliabilitypractices,application validation, observability coverage, automation frameworks, and reliability standards.
- Strong understanding of monitoring and observability platforms, including dashboard design, alert tuning, telemetry coverage, log analysis, metrics, traces, and event correlation.
- Programming or scriptingproficiencyin one or more languages such as Python, Java, Go, PowerShell, orsimilar forautomation, tooling, and operational efficiency.
- Familiarity withdistributedapplications, middleware, messaging, batchprocessing,real-time processing, andproductionapplication behavior in high-availabilityenvironments.
- Experience in financial services, capital markets, regulated environments, or other high-availability operational settings.
- Demonstrated participation in disaster recovery, performance testing, resiliency testing, release readiness, incident response, and root cause analysis.
- Knowledge of AI concepts, data platforms, anomaly detection, incident correlation, and intelligent automation use cases.
- Strong collaboration skills across applicationsupport, applicationdevelopment,release management, risk, security, business,and vendor stakeholders.
- Ability to translate production support insights into actionable engineering improvements that reduce risk, improve stability, and enhance customer experience.
Site Reliability Engineer -Jersey City, NJ & Dallas, TX in northern at Unknown Company
This position is listed as full time and hybrid.