NVIDIA AI in Santa Clara, CA, seeks a senior software engineer to build observability for agentic AI applications in production. You will collaborate with AI teams to define SLOs/SLIs and lead incident response and reliability improvements for BizApps AI services.
Proficiency in Python, Kubernetes, Docker, Datadog, OpenTelemetry, Grafana, Prometheus, and CI/CD is required. Experience with LangChain, LlamaIndex, Semantic Kernel, Terraform, Pulumi, and GitOps is a plus.
#J-18808-LjbffrSenior AI Observability & Reliability Engineer in santa clara at Unknown Company
This position is listed as full time and onsite.