OpenAI is seeking a Training Performance Engineer in San Francisco, CA, to push throughput and uptime across our distributed training stack. You will analyze large-scale runs, pinpoint bottlenecks, and design practical optimizations that scale with growing model size while maintaining compute efficiency.
You will work closely with runtime and systems engineers, researchers, and product teams to implement kernel optimizations, scheduling improvements, and data movement strategies.
#J-18808-LjbffrDistributed ML Training Performance Engineer in california at Unknown Company
This position is listed as full time and onsite.