Job Description
Key Responsibilities:
• Own and improve the reliability, availability, observability, and operational supportability of Maximus UK's Azure Databricks platform, Azure data services, and associated data pipelines and data products.
• Design and implement monitoring, alerting, health checks, and diagnostics across Azure Databricks, Azure data services, orchestration layers, storage, and downstream consumption, extending these patterns into AWS as the estate grows.
• Define and maintain reliability standards, controls, operational runbooks, and support models that improve the resilience, predictability, and supportability of data services.
• Work closely with data engineering teams to identify, prioritise, and remediate reliability, performance, and data quality issues across Databricks notebooks, jobs, workflows, and other Azure data workloads.
• Establish proactive incident detection, triage, and root cause analysis practices, reducing mea...
Ready to Apply?
Take the next step in your AI career. Submit your application to Maximus today.
Submit Application