5 дней назад
Director, Site Reliability Engineering
Мэтч & Сопровод
Для мэтча с этой вакансией нужен Plus
Описание вакансии
Текст:
TL;DR
Director, Site Reliability Engineering (Cloud Reliability): Building and leading a global SRE organization responsible for reliability engineering across Omnicell’s cloud platforms with an accent on automation, observability, resilience, and production engineering. Focus on establishing enterprise SLO, SLI, and error-budget practices, developing self-healing capabilities, and improving platform availability, scalability, and operational readiness.
Location: United Kingdom
Company
develops intelligent medication management, cloud-native platforms, and healthcare technology focused on improving patient safety and healthcare outcomes.
What you will do
- Build and lead a global Site Reliability Engineering organization, including recruiting, mentoring, and developing SRE managers, principal engineers, and senior technical talent.
- Define enterprise reliability engineering strategy, governance, standards, roadmaps, and operating models.
- Establish production engineering practices covering performance, scalability, availability, capacity planning, service hardening, resilience testing, and failure analysis.
- Develop observability standards for OpenTelemetry, metrics, distributed tracing, centralized logging, monitoring, alerting, dashboards, and service health models.
- Lead automation initiatives that reduce operational toil, enable self-healing capabilities, automate remediation, improve deployment safety, and support AI-assisted engineering workflows.
- Partner with Product Engineering, Cloud Platform Engineering, Site Reliability Operations, Cloud Security, Enterprise Architecture, Quality Engineering, and Technical Support.
Requirements
- Experience leading and scaling a Site Reliability Engineering or comparable cloud reliability organization.
- Strong background in enterprise reliability strategy, production engineering, resilience engineering, observability, automation, and operational readiness.
- Ability to review cloud and Kubernetes architectures and influence engineering strategy at enterprise level.
- Experience establishing SLI, SLO, error-budget, reliability scorecard, production readiness, and capacity planning frameworks.
- Executive-level communication skills and experience presenting reliability metrics, technical risks, and investment recommendations.
- Role location: United Kingdom.
Culture & Benefits
- Engineering culture centered on ownership, accountability, continuous improvement, and technical excellence.
- Opportunity to shape a global SRE organization and establish reliability engineering as a core discipline.
- Close collaboration across Product, Platform, Security, Operations, and Enterprise Architecture.
- Focus on continuous learning, innovation, career development, and measurable operational outcomes.
Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →