Principal Compute, Kubernetes Orchestration & BCDR Engineer
Location: Puerto Rico, USA
Business Unit: Cencora Puerto Rico – Data Services & Solutions
Reports To: Director, Site Reliability Engineering
Role Type: Individual Contributor – Principal Technical Leader / Architect
Job Type: Full-Time, Exempt
About Cencora Cencora is a global healthcare company delivering secure, scalable, and compliant data
platforms supporting global pharmaceutical supply chains and analytics services.
Position Summary The Principal Compute, Kubernetes Orchestration & BCDR Engineer is the senior-most
technical authority responsible for defining enterprise-wide strategy, governance, and
architecture across hybrid compute, Kubernetes platforms, and business
continuity/disaster recovery (BCDR). This role drives global platform engineering
standards, resiliency programs, and long-term infrastructure strategy across multi-cloud
and on-prem ecosystems.
Primary Responsibilities
Compute Orchestration Strategy & Platform Leadership
- Define enterprise Kubernetes and container platform strategy across hybrid and multi-cloud environments.
- Develop reference architectures and standard patterns for microservices and analytics workloads.
- Establish platform engineering self-service capabilities and standardized environments.
- Serve as escalation authority for critical platform and orchestration issues.
Infrastructure-as-Code & Automation Strategy
- Define enterprise IaC governance using Terraform, ArgoCD, and Helm.
- Implement GitOps-based deployment and compliance models.
- Drive reusable automation modules and policy enforcement frameworks.
Hybrid Compute & Capacity Engineering
- Architect hybrid infrastructure strategies across cloud and on-prem platforms.
- Lead enterprise capacity planning for scalability and performance.
- Drive cost optimization and workload efficiency initiatives.
Business Continuity & Disaster Recovery (BCDR) – Enterprise Ownership
- Define and own enterprise-wide BCDR strategy across hybrid cloud (Azure, AWS, GCP) and on-prem infrastructure.
- Establish BCDR governance, policies, and control frameworks aligned to NIST, ISO 27001, HIPAA, SOC2, and FDA regulations.
- Architect multi-region and multi-cloud failover strategies ensuring RTO ≤ 15 minutes and RPO ≤ 5 minutes.
- Define standardized DR patterns for compute, Kubernetes clusters, and data platforms.
- Design hybrid DR strategies including active-active, active-passive, pilot-light, and warm standby architectures.
- Lead full lifecycle BCDR program including planning, execution, validation, and continuous improvement.
- Define RACI ownership models across Infrastructure, Platform, Data, and Security teams for DR operations.
- Ensure Kubernetes resilience including cluster failover, replication, and workload recovery orchestration.
- Define enterprise backup and data protection strategies across structured and unstructured data workloads.
- Lead DR testing programs (quarterly/annual) including full-scale failover simulations.
- Establish BCDR reporting dashboards covering readiness, compliance, RTO/RPO adherence, and risk posture.
- Provide executive reporting and KPI tracking for disaster readiness and operational resilience.
- Partner with Corporate Risk, Audit, and Compliance to ensure audit readiness and traceability of all DR controls.
- Ensure complete documentation including runbooks, recovery procedures, architecture diagrams, and dependency mappings.
- Drive continuous improvement through post-incident analysis and resilience gap remediation.
- Align DR strategy with enterprise risk management frameworks and business continuity objectives.
- Ensure DR artifacts meet audit standards with full evidence collection and validation records.
- Enforce encryption, secure recovery procedures, and data protection controls across all DR workflows.
Reliability, Observability & Performance
- Define enterprise observability frameworks across metrics, logs, and tracing.
- Establish SLO/SLI/SLA governance models.
- Drive proactive reliability engineering and self-healing systems.
Security & Compliance
- Define security standards for infrastructure and container environments.
- Ensure compliance with global regulatory frameworks.
- Implement RBAC, encryption, and zero-trust architectures.
Enterprise Leadership & Collaboration
- Serve as advisor to executive leadership on infrastructure strategy and risk.
- Mentor engineering teams and promote technical excellence.
- Drive alignment across SRE, Platform, Security, and Data teams.
Key Metrics & Expected Outcomes
- Service Uptime ≥ 99.9%
- RTO ≤ 15 minutes
- RPO ≤ 5 minutes
- MTTR ≤ 2 hours
- 100% BCDR validation compliance
- 100% patch compliance within SLA
Qualifications & Experience
- Bachelor’s degree required; Master’s preferred.
- 12+ years in SRE, infrastructure, or platform engineering.
- Deep experience with hybrid cloud architectures and Kubernetes platforms.
- Proven leadership in enterprise BCDR strategy and execution.
- Hands‑on experience with cloud DR solutions (Azure Site Recovery, AWS DR, multi-cloud failover).
- Strong understanding of compliance and regulatory frameworks (NIST, ISO 27001, HIPAA, SOC2).
- Experience supporting audit processes and producing evidence-based documentation.
- Expertise in Terraform, ArgoCD, Helm, and CI/CD pipelines.
- Strong knowledge of resilience engineering and distributed systems recovery.
#J-18808-Ljbffr