Pular para o conteúdo

Disaster Recovery

A recuperação da Serigy se apoia em três pilares: IaC reproduzível, dados em backup off-site e identidade/segredos centralizados. Este runbook resume a recuperação por nível de falha.

flowchart TB
    F1["Falha de pod / app"] --> R1["K8s reagenda<br/>(rke-app-01/02)"]
    F2["Falha do rke-db-00"] --> R2["Recriar nó + restore do R2"]
    F3["Falha de cluster"] --> R3["Recriar via Terraform/RKE"]
    F4["Falha de site (OVH)"] --> R4["Reprovisionar + restore do R2"]
FalhaRecuperaçãoReferência
Pod/app statelessReagendamento automático em rke-app-01/02Scheduling
Nó de banco (rke-db-00)Recriar nó + restore PITR do R2Backup & Restore
Cluster inteiroRecriar via Terraform + Ansible/RKEAdicionar nó
Site OVHReprovisionar infra + restaurar dados do R2Backup & DR
  • Infra reproduzível — todo nó/cluster nasce do mesmo IaC; nada é único e irrecuperável (exceto os dados).
  • Dados off-site — backups no Cloudflare R2, fora da OVH.
  • Confiança recriávelLLDAP e Vault no rke-mngm-01; suas próprias cópias/seal-keys devem ser protegidas.
  • Restauração testada periodicamente (ver Backup & Restore).
  • RTO/RPO definidos e medidos.
  • Procedimento de recuperação do Vault (unseal keys) documentado com segurança.
  • Cópia segura das credenciais de acesso à OVH e ao R2.