Disaster Recovery
A recuperação da Serigy se apoia em três pilares: IaC reproduzível, dados em backup off-site e identidade/segredos centralizados. Este runbook resume a recuperação por nível de falha.
Cenários
Seção intitulada “Cenários”flowchart TB
F1["Falha de pod / app"] --> R1["K8s reagenda<br/>(rke-app-01/02)"]
F2["Falha do rke-db-00"] --> R2["Recriar nó + restore do R2"]
F3["Falha de cluster"] --> R3["Recriar via Terraform/RKE"]
F4["Falha de site (OVH)"] --> R4["Reprovisionar + restore do R2"]
| Falha | Recuperação | Referência |
|---|---|---|
| Pod/app stateless | Reagendamento automático em rke-app-01/02 | Scheduling |
Nó de banco (rke-db-00) | Recriar nó + restore PITR do R2 | Backup & Restore |
| Cluster inteiro | Recriar via Terraform + Ansible/RKE | Adicionar nó |
| Site OVH | Reprovisionar infra + restaurar dados do R2 | Backup & DR |
O que torna a recuperação possível
Seção intitulada “O que torna a recuperação possível”- Infra reproduzível — todo nó/cluster nasce do mesmo IaC; nada é único e irrecuperável (exceto os dados).
- Dados off-site — backups no Cloudflare R2, fora da OVH.
- Confiança recriável — LLDAP e Vault
no
rke-mngm-01; suas próprias cópias/seal-keys devem ser protegidas.
Itens a garantir
Seção intitulada “Itens a garantir”- Restauração testada periodicamente (ver Backup & Restore).
- RTO/RPO definidos e medidos.
- Procedimento de recuperação do Vault (unseal keys) documentado com segurança.
- Cópia segura das credenciais de acesso à OVH e ao R2.