← Voltar aos projetos
ConfiabilidadeRunbooksResposta Assíncrona a Incidentes

Automação de recuperação de desastre orientada por runbooks

Empresa
Arista Networks
Função
Senior DevOps & Site Reliability Engineer
Tempo na empresa
ago. de 2023 — ago. de 2025

Problema

A recuperação do site corporativo principal era um processo manual que levava horas e ainda dependia do conhecimento tácito de quem estivesse em on-call. Isso era especialmente arriscado para um time que transferia incidentes entre fusos horários.

Abordagem

Construí uma ferramenta de recuperação em Python e a disponibilizei por meio de um workflow do GitHub Actions com controle de acesso. Ela reconstruía o site em outra região, restaurava o último snapshot íntegro e substituía uma dezena de passos sujeitos a erro por uma única operação sob demanda. Também escrevi os runbooks técnicos necessários para handoffs assíncronos na rotação global de on-call.

Impacto

  • O tempo de recuperação caiu de horas para menos de 10 minutos.
  • Engenheiros de on-call podem executar e compreender a recuperação a partir de procedimentos escritos e compartilhados, sem depender de conhecimento tácito.
  • Permissões no workflow tornaram a execução auditável e limitaram a operação a pessoas autorizadas.

Stack técnica

PythonGitHub ActionsTerraformKubernetes