ConfiabilidadeRunbooksResposta Assíncrona a Incidentes
Automação de recuperação de desastre orientada por runbooks
- Empresa
- Arista Networks
- Função
- Senior DevOps & Site Reliability Engineer
- Tempo na empresa
- ago. de 2023 — ago. de 2025
Problema
A recuperação do site corporativo principal era um processo manual que levava horas e ainda dependia do conhecimento tácito de quem estivesse em on-call. Isso era especialmente arriscado para um time que transferia incidentes entre fusos horários.
Abordagem
Construí uma ferramenta de recuperação em Python e a disponibilizei por meio de um workflow do GitHub Actions com controle de acesso. Ela reconstruía o site em outra região, restaurava o último snapshot íntegro e substituía uma dezena de passos sujeitos a erro por uma única operação sob demanda. Também escrevi os runbooks técnicos necessários para handoffs assíncronos na rotação global de on-call.
Impacto
- O tempo de recuperação caiu de horas para menos de 10 minutos.
- Engenheiros de on-call podem executar e compreender a recuperação a partir de procedimentos escritos e compartilhados, sem depender de conhecimento tácito.
- Permissões no workflow tornaram a execução auditável e limitaram a operação a pessoas autorizadas.
Stack técnica
PythonGitHub ActionsTerraformKubernetes