CRDC | Central de Registros
Gerente de Operações, Tecnologia e Infraestrutura (SRE)
Respondo pela disponibilidade e pela continuidade dos sistemas críticos de uma central de registros, com equipe de 23 pessoas em quatro empresas. Estruturei o N2 de sustentação dentro da TI, cobrindo a etapa Observe do SDLC, com handoff ao N3 da squad quando a causa está no produto ou no código, e escrevi as normas de incidentes, problemas e mudanças sob as quais a operação passou a rodar.
- 9 SLOs com error budget e burn rate onde havia só monitoramento de infraestrutura, com centenas de falsos positivos por mês
- norma de incidentes com severidade P1 a P4 por matriz, Major Incident Management, RTO de 2 horas em P1, CMDB de 21 itens e 16 indicadores
- incidente recorrente, 9 ocorrências em 34 dias, com causa raiz confirmada por AIOps com RAG e análise forense read-only
- varredura de qualidade de 358 projetos em 30 segundos, contra 30 minutos por repositório em 6 licenças fragmentadas
- duas expirações de certificado em 12 meses, e nenhuma depois de três camadas de vigilância
- desperdício de cloud identificado com recurso nomeado em 29 contas AWS, por um custo de medição abaixo de 0,5% do valor endereçado
Stack: AWS multi-conta, IAM, EKS, Lambda, Terraform, GitOps, Datadog, Elastic, APM, AWS Bedrock, RAG, n8n, Python, ITIL 4, ITSM, Major Incident Management, GMUD, FinOps, DR com RTO e RPO, ISO 20000, PFMI, BCB 4.893
























