postmortem-miner
publicadoTransformar histórico de incidente em decisão de triagem. O mesmo método que sustenta redução de MTTR.
8 padrões explicam 90% de 20 incidentes em 15 ms · triagem de profundidade 4 · 93 testes · cobertura 99%
Gerente de Operações, Tecnologia e Infraestrutura (SRE) · Fundador e CTO da Ohr AI · Staff/Principal Architect · Cibersegurança · AI Engineering
Currículo afirma. Código prova.
Gerente de Operações, Tecnologia e Infraestrutura (SRE) numa central de registros, respondendo pela disponibilidade e pela continuidade dos sistemas críticos, com resposta a incidente, controle de mudança em produção e o custo da infraestrutura sob o mesmo mandato. Comecei em 2009 no suporte N1 em telecom e estou em cibersegurança em tempo integral desde 2015. O eixo técnico é observabilidade com error budget e IA que passa por gate antes de chegar em produção. Fora da central, sou fundador e CTO da Ohr AI, onde escrevo o produto que prova essa mesma tese, do código que roda ao cliente que assina.
אֱמֶת · emet, verdade. O que um sistema precisa dizer quando ninguém está olhando.

Um número por empresa. Cada um está detalhado, com contexto, na página de experiência. ver o detalhe de cada um
Cada seção responde a uma pergunta diferente. Vá direto na que te trouxe aqui.
Do suporte N1 em telecom à gerência de operações e infraestrutura, passando por arquitetura Staff e Principal, backend, mobile e cibersegurança. É de onde vem a leitura de ponta a ponta.
/sobre/Dezoito posições em infraestrutura crítica, fintech, banking e varejo digital, com número medido em produção em cada frente.
/experiencia/Projetos de código aberto em SRE, IAM, AppSec e IA aplicada, cada um com número defendido por CI.
/projetos/Cibersegurança, IA aplicada, arquitetura, FinOps e gestão de times e projetos. O número ruim virando número bom, com o caminho documentado para o time seguir sozinho.
/consultoria/A plataforma de automação de serviços com IA que fundei e lidero: financeiro, RH, jurídico e mais, de ponta a ponta, hoje em mais de 20 empresas.
/ohr-ai/O blog. Artigos sobre segurança, operações, governança, engenharia de software e cloud e plataforma, cada um com diagramas e com a IA no lugar em que ela ajuda de verdade.
/blog/Engenharia, gestão, IA e governança de dados, em Cambridge, PUC Minas, PUC-RS e PUC Goiás. Cada uma puxou a seguinte.
/formacao/Vinte e oito credenciais em cibersegurança, cloud e IA, gestão e desenvolvimento, mais os frameworks sob os quais eu opero.
/certificacoes/O que eu devolvo para a comunidade: palestra técnica, liderança de user group e mentoria social.
/trabalho-social/E-mail, GitHub e LinkedIn. Respondo pessoalmente.
/contato/Cada projeto resolve um problema real das áreas em que eu trabalho: triagem de incidente, governança de acesso, plantão sob pressão, IA com guardrail. Todos rodam com um comando, em máquina limpa, sem chave de API e sem conta em nuvem. Os números abaixo saem da própria execução, verificada por CI.
Transformar histórico de incidente em decisão de triagem. O mesmo método que sustenta redução de MTTR.
8 padrões explicam 90% de 20 incidentes em 15 ms · triagem de profundidade 4 · 93 testes · cobertura 99%
IAM e IGA, o eixo de 9 anos: SoD, privilege reachability cross-account, ciclo JML e recertification, tudo read-only e com procedência.
37 violações de SoD em 4 severidades · 12 caminhos de escalonamento cross-account · 9 targets sensíveis · 64 testes em Python 3.11 a 3.13 · CI com Semgrep, CodeQL e pip-audit
Calendário hebraico aplicado a escala de plantão: fronteiras por zmanim astronômicos, não tabela chumbada, e repartição justa entre quem observa e quem não.
Jain 0.9998 · spread 1.0 · 0 violações em 92 dias · zero dependências de runtime · 77 testes · cobertura 96%
Onde a decisão técnica acontece de verdade, não no slide. Cada texto parte de um problema que eu opero, mostra a estrutura em diagrama e termina no ponto exato em que a IA entra na operação. Leitura para quem decide, não para quem só acompanha, com um conceito hebraico de conhecimento guiando cada um.
Segurançaצֹפֶה
A cadeia de detecção de ponta a ponta, onde a IA acelera a triagem, o que o atacante já faz com modelo e como medir o vigia com precisão e recall.
Operaçõesנֵר תָּמִיד
Por que AIOps sem SLO vira mais ruído, como o burn rate decide quando acordar alguém e onde o modelo entra na correlação e no diagnóstico.
Engenhariaכֵּלִים
As quatro camadas de uma ferramenta de IA séria, o MCP como contrato de acesso, RAG que cita a fonte e avaliação que reprova o pull request.
Seis coisas aparecem em tudo que eu construo, e são o que eu levo para um time.
Primeiro a solução explicável, depois a medição de quanto o modelo agrega sobre ela. Num incidente às 3h da manhã eu preciso de uma conclusão que dê para contestar linha por linha, e é justamente aí que um score sem rastro não ajuda ninguém a decidir.
Precisão e recall que não dão para calcular são opinião com aparência de número. Por isso os meus geradores de dado sintético plantam o problema de propósito: eu sei onde ele está antes de rodar a detecção, então dá para dizer o que passou e o que escapou.
Benchmark, cobertura e qualidade de saída de LLM entram como gate de regressão: se o número piora, o Pull Request reprova. Sem isso o README vira a foto de um dia bom que ninguém revalidou desde então.
Superfície de ataque se decide no desenho. Threat modeling antes da primeira linha, identidade e menor privilégio dentro do modelo de domínio, segredo fora do código, e SAST, SCA e DAST configurados para bloquear merge. Quando uma vulnerabilidade chega em produção, quase sempre a decisão que a permitiu foi tomada meses antes, num diagrama que ninguém questionou.
Em fintech e banking a operação é 24x7 e a auditoria não marca hora. ISO 27001, PCI-DSS, LGPD e BACEN entram como gate de CI, com a trilha de evidência gerada pelo próprio pipeline no momento em que a coisa acontece, e não reconstruída depois. O que sustenta plantão é SLO com erro orçado, rollback já ensaiado e postmortem que procura causa, não culpado.
OKR desdobrado até a tarefa, DORA reportado a C-Level e PDI com trilha que a pessoa consegue enxergar sem precisar me perguntar. Uso KPI de time para achar gargalo no fluxo, nunca para ranquear gente. Conduzi de 10 a 15 engenheiros entre desenvolvimento, segurança, QA e dados.
IAM e IGA (SailPoint, ciclo JML, RBAC, ABAC, SoD, PAM) · SSO com SAML, OAuth 2.0 e OIDC · AppSec e SSDLC com SAST, DAST e SCA como gate de merge · Zero Trust · threat modeling · TLS 1.3, mTLS, certificate pinning · Active Directory, Microsoft Entra ID, Azure PIM · ISO 27001, PCI-DSS, LGPD, NIST CSF, BACEN
Agentes com orquestração autônoma e auditável · RAG · MCP · LLMOps e MLOps · prompt engineering seguro e segurança de LLM · AWS Bedrock, OpenAI, Anthropic, LangChain, n8n · Python
SLI, SLO, incident response e postmortem · Datadog (APM, logs, métricas), CloudWatch, New Relic · AWS e Azure · Kubernetes, Docker · Terraform · GitHub Actions, Jenkins e SonarQube como quality gate · deploy canary e blue-green com rollback automático
Clean Architecture, Hexagonal, DDD, SOLID · microsserviços e event-driven · Java e Java EE, Kotlin, Spring, Python, C# e ASP.NET · mobile nativo Android e iOS, Jetpack Compose, SwiftUI, KMP
Times de 10 a 15 pessoas · OKR e métricas DORA reportadas a C-Level · 1:1, PDI, trilha de carreira, recrutamento, capacity planning e code review
























