Ir para o conteúdo
ESEnoque Sousa
Sistema em produção · Uso internoInfraestrutura distribuída · Resposta a incidentes

Observabilidade e resposta a incidentes

Detalhes do projeto

Por que nasceu

Uma suspeita de comprometimento atravessava muitas lojas e terminais heterogêneos. Era preciso separar infecção, desvio operacional legítimo e coleta incompleta em bilhões de registros, sem interromper vendas nem destruir evidências.

O que eu criei

Criei a plataforma de monitoramento e o conjunto de ferramentas forenses, conectei rotas autorizadas de aquisição ao Codex e ao Claude CLI sob supervisão humana e transformei a resposta em um fluxo repetível de adquirir, triar, conter, erradicar e recuperar.

Como foi estruturado

  1. 01Coletar

    Verificações TCP ativas medem disponibilidade, latência e perda de pacotes; coletores remotos via WMI/DCOM obtêm inventário Windows, serviços e eventos de sistema.

  2. 02Correlacionar

    Fastify e SQLite deduplicam mudanças de estado; tarefas de aquisição forense registram completude, manifestos, hashes SHA-256 e cadeia de custódia.

  3. 03Agir

    A análise assistida por IA, sob supervisão humana, compara dispositivos equivalentes e reduz hipóteses; somente um fluxo revisado pode simular, aprovar, colocar em quarentena e restaurar.

Restrições e trade-offs

+

Restrições que moldaram o sistema

  • 01As lojas continuavam atendendo durante a investigação; coleta e contenção precisavam ter raio de impacto restrito.
  • 02Acesso de rede e cobertura dos artefatos variavam; evidência incompleta nunca poderia receber o rótulo de limpa.
  • 03Topologia, credenciais e evidências brutas precisavam permanecer privadas, enquanto as ações do operador continuavam auditáveis.

Trade-offs

  • 01A aquisição forense direcionada foi escolhida em vez da imagem integral de disco para alcançar a frota rapidamente e preservar os artefatos necessários à investigação.
  • 02Travas humanas tornaram a resposta mais lenta que uma remediação autônoma, mas impediram que uma IA ou script ampliasse o incidente por engano.
  • 03Somente indicadores verificados habilitavam remoção; casos incertos permaneciam visíveis para revisão manual, sem classificação forçada.

Outras decisões de arquitetura

  • A aquisição forense direcionada foi escolhida em vez da imagem integral de disco para alcançar o ambiente distribuído com rapidez e preservar os artefatos necessários.
  • Uma aquisição incompleta nunca gera classificação de ambiente limpo; somente indicadores de comprometimento validados podem autorizar a erradicação.

Valor para a operação

Bilhões de registros passaram por triagem até se tornarem evidências comparáveis, sustentando contenção, erradicação e recuperação por etapas no ambiente afetado.

Princípio de engenharia

A IA acelera a investigação quando evidência, autoridade e rollback permanecem explícitos; ela não substitui o julgamento de quem comanda o incidente.