Ir para o conteúdo
ESEnoque Sousa
Sistema em produção · Uso internoEndpoints Windows · Remediação assistida por IA

Gestão e remediação de endpoints

Detalhes do projeto

Por que nasceu

Ferramentas de diretório, monitoramento e acesso remoto resolviam camadas isoladas, mas não fechavam o ciclo completo de resolução. Cada incidente ainda exigia coletar artefatos, localizar um par saudável e testar correções manualmente. Casos recorrentes consumiam de 20 a 40 minutos por endpoint; incidentes complexos podiam levar horas enquanto as lojas precisavam continuar vendendo.

O que eu criei

Projetei e desenvolvi a plataforma de ponta a ponta: agente Windows, coletores nativos, serviço central de gestão, console operacional, orquestração da frota e o fluxo supervisionado de IA para diagnóstico, remediação e documentação operacional.

Como foi estruturado

  1. 01Coletar

    O agente em C#/.NET coleta inventário, eventos e postura de segurança local, reporta por check-in ativo e executa tarefas autorizadas; a coleta remota via CIM/SMB cobre unidades sem rota de saída.

  2. 02Correlacionar

    O serviço central reconcilia identidades e persiste snapshots, estado das tarefas, credenciais protegidas, aprovações e registros de auditoria; o console operacional exige a seleção explícita do alvo.

  3. 03Agir

    Após a autorização do operador, Codex ou Claude CLI compara o endpoint com pares saudáveis, triangula a falha, captura o dump, preserva arquivos alterados ou corrompidos, aplica a correção aprovada, valida a recuperação e documenta o procedimento.

Restrições e trade-offs

+

Restrições que moldaram o sistema

  • 01As lojas permaneciam abertas; uma ação mal-sucedida poderia interromper vendas, não apenas um ambiente de teste.
  • 02A frota combinava versões diferentes de Windows, políticas de rede e conectividade intermitente.
  • 03O acesso administrativo precisava ficar restrito ao endpoint designado, enquanto credenciais, evidências e toda ação privilegiada permaneciam protegidas e auditáveis.

Trade-offs

  • 01A coleta local pelo agente, com fallback remoto via CIM/SMB, priorizou cobertura em conectividade imperfeita sem depender de um único transporte.
  • 02Fastify e SQLite mantiveram o serviço central de gestão simples de operar e recuperar, sem introduzir uma camada distribuída de dados mais pesada.
  • 03Aprovação humana, captura de evidências e armazenamento cifrado de credenciais adicionam etapas antes da execução, trocando autonomia irrestrita por um raio de impacto menor.

Outras decisões de arquitetura

  • C#/.NET foi escolhido em vez de Rust pela integração nativa com WMI, COM, Serviços do Windows, Event Log e implantação via GPO.
  • Fastify e SQLite mantiveram o serviço central recuperável sem introduzir uma camada distribuída de dados que a operação não exigia.

Valor para a operação

Nos casos recorrentes observados, a resolução caiu de 20–40 minutos para 5–7. O Service Desk deixou de reproduzir correções manualmente e passou a coordenar resolução imediata baseada em evidências, reutilizando cada procedimento documentado.

Princípio de engenharia

A IA é mais rápida quando não opera sem limites: contexto verificado, alvo designado, pares saudáveis, autoridade explícita, evidências preservadas e caminho de recuperação transformam capacidade técnica em velocidade operacional segura.