Gestão e remediação de endpoints
Detalhes do projeto
Por que nasceu
Ferramentas de diretório, monitoramento e acesso remoto resolviam camadas isoladas, mas não fechavam o ciclo completo de resolução. Cada incidente ainda exigia coletar artefatos, localizar um par saudável e testar correções manualmente. Casos recorrentes consumiam de 20 a 40 minutos por endpoint; incidentes complexos podiam levar horas enquanto as lojas precisavam continuar vendendo.
O que eu criei
Projetei e desenvolvi a plataforma de ponta a ponta: agente Windows, coletores nativos, serviço central de gestão, console operacional, orquestração da frota e o fluxo supervisionado de IA para diagnóstico, remediação e documentação operacional.
Como foi estruturado
- 01Coletar
O agente em C#/.NET coleta inventário, eventos e postura de segurança local, reporta por check-in ativo e executa tarefas autorizadas; a coleta remota via CIM/SMB cobre unidades sem rota de saída.
- 02Correlacionar
O serviço central reconcilia identidades e persiste snapshots, estado das tarefas, credenciais protegidas, aprovações e registros de auditoria; o console operacional exige a seleção explícita do alvo.
- 03Agir
Após a autorização do operador, Codex ou Claude CLI compara o endpoint com pares saudáveis, triangula a falha, captura o dump, preserva arquivos alterados ou corrompidos, aplica a correção aprovada, valida a recuperação e documenta o procedimento.
Restrições e trade-offs
+
Restrições que moldaram o sistema
- 01As lojas permaneciam abertas; uma ação mal-sucedida poderia interromper vendas, não apenas um ambiente de teste.
- 02A frota combinava versões diferentes de Windows, políticas de rede e conectividade intermitente.
- 03O acesso administrativo precisava ficar restrito ao endpoint designado, enquanto credenciais, evidências e toda ação privilegiada permaneciam protegidas e auditáveis.
Trade-offs
- 01A coleta local pelo agente, com fallback remoto via CIM/SMB, priorizou cobertura em conectividade imperfeita sem depender de um único transporte.
- 02Fastify e SQLite mantiveram o serviço central de gestão simples de operar e recuperar, sem introduzir uma camada distribuída de dados mais pesada.
- 03Aprovação humana, captura de evidências e armazenamento cifrado de credenciais adicionam etapas antes da execução, trocando autonomia irrestrita por um raio de impacto menor.
Outras decisões de arquitetura
- C#/.NET foi escolhido em vez de Rust pela integração nativa com WMI, COM, Serviços do Windows, Event Log e implantação via GPO.
- Fastify e SQLite mantiveram o serviço central recuperável sem introduzir uma camada distribuída de dados que a operação não exigia.
Valor para a operação
Nos casos recorrentes observados, a resolução caiu de 20–40 minutos para 5–7. O Service Desk deixou de reproduzir correções manualmente e passou a coordenar resolução imediata baseada em evidências, reutilizando cada procedimento documentado.
Princípio de engenharia
“A IA é mais rápida quando não opera sem limites: contexto verificado, alvo designado, pares saudáveis, autoridade explícita, evidências preservadas e caminho de recuperação transformam capacidade técnica em velocidade operacional segura.”