Analista de Suporte de Sistemas Pleno | Digital Equities

BTG Pactual · SP

Sobre a área: Somos responsáveis por manter a estabilidade e a continuidade do serviço em produção, garantindo resposta eficiente a incidentes e evolução contínua da operação. Nessa estrutura, a IA é utilizada para aumentar produtividade e assertividade na análise e resposta, mantendo governança, rastreabilidade e revisão humana para decisões críticas. Atuamos com gestão de incidentes, observabilidade, análise de causa raiz (RCA/Problem Management), runbooks e automações, sempre transformando incidentes em aprendizado e backlog para as squads com decisões de release e mudança considerando prontidão operacional e risco. A tecnologia no BTG é um dos pilares das grandes transformações do banco. Por isso, investimos continuamente nas ferramentas e práticas mais modernas do mercado. Valorizamos a meritocracia e contamos com uma equipe versátil, colaborativa e engajada. Buscamos pessoas com mentalidade de dono, que sonham grande e são apaixonadas por aprender e compartilhar conhecimento. No seu dia a dia: Atuará na gestão de incidentes: detecção, triagem, contenção, mitigação e recuperação, coordenando war room quando necessário e comunicando-se de forma estruturada com stakeholders; Evoluirá dashboards, alertas e instrumentação, melhorando a relação sinal/ruído e dando suporte a SLO/SLI e à visão de disponibilidade das plataformas; Conduzirá análises de causa raiz, identificando causas estruturais e recorrências e definindo ações corretivas/preventivas que retroalimentam o backlog das squads; Criará e manterá runbooks/playbooks, automatizará rotinas de mitigação e preparará readiness para janelas críticas, estratégias de rollback e procedimentos de contingência; Usará IA para acelerar diagnóstico, triagem, sumarização de incidentes e documentação, com senso crítico e validação das recomendações; Manterá gestão do conhecimento e evidências (documentação viva, postmortems, lições aprendidas), garantindo rastreabilidade para auditoria; Terá relacionamento próximo com áreas de negócio, PMs, squads de tecnologia e Risco/Compliance. Esperamos de você: Formação superior completa em engenharia, ciências da computação ou áreas relacionadas; Forte capacidade de troubleshooting, conforto com ambientes produtivos e tratativa de incidentes, com experiência em logs, métricas e ferramentas de observabilidade; Tecnologias obrigatórias: Datadog (ou ferramenta equivalente de observabilidade), Azure, GitHub (issues, PRs, evidências técnicas), Confluence (runbooks, postmortems) e ferramentas de IA para operação (análise de logs, sumarização de incidentes, busca em conhecimento, recomendação de runbooks/ações); Tecnologias desejáveis: Kibana/Elastic, ServiceNow / Jira Service Management, Power BI, scripting/automação (Python, Shell) e ferramentas de AIOps (correlação de eventos, detecção de anomalia, redução de ruído); Disponibilidade para trabalhar no modelo híbrido no escritório de São Paulo. Diferenciais: ITIL (Incident/Problem/Change Management), COBIT, fundamentos de SRE (SLO/SLI, error budget, incident command) Conhecimentos de IA aplicada (uso seguro, validação de resultados, privacidade/compliance, governança de prompts e rastreabilidade); Benefícios: Participação nos Lucros e Resultados (PLR); Auxílio Alimentação e Refeição; Plano Médico; Plano Odontológico; Auxílio Creche/Babá; Vale Transporte; WellHub; TotalPass; Programa de Apoio Pessoal (EAP); Planos por adesão como Previdência Privada e Seguro de Vida; Desconto em Farmácia; Programa de Gestantes; Licença Maternidade e Paternidade Estendida – empresa Cidadã.