Prática de Entrevista: Sênior
Perguntas de entrevista DevOps avançadas sobre design de sistemas, gestão de incidentes e liderança para profissionais com mais de 5 anos de experiência.
32 perguntas
Padrão App-of-Apps vs ApplicationSets
Explique o padrão app-of-apps no Argo CD. Quando você o escolheria em vez de ApplicationSets?
avançadoGitOpsPromovendo mudanças de dev para staging e para prod com Argo CD
Descreva como uma mudança vai de dev para staging e depois para prod em uma configuração de Argo CD. Como você impede que algo indevido escorregue para o prod?
avançadoGitOpsEscalando um repositório de manifests para muitos serviços, ambientes e clusters
Você tem 15 microsserviços, 4 ambientes (dev, staging, preprod, prod) e o prod roda em 3 clusters regionais. Isso dá potencialmente 90 Application CRs. Como estruturar o repositório de manifests para que ele não desabe?
avançadoGitOpsPlanejamento de capacidade e escalabilidade
Como você aborda o planejamento de capacidade para um sistema de produção em crescimento? Quais métricas e estratégias você usa?
avançadoSREPráticas de chaos engineering
O que é chaos engineering e como você a implementaria com segurança em um ambiente de produção?
avançadoSREDesign de chargeback para custos compartilhados e não etiquetáveis
Você está projetando um sistema de chargeback para 200 times rodando em AWS, GCP e Azure. Como você lida com os 15 a 25 por cento da fatura que não podem ser atribuídos a um único time, como transferência de dados entre AZs, planos de suporte, NAT gateways e clusters Kubernetes compartilhados?
avançadoFinOpsOtimização de custos na nuvem
Como você aborda a otimização de custos na nuvem? Quais estratégias e ferramentas você usaria?
avançadoCloudCompliance e governança na nuvem
Como você implementa controles de compliance e governança em um ambiente cloud-native?
avançadoSecurityPlanejamento de Disaster Recovery
Como você projeta uma estratégia de disaster recovery? Explique RPO, RTO e as diferentes abordagens de DR.
avançadoArchitectureFinOps e Gerenciamento de Custos em Nuvem
Como você implementa práticas de FinOps para otimizar e gerenciar custos de nuvem em escala?
avançadoCloudMedindo o Sucesso e a Adoção do IDP
Você passou seis meses construindo uma plataforma interna para desenvolvedores. Sua VP de Engenharia pergunta: 'Isso realmente está funcionando? Como sabemos se valeu o investimento?' O que você mostra a ela?
avançadoPlatform EngineeringAPI de Plataforma e Camada de Orquestração
Você está projetando a camada de orquestração da sua IDP. Um desenvolvedor clica em 'Criar Novo Serviço' e, por trás dos panos, isso precisa criar um repositório no GitHub, provisionar um banco de dados, configurar um pipeline de CI/CD, configurar monitoramento e registrar o serviço no catálogo. Como você arquitetaria isso?
avançadoPlatform EngineeringPostmortems de Incidentes
Descreva um incidente de produção que você tratou e como você estruturou o postmortem. O que torna um bom postmortem sem culpados (blameless)?
avançadoSRECircuit Breakers e Outlier Detection no Istio
Como você implementa um circuit breaker no Istio? Explique a diferença entre os limites de connection pool e o outlier detection.
avançadoService MeshDepurando uma Política de Tráfego do Istio que Não Funciona
Você aplicou um VirtualService que divide o tráfego 80/20 entre v1 e v2 de um serviço, mas em produção todo o tráfego ainda vai para v1. Explique como você depuraria isso.
avançadoService MeshDepuração de Processos no Linux
Um processo está consumindo 100% de CPU em um servidor Linux. Descreva como você identificaria e investigaria esse problema.
avançadoLinuxDe um Experimento Único a Chaos Contínuo em Escala
Você já provou que um pod-delete isolado funciona. A liderança agora quer chaos como prática contínua em dezenas de serviços e vários clusters, não como uma demo pontual. O que muda, e o que você faria diferente em escala?
avançadoChaos EngineeringDelimitando o Litmus com Segurança: RBAC e Raio de Impacto
Seu time de segurança percebe que o Litmus consegue deletar pods e injetar falhas de rede em todo o cluster, e quer que ele seja removido. Como você delimita o Litmus para continuar rodando chaos em produção sem entregar as chaves do cluster?
avançadoChaos EngineeringArquitetura Multi-Cloud
Quando você recomendaria uma estratégia multi-cloud? Quais são os desafios e como você os resolveria?
avançadoArchitecturePor Que Rodar um OpenTelemetry Collector
Por que rodar um OpenTelemetry Collector em vez de fazer cada aplicação exportar diretamente para o seu backend de tracing? E como você faria esse deploy no Kubernetes?
avançadoObservabilityEstratégias de Sampling em Escala
Sua plataforma processa 50.000 requisições por segundo e fazer tracing de todas elas está explodindo a conta de observabilidade. Como você aborda o sampling, e qual é o trade-off entre head sampling e tail sampling?
avançadoObservabilityEscalando o Time de Plataforma e Processos
Como você escala um time de plataforma/DevOps para dar suporte a uma organização de engenharia em crescimento?
avançadoDevOpsArquitetura de Feature Flags em Escala
Sua equipe tem mais de 200 microsserviços e quer adotar feature flags em todos eles. Como você projetaria a infraestrutura de feature flags?
avançadoCI/CDEstratégia de Rollback em Progressive Delivery
Sua equipe acabou de habilitar uma nova funcionalidade para 20% dos usuários via feature flags, e o monitoramento mostra um aumento de 3x na latência p99 para esses usuários. Me explique exatamente o que você faria nos próximos 10 minutos.
avançadoCI/CDReduzindo a Fadiga de Alertas no On-Call
Seus engenheiros de plantão estão esgotados. Eles recebem de 40 a 50 pages por turno e dizem que a maior parte é ruído que apenas confirmam e ignoram. Como você resolveria isso?
avançadoIncident ManagementEscalando um Programa de On-Call Entre Muitas Equipes
Você foi encarregado de projetar o programa de on-call para uma organização que cresceu de uma equipe para quinze em um ano. Atualmente é cada um por si. Como é um programa de on-call saudável nessa escala, e como você mediria se ele está funcionando?
avançadoIncident ManagementArquitetura de Segurança e DevSecOps
Como você integra segurança no pipeline de DevOps? Descreva os componentes-chave de uma arquitetura segura.
avançadoSecurityInvestigação de Consumo de Orçamento de Erro
É segunda-feira de manhã. Você olha o dashboard e vê que seu serviço consumiu 80% do orçamento de erro mensal durante o fim de semana. Descreva como você investigaria isso e o que faria a seguir.
avançadoSREAlertas Baseados em SLO e Taxas de Consumo
O alerta tradicional dispara quando a taxa de erro cruza um limiar estático, tipo 'alerta se erros > 1%'. O que há de errado com essa abordagem, e como você configuraria alertas baseados em SLO no lugar?
avançadoSREDesign de Sistema de Autocomplete de Busca
Projete o backend de um sistema de autocomplete de busca que retorna sugestões em até 100ms enquanto o usuário digita.
avançadoSystem DesignDesign de Sistemas para Confiabilidade
Como você projetaria uma aplicação web de alta disponibilidade? Quais componentes e padrões você usaria?
avançadoArchitectureArquitetura Zero Trust
O que é Zero Trust Architecture e como você a implementa em uma infraestrutura moderna?
avançadoSecurity