Infraestrutura de alta disponibilidade, para uma falha não tirar você do ar.
Projetamos sistemas sem ponto único de falha: balanceamento de carga, bancos de dados replicados, failover automático, releases graduais, backups que você já restaurou e alertas que chegam a você primeiro.
O que "alta disponibilidade" significa na prática
Alta disponibilidade não significa que nada nunca quebra. Significa que, quando uma peça quebra, como um servidor, um disco ou um link de rede, outra assume e os clientes mal percebem. O trabalho é encontrar os pontos únicos de falha e removê-los, um a um.
A maioria das quedas vem da mesma lista curta: um banco de dados sem réplica, um servidor rodando a aplicação inteira, um deploy que não pode ser revertido e um backup que ninguém testou. Cada um desses problemas tem uma solução conhecida, e as soluções precisam ser testadas de propósito, porque um failover que nunca foi exercitado é um palpite.
O que construímos
Sem ponto único de falha
Mapeamos o caminho de uma requisição, do DNS ao banco de dados, e acrescentamos redundância em cada etapa que pode falhar.
Banco de dados replicado com failover
Um primário com réplicas e um processo de failover automático, testado ao desligá-lo de propósito.
Balanceamento de carga e verificações de saúde
O tráfego se distribui por vários nós, e os que não estão saudáveis saem de circulação automaticamente.
Releases seguros
Deploys graduais com rollback automático, para publicar código novo não derrubar o serviço.
Backups e monitoramento
Backups com testes de restauração agendados, e painéis e alertas que avisam que algo está errado antes de seus clientes.
Como trabalhamos
Mapeamos os riscos
Listamos os pontos únicos de falha e os ordenamos por probabilidade e por custo.
Removemos em ordem
Corrigimos primeiro os maiores riscos e testamos cada correção quebrando-a de propósito.
Escrevemos os runbooks
Documentamos o que fazer quando cada coisa falha, para a resposta não ficar só na cabeça de uma pessoa.
Mantemos saudável
Podemos monitorar e manter o sistema junto com sua equipe, ou entregá-lo a ela.
Perguntas
Quanto de uptime vocês garantem?
Não garantimos um número de uptime. Projetamos para remover pontos únicos de falha e provamos cada failover testando-o. O resultado é medido no seu monitoramento.
Preciso de Kubernetes?
Não necessariamente. Muitas equipes chegam à alta disponibilidade com configurações de contêineres mais simples. Escolhemos a menor ferramenta que resolve e que sua equipe consegue operar.
Isso funciona em servidores dedicados e também na nuvem?
Sim. Os princípios são os mesmos. Em servidores dedicados, a redundância precisa ser projetada desde o início, e nós fazemos isso.
Vocês trabalham com os nossos engenheiros?
Sim. Documentamos ao longo do caminho e treinamos sua equipe, ou operamos o sistema junto com ela.
Segmentos que usam isto
Serviços relacionados
Quer ver se isto serve para o seu negócio?
Conte sua situação em três linhas. Respondemos por e-mail, normalmente em até um dia útil.
Mensagem recebida.
Lemos todos os pedidos e respondemos por e-mail, normalmente em até um dia útil.