Infraestrutura de alta disponibilidade, para uma falha não tirar você do ar.

Projetamos sistemas sem ponto único de falha: balanceamento de carga, bancos de dados replicados, failover automático, releases graduais, backups que você já restaurou e alertas que chegam a você primeiro.

O que "alta disponibilidade" significa na prática

Alta disponibilidade não significa que nada nunca quebra. Significa que, quando uma peça quebra, como um servidor, um disco ou um link de rede, outra assume e os clientes mal percebem. O trabalho é encontrar os pontos únicos de falha e removê-los, um a um.

A maioria das quedas vem da mesma lista curta: um banco de dados sem réplica, um servidor rodando a aplicação inteira, um deploy que não pode ser revertido e um backup que ninguém testou. Cada um desses problemas tem uma solução conhecida, e as soluções precisam ser testadas de propósito, porque um failover que nunca foi exercitado é um palpite.

O que construímos

Sem ponto único de falha

Mapeamos o caminho de uma requisição, do DNS ao banco de dados, e acrescentamos redundância em cada etapa que pode falhar.

Banco de dados replicado com failover

Um primário com réplicas e um processo de failover automático, testado ao desligá-lo de propósito.

Balanceamento de carga e verificações de saúde

O tráfego se distribui por vários nós, e os que não estão saudáveis saem de circulação automaticamente.

Releases seguros

Deploys graduais com rollback automático, para publicar código novo não derrubar o serviço.

Backups e monitoramento

Backups com testes de restauração agendados, e painéis e alertas que avisam que algo está errado antes de seus clientes.

Como trabalhamos

  1. Mapeamos os riscos

    Listamos os pontos únicos de falha e os ordenamos por probabilidade e por custo.

  2. Removemos em ordem

    Corrigimos primeiro os maiores riscos e testamos cada correção quebrando-a de propósito.

  3. Escrevemos os runbooks

    Documentamos o que fazer quando cada coisa falha, para a resposta não ficar só na cabeça de uma pessoa.

  4. Mantemos saudável

    Podemos monitorar e manter o sistema junto com sua equipe, ou entregá-lo a ela.

Perguntas

Quanto de uptime vocês garantem?

Não garantimos um número de uptime. Projetamos para remover pontos únicos de falha e provamos cada failover testando-o. O resultado é medido no seu monitoramento.

Preciso de Kubernetes?

Não necessariamente. Muitas equipes chegam à alta disponibilidade com configurações de contêineres mais simples. Escolhemos a menor ferramenta que resolve e que sua equipe consegue operar.

Isso funciona em servidores dedicados e também na nuvem?

Sim. Os princípios são os mesmos. Em servidores dedicados, a redundância precisa ser projetada desde o início, e nós fazemos isso.

Vocês trabalham com os nossos engenheiros?

Sim. Documentamos ao longo do caminho e treinamos sua equipe, ou operamos o sistema junto com ela.

Segmentos que usam isto

Serviços relacionados

Quer ver se isto serve para o seu negócio?

Conte sua situação em três linhas. Respondemos por e-mail, normalmente em até um dia útil.