Como o Uber constrói clusters OpenSearch resilientes a falhas de zona

Construir Jul 17, 2026 at 14:219Adicionar aos favoritos

Como o Uber constrói clusters OpenSearch resilientes a falhas de zona
Ilustração : Léa Fontaine

Uber publica sua receita para manter o OpenSearch quando uma zona AZ cai. Sem IA mágica — apenas topologia, alocação de shards e exercícios regulares.

O fato

InfoQ publica (17 de julho de 2026) um relato de experiência da Uber sobre a construção de clusters OpenSearch resilientes a falhas de zona (AZ). O artigo detalha os padrões de placement, failover e teste — e esclarece que a Uber empilha um sistema "isolation-group" próprio sobre a plataforma de orquestração de contêineres Odin, acima das primitivas do OpenSearch.

Nossa leitura

Dois pontos a destacar. O placement ciente de zona é um trabalho de engenharia, não uma caixa para marcar. O OpenSearch não redistribui magicamente os shards após uma falha de AZ — a topologia deve ser pensada antecipadamente (alocação awareness, forced awareness, réplicas por zona). A Uber detalha hooks concretos, com a contribuição de seu próprio sistema de isolation-groups sobre o Odin — algo que falta em 90% da documentação em circulação.

A disciplina do drill faz a diferença. Prever a falha é fácil; repeti-la em pré-produção, menos. É isso que a onda de harness/plataforma (veja #1211 no QCon AI Boston) traz para o lado de IA: o drill contínuo, aplicado à infraestrutura de busca há dez anos, torna-se a norma para os agentes em produção.

A observar

A abordagem da Uber (OpenSearch + isolation-groups + Odin) é transponível para outros data stores distribuídos (Cassandra, Kafka). Para as equipes que constroem a camada RAG/vector acima do OpenSearch: a resiliência de zona é definida antecipadamente à camada de embedding — a camada de IA herda o piso que sua base estabelece.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

24 pessoas gostaram deste artigo

Gosto
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Partilhar:
Comentários (9)

Inicie sessão para se juntar à discussão.

ArtLoverLA 17 Jul 2026 · 18:18

I'm impressed by their proactive approach. How do they balance between frequent testing and maintaining optimal performance?

TravelTom 17 Jul 2026 · 20:24

They likely use automated tools to minimize manual intervention, ensuring tests don't disrupt performance.

sandrine.b 17 Jul 2026 · 18:07

Great insights! I'd love to hear more about their monitoring and alerting mechanisms during such failures.

EcoWarrior99 17 Jul 2026 · 17:20

Interesting approach. I wonder how they ensure data integrity during failover, especially for real-time applications.

1
TechSavvy47 17 Jul 2026 · 17:20

Interesting read! I'd like to know more about their strategy for minimizing downtime during zone failures.

1
Alex_London 17 Jul 2026 · 10:16

I'm curious about the impact of frequent failover testing on the overall system performance. Do they see any degradation over time?

LecteurDuDimanche 17 Jul 2026 · 10:08

How do they balance the trade-off between resilience and performance? It's a tough nut to crack.

Critique42 17 Jul 2026 · 09:53

Great insights on resilience! I wonder how they handle data consistency during failover scenarios.

J.P.R. 17 Jul 2026 · 09:51

How do they monitor and measure the effectiveness of their failover testing? Real-time analytics or post-mortem reviews?

LitLover42 17 Jul 2026 · 09:44

Interesting read! I wonder how often they test their failover mechanisms to ensure resilience.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações