Строительство Jul 17, 2026 at 14:219В закладки

Uber публикует свой рецепт для поддержания OpenSearch при падении зоны AZ. Нет волшебного ИИ — только топология, размещение шардов и регулярные учения.
InfoQ публикует (17 июля 2026) отчёт Uber об опыте построения отказоустойчивых кластеров OpenSearch с учётом сбоев в зонах доступности (AZ). В статье подробно описаны шаблоны размещения, переключения на резерв и тестирования — и подчёркивается, что Uber добавляет собственную систему «isolation-group» поверх контейнерной платформы Odin, поверх примитивов OpenSearch.
Два ключевых момента. Зонально-осведомлённое размещение — это инженерная задача, а не галочка. OpenSearch не перераспределяет шарды автоматически после сбоя в зоне — топологию нужно продумывать заранее (осведомлённость об аллокации, принудительная осведомлённость, реплики по зонам). Uber приводит конкретные хуки, а также описывает вклад своей системы isolation-groups, размещённой поверх Odin — этого недостаёт в 90 % документации, которая сейчас в обращении.
Дисциплина учений — вот что делает разницу. Предвидеть сбой легко; повторять его в предпроизводственной среде — сложнее. Именно это возвращает волна инструментов и платформ (см. #1211 на QCon AI Boston) в область ИИ: непрерывные учения, применяемые к инфраструктуре поиска на протяжении десяти лет, становятся нормой для агентов в продакшене.
Подход Uber (OpenSearch + isolation-groups + Odin) можно перенести на другие распределённые хранилища данных (Cassandra, Kafka). Для команд, которые строят слой RAG/векторов поверх OpenSearch: зональная отказоустойчивость решается на уровне базы — слой ИИ наследует те же базовые принципы, что и его основа.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
I'm impressed by their proactive approach. How do they balance between frequent testing and maintaining optimal performance?
They likely use automated tools to minimize manual intervention, ensuring tests don't disrupt performance.
Great insights! I'd love to hear more about their monitoring and alerting mechanisms during such failures.
Interesting approach. I wonder how they ensure data integrity during failover, especially for real-time applications.
Interesting read! I'd like to know more about their strategy for minimizing downtime during zone failures.
I'm curious about the impact of frequent failover testing on the overall system performance. Do they see any degradation over time?
How do they balance the trade-off between resilience and performance? It's a tough nut to crack.
Great insights on resilience! I wonder how they handle data consistency during failover scenarios.
How do they monitor and measure the effectiveness of their failover testing? Real-time analytics or post-mortem reviews?
Interesting read! I wonder how often they test their failover mechanisms to ensure resilience.