Земля Jul 31, 2026 at 12:519В закладки

Исследование CAST AI на ~23 000 кластерах Kubernetes (AWS/Azure/GCP): средняя загрузка GPU составляет 5 %. Три корейских разработчика ответили в тот же день. Структурный рычаг заключается не в увеличении вычислительных мощностей, а в их более эффективном использовании.
Исследование CAST AI, опубликованное 31 июля и переданное ETNews, оценивает среднее использование GPU в размере 5 % в примерно 23 000 кластерах Kubernetes, эксплуатируемых в трёх крупнейших облаках (AWS, Azure, GCP), когда Kubernetes не оптимизирован. Три корейских разработчика — Elice, Nota и Lablup — представили свои решения в тот же день. Иными словами: капитальные затраты на GPU уже оплачены, а их использование остаётся низким по всему миру; Корея стала первой страной, где разработчики предлагают решения для исправления ситуации.
ETNews, 31 июля 2026. Статья объединяет два уровня: глобальную статистику (исследование CAST AI, 5 % среднего использования на ~23 000 кластерах K8s в AWS/Azure/GCP при отсутствии оптимизации Kubernetes) и локальный ответ (три корейских разработчика, предлагающих свои решения для исправления ситуации). Непосредственный контекст для Кореи: в конце июля правительство заключило пакет на 950 млрд долларов с США, включая компонент капитальных затрат на GPU (проект «Вера Рубин», план закупки 10 000 карт в следующем финансовом году, согласно ETNews от 19 июля). Страна массово закупает GPU, в то время как глобальные данные напоминают, что неоптимизированные вычислительные ресурсы — это потраченные впустую капитальные затраты.
Три технических подхода, которые предлагают Elice, Nota и Lablup:
Elice (платформы для обучения и корпоративных решений), Nota (сжатие моделей) и Lablup (мультитенантная оркестрация Backend.AI) представляют три аспекта одной и той же задачи по оптимизации.
Два тренда сходятся. Ограничения бюджета токенов — CFO не видит цену токена, он видит счёт за GPU. GPU с 5 % использованием эквивалентен токену с ценой в 20 раз выше рыночной. APAC-AI-poc — Корея не уникальна по уровню использования GPU, но она первая, где разработчики предлагают решения для исправления ситуации. Переход от POC к продакшену упирается в оркестрацию, а не в модель. На что обратить внимание: внедрение бенчмарков использования за пределами академического MFU, публикация аналогичных исследований за пределами американских облаков (Alibaba Cloud, Tencent, корпоративные on-prem), а также интеграция этих решений корейскими гиперскейлерами (NHN Cloud, KT Cloud).
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Isn’t the real issue here that most workloads just aren’t built for GPU efficiency yet, regardless of these tools? Unless devs rewrite their code, we’re still stuck with the same problem.
What if the real bottleneck isn’t GPU underutilization but the lack of optimized workloads? These tools might just shift inefficiencies elsewhere.
I'm curious about the long-term viability of these Korean solutions. Will they be able to keep up with the rapid advancements in GPU technology?
I wonder how these Korean companies plan to ensure data security and privacy when scaling their solutions globally.
I wonder how these Korean solutions will integrate with existing infrastructure. Seamless integration is crucial for widespread adoption.
I wonder how these Korean solutions will handle the varying regulatory environments across different countries. Compliance could be a significant hurdle.
I'm curious about the energy efficiency of these Korean solutions. Do they also address the environmental impact of underutilized GPUs?
Korean solutions often focus on optimization, but specific energy efficiency data is scarce; worth digging deeper.
This is a great initiative. I wonder how these Korean companies plan to scale their solutions globally.
I wonder how these Korean solutions will integrate with existing global tech infrastructures. Will they be compatible with current systems or require a complete overhaul?
Le coût du token entre dans le budget : quotas, CFO et rationnement de l'IA