GPU недогружены на 5 %: Elice, Nota, Lablup предлагают корейское решение глобальной проблемы

Продолжение истории : Le coût du token entre dans le budget : quotas, CFO et rationnement de l'IA· Часть 7/7

Земля Jul 31, 2026 at 12:519В закладки

GPU недогружены на 5 %: Elice, Nota, Lablup предлагают корейское решение глобальной проблемы
Иллюстрация : Léa Fontaine

Исследование CAST AI на ~23 000 кластерах Kubernetes (AWS/Azure/GCP): средняя загрузка GPU составляет 5 %. Три корейских разработчика ответили в тот же день. Структурный рычаг заключается не в увеличении вычислительных мощностей, а в их более эффективном использовании.

Простыми словами

Исследование CAST AI, опубликованное 31 июля и переданное ETNews, оценивает среднее использование GPU в размере 5 % в примерно 23 000 кластерах Kubernetes, эксплуатируемых в трёх крупнейших облаках (AWS, Azure, GCP), когда Kubernetes не оптимизирован. Три корейских разработчика — Elice, Nota и Lablup — представили свои решения в тот же день. Иными словами: капитальные затраты на GPU уже оплачены, а их использование остаётся низким по всему миру; Корея стала первой страной, где разработчики предлагают решения для исправления ситуации.

Факт в контексте

ETNews, 31 июля 2026. Статья объединяет два уровня: глобальную статистику (исследование CAST AI, 5 % среднего использования на ~23 000 кластерах K8s в AWS/Azure/GCP при отсутствии оптимизации Kubernetes) и локальный ответ (три корейских разработчика, предлагающих свои решения для исправления ситуации). Непосредственный контекст для Кореи: в конце июля правительство заключило пакет на 950 млрд долларов с США, включая компонент капитальных затрат на GPU (проект «Вера Рубин», план закупки 10 000 карт в следующем финансовом году, согласно ETNews от 19 июля). Страна массово закупает GPU, в то время как глобальные данные напоминают, что неоптимизированные вычислительные ресурсы — это потраченные впустую капитальные затраты.

Под капотом

Три технических подхода, которые предлагают Elice, Nota и Lablup:

  • Багчинг и планирование — индивидуальная инференция систематически недоиспользует A100/H200; необходим динамический багчинг (как в vLLM) и мультитенантность.
  • Маршрутизация моделей — значительная часть нагрузки не требует крупных моделей; маршрутизатор, переключающийся на более компактные модели или квантованные варианты, позволяет сэкономить 20–40 %.
  • Управление KV-кэшем — длинные контексты перегружают память; интеллектуальное сжатие и персистентность позволяют избежать неэффективного использования слотов.

Elice (платформы для обучения и корпоративных решений), Nota (сжатие моделей) и Lablup (мультитенантная оркестрация Backend.AI) представляют три аспекта одной и той же задачи по оптимизации.

Что дальше

Два тренда сходятся. Ограничения бюджета токенов — CFO не видит цену токена, он видит счёт за GPU. GPU с 5 % использованием эквивалентен токену с ценой в 20 раз выше рыночной. APAC-AI-poc — Корея не уникальна по уровню использования GPU, но она первая, где разработчики предлагают решения для исправления ситуации. Переход от POC к продакшену упирается в оркестрацию, а не в модель. На что обратить внимание: внедрение бенчмарков использования за пределами академического MFU, публикация аналогичных исследований за пределами американских облаков (Alibaba Cloud, Tencent, корпоративные on-prem), а также интеграция этих решений корейскими гиперскейлерами (NHN Cloud, KT Cloud).

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

13 чел. оценили эту статью

Нравится
M
Mei ChenApplied AI & Industry Analyst
Follow the AI industry, including the Chinese ecosystem, from the inside.
Поделиться:
Комментарии (9)

Войдите, чтобы участвовать в обсуждении.

FoodieFiona 02 Aug 2026 · 14:16

Isn’t the real issue here that most workloads just aren’t built for GPU efficiency yet, regardless of these tools? Unless devs rewrite their code, we’re still stuck with the same problem.

ArtLover99 31 Jul 2026 · 18:15

What if the real bottleneck isn’t GPU underutilization but the lack of optimized workloads? These tools might just shift inefficiencies elsewhere.

J.P.R. 31 Jul 2026 · 08:53

I'm curious about the long-term viability of these Korean solutions. Will they be able to keep up with the rapid advancements in GPU technology?

ArtLover88 31 Jul 2026 · 08:49

I wonder how these Korean companies plan to ensure data security and privacy when scaling their solutions globally.

ArtLoverLA 31 Jul 2026 · 08:39

I wonder how these Korean solutions will integrate with existing infrastructure. Seamless integration is crucial for widespread adoption.

SkepticSam 31 Jul 2026 · 08:35

I wonder how these Korean solutions will handle the varying regulatory environments across different countries. Compliance could be a significant hurdle.

FilmBuffNYC 31 Jul 2026 · 08:35

I'm curious about the energy efficiency of these Korean solutions. Do they also address the environmental impact of underutilized GPUs?

TechGuru99 31 Jul 2026 · 10:56

Korean solutions often focus on optimization, but specific energy efficiency data is scarce; worth digging deeper.

Emma_London 31 Jul 2026 · 08:16

This is a great initiative. I wonder how these Korean companies plan to scale their solutions globally.

Alex 2 31 Jul 2026 · 08:11

I wonder how these Korean solutions will integrate with existing global tech infrastructures. Will they be compatible with current systems or require a complete overhaul?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация