Модели и инструменты Jul 13, 2026 at 02:209В закладки

Проблемный механизм внимания, который делает обучение с длинным контекстом наконец-то экономически эффективным — если бенчмарки оправдают себя за пределами лаборатории.
Flash-MSA — это GPU-ядро, которое заменяет плотное внимание на структурированное разреженное внимание во время обучения. Цель: сделать обучение на последовательностях из миллиона токенов экономически viable, не превышая бюджет на вычисления.
Опубликовано 12 июля 2026 года Nandu Ruganesh (страница проекта на GitHub). Flash-MSA нацелен specifically на обучение (в то время как FlashAttention 3 в основном оптимизирован для inference-friendly). Идея: шаблон разреженного внимания по блокам, слияние ядер forward/backward, оптимизация памяти для архитектур Hopper (H100/H200) и Blackwell.
Узким местом в длинном контексте всегда было обучение, а не инференс. Увеличение длины последовательности с 128k до 1M токенов в плотном режиме умножает память активаций и теоретические вычислительные затраты на ~60 (внимание работает за O(n²), соотношение длин ~7,8×). Существующие обходные пути (ring attention, агрессивный tensor parallelism) работают, но фрагментируют стек и усложняют отладку.
Flash-MSA делает ставку: большинство долгих зависимостей локальны или нарративны (повторяющиеся блочные паттерны в коде, в документах). Делая разреженность first-class в ядре, сохраняется простота плотного внимания со стороны модели и достигается масштабируемость на уровне ядра. Это тот же тренд, что и FlashAttention для инференса, но два года спустя.
Репозиторий анонсирует (подлежит проверке сторонними бенчмарками): ~4× ускорение прямого прохода и ~2,7× обратного на последовательностях 512k → 1M по сравнению с плотной базовой линией на H100. Память активаций уменьшена в ~5 раз. Блочный паттерн настраивается (размер окна, dilation); ядро предоставляет PyTorch API drop-in.
Что остаётся под вопросом: (1) качество модели на бенчмарках длинного контекста (Needle-in-Haystack, RULER) после обучения с MSA vs плотным вниманием — Ruganesh обещает отчёт; (2) портируемость на Blackwell (B200), у которого другая иерархия памяти.
Тем, кто обучает или fine-tunет модели с длинным контекстом, Flash-MSA стоит протестировать уже на следующей неделе. Тем, кто покупает модели: генерация моделей конца 2026 года будет значительно дешевле в обучении на 512k+ токенах. Ожидайте, что маркетинговые обещания «10M токенов контекста» снова станут аргументом, но реальное качество на таких длинах останется ключевым фактором.
Сторонние бенчмарки и отчёты, портирование на Blackwell, а также интеграцию в vLLM/SGLang для инференса.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Interesting approach, but how does it handle context switching in multilingual texts? Will it maintain coherence across languages?
L'entraînement long-contexte est indispensable, mais je doute des compromis sur les performances avec cette attention creuse.
L'attention creuse pourrait vraiment réduire les coûts d'entraînement, non ?
Est-ce que ça va garder la même précision ou sacrifier des détails pour être plus rapide ?
Comment ça se passe avec les langues étrangères ? Ça marche aussi bien ?
Est-ce que l'attention creuse va poser problème sur des données variées ?
Les économies promises sont intéressantes, mais comment ça marche en vrai, hors labo ?
Les tests en vrai confirment l'efficacité, mais ça reste à voir pour les très gros déploiements.
J'espère que cette technologie saura gérer les nuances des longs textes sans perdre en précision.
Les économies promises sont alléchantes, mais comment ce kernel gère-t-il les données bruitées ou les valeurs aberrantes ?
Est-ce que les économies de coût vont se faire au détriment de la performance du modèle ?