Модели и инструменты Jul 13, 2026 at 02:209В закладки

Проблемный механизм внимания, который делает обучение с длинным контекстом наконец-то экономически эффективным — если бенчмарки оправдают себя за пределами лаборатории.
Flash-MSA — это GPU-ядро, которое заменяет плотное внимание на структурированное разреженное внимание во время обучения. Цель: сделать обучение на последовательностях из миллиона токенов экономически целесообразным без резкого увеличения вычислительных затрат.
Опубликовано 12 июля 2026 года Nandu Ruganesh (страница проекта на GitHub). Flash-MSA нацелен именно на обучение (в то время как FlashAttention 3 в основном оптимизирован для инференса). Идея: блочный шаблон разреженного внимания, слияние ядер forward/backward, управление памятью, оптимизированное для архитектур Hopper (H100/H200) и Blackwell.
Узкое место в работе с длинным контекстом всегда было обучение, а не инференс. Увеличение длины последовательности с 128k до 1M токенов в плотном режиме увеличивает память активаций и теоретические вычислительные затраты примерно в 60 раз (внимание работает за O(n²), соотношение длин ~7,8×). Существующие обходные пути (ring attention, агрессивный tensor parallelism) работают, но фрагментируют стек и усложняют отладку.
Flash-MSA делает ставку на то, что большинство долгих зависимостей носят локальный или нарративный характер (повторяющиеся блочные паттерны в коде, в документах). Делая разреженность первоклассным элементом ядра, мы сохраняем простоту плотного внимания на уровне модели и получаем масштабируемость на уровне ядра. Это тот же тренд, что и FlashAttention для инференса, но два года спустя.
Репозиторий обещает (подлежит проверке сторонними бенчмарками): ускорение прямого прохода ~4× и обратного прохода ~2,7× на последовательностях 512k → 1M по сравнению с плотной базовой линией на H100. Память активаций сокращена примерно в 5 раз. Блочный шаблон настраиваемый (размер окна, dilation); ядро предоставляет PyTorch API, совместимую с drop-in.
Что остаётся неопределённым: (1) качество модели на бенчмарках длинного контекста (Needle-in-Haystack, RULER) после обучения с MSA по сравнению с плотным вниманием — Ruganesh обещает отчёт; (2) портируемость на Blackwell (B200), у которого другая иерархия памяти.
Для тех, кто обучает или дообучает модели с длинным контекстом, Flash-MSA стоит протестировать уже на следующей неделе. Для тех, кто покупает модели: обучение моделей в конце 2026 года станет значительно дешевле для последовательностей от 512k токенов. Ожидайте, что маркетинговые обещания «10M токенов контекста» снова станут аргументом, но реальное качество на таких длинах останется главным критерием.
Сторонний отчёт с бенчмарками, воспроизводимость на Blackwell и интеграция в vLLM/SGLang для инференса.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Interesting approach, but how does it handle context switching in multilingual texts? Will it maintain coherence across languages?
L'entraînement long-contexte est indispensable, mais je doute des compromis sur les performances avec cette attention creuse.
L'attention creuse pourrait vraiment réduire les coûts d'entraînement, non ?
Est-ce que ça va garder la même précision ou sacrifier des détails pour être plus rapide ?
Comment ça se passe avec les langues étrangères ? Ça marche aussi bien ?
Est-ce que l'attention creuse va poser problème sur des données variées ?
Les économies promises sont intéressantes, mais comment ça marche en vrai, hors labo ?
Les tests en vrai confirment l'efficacité, mais ça reste à voir pour les très gros déploiements.
J'espère que cette technologie saura gérer les nuances des longs textes sans perdre en précision.
Les économies promises sont alléchantes, mais comment ce kernel gère-t-il les données bruitées ou les valeurs aberrantes ?
Est-ce que les économies de coût vont se faire au détriment de la performance du modèle ?