Modelos e Ferramentas Jul 13, 2026 at 02:209Adicionar aos favoritos

Um kernel de atenção esparsa que torna o treinamento de longo contexto economicamente viável — se os benchmarks se mantiverem fora do laboratório.
Flash-MSA é um kernel GPU que substitui a atenção densa por atenção esparsa estruturada durante o treinamento. Objetivo: tornar viável o treinamento em sequências de um milhão de tokens sem explodir o orçamento computacional.
Publicado em 12 de julho de 2026 por Nandu Ruganesh (página do projeto no GitHub), o Flash-MSA tem como alvo específico o treinamento (onde o FlashAttention 3 ganhou principalmente em inferência-friendly). A ideia: padrão de atenção esparsa em blocos, fusão dos kernels forward/backward, gerenciamento de memória otimizado para Hopper (H100/H200) e Blackwell.
O gargalo do contexto longo sempre foi o treinamento, não a inferência. Passar de 128k para 1M de tokens em atenção densa multiplica a memória de ativações e o compute teórico por ~60 (atenção em O(n²), proporção de comprimento ~7,8×). As soluções atuais (ring attention, tensor parallelism agressivo) funcionam, mas fragmentam a stack e complicam a depuração.
O Flash-MSA faz uma aposta: a maioria das dependências longas são locais ou narrativas (padrões de blocos repetitivos no código, em documentos). Ao tornar a esparsidade de primeira classe no kernel, mantém-se a simplicidade de uma atenção densa do lado do modelo e ganha-se escalabilidade do lado do kernel. É o mesmo movimento do FlashAttention do lado da inferência, dois anos depois.
O repositório anuncia (a validar em benchmarks de terceiros): ~4× de aceleração no forward pass e ~2,7× no backward em sequências de 512k → 1M vs. baseline densa, em H100. Memória de ativações dividida por ~5. O padrão em blocos é configurável (tamanho da janela, dilatação); o kernel expõe uma API PyTorch drop-in.
O que ainda é incerto: (1) a qualidade do modelo em benchmarks de contexto longo (Needle-in-Haystack, RULER) após treinamento MSA vs. densa — Ruganesh promete um writeup; (2) a portabilidade para Blackwell (B200), que tem uma hierarquia de memória diferente.
Para quem treina ou fine-tuna em contexto longo, o Flash-MSA vale um teste já na próxima semana. Para quem compra modelos: a geração de modelos no final de 2026 será significativamente mais barata de treinar com 512k+ tokens. Espere que a corrida por "10M tokens de contexto" volte a ser um argumento comercial, mas que a qualidade efetiva nessas extensões seja o verdadeiro diferencial.
Um writeup com benchmarks de terceiros, a reprodução em Blackwell e uma integração no vLLM/SGLang do lado do serving.
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
Interesting approach, but how does it handle context switching in multilingual texts? Will it maintain coherence across languages?
L'entraînement long-contexte est indispensable, mais je doute des compromis sur les performances avec cette attention creuse.
L'attention creuse pourrait vraiment réduire les coûts d'entraînement, non ?
Est-ce que ça va garder la même précision ou sacrifier des détails pour être plus rapide ?
Comment ça se passe avec les langues étrangères ? Ça marche aussi bien ?
Est-ce que l'attention creuse va poser problème sur des données variées ?
Les économies promises sont intéressantes, mais comment ça marche en vrai, hors labo ?
Les tests en vrai confirment l'efficacité, mais ça reste à voir pour les très gros déploiements.
J'espère que cette technologie saura gérer les nuances des longs textes sans perdre en précision.
Les économies promises sont alléchantes, mais comment ce kernel gère-t-il les données bruitées ou les valeurs aberrantes ?
Est-ce que les économies de coût vont se faire au détriment de la performance du modèle ?