모델 및 도구 Jul 13, 2026 at 02:209북마크에 추가

고려 컨텍스트 학습을 마침내 경제적으로 만드는 희소 어텐션 커널 - 벤치마크가 실험실 밖에서도 유효하다면
Flash-MSA는 훈련 중에 조밀한 어텐션을 구조화된 희소 어텐션으로 대체하는 GPU 커널입니다. 목표는 계산 비용을 폭발시키지 않고 백만 토큰 시퀀스 훈련을 실현 가능한 것으로 만드는 것입니다.
2026년 7월 12일 Nandu Ruganesh가 발표한 Flash-MSA는 훈련에 특화되어 있으며(FlashAttention 3는 주로 추론 친화적在这一点上), 블록별 희소 어텐션 패턴, 포워드/백워드 커널 통합, Hopper(H100/H200) 및 Blackwell용 메모리 관리를 제공합니다.
장문맥의 병목은 추론이 아니라 훈련에 있었습니다. 조밀한 어텐션으로 128k에서 1M 토큰으로 늘리면 활성화 메모리와 이론적 계산량이 ~60배 증가합니다(어텐션은 O(n²), 길이 비율 ~7.8×). 현재 워크어라운드(링 어텐션, 텐서 병렬 처리)는 작동하지만 스택을 조각내고 디버깅을 복잡하게 만듭니다.
Flash-MSA는 대부분의 장거리 의존성은 로컬적이거나 서사적 패턴(블록 반복 패턴)이라는 가정을 합니다. 커널에서 희소성을 일급 객체로 만들어 모델 측에서는 조밀한 어텐션의 단순성을 유지하고 커널 측에서 확장성을 얻습니다. 이는 FlashAttention이 추론에서 했던 것과 같은 움직임입니다.
리포지토리는(서드파티 벤치마크로 검증 필요) H100에서 512k→1M 시퀀스에서 포워드 패스 ~4배 가속, 백워드 ~2.7배 가속을 발표합니다. 활성화 메모리는 ~5배 감소합니다. 블록 패턴은 구성 가능(윈도우 크기, dilation)하며 PyTorch 드롭인 API를 제공합니다.
불확실한 점: (1) MSA vs 조밀한 훈련 후 장문맥 벤치마크(N needle-in-a-haystack, RULER)에서 모델 품질 - Ruganesh는 writeup을 약속함; (2) Blackwell(B200)으로의 이식성(메모리 계층 구조가 다름).
장문맥 훈련이나 파인튜닝을 하는 경우, Flash-MSA는 다음 주에 pilots를 진행해 볼 가치가 있습니다. 모델 구매자라면 2026년 하반기 모델 훈련 비용이 512k+ 토큰에서 크게 절감될 것입니다. "10M 토큰 컨텍스트" 마케팅이 다시 등장하겠지만, 실제 품질이 진정한 차별화 요소가 될 것입니다.
서드파티 벤치마크 writeup, Blackwell에서의 재현, vLLM/SGLang의 serving 통합.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Interesting approach, but how does it handle context switching in multilingual texts? Will it maintain coherence across languages?
L'entraînement long-contexte est indispensable, mais je doute des compromis sur les performances avec cette attention creuse.
L'attention creuse pourrait vraiment réduire les coûts d'entraînement, non ?
Est-ce que ça va garder la même précision ou sacrifier des détails pour être plus rapide ?
Comment ça se passe avec les langues étrangères ? Ça marche aussi bien ?
Est-ce que l'attention creuse va poser problème sur des données variées ?
Les économies promises sont intéressantes, mais comment ça marche en vrai, hors labo ?
Les tests en vrai confirment l'efficacité, mais ça reste à voir pour les très gros déploiements.
J'espère que cette technologie saura gérer les nuances des longs textes sans perdre en précision.
Les économies promises sont alléchantes, mais comment ce kernel gère-t-il les données bruitées ou les valeurs aberrantes ?
Est-ce que les économies de coût vont se faire au détriment de la performance du modèle ?