모델 & 도구 Jul 13, 2026 at 02:209북마크에 추가

고 hollow attention kernel이 드디어 장문 맥락 학습을 경제적으로 가능하게 하다 - 벤치마크가 실험실 밖에서도 유지된다면.
Flash-MSA는 훈련 중에 조밀한 어텐션을 구조화된 희소 어텐션으로 대체하는 GPU 커널입니다. 목표는 100만 토큰 시퀀스 훈련을 컴퓨팅 예산 폭등 없이 실현 가능한 수준으로 만드는 것입니다.
2026년 7월 12일 Nandu Ruganesh가 발표한 Flash-MSA는 훈련에 특화되어 있습니다(FlashAttention 3는 주로 추론 친화적 개선에 주력했습니다). 핵심 아이디어는 블록별 희소 어텐션 패턴, 포워드/백워드 커널 통합, Hopper(H100/H200) 및 Blackwell용 메모리 관리입니다.
장문맥의 병목은 항상 추론이 아니라 훈련이었습니다. 조밀한 어텐션으로 128k에서 1M 토큰으로 늘리면 활성화 메모리와 이론적 컴퓨팅이 ~60배 증가합니다(어텐션이 O(n²)이고 길이 비율이 ~7.8배). 현재 해결책(링 어텐션, 과감한 텐서 병렬 처리)은 작동하지만 스택을 조각내고 디버깅을 복잡하게 만듭니다.
Flash-MSA는 다음과 같은 가정을 내세웁니다: 대부분의 장거리 의존성은 지역적이거나 서사적입니다(코드 내 반복 블록 패턴, 문서 내 패턴). 커널에서 희소성을 일급 객체로 만들어 모델 측에서는 조밀한 어텐션의 단순성을 유지하고 커널 측에서는 확장성을 얻는 것입니다. 이는 FlashAttention이 추론에서 이룬 것과 같은 움직임으로, 2년 후의 일입니다.
리포지토리에는(서드파티 벤치마크로 검증 필요) H100에서 512k→1M 시퀀스 기준 포워드 패스 ~4배 가속, 백워드 ~2.7배 가속이 발표되어 있습니다. 활성화 메모리는 ~5배 감소합니다. 블록 패턴은 구성 가능(윈도우 크기, dilation)하며 PyTorch 드롭인 API를 제공합니다.
아직 불확실한 점: (1) 조밀한 훈련 vs MSA 훈련 후 장문맥 벤치마크(Needle-in-Haystack, RULER)에서 모델 품질 - Ruganesh가 상세 분석을 약속했습니다; (2) Blackwell(B200)으로의 이식성(메모리 계층 구조가 다름).
장문맥 훈련이나 파인튜닝을 하는 경우라면 다음 주에라도 Flash-MSA를 테스트해볼 가치가 있습니다. 모델 구매자라면 2026년 말 모델 훈련 비용이 512k+ 토큰에서 크게 절감될 것입니다. "10M 토큰 문맥" 경쟁이 다시 상업적Argument로 부활하겠지만, 실제 품질이 진정한 차별화 요소가 될 것입니다.
서드파티 벤치마크 상세 분석, Blackwell에서의 재현, vLLM/SGLang의 서빙 통합.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Interesting approach, but how does it handle context switching in multilingual texts? Will it maintain coherence across languages?
L'entraînement long-contexte est indispensable, mais je doute des compromis sur les performances avec cette attention creuse.
L'attention creuse pourrait vraiment réduire les coûts d'entraînement, non ?
Est-ce que ça va garder la même précision ou sacrifier des détails pour être plus rapide ?
Comment ça se passe avec les langues étrangères ? Ça marche aussi bien ?
Est-ce que l'attention creuse va poser problème sur des données variées ?
Les économies promises sont intéressantes, mais comment ça marche en vrai, hors labo ?
Les tests en vrai confirment l'efficacité, mais ça reste à voir pour les très gros déploiements.
J'espère que cette technologie saura gérer les nuances des longs textes sans perdre en précision.
Les économies promises sont alléchantes, mais comment ce kernel gère-t-il les données bruitées ou les valeurs aberrantes ?
Est-ce que les économies de coût vont se faire au détriment de la performance du modèle ?