Apple & MILA Research — Attention to Mamba: 실행 가능한 교차 아키텍처 증류를 위한 기술 백서
1. Executive Summary & Background
Apple & MILA Research — Attention to Mamba: 실행 가능한 교차 아키텍처 증류를 위한 기술 백서
1. Executive Summary & Background
최근 언어 모델 분야에서는 기존 Transformer 아키텍처의 이차(Quadratic) 시간 복잡도를 극복하기 위한 대안으로 Mamba와 같은 상태 공간 모델(SSM)이 주목받고 있습니다. 그러나 기존의 Transformer 모델이 구축해 온 방대한 사전 학습 지식을 SSM으로 효과적으로 이전하는 것은 여전히 난제로 남아 있습니다. 단순한 직접 증류(Direct distillation) 방식은 교사 모델(Teacher)의 성능을 보존하지 못하고 실패하는 경우가 많으며, 이를 해결하기 위해 Attention과 SSM 블록을 결합한 하이브리드 솔루션이 주로 제안되어 왔습니다.
본 연구는 이러한 교차 아키텍처 증류의 한계를 극복하기 위해 ‘원칙에 입각한 초기화(Principled Initialization)’를 핵심으로 하는 2단계 증류 레시피를 제안합니다. 본 방식은 Transformer의 Softmax Attention을 선형화된 Attention으로 증류한 후, 이를 다시 Mamba 아키텍처로 증류하는 과정을 거칩니다. 해당 방식을 통해 학습된 모델은 기존 Transformer의 성능을 거의 유지하면서도, 더 효율적인 추론이 가능한 SSM 기반 구조로 전환될 수 있음을 입증하였습니다.
2. Core Concepts & Architecture Deep Dive
본 연구는 Transformer와 SSM 간의 수학적 연관성을 기반으로 하여, 아키텍처 간의 연결 고리를 구축하는 것에 집중합니다.
A. 1단계: Softmax Attention에서 선형 Attention으로의 증류 첫 번째 단계에서는 Hedgehog 절차를 사용하여 Softmax Attention을 선형화합니다. 이는 머서의 정리(Mercer’s theorem)를 활용하여 지수 연산자(Softmax)를 특성 벡터의 내적으로 근사하는 커널 트릭(Kernel trick)을 적용한 것입니다. 특히, 학습 가능한 특성 맵(Feature map)을 단일 계층 MLP로 구현함으로써, 고정된 Taylor 근사 방식보다 향상된 표현력을 확보하고 Softmax Attention의 주요 특징(활성값의 스파이크 등)을 효과적으로 모사합니다.
B. 2단계: 선형 Attention에서 Mamba로의 전환 및 미세 조정 두 번째 단계에서는 1단계에서 얻은 가중치를 Mamba 모델의 초기화 파라미터로 활용합니다.
- 구조적 대응: Mamba의 상태 공간 모델(SSM) mixer 파라미터(B, C, X)를 선형 Attention의 Query, Key, Value 매트릭스에 대응시킵니다.
- HedgeMamba 아키텍처: 최종적으로 도출된 ‘HedgeMamba’ 레이어는 기존 Mamba 구조에 Hedgehog 특성 맵을 통합하고, 정규화(Normalization) 인자를 포함하여 Attention 점수와 유사한 행동 양식을 보이도록 구성됩니다.
- 미세 조정(Fine-tuning): 초기화 후에는 게이트 브랜치(Gate branch)와 컨볼루션 레이어를 포함한 Mamba의 추가 구성요소를 활성화하고, 표준 교차 엔트로피 손실 함수(Cross-Entropy loss)를 사용하여 전체 아키텍처를 최종적으로 미세 조정합니다.
3. Experimental Results & Benchmark Analysis
연구진은 Pythia-1B 모델을 교사 모델로 설정하여 10B 토큰 규모의 데이터를 사용해 실험을 수행했습니다.
- 성능 보존: 증류된 HedgeMamba 모델은 14.11의 perplexity를 기록하여, 교사 모델인 Pythia-1B의 13.86과 매우 근접한 성능을 달성하였습니다.
- 비교 분석: 제안된 방식은 단순한 Hedgehog baseline보다 우수한 성능을 보였으며, 직접 증류 방식은 만족스럽지 못한 결과(perplexity > 100)를 보여 본 레시피의 유효성을 입증했습니다.
- 구성요소 기여도: Ablation 연구 결과, 추가된 Mamba 구성요소 중 ‘게이트 브랜치(Gate branch)’가 perplexity와 하위 태스크(Downstream task) 성능 개선에 가장 큰 기여를 하는 것으로 나타났습니다.
4. Research Methodology & Evaluation Protocol
- 데이터셋: OpenWebText 데이터셋을 활용하여 총 10B 토큰의 증류 토큰 예산을 설정하였습니다. 이는 교사 모델 사전 학습 토큰 예산의 약 2.7% 수준입니다.
- 평가 도구: lm-eval-harness를 사용하여 ARC-Easy, Social IQA, PiQA 등 언어 이해 및 상식 추론 태스크에서 정확도를 측정하였습니다.
- 토큰 예산 최적화: 1단계와 2단계의 토큰 할당 비율을 분석한 결과, 10/90 분할(1단계 10%, 2단계 90%) 방식이 perplexity 개선에 가장 효과적이었습니다.
5. Strategic Implications
본 연구는 Transformer 아키텍처를 SSM으로 효율적으로 전환하고자 하는 인프라 및 모델 엔지니어링 전략에 중요한 시사점을 제공합니다.
- 지식 이전의 효율성: 사전 학습된 대규모 Transformer 모델의 지식을 버리지 않고, SSM의 추론 효율성을 결합할 수 있는 경로를 제시했습니다.
- 기술적 성숙도의 활용: 새 모델을 밑바닥부터 학습(From scratch)하는 대신, 기존에 잘 알려진 Transformer 학습 경험과 사전 학습 가중치를 활용함으로써 개발 비용을 절감할 수 있는 실용적인 프레임워크를 제공합니다.
- 확장성: 1B 모델 스케일에서 유효성을 입증했으며, 아키텍처 증류의 단계별 토큰 할당 전략은 향후 다양한 규모의 모델 증류 연구에서 표준적인 방법론으로 활용될 가능성이 큽니다.
References:
- Attention to Mamba: A Recipe for Cross-Architecture Distillation (https://arxiv.org/abs/2604.14191v1)
Tags:
SSM #Mamba #Distillation #Transformers #LLM #Efficiency
상태공간모델 #맘바 #모델증류 #트랜스포머 #언어모델 #모델효율화
메타데이터
- post_id
- a48584d89bf3
- slug
- apple-mila-research-attention-to-mamba-실행-가능한-교차-아키텍처-증류를-위한-기술-백서-a48584d89bf3
- url
- https://medium.com/@mdpman/apple-mila-research-attention-to-mamba-%EC%8B%A4%ED%96%89-%EA%B0%80%EB%8A%A5%ED%95%9C-%EA%B5%90%EC%B0%A8-%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98-%EC%A6%9D%EB%A5%98%EB%A5%BC-%EC%9C%84%ED%95%9C-%EA%B8%B0%EC%88%A0-%EB%B0%B1%EC%84%9C-a48584d89bf3
- canonical_url
- https://medium.com/@mdpman/apple-mila-research-attention-to-mamba-%EC%8B%A4%ED%96%89-%EA%B0%80%EB%8A%A5%ED%95%9C-%EA%B5%90%EC%B0%A8-%EC%95%84%ED%82%A4%ED%85%8D%EC%B2%98-%EC%A6%9D%EB%A5%98%EB%A5%BC-%EC%9C%84%ED%95%9C-%EA%B8%B0%EC%88%A0-%EB%B0%B1%EC%84%9C-a48584d89bf3
- author_url
- https://medium.com/@mdpman
- status
- ok
- fetched_at
- 2026-06-09 15:37:30