Bldev's Blog

Mamba: 선택적 상태 공간 모델로 트랜스포머를 넘어선 선형 시간 시퀀스 모델링

2026. 9. 2.

연구 배경 및 핵심 문제 의식

대규모 언어 모델의 사실상 표준으로 자리 잡은 트랜스포머는 강력한 표현력을 자랑하지만, 시퀀스 길이 n에 대해 O(n²)의 어텐션 연산 복잡도라는 구조적 한계를 안고 있다. 이 이차 복잡도는 컨텍스트 창이 수만 토큰을 넘어서는 순간 학습과 추론 모두에서 치명적인 병목으로 작용한다. 이를 극복하고자 선형 시간 복잡도를 목표로 하는 수많은 대안 아키텍처들이 제안되었다. 상태 공간 모델(SSM) 계열의 S4, H3, Hyena를 비롯해 RetNet, RWKV 등은 이 문제에 정면으로 도전한 대표적인 모델들이다.

그러나 이들 선형 시간 모델의 대부분은 공통된 구조적 약점을 공유한다. 바로 '입력 불변(Linear Time-Invariant, LTI)' 특성이다. LTI 시스템에서 상태 전이 행렬은 입력 토큰의 내용과 무관하게 고정되어 있어, 시퀀스의 어떤 위치에 어떤 정보가 있는지를 선택적으로 판단하는 '콘텐츠 기반 추론(content-based reasoning)'이 근본적으로 불가능하다. 언어처럼 이산적이고 정보 밀도가 높은 모달리티에서는 특정 토큰을 선택적으로 기억하거나 무시하는 능력이 필수적인데, LTI 구조는 이를 뒷받침할 수 없다.

이러한 한계는 단순한 이론적 약점에 그치지 않고, 실험적으로도 명확히 드러난다. Selective Copying과 Induction Heads라는 두 가지 합성 연상 회상(associative recall) 과제는 모델이 시퀀스 내에서 특정 콘텐츠를 식별하고 기억하는 능력을 직접 측정하는 벤치마크다. 기존 LTI SSM 계열 모델들은 이 두 과제에서 모두 0%의 정확도로 완전히 실패한 반면, Mamba는 두 과제 모두 100% 정확도를 기록하며 트랜스포머 수준의 표현력을 입증했다.

"While prior LTI SSMs fail completely at selective copying and induction heads, Mamba solves both synthetic tasks with 100% accuracy, demonstrating full Transformer-level expressivity."
— 원문 링크

이 실험 결과는 Mamba 연구의 핵심 동기를 선명하게 보여준다. 선형 시간 복잡도를 유지하면서도, 입력 콘텐츠에 따라 동적으로 동작하는 선택 능력을 SSM에 부여하는 것 — 바로 이것이 Mamba가 해결하려는 근본 문제이자, 이 논문이 제시하는 패러다임 전환의 출발점이다.

선행 연구와의 패러다임 비교

기존 서브쿼드래틱 모델들의 구조를 살펴보면, S4와 H3, Hyena는 모두 연속 시간 상태 공간 이론에 뿌리를 둔 LTI 아키텍처다. 이들은 훈련 시 병렬 합성곱(convolution)으로, 추론 시 순환(recurrence)으로 동작할 수 있는 이중성을 갖지만, 핵심 파라미터인 상태 전이 행렬 A와 입력 행렬 B, 출력 행렬 C가 모두 입력과 무관한 고정값이다. RetNet과 RWKV도 마찬가지로, 게이팅 메커니즘을 통해 일부 선택성을 모사하지만 완전한 콘텐츠 의존적 동작과는 거리가 있다.

Mamba는 이 패러다임을 정면으로 뒤집는다. Mamba의 선택 메커니즘(Selection Mechanism)은 상태 공간 모델의 핵심 파라미터인 B, C, Δ(이산화 스텝 크기)를 입력 시퀀스의 함수로 동적으로 생성한다. 즉, 어떤 정보를 상태에 통합할지, 어떤 정보를 걸러낼지가 매 토큰마다 입력 콘텐츠에 따라 결정된다. 이를 통해 무관한 정보는 상태에서 빠르게 소멸시키고, 핵심 토큰은 시퀀스 전체에 걸쳐 상태 안에 영속적으로 보존할 수 있다.

"Selective SSMs allow the model to selectively filter out irrelevant information and remember important tokens indefinitely by letting the state parameters (B, C, Δ) be dynamic functions of the input."
— 원문 링크

아래 비교표는 주요 아키텍처들의 핵심 설계 축을 한눈에 대조한다. '입력 불변 파라미터 vs 입력 의존적 동적 파라미터'라는 분기점이 Mamba와 기존 모델들 사이의 가장 본질적인 차이임을 확인할 수 있다.

핵심 아키텍처 및 구현 실증

Mamba의 혁신은 크게 두 층위에서 이루어진다. 알고리즘 층위에서는 선택 메커니즘이 SSM의 표현력을 트랜스포머 수준으로 끌어올리고, 하드웨어 층위에서는 병렬 스캔 알고리즘이 선형 시간 복잡도를 실제 GPU 상에서 효율적으로 구현한다. 두 혁신은 상호 의존적이며, 어느 하나만으로는 Mamba의 실용성이 성립하지 않는다.

선택 메커니즘의 핵심은 이산화(discretization) 단계에 있다. 연속 시간 SSM의 파라미터 A, B를 이산 시퀀스에 적용하기 위한 스텝 크기 Δ가 입력의 선형 투영(linear projection)으로 결정되며, Zero-Order Hold(ZOH) 이산화 규칙을 통해 A̅, B̅가 매 스텝마다 갱신된다. 이로써 B, C, Δ 모두 입력 의존적 동적 함수가 되어, 모델은 콘텐츠에 따라 정보를 선별적으로 흡수하거나 망각한다.

"Selective SSMs allow the model to selectively filter out irrelevant information and remember important tokens indefinitely by letting the state parameters (B, C, Δ) be dynamic functions of the input."
— 원문 링크

그러나 파라미터가 입력마다 달라지면 고정 커널을 이용한 병렬 합성곱 트릭을 쓸 수 없다. 이를 해결하기 위해 Mamba는 하드웨어 인식 병렬 스캔(Hardware-aware Parallel Scan) 알고리즘을 도입한다. 핵심 아이디어는 중간 은닉 상태를 느린 HBM(High Bandwidth Memory)에 구체화하지 않고, GPU 칩 내의 빠른 SRAM 안에서 재귀 스캔을 수행한다는 것이다. 커널 퓨전(kernel fusion)과 역전파 시 재계산(recomputation) 기법을 결합하여 메모리 이동을 최소화하고, 동일 크기 트랜스포머 대비 최대 5배의 처리량 향상을 달성한다.

"Mamba introduces a hardware-aware algorithm that computes the selective scan recurrently in fast SRAM without materializing intermediate hidden states in slow HBM, achieving up to 5x higher throughput."
— 원문 링크

추론 단계에서 Mamba는 순환 모드로 동작하여 시퀀스 길이에 무관한 O(1) 크기의 고정 상태만 유지하면 된다. 트랜스포머의 KV 캐시가 시퀀스 길이에 비례해 선형 증가하는 것과 대조적이다. 아래 코드 실증은 이산화와 선택 스캔의 실제 구현을 단계별로 보여준다.

벤치마크 실험 결과 및 모델 품질

Mamba의 실험 검증은 언어, 오디오, 유전체(DNA)의 세 모달리티에 걸쳐 수행되어, 특정 도메인에 편향된 개선이 아님을 보여준다. 이 절에서는 각 도메인의 핵심 수치를 중심으로 Mamba의 실질적 우위를 분석한다.

언어 모델링 벤치마크에서 Mamba-3B 모델은 동일 파라미터 규모의 트랜스포머를 능가하는 것을 넘어, 파라미터 수가 두 배인 Transformer-6B 수준의 퍼플렉서티(perplexity)를 기록했다. 이는 선형 시간 복잡도를 유지하면서도 트랜스포머의 모델 품질을 실질적으로 따라잡을 수 있음을 보여주는 결정적 증거다. 오디오 생성 태스크(SC09 및 SaShiMi 벤치마크)와 유전체 서열 모델링(HyenaDNA와의 비교)에서도 Mamba는 동등하거나 우월한 성능을 기록하며 범용 시퀀스 모델로서의 가능성을 입증했다.

추론 처리량 측면에서는 하드웨어 인식 병렬 스캔의 효과가 수치로 명확히 나타난다. Mamba는 HBM과 SRAM 사이의 메모리 이동을 최소화하는 커널 퓨전 전략을 통해, 동일 크기의 트랜스포머 대비 최대 5배에 달하는 추론 처리량을 달성한다. 시퀀스 길이가 길어질수록 트랜스포머의 KV 캐시 메모리 요구량이 선형 증가하는 반면, Mamba는 고정 크기 상태만 유지하므로 이 격차는 더욱 벌어진다.

"Mamba introduces a hardware-aware algorithm that computes the selective scan recurrently in fast SRAM without materializing intermediate hidden states in slow HBM, achieving up to 5x higher throughput."
— 원문 링크

합성 벤치마크에서의 결과는 이 모든 실용적 성과의 기반이 무엇인지를 다시 한번 상기시킨다. Selective Copying과 Induction Heads 과제에서 기존 LTI SSM이 전혀 해결하지 못한 것과 달리, Mamba는 두 과제 모두 100%의 완벽한 정확도를 보였다. 이는 Mamba의 선택 메커니즘이 단순한 성능 향상이 아니라, 이전 아키텍처가 구조적으로 불가능했던 능력을 처음으로 가능케 했음을 의미한다.

"While prior LTI SSMs fail completely at selective copying and induction heads, Mamba solves both synthetic tasks with 100% accuracy, demonstrating full Transformer-level expressivity."
— 원문 링크

실무적 한계 및 후속 연구

Mamba가 선형 SSM의 고질적 문제를 돌파한 것은 분명하지만, 선택 메커니즘 자체가 내포하는 구조적 한계를 냉정히 짚을 필요가 있다. 기술을 실무에 적용하려는 독자라면 특히 이 부분을 주목해야 한다.

Mamba의 선택 메커니즘은 입력 시퀀스에 따라 전이 행렬 B, C, Δ를 동적으로 매개변수화함으로써, 무관한 정보를 필터링하고 핵심 정보를 영구히 유지하는 능력을 갖춘다. 이 강점은 합성 연상 회상 과제—Selective Copying과 Induction Heads—에서 명확히 드러난다. 기존 LTI SSM이 두 과제 모두에서 0%의 정확도로 실패한 반면, Mamba는 100% 완벽한 해결 능력을 보이며 트랜스포머 수준의 표현력을 입증했다.

"While prior LTI SSMs fail completely at selective copying and induction heads, Mamba solves both synthetic tasks with 100% accuracy, demonstrating full Transformer-level expressivity."
— 원문 링크

그러나 동전의 이면도 존재한다. B, C, Δ가 동적으로 결정되더라도 이 정보가 압축되어 저장되는 상태 벡터의 크기 N은 고정되어 있다. 이는 트랜스포머의 어텐션이 KV 캐시를 통해 시퀀스 전체를 명시적으로 보존하는 방식과 근본적으로 다른 트레이드오프를 만들어낸다. 트랜스포머는 O(n) 메모리를 쓰는 대신 임의의 위치 정보를 정확히 조회할 수 있지만, Mamba는 O(1) 메모리를 유지하는 대신 상태 압축 과정에서 정보 손실이 발생할 수 있다. 특히 긴 문서 전반에 걸쳐 임의로 분산된 다수의 사실을 동시에 정확히 조회해야 하는 인-컨텍스트 임의 사실 연상 회상(in-context associative retrieval) 태스크—예컨대 장문 QA나 멀티홉 추론—에서 이 고정 상태 용량(fixed state capacity)의 한계가 두드러진다.

이를 보완하기 위한 후속 연구로 Jamba 등 하이브리드 아키텍처가 등장했다. Jamba는 Mamba 블록과 트랜스포머 어텐션 레이어를 혼합하여 Mamba의 처리량 효율성과 트랜스포머의 정밀한 사실 조회 능력을 모두 확보하려는 접근이다. 이는 역설적으로 Mamba 단독으로는 트랜스포머를 완전히 대체하기 어렵다는 현실적 인식을 반영한다. Mamba를 평가할 때는 이처럼 구조적 강점과 한계를 함께 이해하는 균형 잡힌 시각이 중요하다.