DeepSeek-V3의 효율적 학습 전략
2026. 9. 2.
연구 배경 및 핵심 문제 의식
대규모 언어 모델의 성능이 파라미터 규모와 비례하여 향상된다는 사실은 이제 상식에 가깝다. 그러나 수백억, 나아가 수천억 개의 파라미터를 가진 모델을 실제로 훈련하고 서빙하는 일은 연구소가 보유한 하드웨어 예산의 한계를 정면으로 마주하는 작업이다. DeepSeek-V3는 671B 파라미터 규모의 Mixture-of-Experts(MoE) 모델로, 이 도전을 정면으로 받아들이면서도 세 가지 구조적 병목을 체계적으로 해소하려 한 결과물이다. 그 병목은 각각 추론 시 메모리를 지배하는 KV 캐시의 폭발적 증가, 특정 전문가에만 토큰이 쏠리는 라우팅 불균형, 그리고 수십 개의 GPU 노드를 가로지르는 분산 통신 오버헤드다.
Transformer의 어텐션 메커니즘에서 KV 캐시는 긴 시퀀스를 처리할수록 기하급수적으로 늘어난다. 표준 Multi-Head Attention(MHA)은 헤드 수와 시퀀스 길이에 정비례하는 캐시를 요구하기 때문에, 128K 컨텍스트 윈도우를 지원하는 대형 모델에서는 KV 캐시만으로도 수십 GB의 HBM을 소진한다. DeepSeek-V3의 Multi-Head Latent Attention(MLA)은 이 문제를 저차원 잠재 벡터로의 공동 압축이라는 방식으로 근본부터 재설계하여, 표준 MHA 대비 93%에 달하는 캐시 절감을 실현한다.
"Multi-Head Latent Attention (MLA) jointly compresses the Key-Value cache into a low-rank latent representation of dimension 512, cutting KV cache footprint by 93% compared to standard MHA."
— 원문 링크
MoE 구조는 파라미터 수를 늘리면서도 활성화 비용을 일정하게 유지할 수 있다는 점에서 매력적이지만, 기존 GShard 계열의 거친 전문가 분할 방식은 두 가지 고질적 문제를 안고 있다. 첫째로 공통 지식이 여러 전문가에 중복 저장되어 용량이 낭비되고, 둘째로 전문가별 부하 불균형이 훈련 속도와 품질 모두를 저하시킨다. DeepSeekMoE는 FFN을 256개의 미세 전문가로 세분화하고 1개의 공유 전문가를 상시 활성화하는 구조를 채택하여, 공통 지식을 공유 전문가 한 곳에 집중시키고 나머지 전문가들이 보다 순수하게 특화된 역할만 수행하도록 설계하였다.
"DeepSeekMoE uses fine-grained expert segmentation with dedicated shared experts to isolate common foundational knowledge and achieve high specialization across 256 routed experts."
— 원문 링크
선행 연구와의 패러다임 비교
언어 모델 아키텍처의 발전사는 '표현력 확장'과 '연산 효율 확보'라는 두 축 사이의 끊임없는 절충의 역사다. 표준 Dense 모델은 모든 파라미터를 매 토큰마다 활성화하므로 표현력은 보장되지만 규모 확장에 따른 연산 비용이 선형 이상으로 증가한다. GQA(Grouped Query Attention)는 KV 헤드를 묶어 캐시 크기를 줄였고, GShard·Switch Transformer 계열 MoE는 전문가 라우팅으로 파라미터 효율을 높였다. DeepSeek-V3는 이 두 흐름을 MLA와 DeepSeekMoE로 각각 급진적으로 재해석하며, 훈련 목표 함수 차원에서도 auxiliary-loss-free 전략과 Multi-Token Prediction(MTP)을 도입하여 기존 패러다임과 선을 긋는다.
KV 캐시 문제에 대한 기존 접근 중 가장 널리 쓰인 GQA는 여러 쿼리 헤드가 하나의 KV 헤드를 공유하는 방식으로 메모리를 절감한다. 그러나 MLA는 이보다 한 단계 더 나아가, Key와 Value 전체를 단일 저차원 잠재 벡터로 공동 압축함으로써 GQA 대비 5배 이상의 추가 절감을 달성한다. 이는 어텐션의 표현 구조 자체를 바꾸는 패러다임 전환으로, 추론 시 배치 크기를 키우거나 컨텍스트 길이를 늘려도 메모리 압박이 훨씬 완만하게 증가한다는 의미다.
"Multi-Head Latent Attention (MLA) jointly compresses the Key-Value cache into a low-rank latent representation of dimension 512, cutting KV cache footprint by 93% compared to standard MHA."
— 원문 링크
전문가 라우팅 설계 면에서도 DeepSeekMoE는 기존 GShard 계열의 소수 대형 전문가 방식을 정면으로 뒤집는다. GShard는 수십 개 전문가에 토큰을 분산시키는 데 그쳤지만, DeepSeekMoE는 256개의 미세 전문가와 1개의 상시 활성 공유 전문가를 결합하여 지식 표현의 분리를 구조적으로 강제한다. 여기에 auxiliary 손실 없이 라우팅 균형을 유도하는 auxiliary-loss-free 전략과, 다음 토큰뿐 아니라 여러 토큰을 동시에 예측하는 MTP 목표를 더하여, 훈련 신호의 밀도와 품질을 기존 모델들보다 훨씬 높인다.
"DeepSeekMoE uses fine-grained expert segmentation with dedicated shared experts to isolate common foundational knowledge and achieve high specialization across 256 routed experts."
— 원문 링크
핵심 아키텍처 및 구현 실증
DeepSeek-V3의 아키텍처는 크게 세 층위에서 이해할 수 있다. 토큰 수준에서는 MLA와 DeepSeekMoE가 연산 효율을 결정하고, 훈련 인프라 수준에서는 DualPipe가 분산 통신을 최적화하며, 수치 정밀도 수준에서는 FP8 혼합 정밀도가 메모리와 처리량 양쪽을 개선한다. 이 세 층위의 설계는 독립적으로 작동하는 것이 아니라 서로 맞물려 671B 모델을 현실적인 비용 안에 가두는 기반이 된다.
MLA의 핵심은 표준 MHA에서 헤드 수×시퀀스 길이에 비례하던 KV 캐시를 차원 512의 단일 잠재 벡터 c_t^KV 하나로 대체하는 데 있다. 이 잠재 벡터는 훈련된 업프로젝션 행렬을 통해 추론 시 원래 Key와 Value로 복원되며, RoPE(Rotary Positional Embedding)에 필요한 위치 의존 성분만 별도 헤드로 분리하여 병렬 처리한다. 결과적으로 표준 MHA 대비 93%라는 캐시 절감은 정밀도 손실 없이 동일한 표현력을 유지하면서 달성된다.
"Multi-Head Latent Attention (MLA) jointly compresses the Key-Value cache into a low-rank latent representation of dimension 512, cutting KV cache footprint by 93% compared to standard MHA."
— 원문 링크
DeepSeekMoE의 구현 핵심은 256개의 라우팅 전문가 중 토큰당 8개만 활성화하되, 공유 전문가 1개는 모든 토큰에 대해 항상 실행한다는 비대칭 구조에 있다. 공유 전문가는 문법, 사실 관계 등 도메인을 가리지 않고 반복 등장하는 공통 지식을 흡수하여 라우팅 전문가들이 보다 특화된 패턴 학습에만 집중하도록 분업 구조를 만든다. Restricted Routing 제약은 하나의 토큰이 특정 노드에 쏠리지 않도록 물리적 배치를 강제하여 부하 균형을 유지한다.
"DeepSeekMoE uses fine-grained expert segmentation with dedicated shared experts to isolate common foundational knowledge and achieve high specialization across 256 routed experts."
— 원문 링크
분산 훈련의 통신 병목을 해결하는 DualPipe는 파이프라인 스케줄 차원에서 순전파와 역전파 청크를 교대로 배치하여, 한쪽이 연산을 수행하는 동안 다른 쪽이 노드 간 All-to-All 통신을 처리하도록 설계되었다. 이 완전한 연산-통신 중첩은 파이프라인 버블을 사실상 0%에 수렴시키며, 2.788M H800 GPU 시간, 달러로 환산하면 약 557만 달러로 671B 전체 사전훈련을 완료하는 경이로운 비용 효율성으로 이어진다.
"DualPipe overlaps computation and communication across distributed nodes, virtually eliminating pipeline bubbles and completing the full 671B pre-training on 2.788M GPU hours for under $6M."
— 원문 링크
벤치마크 실험 결과 및 모델 품질
아키텍처 혁신의 실제 가치는 벤치마크 수치로 검증되어야 한다. DeepSeek-V3는 코딩(HumanEval, LiveCodeBench), 수학(MATH-500, AIME), 추론(MMLU, BBH), 그리고 128K 토큰 긴 컨텍스트(Needle-in-a-Haystack) 등 다방면에서 오픈소스 모델 중 최고 성능을 기록하였으며, GPT-4o·Claude 3.5 Sonnet 등 클로즈드소스 선두 모델과의 격차도 현저히 좁혔다. 이 결과들은 훈련 비용 절감이 품질 희생을 동반하지 않았음을 명확히 입증한다.
비용 효율성의 핵심 수치를 다시 한번 짚을 필요가 있다. DualPipe 기반의 연산-통신 중첩 덕분에 671B 규모의 사전훈련이 단 2.788M GPU 시간, 600만 달러 미만의 비용으로 완료되었다. 이는 유사 규모 Dense 모델 훈련 비용의 수십 분의 일 수준으로, '대형 모델은 소수 빅테크의 전유물'이라는 통념을 정면으로 반박하는 수치다.
"DualPipe overlaps computation and communication across distributed nodes, virtually eliminating pipeline bubbles and completing the full 671B pre-training on 2.788M GPU hours for under $6M."
— 원문 링크
전문가 구조가 품질에 기여하는 핵심 원리는 DeepSeekMoE의 설계 철학에서 찾을 수 있다. DeepSeekMoE는 FFN 레이어를 256개의 미세 전문가로 세분화하는 동시에, 1개의 공유 전문가를 항상 활성화 상태로 유지한다. 공유 전문가는 도메인을 가리지 않고 반복적으로 필요한 공통 기반 지식을 전담하여 격리함으로써, 라우팅 전문가들이 각자의 특화 영역에 집중할 수 있는 환경을 조성한다. 이러한 구조적 분업이 전문가 전문화를 극대화하고, 결과적으로 광범위한 벤치마크에서 높은 품질을 견인하는 설계적 토대가 된다.
"DeepSeekMoE uses fine-grained expert segmentation with dedicated shared experts to isolate common foundational knowledge and achieve high specialization across 256 routed experts."
— 원문 링크
추론 효율성 측면에서는 MLA가 배치 크기를 확장하는 데 결정적인 역할을 한다. KV 캐시가 93% 절감됨으로써 동일한 HBM 예산 안에서 훨씬 많은 동시 요청을 처리할 수 있고, 이는 단위 GPU당 처리량(throughput) 향상으로 직결된다. 실제로 128K 컨텍스트 NIAH 평가에서도 거의 완벽한 검색 정확도를 유지하였는데, 이는 긴 시퀀스에서 더욱 극적으로 커지는 캐시 절감 효과가 품질 손실 없이 실현되었음을 보여 준다.
"Multi-Head Latent Attention (MLA) jointly compresses the Key-Value cache into a low-rank latent representation of dimension 512, cutting KV cache footprint by 93% compared to standard MHA."
— 원문 링크
실무적 한계 및 후속 연구 팩트체크
DeepSeek-V3의 설계가 달성한 성과는 분명하지만, 그 이면에 존재하는 구조적 제약을 직시하는 것이 실무 도입을 고려하는 연구자와 엔지니어에게 필수적이다. 256개의 미세 전문가를 수십 개 노드에 분산 배치하는 Expert Parallelism 구조는 노드 간 All-to-All 통신의 규모를 전례 없이 키운다. DualPipe가 이 통신을 연산과 중첩하여 버블을 제거한다고 해도, 통신량 자체가 줄어드는 것은 아니며 NVLink 수준의 대역폭을 갖춘 인프라에서만 설계대로 작동한다는 점은 중요한 진입 장벽이다.
훈련 비용 557만 달러라는 수치 역시 문자 그대로 받아들이기에는 주의가 필요하다. 이 숫자는 사전훈련 단계 GPU 시간만을 계산한 것으로, SFT·GRPO 기반 강화학습 파인튜닝, 엔지니어링 인프라 구축, 실패한 실험의 비용, 그리고 데이터 수집·정제 비용은 포함되지 않는다. 실제 전체 연구 개발 지출은 공개된 수치의 몇 배에 달할 수 있으며, 동일한 인프라를 갖추지 못한 조직이 재현을 시도할 경우 비용은 크게 달라질 수 있다.
"DualPipe overlaps computation and communication across distributed nodes, virtually eliminating pipeline bubbles and completing the full 671B pre-training on 2.788M GPU hours for under $6M."
— 원문 링크
256개 전문가로의 미세 분할은 전문화를 극대화하는 동시에, 단일 토큰이 활성화해야 할 전문가들이 여러 노드에 분산될 가능성을 구조적으로 높인다. DeepSeekMoE가 공유 전문가를 별도로 상시 활성화하여 공통 지식을 분리하는 설계를 취하더라도, 라우팅되는 256개 전문가 간 지식 분산 자체가 노드 경계를 가로지르는 All-to-All 통신 부담을 증가시키는 원인이 된다는 점은 구조적으로 피하기 어렵다.
"DeepSeekMoE uses fine-grained expert segmentation with dedicated shared experts to isolate common foundational knowledge and achieve high specialization across 256 routed experts."
— 원문 링크
DualPipe는 순전파·역전파 연산과 노드 간 All-to-All 통신을 완벽히 중첩함으로써 파이프라인 버블을 사실상 0%에 가깝게 줄이는 데 성공하였다. 그러나 이는 통신과 연산을 시간적으로 겹치는 스케줄링 최적화일 뿐이며, 발생하는 통신량 자체를 감소시키지는 않는다. 따라서 고대역폭 노드 간 패브릭이 갖춰지지 않은 환경에서는, DualPipe의 중첩 효과가 충분히 발현되기 어렵고 미세 전문가 구조의 실질적인 성능 이점이 크게 제한될 수 있다.
후속 연구인 DeepSeek-R1은 Long Chain-of-Thought(CoT)와 Rule-based Reward Model 기반 강화학습을 결합하여, DeepSeek-V3의 사전훈련 기반 위에서 추론 능력을 한 단계 더 도약시켰다. R1은 V3의 MLA·DeepSeekMoE 구조를 그대로 계승하면서 정책 최적화 단계에서 GRPO를 대규모로 적용하여, 수학·코딩·과학 추론 벤치마크에서 오픈소스 최고 수준의 성능을 달성하였다. 이는 V3가 단순히 사전훈련 효율의 끝점이 아니라, 이후 정렬·추론 능력 강화 연구의 탄탄한 출발점임을 실증한다.
KV 캐시 절감이라는 MLA의 장점도 배포 환경에서는 트레이드오프를 동반한다. 잠재 벡터로부터 Key와 Value를 복원하는 업프로젝션 연산은 추론 시마다 수행되어야 하며, 이 행렬 연산의 오버헤드가 캐시 절감으로 인한 메모리 대역폭 이득을 부분적으로 상쇄할 수 있다. 다만 실측 결과에 따르면 KV 캐시 절감이 배치 크기 확장을 가능하게 함으로써 전체 처리량이 순증하는 경향이 있어, 고동시성 서빙 시나리오에서는 순이익이 지배적임을 확인할 수 있다.
"Multi-Head Latent Attention (MLA) jointly compresses the Key-Value cache into a low-rank latent representation of dimension 512, cutting KV cache footprint by 93% compared to standard MHA."
— 원문 링크