1편
모델 학습 최적화 · 분산 학습 · AI 인프라 · 자연어처리
2026. 9. 2.
연구 배경 및 핵심 문제 의식 대규모 언어 모델의 성능이 파라미터 규모와 비례하여 향상된다는 사실은 이제 상식에 가깝다. 그러나 수백억, 나아가 수천억 개의 파라미터를 가진 모델을 실제로 훈련하고 서빙하는 일은 연구소가 보유한 하드웨어 예산의 한계를 정면으로 마주하는 작업이다. 는 671B 파라미터 규모의 Mixture