Bldev's Blog

자연어처리

3편

프롬프트 엔지니어링 · 자연어처리 · AI 추론 · 모델 최적화

추가 학습 없이 스스로 개선하는 LLM: Self-Refine의 반복적 자기 피드백 전략

2026. 9. 2.

연구 배경 및 핵심 문제 의식 대형 언어 모델(LLM)은 놀라운 언어 생성 능력을 갖추고 있지만, 단 한 번의 추론 패스(forward pass)만으로 최선의 답변을 내놓는다는 암묵적 가정 아래 운용되어 왔다. 그러나 실제 작업 환경에서는 코드 작성, 수학적 추론, 대화 응답 생성처럼 복잡한 태스크일수록 첫 번째 시도의

자연어처리 · LLM 정렬 · 강화학습 · 파인튜닝

RLHF 없이 LLM 정렬하기: DPO가 보상 모델을 대체하는 방법

2026. 9. 2.

연구 배경 및 핵심 문제 의식 대규모 언어 모델(LLM)이 사람의 의도에 부합하도록 행동하게 만드는 일, 이른바 '정렬(alignment)' 문제는 오늘날 AI 연구의 핵심 과제다. 지금까지 가장 널리 쓰인 접근법은 인간 피드백 기반 강화학습( )이다. 는 크게 세 단계로 나뉜다. 먼저 ( )으로 기본 역량을 갖춘 정책

모델 학습 최적화 · 분산 학습 · AI 인프라 · 자연어처리

DeepSeek-V3의 효율적 학습 전략

2026. 9. 2.

연구 배경 및 핵심 문제 의식 대규모 언어 모델의 성능이 파라미터 규모와 비례하여 향상된다는 사실은 이제 상식에 가깝다. 그러나 수백억, 나아가 수천억 개의 파라미터를 가진 모델을 실제로 훈련하고 서빙하는 일은 연구소가 보유한 하드웨어 예산의 한계를 정면으로 마주하는 작업이다. 는 671B 파라미터 규모의 Mixture