1편
자연어처리 · LLM 정렬 · 강화학습 · 파인튜닝
2026. 9. 2.
연구 배경 및 핵심 문제 의식 대규모 언어 모델(LLM)이 사람의 의도에 부합하도록 행동하게 만드는 일, 이른바 '정렬(alignment)' 문제는 오늘날 AI 연구의 핵심 과제다. 지금까지 가장 널리 쓰인 접근법은 인간 피드백 기반 강화학습( )이다. 는 크게 세 단계로 나뉜다. 먼저 ( )으로 기본 역량을 갖춘 정책