DAY 35텍스트 생성·지도 미세조정
지시를 따르도록 조정하기
다음 토큰 예측 모델을 대화 형식에 맞춥니다.
01 / UNDERSTAND
핵심 개념
지도 미세조정은 질문과 바람직한 답변 같은 예제로 추가 학습하는 단계입니다. 기반 모델의 언어 능력을 특정 형식과 과제에 더 잘 맞추는 데 사용합니다.
이 과정도 본질적으로 토큰 예측 손실을 이용할 수 있지만, 데이터가 일반 텍스트에서 지시·응답 예제로 달라집니다. 좋은 형식의 답변과 사실 정확성은 별도로 평가해야 합니다.
지시 조정은 모델의 답변 행동을 데이터로 다듬습니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
‘요약해 줘’라는 지시와 좋은 요약 예제를 준비합니다.
02
모델이 답변 토큰을 예측하며 오차를 줄입니다.
03
다른 문서에도 적절한 요약을 하는지 평가합니다.
03 / EXPLORE
직접 실험해 보기
기반 모델과 지시 조정 모델의 입력·출력 형식을 비교하세요.
LIVE EXPERIMENT · 05
단계를 눌러 흐름 따라가기
기반 모델
사전학습한 모델에서 시작합니다.
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
지도 미세조정의 대표적 데이터는?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
Training language models to follow instructions with human feedbackOuyang et al. (2022)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.