L·LLM Daily Lab
DAY 35 / 50
전체 목록
DAY 35텍스트 생성·지도 미세조정

지시를 따르도록 조정하기

다음 토큰 예측 모델을 대화 형식에 맞춥니다.

18–20분 조작형 실험 확인 퀴즈

핵심 개념

지도 미세조정은 질문과 바람직한 답변 같은 예제로 추가 학습하는 단계입니다. 기반 모델의 언어 능력을 특정 형식과 과제에 더 잘 맞추는 데 사용합니다.

이 과정도 본질적으로 토큰 예측 손실을 이용할 수 있지만, 데이터가 일반 텍스트에서 지시·응답 예제로 달라집니다. 좋은 형식의 답변과 사실 정확성은 별도로 평가해야 합니다.

지시 조정은 모델의 답변 행동을 데이터로 다듬습니다.

작은 숫자로 따라가기

01

‘요약해 줘’라는 지시와 좋은 요약 예제를 준비합니다.

02

모델이 답변 토큰을 예측하며 오차를 줄입니다.

03

다른 문서에도 적절한 요약을 하는지 평가합니다.

직접 실험해 보기

기반 모델과 지시 조정 모델의 입력·출력 형식을 비교하세요.

LIVE EXPERIMENT · 05

단계를 눌러 흐름 따라가기

기반 모델

사전학습한 모델에서 시작합니다.

YOUR NOTES · 3 MIN

오늘의 변화를 내 말로 설명하기

무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?

메모는 이 브라우저에만 저장됩니다.

오늘의 이해 확인

지도 미세조정의 대표적 데이터는?

FURTHER READING

개념 원문

오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.

Training language models to follow instructions with human feedbackOuyang et al. (2022)

이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.