L·LLM Daily Lab
DAY 32 / 50
전체 목록
DAY 32텍스트 생성·훈련·검증 분리

검증 점수 읽는 법

성능을 확인할 때 정보가 새어 들어가는 경우를 살핍니다.

18–20분 조작형 실험 확인 퀴즈

핵심 개념

훈련 데이터로 파라미터를 조정하고, 별도 검증 데이터로 일반화 상태를 살핍니다. 최종 평가 데이터는 모델과 설정을 다 고른 뒤 확인하는 편이 좋습니다.

검증 문장이 훈련에 중복되어 있으면 실제로 처음 보는 문제를 푸는 능력을 과대평가할 수 있습니다. 숫자 하나보다 평가 데이터의 출처와 구성도 함께 봅니다.

좋은 훈련 성적만으로 일반화를 판단하지 않습니다.

작은 숫자로 따라가기

01

훈련 손실 0.1, 검증 손실 0.2인 모델 A가 있습니다.

02

다른 모델 B는 훈련 0.05, 검증 0.5입니다.

03

B의 훈련 점수는 좋지만 새 데이터 성적은 나쁩니다.

직접 실험해 보기

훈련·검증 막대를 비교해 새 데이터 성적이 악화되는 지점을 찾으세요.

LIVE EXPERIMENT · 09

평가 기준을 바꿔 보기

MODEL A65/ 100

강점과 비용은 같은 숫자가 아닙니다.

MODEL B53/ 100

평가 질문을 바꾸면 순위도 달라집니다.

YOUR NOTES · 3 MIN

오늘의 변화를 내 말로 설명하기

무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?

메모는 이 브라우저에만 저장됩니다.

오늘의 이해 확인

모델 선택 후 마지막 성능 확인에 쓰는 데이터는?

FURTHER READING

개념 원문

오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.

An Open Source Data Contamination Report for Large Language ModelsLi et al. (2023)

이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.