DAY 32텍스트 생성·훈련·검증 분리
검증 점수 읽는 법
성능을 확인할 때 정보가 새어 들어가는 경우를 살핍니다.
01 / UNDERSTAND
핵심 개념
훈련 데이터로 파라미터를 조정하고, 별도 검증 데이터로 일반화 상태를 살핍니다. 최종 평가 데이터는 모델과 설정을 다 고른 뒤 확인하는 편이 좋습니다.
검증 문장이 훈련에 중복되어 있으면 실제로 처음 보는 문제를 푸는 능력을 과대평가할 수 있습니다. 숫자 하나보다 평가 데이터의 출처와 구성도 함께 봅니다.
좋은 훈련 성적만으로 일반화를 판단하지 않습니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
훈련 손실 0.1, 검증 손실 0.2인 모델 A가 있습니다.
02
다른 모델 B는 훈련 0.05, 검증 0.5입니다.
03
B의 훈련 점수는 좋지만 새 데이터 성적은 나쁩니다.
03 / EXPLORE
직접 실험해 보기
훈련·검증 막대를 비교해 새 데이터 성적이 악화되는 지점을 찾으세요.
LIVE EXPERIMENT · 09
평가 기준을 바꿔 보기
MODEL A65/ 100
강점과 비용은 같은 숫자가 아닙니다.
MODEL B53/ 100
평가 질문을 바꾸면 순위도 달라집니다.
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
모델 선택 후 마지막 성능 확인에 쓰는 데이터는?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
An Open Source Data Contamination Report for Large Language ModelsLi et al. (2023)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.