DAY 31텍스트 생성·데이터와 분포
무엇으로 사전학습할까
모델이 보는 텍스트가 능력의 범위를 바꿉니다.
01 / UNDERSTAND
핵심 개념
사전학습은 대량의 텍스트에서 다음 토큰 예측을 반복하는 단계입니다. 어떤 언어와 주제의 데이터를 얼마나 보았는지가 모델의 출력에 영향을 줍니다.
데이터의 품질과 중복, 개인정보, 저작권 같은 문제도 중요합니다. 학습 데이터의 출처와 구성을 모르면 모델의 한계를 해석하기 어렵습니다.
학습 데이터의 범위는 모델의 강점과 빈틈에 연결됩니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
과학 글만 많이 본 모델을 생각합니다.
02
요리 문장에 대한 다음 토큰 예측은 상대적으로 어려울 수 있습니다.
03
데이터 분포를 바꾸면 잘 다루는 주제도 바뀔 수 있습니다.
03 / EXPLORE
직접 실험해 보기
데이터 종류 카드를 바꿔 학습 분포와 평가 분포를 비교하세요.
LIVE EXPERIMENT · 10
데이터가 모델의 세계를 만든다
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
사전학습 데이터의 구성이 중요한 이유는?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
The Pile: An 800GB Dataset of Diverse Text for Language ModelingGao et al. (2020)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.