L·LLM Daily Lab
DAY 31 / 50
전체 목록
DAY 31텍스트 생성·데이터와 분포

무엇으로 사전학습할까

모델이 보는 텍스트가 능력의 범위를 바꿉니다.

18–20분 조작형 실험 확인 퀴즈

핵심 개념

사전학습은 대량의 텍스트에서 다음 토큰 예측을 반복하는 단계입니다. 어떤 언어와 주제의 데이터를 얼마나 보았는지가 모델의 출력에 영향을 줍니다.

데이터의 품질과 중복, 개인정보, 저작권 같은 문제도 중요합니다. 학습 데이터의 출처와 구성을 모르면 모델의 한계를 해석하기 어렵습니다.

학습 데이터의 범위는 모델의 강점과 빈틈에 연결됩니다.

작은 숫자로 따라가기

01

과학 글만 많이 본 모델을 생각합니다.

02

요리 문장에 대한 다음 토큰 예측은 상대적으로 어려울 수 있습니다.

03

데이터 분포를 바꾸면 잘 다루는 주제도 바뀔 수 있습니다.

직접 실험해 보기

데이터 종류 카드를 바꿔 학습 분포와 평가 분포를 비교하세요.

LIVE EXPERIMENT · 10

데이터가 모델의 세계를 만든다

YOUR NOTES · 3 MIN

오늘의 변화를 내 말로 설명하기

무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?

메모는 이 브라우저에만 저장됩니다.

오늘의 이해 확인

사전학습 데이터의 구성이 중요한 이유는?

FURTHER READING

개념 원문

오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.

The Pile: An 800GB Dataset of Diverse Text for Language ModelingGao et al. (2020)

이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.