DAY 28데이터와 튜닝·교차 엔트로피 손실
정답 토큰의 놀람
정답에 낮은 확률을 주면 왜 손실이 큰지 봅니다.
01 / UNDERSTAND
핵심 개념
다음 토큰 학습에서는 실제 정답 토큰에 모델이 준 확률을 살핍니다. 그 확률이 낮으면 -log(확률)이 커져 손실이 커집니다.
모델은 모든 후보를 똑같이 맞출 수 없으므로, 주어진 문맥에서 실제 다음 토큰에 더 높은 확률을 주도록 파라미터를 조정합니다.
학습 손실은 정답 토큰에 준 확률을 평가합니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
정답이 ‘고양이’일 때 모델 확률이 0.8이라고 합시다.
02
다른 모델이 정답에 0.1을 줬다면 더 큰 손실을 받습니다.
03
정답 확률이 1에 가까워질수록 이 예제의 손실은 0에 가까워집니다.
03 / EXPLORE
직접 실험해 보기
정답 후보의 확률을 움직여 손실 값의 변화를 관찰하세요.
LIVE EXPERIMENT · 07
다음 토큰 분포 바꾸기
“오늘 날씨는 ▌”
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
정답 토큰 확률이 낮아지면 손실은?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
Attention Is All You NeedVaswani et al. (2017)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.