DAY 19Transformer 내부·인과적 Attention
미래를 가리는 마스크
다음 토큰을 예측할 때 미래 위치를 볼 수 없게 합니다.
01 / UNDERSTAND
핵심 개념
생성형 언어 모델은 앞의 토큰으로 다음 토큰을 예측합니다. 학습 중에도 현재 위치가 미래의 정답을 엿보면 안 됩니다.
인과 마스크는 미래 Key 위치의 점수를 Softmax 전에 가립니다. 따라서 첫 위치는 첫 위치만, 둘째 위치는 첫째와 둘째 위치까지만 참고합니다.
미래를 가리는 규칙이 생성 순서를 지킵니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
세 토큰 A·B·C를 놓습니다.
02
B 위치의 Query는 A와 B를 볼 수 있지만 C는 가립니다.
03
마스크 뒤 Softmax에서 C의 비중은 0이 됩니다.
03 / EXPLORE
직접 실험해 보기
마스크를 켜고 각 행에서 미래 칸이 사라지는지 확인하세요.
LIVE EXPERIMENT · 04
Attention 한 행을 해부하기
QUERY ↓ / KEY →나고양이본다
3××
13×
024
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
둘째 위치가 볼 수 있는 것은?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
Attention Is All You NeedVaswani et al. (2017)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.