L·LLM Daily Lab
DAY 19 / 50
전체 목록
DAY 19Transformer 내부·인과적 Attention

미래를 가리는 마스크

다음 토큰을 예측할 때 미래 위치를 볼 수 없게 합니다.

18–20분 조작형 실험 확인 퀴즈

핵심 개념

생성형 언어 모델은 앞의 토큰으로 다음 토큰을 예측합니다. 학습 중에도 현재 위치가 미래의 정답을 엿보면 안 됩니다.

인과 마스크는 미래 Key 위치의 점수를 Softmax 전에 가립니다. 따라서 첫 위치는 첫 위치만, 둘째 위치는 첫째와 둘째 위치까지만 참고합니다.

미래를 가리는 규칙이 생성 순서를 지킵니다.

작은 숫자로 따라가기

01

세 토큰 A·B·C를 놓습니다.

02

B 위치의 Query는 A와 B를 볼 수 있지만 C는 가립니다.

03

마스크 뒤 Softmax에서 C의 비중은 0이 됩니다.

직접 실험해 보기

마스크를 켜고 각 행에서 미래 칸이 사라지는지 확인하세요.

LIVE EXPERIMENT · 04

Attention 한 행을 해부하기

QUERY ↓ / KEY →나고양이본다
3××
13×
024
YOUR NOTES · 3 MIN

오늘의 변화를 내 말로 설명하기

무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?

메모는 이 브라우저에만 저장됩니다.

오늘의 이해 확인

둘째 위치가 볼 수 있는 것은?

FURTHER READING

개념 원문

오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.

Attention Is All You NeedVaswani et al. (2017)

이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.