DAY 20Transformer 내부·가중합과 출력
Value를 섞어 새 표현으로
점수 계산의 목적이 무엇이었는지 완성합니다.
01 / UNDERSTAND
핵심 개념
Attention 비중은 각 Value를 얼마만큼 가져올지 정합니다. 위치별 Value 벡터에 비중을 곱해 더하면 현재 Query 위치의 새 표현이 됩니다.
높은 비중을 받은 위치의 정보가 더 크게 기여합니다. 하지만 출력은 여러 Value의 합이므로 한 토큰을 그대로 복사하는 계산과는 다릅니다.
Q·K로 고르고 V를 섞어 새 표현을 만듭니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
Value 두 개가 [1,0], [0,2]라고 가정합니다.
02
Attention 비중이 [0.75,0.25]이면 출력은 [0.75,0.5]입니다.
03
비중을 [0.25,0.75]로 바꾸면 출력은 [0.25,1.5]입니다.
03 / EXPLORE
직접 실험해 보기
비중을 바꾸며 출력 벡터가 어느 Value 쪽으로 이동하는지 보세요.
LIVE EXPERIMENT · 04
Attention 한 행을 해부하기
QUERY ↓ / KEY →나고양이본다
310
132
024
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
Attention 출력은 무엇으로 계산하나요?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
Attention Is All You NeedVaswani et al. (2017)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.