DAY 48통합과 확장·멀티모달 입력
이미지와 말도 토큰으로?
텍스트 밖의 정보를 모델에 연결하는 방법을 봅니다.
01 / UNDERSTAND
핵심 개념
멀티모달 모델은 이미지나 음성 같은 입력을 처리할 수 있습니다. 입력 형태에 맞는 인코더나 패치·프레임 표현을 사용해 모델이 계산할 수 있는 숫자 시퀀스로 바꿉니다.
모든 모델이 같은 구조를 쓰지는 않습니다. 오늘의 핵심은 텍스트, 이미지, 음성의 원자료를 그대로 같은 토큰 ID로 취급하지 않고 변환 단계를 거친다는 점입니다.
모달리티마다 입력 변환 단계가 있습니다.
02 / WORKED EXAMPLE∑
작은 숫자로 따라가기
01
이미지를 작은 패치들로 나눈다고 가정합니다.
02
각 패치가 숫자 표현으로 변환됩니다.
03
텍스트 질문과 함께 모델이 처리할 입력으로 결합됩니다.
03 / EXPLORE
직접 실험해 보기
텍스트와 이미지 입력이 각각 어떤 변환 단계를 거치는지 따라가세요.
LIVE EXPERIMENT · 05
단계를 눌러 흐름 따라가기
원본 이미지
픽셀 정보를 입력으로 받습니다.
YOUR NOTES · 3 MIN
메모는 이 브라우저에만 저장됩니다.오늘의 변화를 내 말로 설명하기
무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?
04 / CHECK YOURSELF
오늘의 이해 확인
이미지를 모델에 넣을 때 보통 필요한 것은?
FURTHER READING
개념 원문
오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.
Flamingo: a Visual Language Model for Few-Shot LearningAlayrac et al. (2022)이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.