L·LLM Daily Lab
DAY 48 / 50
전체 목록
DAY 48통합과 확장·멀티모달 입력

이미지와 말도 토큰으로?

텍스트 밖의 정보를 모델에 연결하는 방법을 봅니다.

18–20분 조작형 실험 확인 퀴즈

핵심 개념

멀티모달 모델은 이미지나 음성 같은 입력을 처리할 수 있습니다. 입력 형태에 맞는 인코더나 패치·프레임 표현을 사용해 모델이 계산할 수 있는 숫자 시퀀스로 바꿉니다.

모든 모델이 같은 구조를 쓰지는 않습니다. 오늘의 핵심은 텍스트, 이미지, 음성의 원자료를 그대로 같은 토큰 ID로 취급하지 않고 변환 단계를 거친다는 점입니다.

모달리티마다 입력 변환 단계가 있습니다.

작은 숫자로 따라가기

01

이미지를 작은 패치들로 나눈다고 가정합니다.

02

각 패치가 숫자 표현으로 변환됩니다.

03

텍스트 질문과 함께 모델이 처리할 입력으로 결합됩니다.

직접 실험해 보기

텍스트와 이미지 입력이 각각 어떤 변환 단계를 거치는지 따라가세요.

LIVE EXPERIMENT · 05

단계를 눌러 흐름 따라가기

원본 이미지

픽셀 정보를 입력으로 받습니다.

YOUR NOTES · 3 MIN

오늘의 변화를 내 말로 설명하기

무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?

메모는 이 브라우저에만 저장됩니다.

오늘의 이해 확인

이미지를 모델에 넣을 때 보통 필요한 것은?

FURTHER READING

개념 원문

오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.

Flamingo: a Visual Language Model for Few-Shot LearningAlayrac et al. (2022)

이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.