L·LLM Daily Lab
DAY 43 / 50
전체 목록
DAY 43실제 응용·과제와 지표

모델을 어떻게 평가할까

하나의 점수로 모델 전체를 설명할 수 없는 이유를 봅니다.

18–20분 조작형 실험 확인 퀴즈

핵심 개념

평가는 모델이 실제로 수행할 과제를 먼저 정하는 데서 시작합니다. 정답이 분명한 문제에는 정확도를, 열린 답변에는 별도의 기준과 사람 검토를 사용할 수 있습니다.

평가 점수는 문제 구성, 채점 방식, 데이터 오염 여부에 영향을 받습니다. 숫자를 볼 때는 어떤 질문에 대한 숫자인지 함께 읽어야 합니다.

평가는 과제와 채점 조건을 함께 설명해야 합니다.

작은 숫자로 따라가기

01

수학 문제 10개 중 8개를 맞혀 정확도 80%를 얻습니다.

02

하지만 긴 글 요약은 이 점수로 평가하지 않았습니다.

03

다른 과제에는 별도의 검증이 필요합니다.

직접 실험해 보기

평가 과제를 바꿔 같은 모델도 다른 점수를 받을 수 있음을 확인하세요.

LIVE EXPERIMENT · 09

평가 기준을 바꿔 보기

MODEL A65/ 100

강점과 비용은 같은 숫자가 아닙니다.

MODEL B53/ 100

평가 질문을 바꾸면 순위도 달라집니다.

YOUR NOTES · 3 MIN

오늘의 변화를 내 말로 설명하기

무엇을 조작했나요? 어떤 숫자나 그림이 달라졌나요? 그 이유는 무엇인가요?

메모는 이 브라우저에만 저장됩니다.

오늘의 이해 확인

정확도 80%로 단정할 수 없는 것은?

FURTHER READING

개념 원문

오늘의 작은 숫자 예제는 이 강의를 위해 작성했습니다. 아래 자료에서 실제 연구와 구현 설명을 확인할 수 있습니다.

An Open Source Data Contamination Report for Large Language ModelsLi et al. (2023)

이 자료는 개념 학습용입니다. 실제 모델의 구조와 학습 설정은 구현마다 다를 수 있습니다.