데모 1 · 모델의 크기는 다이얼(파라미터) 수

단어 맞히기에서 본 다이얼 판을 기억하나요? 모델이 크다는 건 이 다이얼(파라미터)이 많다는 뜻이에요. 모델을 골라 다이얼 수와 점수가 어떻게 달라지는지 비교해 보세요.

다이얼 판 (파라미터)

학습이란 이 다이얼들을 조금씩 돌려 맞추는 일이에요.

다이얼이 10배면 점수도 10배?

가로축은 다이얼 수(한 칸 갈 때마다 10배), 세로축은 종합 성능 지수예요.

실제 다이얼 수는 회사들이 공개하지 않아요. 여기서는 "작은 모델일수록 다이얼이 적다"는 상대 크기만 어림 모형으로 보여줘요. 점수는 데모 3의 종합 성능 지수와 같아요.

데모 2 · 같은 100만 토큰, 가격은 최대 10배

AI 회사는 글자 수 대신 토큰 수로 요금을 매겨요. 같은 회사의 모델인데도 어떤 모델이냐에 따라 100만 토큰당 가격이 10배까지 벌어져요.

입력 토큰 가격 (100만 토큰당)

AI에게 보내는 글, 즉 질문과 자료의 값이에요.

출력 토큰 가격 (100만 토큰당)

AI가 만들어 내는 답의 값이에요. 입력보다 5배 비싸요.

단위는 미국 달러이고 정가 기준이에요. 두 그래프의 눈금은 서로 달라요.

데모 3 · 성능과 속도는 얼마나 다를까?

가격이 10배라고 성능도 10배는 아니에요. 종합 성능 지수는 2배 남짓 차이인데 가격은 10배 차이가 나요. 대신 작은 모델일수록 답이 훨씬 빨리 나와요.

종합 성능 지수 (100점 만점)

코딩, 과학, 추론 등 여러 시험을 합산한 점수예요.

상대 속도: 토큰 만들기 경주

작은 모델일수록 토큰 하나를 만드는 계산이 적어서 답이 빨리 나와요. 같은 시간 동안 누가 토큰을 많이 만드는지 지켜보세요. (어림 연출)

성능 지수는 Artificial Analysis Intelligence Index v4.1.1(2026년 8월)에서 각 모델의 가장 높은 추론 설정 기준이에요. 가장 비싼 Fable 5가 1등이 아닌 게 눈에 띄죠? 과제 종류와 측정 환경에 따라 순위는 달라질 수 있어요.

데모 4 · 작업에 맞는 모델 고르기

작업을 하나 골라 보세요. 모델마다 비용이 얼마나 드는지, 성능은 충분한지 비교해 볼 수 있어요. 핵심은 가장 비싼 모델이 아니라 딱 맞는 모델을 고르는 거예요.

핵심 개념

비교에서 방금 본 것들, 궁금한 개념을 눌러 보세요

자료 출처와 기준일