내가 보낸 것
전용 모델
언어 모델 (LLM)
이 페이지는 원리를 보여 주는 모형이에요. 조각 64개, 숫자 3개 같은 값은 실제 모델의 토큰 수나 요금이 아니고, 답변도 미리 써 둔 예시예요.
네 가지 데모
순서대로 보면 좋아요. 카드를 누르면 그 데모로 바뀌어요.
그래서 어떻게 할까요?
데모에서 본 것을 실제로 AI를 쓸 때 어떻게 적용할지 정리했어요
플랫폼·모델을 고를 때 확인할 것
- 사진을 읽을 수 있나요? 이미지 입력을 지원하는 모델인지 확인해요.
- 목소리를 직접 듣나요, 받아쓰기만 하나요? 받아쓰기라면 말투·억양은 전달되지 않아요.
- 그림을 만들 수 있나요? 그건 언어 모델의 능력인지, 옆에 붙은 별도 도구인지 구분해요.
- 목소리로 답하나요? 음성 입력과 음성 출력은 따로 확인해야 해요.
같은 서비스라도 고른 모델·모드에 따라 달라요. "된다"는 기능이 어느 모델의 능력인지 확인하세요.
AI에게 정보를 줄 때
- 글이 있으면 글로. 표·문서·코드는 캡처하지 말고 복사해서 붙여 넣어요.
- 글씨가 든 캡처는 되도록 피하기. 또렷하면 읽긴 하지만, 작거나 흐린 글씨는 틀리기 쉽고 사진 한 장이 글 수십 배의 토큰을 써요.
- 사진이어야 하는 것만 사진으로. 그림, 도면, 현장 사진처럼 말로 옮기기 어려운 것만요.
- 음성은 받아쓴 글을 확인. 억양·강조는 사라지니 중요한 뜻은 글로 덧붙여요.
- 사진 수정은 편집 도구로. AI 생성은 원본을 참고해 새로 그리는 것이라 세부가 흔들려요.
이 페이지가 근거로 삼은 공식 문서 (확인일: 2026-09-13)
- Claude Vision 문서: 이미지를 28×28픽셀 조각(visual token)으로 읽고, 1000×1000 사진 한 장이 토큰 1,296개예요. 작거나 흐린 글씨, 축소된 이미지에서 실수할 수 있다고 안내하고, Claude는 이미지를 생성·편집하지 않는다고 명시해요.
- OpenAI 이미지·비전 문서: 32×32픽셀 조각 또는 512픽셀 타일로 토큰을 계산해요. 작은 글씨·정확한 위치·개수 세기가 약점이고, 이미지 생성은 별도의 이미지 모델이 맡아요.
- OpenAI 음성 문서: 음성 인식 → 텍스트 모델 → 음성 합성을 잇는 길과, 소리를 직접 처리하는 길을 구분해요.
이 페이지의 조각 64개, 숫자 3개, 답변 문장은 원리를 보여 주기 위한 모형이에요. 실제 수치는 모델과 서비스마다 달라요.
핵심 개념
시뮬레이션에서 방금 본 것들, 궁금한 개념을 눌러 보세요
글 말고도 사진·소리처럼 여러 종류의 입력과 출력을 다루는 것을 멀티모달이라고 해요. 언어 모델 하나가 다 하는 게 아니라, 눈·귀·손 역할을 하는 전용 모델이 붙어서 팀으로 일하는 경우가 많아요. 그래서 "멀티모달 지원"이라고 해도 무엇을 어디까지 하는지 확인해야 해요.
사진이나 소리를 언어 모델이 읽을 수 있는 숫자 묶음으로 번역해 주는 모델이에요. 사진은 시각 인코더, 소리는 음성 인식 모델이 맡아요. 단어 맞히기에서 글자를 숫자로 바꾸던 그 자리에, 사진과 소리용 번역기가 하나 더 붙는 셈이에요.
글을 토큰으로 자르듯, 사진은 격자 모양의 조각(패치)으로 잘라요. 실제 조각은 28~32픽셀로 아주 작아서 또렷한 글씨는 잘 읽어요. 그래도 조각보다 작거나 흐린 것은 평균에 묻혀 사라져요. 그래서 작은 글씨, 축소된 캡처, 물건 개수 같은 세부를 틀리기도 해요. 소리는 공간 대신 시간을 짧게 잘라요.
사진을 읽는 능력과 만드는 능력은 별개예요. 언어 모델의 출력은 글자 토큰뿐이라 그림은 이미지 생성 모델이 따로 그려요. Claude는 공식 문서에서 이미지를 만들거나 편집하지 않는다고 밝히고, ChatGPT는 별도 이미지 모델을 붙여 써요. "수정"도 원본을 고치는 게 아니라 주문서를 보고 새로 그리는 것이라 세부가 자꾸 바뀌어요.
데모 2는 받아쓰기를 거치는 방식이에요. 소리를 글자로 바꾸지 않고 소리의 숫자 묶음을 바로 읽도록 학습한 모델도 있어서, 그런 모델은 말투나 배경 소리를 어느 정도 알아채요. 어느 쪽인지는 서비스와 모드마다 다르니 확인이 필요해요.
이 페이지의 조각 64개와 숫자 3개는 모형이에요. 실제 모델은 사진을 수천 개의 작은 조각으로 나누고 조각마다 수백 개의 숫자를 만들어요. 1000×1000 사진 한 장이 토큰 1,300개쯤이고, 모델마다 달라요. 그래도 글자만 읽는 뇌 앞에 번역기가 붙고, 번역하면서 정보가 흐려진다는 원리는 같아요.