내가 보낸 것

전용 모델

언어 모델 (LLM)

재생
표시

이 페이지는 원리를 보여 주는 모형이에요. 조각 64개, 숫자 3개 같은 값은 실제 모델의 토큰 수나 요금이 아니고, 답변도 미리 써 둔 예시예요.

네 가지 데모

순서대로 보면 좋아요. 카드를 누르면 그 데모로 바뀌어요.

그래서 어떻게 할까요?

데모에서 본 것을 실제로 AI를 쓸 때 어떻게 적용할지 정리했어요

플랫폼·모델을 고를 때 확인할 것

  • 사진을 읽을 수 있나요? 이미지 입력을 지원하는 모델인지 확인해요.
  • 목소리를 직접 듣나요, 받아쓰기만 하나요? 받아쓰기라면 말투·억양은 전달되지 않아요.
  • 그림을 만들 수 있나요? 그건 언어 모델의 능력인지, 옆에 붙은 별도 도구인지 구분해요.
  • 목소리로 답하나요? 음성 입력과 음성 출력은 따로 확인해야 해요.

같은 서비스라도 고른 모델·모드에 따라 달라요. "된다"는 기능이 어느 모델의 능력인지 확인하세요.

AI에게 정보를 줄 때

  • 글이 있으면 글로. 표·문서·코드는 캡처하지 말고 복사해서 붙여 넣어요.
  • 글씨가 든 캡처는 되도록 피하기. 또렷하면 읽긴 하지만, 작거나 흐린 글씨는 틀리기 쉽고 사진 한 장이 글 수십 배의 토큰을 써요.
  • 사진이어야 하는 것만 사진으로. 그림, 도면, 현장 사진처럼 말로 옮기기 어려운 것만요.
  • 음성은 받아쓴 글을 확인. 억양·강조는 사라지니 중요한 뜻은 글로 덧붙여요.
  • 사진 수정은 편집 도구로. AI 생성은 원본을 참고해 새로 그리는 것이라 세부가 흔들려요.
이 페이지가 근거로 삼은 공식 문서 (확인일: 2026-09-13)
  • Claude Vision 문서: 이미지를 28×28픽셀 조각(visual token)으로 읽고, 1000×1000 사진 한 장이 토큰 1,296개예요. 작거나 흐린 글씨, 축소된 이미지에서 실수할 수 있다고 안내하고, Claude는 이미지를 생성·편집하지 않는다고 명시해요.
  • OpenAI 이미지·비전 문서: 32×32픽셀 조각 또는 512픽셀 타일로 토큰을 계산해요. 작은 글씨·정확한 위치·개수 세기가 약점이고, 이미지 생성은 별도의 이미지 모델이 맡아요.
  • OpenAI 음성 문서: 음성 인식 → 텍스트 모델 → 음성 합성을 잇는 길과, 소리를 직접 처리하는 길을 구분해요.

이 페이지의 조각 64개, 숫자 3개, 답변 문장은 원리를 보여 주기 위한 모형이에요. 실제 수치는 모델과 서비스마다 달라요.

핵심 개념

시뮬레이션에서 방금 본 것들, 궁금한 개념을 눌러 보세요