강좌 강좌
토큰 입문: 출력 토큰과 초당 토큰 수 읽는 법
AI 뉴스에서 '최대 초당 750토큰' 같은 표현을 봅니다. 여기서 말하는 토큰이 무엇이고, 그 숫자를 어떻게 읽어야 하는지 정리합니다.
한 문장으로 이해하기
출력 토큰은 대규모 언어모델이 사람과 상호작용하며 생성하는 개별 텍스트 조각을 가리킵니다. 대규모 언어모델(LLM, Large Language Model)은 여기서는 사람과 상호작용하며 텍스트를 생성하는 모델을 가리킵니다. 이 강좌를 마치면 출력 토큰의 뜻을 자기 말로 설명하고, 초당 출력 토큰 수와 ‘최대치’라는 표현의 의미를 해석하고, 프리뷰나 제공 범위 같은 적용 조건을 구분할 수 있습니다. 필요한 사전지식은 하나뿐입니다. 챗봇이 사람의 질문에 텍스트 답변을 만들어 준다는 정도의 경험이면 충분합니다.
왜 필요한가
최근 공개된 사례를 하나 보겠습니다. 오픈AI는 현지시간 2026년 8월 13일 GPT-5.6 솔용 ‘울트라패스트’ 모드의 제한적 프리뷰를 시작한다고 밝혔습니다. 오픈AI는 이 모드가 표준 처리 방식보다 최대 14배 빠르다고 설명했고, 제시된 최대 출력 속도는 초당 750토큰입니다. 이렇게 제시된 속도 수치를 이해하려면 출력 토큰의 뜻을 먼저 알아야 합니다. 토큰이 출력된 텍스트 조각을 세는 말이라는 점을 모르면 750이라는 숫자가 무엇을 센 값인지 알 수 없기 때문입니다.
어떻게 이루어지는가
초당 토큰 수치를 읽을 때는 다음 순서로 확인합니다.
- 그 토큰이 출력 토큰인지 확인합니다. 앞의 사례에서 750토큰은 모델이 만들어 내는 출력 쪽 수치입니다.
- 그 수치가 시간당이 아니라 초당 기준인지 확인합니다. 사례의 단위는 ‘초당’입니다.
- 그 값이 평균인지 최대치인지 확인합니다. 사례의 750토큰은 ‘최대’ 출력 속도로 제시된 값이므로 모든 요청에서 같은 속도가 나온다는 뜻은 아닙니다.
- 그 속도를 누가 언제 쓸 수 있는지 함께 확인합니다. 울트라패스트는 세레브라스와의 협력을 기반으로 한 제한적 프리뷰이며, 초기에는 선별된 고객에게 제한적으로 제공됩니다.
하나의 예시로 따라가기
가상 예시입니다. 온라인 쇼핑몰이 고객 문의 창구에 이런 빠른 모드를 붙이는 상황을 생각해 봅시다. 오픈AI가 전자상거래 활용 방안으로 제시한 것은 상품 질문 응답, 재고 확인, 개인화 추천입니다. 그래서 이 가상 쇼핑몰은 “이 신발 재고 있나요” 같은 문의에 답을 돌려주는 일에 쓰려 합니다. 이때 담당자가 읽어야 할 수치가 앞에서 본 최대 초당 750출력토큰입니다. 위의 4단계를 그대로 적용하면 이렇게 정리됩니다. 이 값은 출력 쪽 속도이고, 초당 기준이며, 최대치로 제시된 값이고, 제한적 프리뷰로 선별된 고객에게 제한적으로 제공됩니다. 따라서 이 가상 쇼핑몰은 ‘우리도 항상 이 속도가 나온다’가 아니라 ‘이 속도는 최대치이고 우리가 지금 쓸 수 있는지부터 확인해야 한다’는 결론에 이릅니다.
언제 쓰고 언제 쓰지 않는가
출처가 제시한 울트라패스트의 활용 분야는 사고 대응, 금융·보안 분석, 고객지원과 음성 서비스, 전자상거래, 연구와 실험입니다. 연구 쪽에서는 야간 일괄 실행에 맡기던 작업을 업무 중 반복 실험으로 바꿀 가능성이 제시됐습니다. 다만 이는 제시된 가능성이지 모든 작업에서 확인된 효과가 아닙니다. 적용 조건과 한계도 함께 봐야 합니다. 첫째, 초당 750토큰은 최대치로 제시된 값입니다. 둘째, 현재는 제한적 프리뷰 단계입니다. 셋째, 초기 제공 대상은 선별된 고객입니다. 넷째, 입력 자료가 작성된 시점에는 구체적인 가격과 정식 출시 일정이 공개되지 않았습니다. 다섯째, 오픈AI의 내부 사고 대응 활용에서도 실제 시스템의 최종 판단과 배포 책임은 엔지니어가 맡습니다. 즉 빠른 출력이 사람의 판단을 대신한다는 뜻은 아닙니다.
핵심 정리와 확인문제
출력 토큰은 언어모델이 상호작용 중에 만들어 내는 개별 텍스트 조각이고, 초당 출력 토큰 수는 그 출력이 나오는 속도를 나타내며, 그 수치는 최대치인지와 누가 쓸 수 있는지를 함께 확인해야 합니다.
확인문제
- 출력 토큰은 무엇을 가리키는 말인가요?
- 울트라패스트 모드에 제시된 ‘최대 초당 750토큰’은 무엇을 뜻하나요?
- 이 수치를 읽을 때 제공 조건으로 함께 확인해야 할 사실은 무엇인가요?
정답과 해설
- 정답: 대규모 언어모델이 사람과 상호작용하며 생성하는 개별 텍스트 조각입니다. 해설: 출력 토큰은 모델이 만들어 낸 텍스트를 세는 단위이므로, 속도 수치의 기준이 됩니다.
- 정답: 그 모드에서 제시된 최대 출력 속도가 1초에 750개의 출력 토큰이라는 뜻입니다. 해설: 최대치로 제시된 값이므로 모든 요청에서 항상 그 속도가 난다는 의미는 아닙니다.
- 정답: 울트라패스트가 제한적 프리뷰이며 초기에는 선별된 고객에게 제한적으로 제공된다는 점입니다. 해설: 가격과 정식 출시 일정은 입력 자료 작성 시점에 공개되지 않았으므로 이용 가능 여부부터 확인해야 합니다.