토크나이저 비율을 사용하여 토큰 수를 대략적인 단어 수와 글자 수로 변환한다. 영어 텍스트는 평균적으로 단어당 약 1.33 토큰, 토큰당 약 4글자다.
입력
토큰
변환할 토큰 수다. 토큰은 모델 토크나이저가 생성하는 텍스트의 한 조각으로, 흔히 몇 글자 길이의 단어 일부다.
토크나이저 비율
≥ 0.1
단어당 평균 토큰 수다. 영어 산문은 단어당 약 1.33 토큰을 평균으로 하며, 코드와 비영어권 문자는 더 높은 경향이 있다.
≥ 0.1
토큰당 평균 글자 수다. 영어 텍스트는 토큰당 약 4글자를 평균으로 하지만, 이는 토크나이저와 내용에 따라 달라진다.
결과
값을 입력하면 계산 결과가 표시됩니다.
대략적인 단어 수로, 1,000를 단어당 1.33 토큰으로 나누어 계산한다.
세부 정보
대략적인 글자 수로, 1,000에 토큰당 4 글자를 곱하여 계산한다.
토큰이란
토큰은 언어 모델이 읽고 생성하는 텍스트의 단위다. 토크나이저는 원시
텍스트를 고정된 어휘 집합의 항목으로 분할하며, 각 항목은 일반적으로 짧은
조각이다. 흔한 단어 전체, 어간, 접미사, 문장 부호, 또는 드문 단어의 몇
글자가 그 예다. 모델은 사용량을 단어나 글자가 아니라 토큰으로 과금하고
제한하므로, 토큰과 더 익숙한 단어 및 글자 수 사이를 변환하려면 토크나이저가
산출하는 평균 비율이 필요하다.
변환 비율
영어 산문에는 두 가지 경험적 평균이 흔히 쓰인다. 단어와 토큰은 대략 단어당
1.33 토큰, 동등하게는 토큰당 약 0.75 단어로 대응한다. 글자는 토큰당 약
4 글자로 대응한다. 토큰 수를 , 단어당 토큰 비율을 , 토큰당 글자
비율을 라 하면 다음과 같다.
w=rwn,c=n⋅rc
단어 수는 비율로 나누는데, 단어당 토큰이 많을수록 같은 토큰 예산에서 단어가
적어지기 때문이다. 글자 수는 곱하는데, 각 토큰이 대략 일정한 글자 수를 담기
때문이다.
계산 예시
기본 비율 과 에서 평범한 영어 텍스트 n = 1000
토큰을 생각한다.
w=1.331000≈752 words,c=1000⋅4=4000 characters
따라서 1000 토큰 분량은 대략 752 단어와 4000 글자로, 산문 몇 문단이며
줄 간격을 둔 텍스트로 한 페이지 반 정도의 규모다. 이 수치는 추정값이다.
특정 구절의 실제 분할은 평균과 다르며, 단어 수는 가장 가까운 정수 단어로
반올림된다.
변동 요인
이 비율은 보편적인 상수가 아니다. 세 가지 요인에 따라 달라진다.
언어. 토크나이저가 덜 효율적으로 표현하는 문자, 즉 다수의 비라틴
문자나 형태가 풍부한 언어는 단어당 토큰을 더 많이 산출하여 토큰당 단어
수치를 낮춘다.
콘텐츠 유형. 소스 코드와 표, 수학 표기, 숫자나 드문 기호가 빽빽한
텍스트는 흐르는 산문보다 더 많은 토큰으로 쪼개지며, 를 높이고 를
낮춘다.
토크나이저. 모델 계열마다 자체 어휘를 사용하므로 같은 텍스트라도 모델에
따라 토큰 수가 다르다. 여기의 비율은 영어 평균이며, 정확한 수치는 대상
모델의 토크나이저로 텍스트를 처리해야 얻을 수 있다.
활용
토큰-단어 변환은 주로 작성된 산출물과 그것이 소비하는 토큰 예산 사이를
옮기는 데 쓰인다. 단어 단위의 목표 길이를 대략적인 토큰 수로 환산하여
컨텍스트 윈도 적합성 계산기로 모델의 한도와 대조하거나,
토큰 비용 계산기로 지출을 추정할 수 있다. 비율이 평균이므로
결과는 정밀한 측정값이 아니라 계획용 추정값으로 다루고, 수치가 엄격한 한도에
가까울 때는 여유를 확보해야 한다.
자주 묻는 질문 (FAQ)
한 단어는 몇 토큰인가
영어 산문은 단어당 약 1.33 토큰을 평균으로 하며, 이는 토큰당 약 0.75 단어와 같다. 정확한 비율은 어휘와 문장 부호, 토크나이저에 따라 달라진다. 전문 텍스트와 코드, 비영어권 문자는 흔히 단어당 더 많은 토큰을 생성한다.
한 토큰은 몇 글자인가
토큰 하나는 평균적으로 영어 기준 약 4글자에 해당한다. 흔한 단어는 단일 토큰일 수 있는 반면, 드문 단어와 숫자, 기호는 여러 토큰으로 나뉘어 토큰당 글자 수를 낮춘다.
변환이 근삿값에 그치는 이유는 무엇인가
토큰화는 텍스트를 고정된 어휘 집합에 대응시키는 모델별 알고리즘으로 수행된다. 모델마다 서로 다른 어휘를 사용하므로 같은 텍스트라도 토큰 수가 달라진다. 여기의 비율은 평균값이며, 정확한 수치는 대상 모델의 토크나이저로 텍스트를 처리해야 얻을 수 있다.
면책조항
토큰화는 모델 토크나이저에 따라 달라지며 언어와 내용에 따라 변동한다. 단어 수와 글자 수는 평균 비율에서 나온 근삿값이며 정확한 수치가 아니다. 정확한 값은 제공업체의 토크나이저를 사용해야 한다.