대규모 언어 모델의 파라미터 수와 양자화 비트 폭으로부터 디스크 및 메모리 점유 용량을 추정합니다. 십진 기가바이트와 이진 기비바이트로 함께 표시합니다.
입력
모델
모델 파라미터 수(10억 단위). 가중치 파일 크기는 이 값에 정비례하므로, 동일한 정밀도에서 파라미터가 두 배인 모델은 용량도 대략 두 배가 됩니다.
가중치 하나를 저장하는 데 쓰는 비트 수. 전체 정밀도는 32비트이며, 일반적인 형식은 한 단계씩 크기를 절반으로 줄여 4비트 양자화는 FP32의 8분의 1 공간에 파라미터를 저장합니다.
결과
값을 입력하면 계산 결과가 표시됩니다.
가중치 파일 크기를 십진 기가바이트로 추정한 값입니다. 7B 파라미터에 FP16 / BF16 (16비트)비트를 곱하고 8로 나누어 비트를 바이트로 환산하면 약 ... GB가 됩니다.
세부 정보
같은 용량을 이진 기비바이트로 표현한 값으로, 대부분의 운영체제와 GPU 도구가 사용하는 단위입니다. ... GB는 약 ... GiB입니다.
양자화 기반 모델 크기
대규모 언어 모델의 디스크 용량은 파라미터가 몇 개이고 각 파라미터를 몇 비트로 저장하는지에 의해 거의 전적으로 결정됩니다. 가중치란 결국 하나의 숫자이고 모델은 그 숫자들의 긴 목록이므로, 파라미터 수에 파라미터당 비트 폭을 곱한 뒤 바이트로 환산하면 파일 크기를, 나아가 모델을 적재하는 데 필요한 메모리를 상당히 정확하게 추정할 수 있습니다. 이 계산기는 파라미터 수와 양자화 형식을 십진 기가바이트와 이진 기비바이트 두 가지 수치로 변환합니다.
공식
파라미터 수 (10억 단위)과 파라미터당 비트 폭 가 주어지면, 십진 기가바이트 단위의 가중치 크기는 다음과 같습니다.
S=8N⋅b
8로 나누는 것은 비트를 바이트로 환산하기 위함입니다. 10억 바이트가 정확히 1 십진 기가바이트이므로, 을 10억 단위로 표현하면 결과가 곧바로 기가바이트로 나옵니다. 같은 양을 대부분의 운영체제와 GPU 도구가 표시하는 단위인 이진 기비바이트로 나타내면 다음과 같습니다.
G=S⋅1073741824109
1 기비바이트는 바이트이기 때문입니다.
계산 예시
대부분의 모델이 배포되는 표준 반정밀도 형식인 파라미터당 16비트로 저장된 70억 파라미터 모델을 생각해 봅시다.
S=87×16=14GB,G=14×1073741824109≈13.04GiB
따라서 가중치는 디스크에서 약 14 GB를 차지하며, 메모리 도구는 이를 약 13 GiB로 표시합니다. 같은 모델을 4비트로 양자화하면 각 가중치를 4분의 1 공간에 저장하므로 파일은 약 3.5 GB로 줄어듭니다.
정밀도 선택
전체 32비트 정밀도는 주로 학습 단계에서 사용됩니다. 배포 시에는 16비트가 통상적인 기준이며, 8비트와 4비트 양자화는 정확도를 다소 양보하는 대신 점유 용량을 절반 또는 4분의 1로 줄입니다. INT4 같은 저비트 형식은 수백억 파라미터 규모의 모델을 단일 소비자용 GPU에 올릴 수 있게 해 줍니다. 여기서의 크기 추정값은 가중치만 다루며, 모델을 실제로 실행하려면 활성화와 키-값 캐시를 위한 공간도 필요합니다. 이는 LLM 추론 VRAM 계산기에서 다룹니다. 특정 연결에서 이 크기를 전송 시간으로 환산하려면 모델 다운로드 시간 계산기를 참고하십시오.
자주 묻는 질문 (FAQ)
모델은 어떤 비트 폭을 써야 할까요?
대부분의 모델은 16비트(FP16 또는 BF16)로 학습·배포되며, 이것이 통상적인 기준 크기입니다. 더 작은 하드웨어에서 실행하려면 8비트와 4비트 양자화가 점유 용량을 각각 절반과 4분의 1로 줄여 주지만, 정확도는 다소 희생됩니다.
INT4는 더 큰 모델을 소비자용 GPU에 올리는 데 널리 쓰이고, FP32는 주로 학습이나 최대한의 수치 정밀도가 필요할 때 사용합니다. 적절한 선택은 사용 가능한 메모리와 품질 손실을 어느 정도 감수할 수 있는지에 달려 있습니다.
GB와 GiB는 어떻게 다른가요?
기가바이트(GB)는 10억 바이트이고, 기비바이트(GiB)는 2^30, 즉 1,073,741,824바이트로 약 7.4% 더 큽니다. 저장 장치 제조사와 다운로드 용량은 보통 십진 GB를 쓰지만, 운영체제와 GPU 메모리 도구, 여러 모델 로더는 이진 GiB로 표시합니다. 따라서 같은 파일이라도 GiB 값이 GB 값보다 조금 작게 나타나며, 그래서 여기서는 두 수치를 모두 제시합니다.
양자화는 모델 품질을 떨어뜨리나요?
정밀도를 낮추면 일부 수치 정보가 사라지므로 정확도가 떨어질 수 있지만, 그 영향은 대개 작습니다. 최신 8비트 양자화는 추론에서 거의 무손실에 가깝고, GPTQ나 AWQ 같은 4비트 기법은 메모리를 4분의 1로 줄이면서도 많은 모델에서 품질 대부분을 유지합니다.
매우 낮은 비트 폭이나 작은 모델일수록 성능 저하가 더 뚜렷합니다. 여기서 제시하는 크기 추정값은 양자화 방식과 무관하게 동일하며, 달라지는 것은 정확도 절충뿐입니다.
면책조항
이 추정값은 가중치 저장 용량만 계산합니다. 실제 파일과 메모리 사용량에는 임베딩, 양자화 메타데이터, 활성화 버퍼, 추론 중 키-값 캐시도 포함되므로, 실제 디스크 및 GPU 사용량은 표시된 수치보다 다소 클 수 있습니다.