Skip to content

LLM 추론 VRAM 계산기

대규모 언어 모델을 추론용으로 서빙하는 데 필요한 GPU VRAM을 추정합니다. 파라미터 수, 가중치 정밀도, 그리고 KV 캐시·활성화·단편화를 위한 런타임 오버헤드를 입력으로 사용합니다.

입력

모델

런타임

%
0 – 200 %

결과

값을 입력하면 계산 결과가 표시됩니다.

세부 정보

이 계산기 임베드

미리보기

이 코드를 페이지에 붙여넣으면 계산기가 표시됩니다.

이 계산 공유

이 링크를 여는 사람은 입력한 값이 채워진 상태로 보게 됩니다.

200+ 계산기 · 10개 언어 · 완전 무료

이 계산기가 도움이 되셨나요?

개선이 필요해요

어떤 점을 개선하면 좋을까요?