내 PC로 돌릴 수 있는 로컬 LLM 찾기

하드웨어를 고르면 모델마다 판정과 추천 양자화, 예상 속도 범위를 보여 줍니다.

결과

위에서 GPU나 칩을 고르면 결과가 나옵니다.

판정 읽는 법

쾌적
GPU에 전부 올라가고 20 tok/s 이상
원활
GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
겨우 가능
2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
불가
메모리에 안 들어가거나 2 tok/s 미만

자주 묻는 질문

예상 속도는 얼마나 정확한가요?

모든 속도에는 오차 범위와 신뢰 라벨을 붙입니다. 실측은 같은 GPU·모델·양자화로 잰 공개 벤치마크입니다. 보정된 추정은 메모리 대역폭으로 계산한 값을 공개 벤치마크 결과에 맞춘 것으로, NVIDIA·AMD 카드에 dense 모델을 전부 올린 경우 ±12%, 그 밖에는 ±20%입니다. 이론 추정(±30%)은 실측으로 보정하지 못한 경우입니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 이 범위 안에서 달라집니다.

판정 네 단계는 무엇을 뜻하나요?

쾌적: 모델 전체가 GPU에 올라가고, 글을 읽는 속도보다 빠르게 답을 만들어 냅니다. 원활: 조금 기다리면 되는 속도입니다. MoE 전문가를 시스템 RAM에 두는 경우도 여기에 들 수 있습니다. 겨우 가능: 돌아가기는 하지만 느립니다. CPU로만 돌리거나 GPU와 CPU에 나눠 올리는 경우입니다. 불가: 메모리가 모자라거나, 너무 느려서 실제로 쓰기 어렵습니다. 리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 기준을 1.5배 엄격하게 잡습니다.

내 하드웨어 정보가 어딘가로 전송되나요?

아니요. GPU 감지와 계산은 모두 브라우저 안에서 이루어지고, 따로 서버를 두지 않습니다. 공유 링크에는 직접 고른 GPU, RAM, 설정만 URL 파라미터로 들어갑니다.

속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.