CanRun 계산 방법: 판정, 속도 추정, 오차 범위

CanRun의 모든 답은 같은 계산에서 나옵니다. 계산기, GPU 페이지, 모델 페이지, 가이드 어디서 보든 숫자가 같습니다. 이 페이지에서는 그 계산이 어떻게 돌아가는지, 실제 벤치마크와 비교해 얼마나 맞았는지, 어디서 틀릴 수 있는지 설명합니다.

판정

모델마다 네 가지 판정 중 하나가 붙습니다. 기준은 대부분 처음 시작하는 설정인 Q4_K_M 양자화, 8k 컨텍스트, f16 KV 캐시입니다.

판정 읽는 법

쾌적
GPU에 전부 올라가고 20 tok/s 이상
원활
GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
겨우 가능
2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
불가
메모리에 안 들어가거나 2 tok/s 미만

답하기 전에 긴 추론 과정을 먼저 쓰는 리즈닝 모델은 답 하나에 기다려야 하는 토큰이 훨씬 많습니다. 그래서 속도 기준을 1.5배 높게 잡습니다. Q4_K_M으로 좋은 판정이 나오지 않는 모델은 더 작은 양자화나 더 많은 시스템 RAM으로 무엇이 달라지는지도 함께 보여 드립니다.

메모리

모델에 필요한 메모리는 세 가지를 더한 값입니다.

  • 모델 파일: 파라미터 수로 어림하지 않고, Hugging Face에 올라온 양자화별 실제 GGUF 파일 크기를 씁니다.
  • KV 캐시: 지금까지의 대화를 담아 두는 메모리입니다. 컨텍스트가 길어질수록 커지는데, 얼마나 빨리 커지는지는 모델 구조에 따라 다릅니다. 슬라이딩 윈도 층이 있는 모델은 긴 컨텍스트에서 훨씬 적게 씁니다. 각 모델이 공개한 설정값으로 계산합니다.
  • 연산 버퍼: 글을 생성하는 동안 런타임이 쓰는 작업 메모리입니다.

이 합계를 카드에 적힌 용량이 아니라 실제로 쓸 수 있는 메모리와 비교합니다. 화면 출력까지 맡은 그래픽카드는 운영체제가 메모리 일부를 쓰고, 맥은 통합 메모리를 macOS와 나눠 씁니다. 모델이 다 들어가지 않으면 일부를 시스템 RAM에서 돌릴 수 있는지, 그러면 얼마나 느려지는지도 계산합니다.

속도

토큰 하나를 만들 때마다 모델 가중치와 KV 캐시를 메모리에서 읽어야 하므로, 속도는 메모리 대역폭이 좌우합니다. 카드의 대역폭과 토큰당 읽는 양으로 먼저 추정하고, 하드웨어 종류(NVIDIA·AMD·인텔·애플 GPU, CPU)마다 효율 계수를 곱합니다. 이 계수는 공개 벤치마크에 맞춰 보정한 값입니다. 모델 일부가 시스템 RAM에 있으면 그 부분은 더 느린 RAM 대역폭으로 계산합니다.

신뢰 라벨

CanRun의 속도는 모두 범위로 보여 드리고, 라벨이 함께 붙습니다.

  • ‘실측’: 같은 GPU·모델·양자화로 잰 공개 벤치마크 결과입니다. 어디서, 어떤 조건으로 잰 값인지 함께 적습니다.
  • ‘보정된 추정’: 비슷한 구성의 벤치마크로 검증한 추정치입니다. NVIDIA·AMD 그래픽카드에 dense 모델을 전부 올린 경우는 ±12%, 그 밖의 하드웨어와 MoE 모델, 시스템 RAM을 함께 쓰는 경우는 ±20% 범위로 보여 드립니다.
  • ‘이론 추정’: 아직 벤치마크로 확인하지 못한 구성의 추정치로, ±30% 범위로 보여 드립니다.

첫 토큰이 나오기 전까지 걸리는 프롬프트 처리 속도는 ±40% 범위의 대략적인 값으로만 보여 드립니다.

얼마나 맞았나요

계산을 실제 데이터와 비교하는 검사는 코드나 데이터가 바뀔 때마다 자동으로 다시 돌아갑니다.

  • 모델 파일 크기: 실제 GGUF 파일 11개와 비교해 평균 오차 0.7%, 최대 1.6%였습니다.
  • KV 캐시: 확인한 모델 구조 7종 모두 공식과 정확히 일치했습니다.
  • 속도: 기준 벤치마크 12건과 비교해 평균 오차 6.3%, 최대 17.1%였습니다. 가장 크게 빗나간 경우는 애플 M4 Pro(약 17% 낮게 추정)와 RTX 5060 Ti 16GB의 MoE 모델(약 15% 낮게 추정)이었습니다.

이 수치는 2026년 8월 9일에 확인한 값이고, 자동 검사가 이보다 나빠지지 않게 지키고 있습니다.

알려진 한계

  • 전문가를 시스템 RAM에 두는 MoE 모델은 실제로는 추정보다 빠를 가능성이 큽니다. 커뮤니티에 올라온 결과를 보면 이 구성의 추정치가 실제 속도보다 한참 낮을 수 있어서, 보정하기 전까지는 ‘이론 추정’으로 표시합니다.
  • 최상위 그래픽카드에서 도는 작고 빠른 MoE 모델은 대역폭보다 다른 부담이 속도를 정하기 때문에 추정치에 상한을 둡니다.
  • 벤치마크마다 재는 방식이 다릅니다. 긴 컨텍스트에서 평균을 내기도 하고 짧은 프롬프트로 재기도 해서, 벤치마크마다 컨텍스트 조건을 기록하고 같은 조건끼리 비교합니다.
  • 내 PC에서는 다를 수 있습니다. 노트북의 전력·발열 제한, 싱글 채널 RAM, 드라이버, 백그라운드 프로그램에 따라 실제 속도가 달라집니다. 범위가 이런 차이를 어느 정도 담지만 전부는 아닙니다.
  • 런타임은 스스로 판단합니다. Ollama와 llama.cpp는 메모리를 자기 방식으로 계산해서 CanRun 계산과 다르게 GPU와 CPU에 나눠 올릴 수 있습니다. 내 PC에서 실제로 어떻게 올라갔는지는 ollama ps로 확인하세요.

독립성

판정과 추천은 위 데이터로만 계산합니다. 광고나 제휴 링크, 제조사와의 관계는 결과에 영향을 주지 않습니다. 가격을 보여 줄 때는 확인한 날짜를 함께 적습니다.

출처

  • Hugging Face: GGUF 파일 크기와 모델 설정값
  • llama.cpp: 양자화 형식과 런타임 동작
  • Ollama 문서: 기본 컨텍스트 길이와 KV 캐시 설정
  • GPU·칩별 제조사 사양 페이지: 각 GPU 페이지에 링크
  • 공개 벤치마크: 보여 주는 곳마다 링크