GeForce RTX 5060 Ti 16GB에서 돌아가는 로컬 LLM
시스템 RAM 32GB(DDR5-5600), Windows, 이 GPU로 화면 출력, 8k 컨텍스트, f16 KV 캐시를 기준으로 계산했습니다.
사양
- VRAM
- 16GB
- 메모리 대역폭
- 448.0 GB/s
- FP16 연산
- 23.7 TFLOPS
- 출시 연도
- 2025
- 가격
- 실거래가 US$569 (2026-08-09 기준)
판정 요약
Q4_K_M(없으면 가장 가까운 양자화), 8k 컨텍스트 기준입니다.
- 쾌적13개원활3개겨우 가능8개불가5개양자화를 더 낮추면 1개가 더 돌아갑니다.
판정 읽는 법
- 쾌적
- GPU에 전부 올라가고 20 tok/s 이상
- 원활
- GPU에 전부 올라가고 8~20 tok/s, MoE 전문가를 시스템 RAM에 두고 20 tok/s 이상, 또는 GPU에 90% 이상 올라가고 8 tok/s 이상
- 겨우 가능
- 2~8 tok/s, CPU 전용, GPU에 90% 미만, 또는 MoE 전문가를 RAM에 두고 20 tok/s 미만
- 불가
- 메모리에 안 들어가거나 2 tok/s 미만
한국 모델
EXAONE, HyperCLOVA X SEED, Kanana, Solar가 이 기기에서 어떻게 돌아가는지 보여 줍니다.
GeForce RTX 5060 Ti 16GB 전체 모델 판정
dense 모델을 GPU와 CPU에 나눠 올리면 속도가 크게 떨어집니다. 전체 속도가 느린 CPU 쪽에 맞춰지기 때문입니다. 전문가만 시스템 RAM에 두는 MoE 모델은 훨씬 덜 느려집니다.
옆으로 밀면 모든 열을 볼 수 있습니다.
| 모델 | 판정 | 속도 | 양자화 | 메모리 | 실행 방식 | 컨텍스트 | 참고 |
|---|---|---|---|---|---|---|---|
| EXAONE 4.0 1.2B | 쾌적 | 추정 238.8 tok/s210.1–267.4보정된 추정 ±12% | Q4_K_M | 2.5 / 16.0GB | 풀 GPU | 최대 64k | — |
| HyperCLOVA X SEED 1.5B | 쾌적 | 추정 172.8 tok/s152.0–193.5보정된 추정 ±12% | Q4_K_M | 3.0 / 16.0GB | 풀 GPU | 최대 16k | — |
| gpt-oss-20b | 쾌적상세 | 111.6 tok/s8k 추정 88.1 tok/s (70.5–105.8, 보정된 추정 ±20%)실측 1건 (2k 컨텍스트) | MXFP4 | 13.5 / 16.0GB | 풀 GPU | 최대 64k |
|
| Kanana 1.5 15.7B-A3B | 쾌적 | 추정 65.7 tok/s52.6–78.8보정된 추정 ±20% | Q4_K_M | 12.7 / 16.0GB | 풀 GPU | 최대 16k | — |
| DeepSeek R1 Distill Llama 8B | 쾌적 | 추정 52.3 tok/s46.0–58.6보정된 추정 ±12% | Q4_K_M | 7.2 / 16.0GB | 풀 GPU | 최대 32k |
|
| Kanana 1.5 8B | 쾌적 | 추정 52.3 tok/s46.0–58.6보정된 추정 ±12% | Q4_K_M | 7.2 / 16.0GB | 풀 GPU | 최대 32k | — |
| Llama 3.1 8B | 쾌적상세 | 추정 52.3 tok/s46.0–58.6보정된 추정 ±12% | Q4_K_M | 7.2 / 16.0GB | 풀 GPU | 최대 64k | — |
| Qwen3.5 9B | 쾌적 | 추정 51.1 tok/s45.0–57.2보정된 추정 ±12% | Q4_K_M | 7.3 / 16.0GB | 풀 GPU | 최대 128k | — |
| Qwen3 8B | 쾌적 | 추정 50.3 tok/s44.2–56.3보정된 추정 ±12% | Q4_K_M | 7.4 / 16.0GB | 풀 GPU | 최대 32k | — |
| Gemma 4 12B | 쾌적 | 추정 41.0 tok/s36.0–45.9보정된 추정 ±12% | Q4_K_M | 8.8 / 16.0GB | 풀 GPU | 최대 64k | — |
| Gemma 3 12B | 쾌적상세 | 추정 40.0 tok/s35.2–44.8보정된 추정 ±12% | Q4_K_M | 9.0 / 16.0GB | 풀 GPU | 최대 64k | — |
| HyperCLOVA X SEED Think 14B | 쾌적 | 추정 30.8 tok/s21.5–40.0이론 추정 ±30% | Q4_K_M | 11.4 / 16.0GB | 풀 GPU | 최대 8k |
|
| Qwen3 14B | 쾌적상세 | 추정 30.3 tok/s26.7–34.0보정된 추정 ±12% | Q4_K_M | 11.5 / 16.0GB | 풀 GPU | 최대 32k | — |
| Phi-4 | 원활 | 추정 29.2 tok/s25.7–32.7보정된 추정 ±12% | Q4_K_M | 11.9 / 16.0GB | 풀 GPU | 최대 16k |
|
| Qwen3.5 35B-A3B | 원활 | 추정 20.4 tok/s14.3–26.5이론 추정 ±30% | Q4_K_M | 2.6 / 16.0GB + RAM 21.4GB | MoE 전문가 RAM 배치 | 최대 256k |
|
| Mistral Small 3.2 24B | 원활 | 추정 14.8 tok/s11.8–17.7보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 0.8GB | 부분 오프로드 | 최대 8k |
|
| Gemma 4 26B-A4B | 겨우 가능 | 추정 43.2 tok/s30.2–56.2이론 추정 ±30% | Q4_K_M | 16.0 / 16.0GB + RAM 2.5GB | 부분 오프로드 | 최대 256k |
|
| Qwen3 30B-A3B (2507) | 겨우 가능상세 | 추정 19.2 tok/s13.4–24.9이론 추정 ±30% | Q4_K_M | 2.9 / 16.0GB + RAM 17.7GB | MoE 전문가 RAM 배치 | 최대 64k |
|
| Gemma 3 27B | 겨우 가능 | 추정 9.7 tok/s7.8–11.7보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 2.4GB | 부분 오프로드 | 최대 64k |
|
| Qwen3.5 27B | 겨우 가능 | 추정 8.9 tok/s7.1–10.7보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 2.8GB | 부분 오프로드 | 최대 128k |
|
| EXAONE 4.0 32B | 겨우 가능 | 추정 6.1 tok/s4.9–7.4보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 5.1GB | 부분 오프로드 | 최대 64k |
|
| EXAONE 4.5 33B | 겨우 가능 | 추정 5.6 tok/s4.5–6.7보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 5.8GB | 부분 오프로드 | 최대 64k |
|
| Qwen3 32B | 겨우 가능 | 추정 4.5 tok/s3.6–5.5보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 7.1GB | 부분 오프로드 | 최대 32k |
|
| DeepSeek R1 Distill Qwen 32B | 겨우 가능 | 추정 4.5 tok/s3.6–5.4보정된 추정 ±20% | Q4_K_M | 16.0 / 16.0GB + RAM 7.2GB | 부분 오프로드 | 최대 16k |
|
| Llama 3.3 70B | 불가Q2_K (품질 손실 큼): 겨우 가능 | 추정 2.5 tok/s2.0–3.1보정된 추정 ±20% | Q2_K | 16.0 / 16.0GB + RAM 14.2GB | 부분 오프로드 | 최대 16k | — |
| gpt-oss-120b | 불가상세 | — | MXFP4 | 64.3GB 필요 | — | — |
|
| Qwen3.5 122B-A10B | 불가 | — | Q4_K_M | 79.0GB 필요 | — | — |
|
| Solar Open 100B | 불가 | — | Q4_K_M | 64.4GB 필요 | — | — |
|
| Solar Open 2 250B | 불가 | — | IQ4_XS | 137.2GB 필요 | — | — |
|
리즈닝 모델은 생각하는 데 토큰을 더 쓰기 때문에 속도 기준을 1.5배 엄격하게 잡습니다(30 / 12 / 3 tok/s).
GeForce RTX 5060 Ti 16GB 벤치마크 결과
보정에 쓰는 공개 벤치마크입니다. 측정 조건(컨텍스트·백엔드·플래그)은 위 추정과 다를 수 있습니다.
| 모델 | 양자화 | 백엔드 | 컨텍스트 | 프롬프트 (tok/s) | 생성 (tok/s) | 플래그 | 출처 | 측정일 |
|---|---|---|---|---|---|---|---|---|
| llama-2-7b | Q4_0 | llama.cpp | 512 | 3,737.0 | 90.9 | — | github.com | 2025-08-01 |
| gpt-oss-20b | MXFP4 | llama.cpp | 2k | 3,821.0 | 111.6 | — | github.com | 2025-08-15 |
자주 묻는 질문
GeForce RTX 5060 Ti 16GB에 통째로 올라가는 가장 큰 모델은 무엇인가요?
Mistral Small 3.2 24B IQ4_XS(12.76GB 파일)입니다. 8k 컨텍스트에서 16GB에 전부 올라가고, 속도는 추정 22.2 tok/s (19.6–24.9, 보정된 추정 ±12%)입니다.
GeForce RTX 5060 Ti 16GB에서 원활하게 돌아가는 로컬 LLM은 몇 개인가요?
Q4_K_M·8k 컨텍스트 기준으로 등록된 모델 29개를 보면 쾌적 13개, 원활 3개, 겨우 가능 8개, 불가 5개입니다.
GeForce RTX 5060 Ti 16GB에서 Llama 3.3 70B 같은 70B 모델을 돌릴 수 있나요?
Q2_K (품질 손실 큼), 부분 오프로드 기준 판정: 겨우 가능, 속도: 추정 2.5 tok/s (2.0–3.1, 보정된 추정 ±20%).
속도는 메모리 대역폭으로 계산한 추정치를 공개 벤치마크로 보정한 값입니다. 모든 수치에는 오차 범위와 신뢰 라벨을 함께 표시합니다. 실제 속도는 드라이버, 백엔드, 컨텍스트 길이, 발열에 따라 달라집니다.