Czy mi pójdzie?

Sprawdź, czy Llama, Qwen, Gemma albo Bielik ruszy na Twojej karcie graficznej, ile zajmie pamięci i jak szybko mniej więcej odpowie.

Liczy się, gdy model nie mieści się na karcie i część trafia do RAM.

Qwen: Qwen3 8B · Q4_K_M · NVIDIA GeForce RTX 3060

Pójdzie

  • Wagi modelu 4,7 GB
  • Pamięć kontekstu 1,1 GB
  • Bufory 0,8 GB
  • Pamięć karty do użycia 12,0 GB
Potrzebna pamięć
6,5 GB
Spodziewana prędkość
43–61 tokenów/s
Warstwy na karcie
36 / 36

Szacunek dla llama.cpp i podobnych aplikacji (LM Studio, Ollama). Prędkość dotyczy pisania odpowiedzi; w praktyce zależy od sterowników i ustawień.

Kwantyzacja zmniejsza model. Q4_K_M zachowuje większość jakości przy około jednej trzeciej pełnego rozmiaru. Kontekst to ile tekstu model trzyma w pamięci. Dłuższy kontekst potrzebuje więcej pamięci. Źródła: bity na wagę z llama.cpp, pamięć i przepustowość kart z Wikipedii (CC BY-SA 4.0) i danych producentów.