Czy mi pójdzie?
Sprawdź, czy Llama, Qwen, Gemma albo Bielik ruszy na Twojej karcie graficznej, ile zajmie pamięci i jak szybko mniej więcej odpowie.
Meta: Llama 3.1 8B Instruct · Q4_K_M · NVIDIA GeForce RTX 4060
Pójdzie
- Wagi modelu 4,6 GB
- Pamięć kontekstu 1,0 GB
- Bufory 0,8 GB
- Pamięć karty do użycia 8,0 GB
- Potrzebna pamięć
- 6,3 GB
- Spodziewana prędkość
- 33–47 tokenów/s
- Warstwy na karcie
- 32 / 32
Szacunek dla llama.cpp i podobnych aplikacji (LM Studio, Ollama). Prędkość dotyczy pisania odpowiedzi; w praktyce zależy od sterowników i ustawień.
Kwantyzacja zmniejsza model. Q4_K_M zachowuje większość jakości przy około jednej trzeciej pełnego rozmiaru.
Kontekst to ile tekstu model trzyma w pamięci. Dłuższy kontekst potrzebuje więcej pamięci.
Źródła: bity na wagę z llama.cpp, pamięć i przepustowość kart z Wikipedii (CC BY-SA 4.0) i danych producentów.