Czy mi pójdzie?
Sprawdź, czy Llama, Qwen, Gemma albo Bielik ruszy na Twojej karcie graficznej, ile zajmie pamięci i jak szybko mniej więcej odpowie.
Wybierz model i swoją kartę graficzną
Od razu zobaczysz, czy się zmieści, ile pamięci potrzebuje i mniej więcej jak szybko odpowiada.
- Wybierz model z publicznymi wagami (18 na liście).
- Wybierz swoją kartę albo „Bez karty graficznej”, żeby liczyć na procesorze i RAM.
- Zmień kwantyzację albo kontekst i zobacz, jak zmienia się pamięć.
Kwantyzacja zmniejsza model. Q4_K_M zachowuje większość jakości przy około jednej trzeciej pełnego rozmiaru.
Kontekst to ile tekstu model trzyma w pamięci. Dłuższy kontekst potrzebuje więcej pamięci.
Źródła: bity na wagę z llama.cpp, pamięć i przepustowość kart z Wikipedii (CC BY-SA 4.0) i danych producentów.