Czy mi pójdzie?
Sprawdź, czy Llama, Qwen, Gemma albo Bielik ruszy na Twojej karcie graficznej, ile zajmie pamięci i jak szybko mniej więcej odpowie.
Na razie brak modeli lokalnych
Lista modeli z publicznymi wagami wypełni się po dziennym odświeżeniu z Hugging Face.
Kwantyzacja zmniejsza model. Q4_K_M zachowuje większość jakości przy około jednej trzeciej pełnego rozmiaru.
Kontekst to ile tekstu model trzyma w pamięci. Dłuższy kontekst potrzebuje więcej pamięci.
Źródła: bity na wagę z llama.cpp, pamięć i przepustowość kart z Wikipedii (CC BY-SA 4.0) i danych producentów.