¿Me funciona?
Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.
Aún no hay modelos locales
La lista de modelos con pesos públicos se llena tras la actualización diaria de Hugging Face.
Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo.
Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria.
Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.