¿Me funciona?
Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.
Elige un modelo y tu tarjeta gráfica
Verás al momento si cabe, cuánta memoria necesita y más o menos qué tan rápido responde.
- Elige un modelo con pesos públicos (18 en la lista).
- Elige tu tarjeta o «Sin tarjeta gráfica» para usar el procesador y la RAM.
- Cambia la cuantización o el contexto y mira cómo cambia la memoria.
Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo.
Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria.
Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.