¿Me funciona?

Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.

Se usa cuando el modelo no cabe en la tarjeta y una parte pasa a la RAM.

Aún no hay modelos locales

La lista de modelos con pesos públicos se llena tras la actualización diaria de Hugging Face.

Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo. Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria. Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.