¿Me funciona?
Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.
Meta: Llama 3.1 8B Instruct · Q4_K_M · NVIDIA GeForce RTX 4060
Funciona
- Pesos del modelo 4,6 GB
- Memoria del contexto 1,0 GB
- Búferes 0,8 GB
- Memoria de la tarjeta disponible 8,0 GB
- Memoria necesaria
- 6,3 GB
- Velocidad esperada
- 33 a 47 tokens/s
- Capas en la tarjeta
- 32 / 32
Estimación para llama.cpp y apps similares (LM Studio, Ollama). La velocidad es la de escritura de la respuesta; el resultado real depende de drivers y ajustes.
Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo.
Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria.
Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.