¿Me funciona?
Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.
Qwen: Qwen3 8B · Q4_K_M · NVIDIA GeForce RTX 3060
Funciona
- Pesos del modelo 4,7 GB
- Memoria del contexto 1,1 GB
- Búferes 0,8 GB
- Memoria de la tarjeta disponible 12,0 GB
- Memoria necesaria
- 6,5 GB
- Velocidad esperada
- 43 a 61 tokens/s
- Capas en la tarjeta
- 36 / 36
Estimación para llama.cpp y apps similares (LM Studio, Ollama). La velocidad es la de escritura de la respuesta; el resultado real depende de drivers y ajustes.
Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo.
Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria.
Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.