¿Me funciona?

Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.

Se usa cuando el modelo no cabe en la tarjeta y una parte pasa a la RAM.

Meta: Llama 3.1 8B Instruct · Q4_K_M · NVIDIA GeForce RTX 4060

Funciona

  • Pesos del modelo 4,6 GB
  • Memoria del contexto 1,0 GB
  • Búferes 0,8 GB
  • Memoria de la tarjeta disponible 8,0 GB
Memoria necesaria
6,3 GB
Velocidad esperada
33 a 47 tokens/s
Capas en la tarjeta
32 / 32

Estimación para llama.cpp y apps similares (LM Studio, Ollama). La velocidad es la de escritura de la respuesta; el resultado real depende de drivers y ajustes.

Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo. Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria. Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.