¿Me funciona?
Comprueba si Llama, Qwen, Gemma o Bielik funciona en tu tarjeta gráfica, cuánta memoria ocupa y más o menos qué tan rápido responde.
Google: Gemma 3 12B · Q4_K_M · NVIDIA GeForce RTX 4090
Faltan datos
- Memoria necesaria
- —
- Velocidad esperada
- —
Aún no tenemos los datos de capas de este modelo, así que solo mostramos parte de la estimación.
Estimación para llama.cpp y apps similares (LM Studio, Ollama). La velocidad es la de escritura de la respuesta; el resultado real depende de drivers y ajustes.
Cuantización reduce el modelo. Q4_K_M conserva casi toda la calidad con cerca de un tercio del tamaño completo.
Contexto es cuánto texto tiene presente el modelo. Más contexto necesita más memoria.
Fuentes: bits por peso de llama.cpp, memoria y ancho de banda de las tarjetas de Wikipedia (CC BY-SA 4.0) y fabricantes.