Roda no meu PC?
Veja se Llama, Qwen, Gemma ou Bielik roda na sua placa de vídeo, quanta memória ocupa e mais ou menos com que velocidade responde.
Google: Gemma 3 12B · Q4_K_M · NVIDIA GeForce RTX 4090
Dados insuficientes
- Memória necessária
- —
- Velocidade esperada
- —
Ainda não temos os dados de camadas deste modelo, então mostramos só parte da estimativa.
Estimativa para llama.cpp e apps parecidos (LM Studio, Ollama). A velocidade é a da escrita da resposta; o resultado real depende de drivers e configurações.
Quantização reduz o modelo. Q4_K_M mantém a maior parte da qualidade com cerca de um terço do tamanho total.
Contexto é quanto texto o modelo mantém em mente. Mais contexto precisa de mais memória.
Fontes: bits por peso do llama.cpp, memória e largura de banda das placas da Wikipédia (CC BY-SA 4.0) e dos fabricantes.