Roda no meu PC?

Veja se Llama, Qwen, Gemma ou Bielik roda na sua placa de vídeo, quanta memória ocupa e mais ou menos com que velocidade responde.

Usado quando o modelo não cabe na placa e parte dele vai para a RAM.

Meta: Llama 3.1 8B Instruct · Q4_K_M · NVIDIA GeForce RTX 4060

Roda

  • Pesos do modelo 4,6 GB
  • Memória do contexto 1,0 GB
  • Buffers 0,8 GB
  • Memória da placa disponível 8,0 GB
Memória necessária
6,3 GB
Velocidade esperada
33 a 47 tokens/s
Camadas na placa
32 / 32

Estimativa para llama.cpp e apps parecidos (LM Studio, Ollama). A velocidade é a da escrita da resposta; o resultado real depende de drivers e configurações.

Quantização reduz o modelo. Q4_K_M mantém a maior parte da qualidade com cerca de um terço do tamanho total. Contexto é quanto texto o modelo mantém em mente. Mais contexto precisa de mais memória. Fontes: bits por peso do llama.cpp, memória e largura de banda das placas da Wikipédia (CC BY-SA 4.0) e dos fabricantes.