Roda no meu PC?

Veja se Llama, Qwen, Gemma ou Bielik roda na sua placa de vídeo, quanta memória ocupa e mais ou menos com que velocidade responde.

Usado quando o modelo não cabe na placa e parte dele vai para a RAM.

Escolha um modelo e sua placa de vídeo

Você vê na hora se cabe, quanta memória precisa e mais ou menos a velocidade das respostas.

  1. Escolha um modelo com pesos públicos (18 na lista).
  2. Escolha sua placa ou “Sem placa de vídeo” para usar o processador e a RAM.
  3. Mude a quantização ou o contexto e veja como a memória muda.
Quantização reduz o modelo. Q4_K_M mantém a maior parte da qualidade com cerca de um terço do tamanho total. Contexto é quanto texto o modelo mantém em mente. Mais contexto precisa de mais memória. Fontes: bits por peso do llama.cpp, memória e largura de banda das placas da Wikipédia (CC BY-SA 4.0) e dos fabricantes.