Läuft das bei mir?

Prüfe, ob Llama, Qwen, Gemma oder Bielik auf deiner Grafikkarte läuft, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.

Zählt, wenn das Modell nicht auf die Karte passt und ein Teil in den RAM wandert.

Qwen: Qwen3 8B · Q4_K_M · NVIDIA GeForce RTX 3060

Läuft

  • Modellgewichte 4,7 GB
  • Kontextspeicher 1,1 GB
  • Puffer 0,8 GB
  • Nutzbarer Grafikspeicher 12,0 GB
Benötigter Speicher
6,5 GB
Erwartete Geschwindigkeit
43–61 Tokens/s
Schichten auf der Karte
36 / 36

Schätzung für llama.cpp und ähnliche Apps (LM Studio, Ollama). Die Geschwindigkeit gilt fürs Schreiben der Antwort; echte Werte hängen von Treibern und Einstellungen ab.

Quantisierung verkleinert das Modell. Q4_K_M behält den Großteil der Qualität bei etwa einem Drittel der vollen Größe. Kontext ist, wie viel Text das Modell im Blick behält. Mehr Kontext braucht mehr Speicher. Quellen: Bits pro Gewicht aus llama.cpp, Speicher und Bandbreite der Karten aus Wikipedia (CC BY-SA 4.0) und Herstellerangaben.