Läuft das bei mir?
Prüfe, ob Llama, Qwen, Gemma oder Bielik auf deiner Grafikkarte läuft, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.
Qwen: Qwen3 8B · Q4_K_M · NVIDIA GeForce RTX 3060
Läuft
- Modellgewichte 4,7 GB
- Kontextspeicher 1,1 GB
- Puffer 0,8 GB
- Nutzbarer Grafikspeicher 12,0 GB
- Benötigter Speicher
- 6,5 GB
- Erwartete Geschwindigkeit
- 43–61 Tokens/s
- Schichten auf der Karte
- 36 / 36
Schätzung für llama.cpp und ähnliche Apps (LM Studio, Ollama). Die Geschwindigkeit gilt fürs Schreiben der Antwort; echte Werte hängen von Treibern und Einstellungen ab.
Quantisierung verkleinert das Modell. Q4_K_M behält den Großteil der Qualität bei etwa einem Drittel der vollen Größe.
Kontext ist, wie viel Text das Modell im Blick behält. Mehr Kontext braucht mehr Speicher.
Quellen: Bits pro Gewicht aus llama.cpp, Speicher und Bandbreite der Karten aus Wikipedia (CC BY-SA 4.0) und Herstellerangaben.