Läuft das bei mir?
Prüfe, ob Llama, Qwen, Gemma oder Bielik auf deiner Grafikkarte läuft, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.
Meta: Llama 3.1 8B Instruct · Q4_K_M · NVIDIA GeForce RTX 4060
Läuft
- Modellgewichte 4,6 GB
- Kontextspeicher 1,0 GB
- Puffer 0,8 GB
- Nutzbarer Grafikspeicher 8,0 GB
- Benötigter Speicher
- 6,3 GB
- Erwartete Geschwindigkeit
- 33–47 Tokens/s
- Schichten auf der Karte
- 32 / 32
Schätzung für llama.cpp und ähnliche Apps (LM Studio, Ollama). Die Geschwindigkeit gilt fürs Schreiben der Antwort; echte Werte hängen von Treibern und Einstellungen ab.
Quantisierung verkleinert das Modell. Q4_K_M behält den Großteil der Qualität bei etwa einem Drittel der vollen Größe.
Kontext ist, wie viel Text das Modell im Blick behält. Mehr Kontext braucht mehr Speicher.
Quellen: Bits pro Gewicht aus llama.cpp, Speicher und Bandbreite der Karten aus Wikipedia (CC BY-SA 4.0) und Herstellerangaben.