Läuft das bei mir?

Prüfe, ob Llama, Qwen, Gemma oder Bielik auf deiner Grafikkarte läuft, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.

Zählt, wenn das Modell nicht auf die Karte passt und ein Teil in den RAM wandert.

Google: Gemma 3 12B · Q4_K_M · NVIDIA GeForce RTX 4090

Zu wenig Daten

Benötigter Speicher
—
Erwartete Geschwindigkeit
—

Für dieses Modell fehlen noch die Schichtdaten, daher zeigen wir nur einen Teil der Schätzung.

Schätzung für llama.cpp und ähnliche Apps (LM Studio, Ollama). Die Geschwindigkeit gilt fürs Schreiben der Antwort; echte Werte hängen von Treibern und Einstellungen ab.

Quantisierung verkleinert das Modell. Q4_K_M behält den Großteil der Qualität bei etwa einem Drittel der vollen Größe. Kontext ist, wie viel Text das Modell im Blick behält. Mehr Kontext braucht mehr Speicher. Quellen: Bits pro Gewicht aus llama.cpp, Speicher und Bandbreite der Karten aus Wikipedia (CC BY-SA 4.0) und Herstellerangaben.