Läuft das bei mir?

Prüfe, ob Llama, Qwen, Gemma oder Bielik auf deiner Grafikkarte läuft, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.

Zählt, wenn das Modell nicht auf die Karte passt und ein Teil in den RAM wandert.

Wähle ein Modell und deine Grafikkarte

Du siehst sofort, ob es passt, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.

  1. Wähle ein Modell mit öffentlichen Gewichten (18 in der Liste).
  2. Wähle deine Karte oder „Keine Grafikkarte“ für Prozessor und RAM.
  3. Ändere Quantisierung oder Kontext und sieh, wie sich der Speicher ändert.
Quantisierung verkleinert das Modell. Q4_K_M behält den Großteil der Qualität bei etwa einem Drittel der vollen Größe. Kontext ist, wie viel Text das Modell im Blick behält. Mehr Kontext braucht mehr Speicher. Quellen: Bits pro Gewicht aus llama.cpp, Speicher und Bandbreite der Karten aus Wikipedia (CC BY-SA 4.0) und Herstellerangaben.