Läuft das bei mir?

Prüfe, ob Llama, Qwen, Gemma oder Bielik auf deiner Grafikkarte läuft, wie viel Speicher es braucht und wie schnell es ungefähr antwortet.

Zählt, wenn das Modell nicht auf die Karte passt und ein Teil in den RAM wandert.

Noch keine lokalen Modelle

Die Liste der Modelle mit öffentlichen Gewichten füllt sich nach der täglichen Aktualisierung von Hugging Face.

Quantisierung verkleinert das Modell. Q4_K_M behält den Großteil der Qualität bei etwa einem Drittel der vollen Größe. Kontext ist, wie viel Text das Modell im Blick behält. Mehr Kontext braucht mehr Speicher. Quellen: Bits pro Gewicht aus llama.cpp, Speicher und Bandbreite der Karten aus Wikipedia (CC BY-SA 4.0) und Herstellerangaben.