125 Milliarden Modell GPU. Ein Open-Source-Projekt hat es ermöglicht, das Modell Qwen3.8-Flash-Next mit 125 Milliarden Parametern auf Grafikkarten mit 12 GB VRAM auszuführen.

Das System verteilt die Last auf GPU, Systemspeicher und SSD und erreicht eine Geschwindigkeit von 94 Token pro Sekunde, gemessen auf einer GeForce RTX 5070. Das Projekt ist unter der MIT-Lizenz auf GitHub verfügbar und basiert auf Elementen aus llama.cpp und ggml.
125 Milliarden Modell GPU: Warum das wichtig ist
Zu den Mindestanforderungen für die Ausführung gehören eine Grafikkarte mit mindestens 12 GB VRAM, 32 GB System-RAM und etwa 80 GB freier Speicherplatz auf der Festplatte, bevorzugt SSD. Die Größe des herunterzuladenden Modells beträgt etwa 70 GB.
Die Tests wurden an zwei verschiedenen Konfigurationen durchgeführt. Auf einer GeForce RTX 5070 mit 12 GB in Kombination mit einem Ryzen 5 7600 und 64 GB RAM bietet die Quantisierung Q2_0 eine Antwortgeschwindigkeit von 94 Token/s und eine Prompt-Ingestionsrate von 2.650 Token/s. Mit IQ2_XS sinkt der Wert auf 79 Token/s, mit IQ3_XXS auf 62 Token/s und mit IQ3_S, die als präziseste, aber langsamste Variante gilt, auf 53 Token/s.
Eine Radeon RX 9070 XT mit 16 GB in Kombination mit einem Ryzen 9 3900X und 47 GB RAM erreicht 60 Token/s mit Q2_0, 52 mit IQ2_XS und 44 mit der Coder-Build. Wer über 24 GB Videospeicher verfügt, wie bei der GeForce RTX 3090, könnte eine Geschwindigkeit zwischen 100 und 140 Token/s erreichen, dies ist jedoch nur eine Schätzung.
Das Modell nutzt eine Expertenarchitektur mit 24.576 spezialisierten Modulen, von denen pro Token nur 10 aktiviert werden. Das Projekt hält die wenigen tausend am häufigsten verwendeten Experten auf der Grafikkarte, parkt den gesamten Satz im RAM, weist dem Prozessor die verbleibende Arbeit zu und entlädt eine Lookup-Tabelle auf die SSD.
Auch das spekulative Decoding wird eingesetzt: Ein Hilfsmodell schlägt die nächsten Wörter vor, die vom Hauptmodell in Blöcken verifiziert werden, mit einem angegebenen Gewinn zwischen 1,6- und 1,8-fach bei gleicher Antwort. Das Lesen langer Texte erfolgt in Paketen von bis zu 8.192 Token auf einmal und übersteigt tausend Token pro Sekunde.
Was sich ändert und welche Auswirkungen es hat
Die Wahl der Quantisierung hängt vom installierten Speichervolumen ab. Bei 32 GB wird die Coder-Variante vorgeschlagen, die durch das Entfernen der Hälfte der Experten entsteht und 91 % des SWE-bench-Verified-Scores des vollständigen Modells erreicht, aber bei CJK-Texten und Code weniger leistungsfähig ist. Bei 64 GB sind alle Größen verfügbar; die UD-Q4_K_XL von Unsloth, die dem Original näher kommt, wird hauptsächlich von der SSD gelesen und sinkt auf 7–8,5 Token/s.
Der Zugriff erfolgt über den Browser unter 127.0.0.1:8080 mit Chat und Ressourcenüberwachung oder per API über OpenAI-kompatible Endpunkte (/v1), Anthropic (/v1/messages) und Responses API (/v1/responses). Das System verarbeitet eine Anfrage nach der anderen, und die Bildverarbeitung auf AMD-Karten funktioniert nur unter Linux.
Beim Start lädt das System 35 bis 55 GB in den Speicher und kann für ein bis drei Minuten blockiert sein. Die Verarbeitung der ersten Nachricht eines Gesprächs dauert etwa eine Minute pro 30.000 Token.
Quelle und weiterführende Informationen zu 125 Milliarden Modell GPU: Originalartikel.
* Inhalt erstellt mit Unterstützung von KI-Systemen.
Hardware Ready Ready to Bench?