AMD Gorgon Halo. Die Plattform AMD Gorgon Halo führt 192 GB Unified Memory in Mini-PCs ein. Der GMKtec EVO-X5 Pro kann lokale Sprachmodelle (LLM) mit bis zu 320 Milliarden Parametern ausführen, ist aber teuer.

Im Rennen um lokale Künstliche Intelligenz spielt die verfügbare Speichermenge eine ebenso entscheidende Rolle wie die Prozessorleistung. Das zeigt der neue GMKtec EVO-X5 Pro, einer der ersten Systeme auf Basis der AMD-Plattform Gorgon Halo, ausgestattet mit 192 GB Unified Memory LPDDR5X-8533.
AMD Gorgon Halo: Warum das wichtig ist
Der Hersteller hatte die Maschine ursprünglich für die lokale Verarbeitung von Modellen mit 300 Milliarden Parametern konzipiert, doch dank der neuesten Optimierungen wird nun eine vollständige Offline-Fähigkeit bis zu 320 Milliarden Parametern behauptet. Diese Kapazität verändert grundlegend die Art der auf einem Desktop-Computer ausführbaren Modelle: Mit einer 4-Bit-Quantisierung kann eine solche Konfiguration Modelle beherbergen, die vor Kurzem noch Serverinfrastrukturen oder professionelle Beschleuniger mit deutlich mehr Speicher erforderten.
GMKtec nennt ausdrücklich die lokale Ausführung von LLMs bis zu 320 Milliarden Parametern, wobei Kompatibilität und Geschwindigkeit vom verwendeten Modell, dem Quantisierungsgrad und der Softwareoptimierung abhängen.
Die zentrale Hardwarekomponente ist der Ryzen AI Max+ PRO 495, eine Lösung, die AMD an der Spitze seiner Gorgon-Halo-Plattform positioniert. Der Chip integriert 16 Zen-5-Kerne und 32 Threads, erreicht eine Boost-Frequenz von 5,2 GHz und kombiniert mit der CPU eine Radeon 8065S mit 40 Compute Units auf Basis der RDNA-3.5-Architektur. Abgerundet wird das Bild durch eine XDNA-2-NPU, die bis zu 55 TOPS leisten kann.
Der große Vorteil von Gorgon Halo liegt nicht in einem revolutionären Leistungssprung der CPU, sondern im Speicher: Die 192 GB, die sich CPU und GPU teilen, können flexibler genutzt werden als bei der klassischen PC-Konfiguration mit getrenntem System-RAM und VRAM. Im Fall des EVO-X5 Pro können bis zu 160 GB der GPU zugewiesen werden, während der Rest für Betriebssystem und Anwendungen bleibt.
Diese Architektur ist besonders gut für die Inferenz von LLMs geeignet. Bei der lokalen Ausführung eines Sprachmodells dient ein enormer Teil der benötigten Ressourcen lediglich dazu, die Modellgewichte im Speicher zu halten. Bei gleicher Quantisierung bedeutet mehr Speicher, dass deutlich größere Modelle geladen werden können, ohne auf eine professionelle Grafikkarte mit hohem VRAM-Ausstattung zurückgreifen zu müssen.
Was sich ändert und welche Effekte es gibt
Die LPDDR5X erreicht 8.533 MT/s bei einer angegebenen Bandbreite von etwa 273 GB/s. Dieser Wert liegt über den 256 GB/s der vorherigen Strix-Halo-Plattform, reicht aber nicht aus, um Gorgon Halo in ein drastisch schnelleres System für die Inferenz zu verwandeln. Der Hauptvorteil bleibt somit die Kapazität, während der Bandbreitenanstieg sich eher in einer moderateren Verbesserung der Token-Generierungsgeschwindigkeit niederschlagen dürfte.
Der EVO-X5 Pro verfügt außerdem über drei M.2-PCIe-4.0-Slots mit einer angegebenen Gesamtkapazität von bis zu 24 TB, zwei 10-GbE-Ethernet-Anschlüsse, USB4 sowie Unterstützung für externe GPUs und Multi-System-Konfigurationen. Die Kühlung nutzt eine Dampfkammer in Kombination mit drei Lüftern, wobei drei Betriebsmodi zur Bewältigung längerer Lastspitzen dienen. Das System integriert zudem AMD DASH für die Fernverwaltung und ein dediziertes TPM-2.0-Modul, was es auch für kleine professionelle Umgebungen interessanter macht.
All dieser Speicher hat jedoch einen hohen Preis. Das Modell EVO-X5 Pro mit 192 GB RAM und einer 2-TB-SSD kostet 6.599 Euro, während die Version mit 4 TB auf 6.899 Euro steigt. Das Problem liegt vor allem in der Verfügbarkeit des LPDDR5X-Speichers, dessen Nachfrage durch den KI-Boom enorm angetrieben wurde.
Gorgon Halo bringt somit eine Speicherkapazität auf den Desktop, die ausreicht, um Sprachmodelle mit hunderten Milliarden Parametern zu bewältigen, tut dies aber zu einem Preis, der es deutlich vom Markt für normale PCs entfernt. Die Konkurrenz von NVIDIA bewegt sich in dieselbe Richtung mit Systemen auf Basis des GB10, doch auch dort machen steigende Preise für KI-Workstations die Verlagerung fortgeschrittener Inferenz aus den Rechenzentren immer kostspieliger.
Quelle und weiterführende Informationen zu AMD Gorgon Halo: Originalartikel.
* Inhalt mit Unterstützung von Künstlicher Intelligenz erstellt.
Hardware Ready Ready to Bench?