Home / News / Modello da 125 miliardi di parametri eseguito su GeForce RTX da 12 GB

Modello da 125 miliardi di parametri eseguito su GeForce RTX da 12 GB

Modello da 125. Un progetto open source ha permesso l’esecuzione del modello Qwen3.8-Flash-Next, con 125 miliardi di parametri, su schede video dotate di 12 GB di VRAM.

modello da 125

Il sistema distribuisce il carico tra GPU, memoria di sistema e SSD, raggiungendo una velocità di 94 token al secondo misurati su una GeForce RTX 5070. Il progetto, disponibile su GitHub con licenza MIT, si basa su elementi di llama.cpp e ggml.

Modello da 125: perché è importante

I requisiti minimi per l’esecuzione includono una scheda video con almeno 12 GB di VRAM, 32 GB di RAM di sistema e circa 80 GB di spazio libero su disco, preferibilmente SSD. Il modello da scaricare ha dimensioni di circa 70 GB.

I test sono stati condotti su due configurazioni differenti. Su una GeForce RTX 5070 da 12 GB abbinata a un Ryzen 5 7600 e 64 GB di RAM, la quantizzazione Q2_0 offre 94 token/s in risposta e una velocità di ingestione del prompt pari a 2.650 token/s. Con IQ2_XS si scende a 79 token/s, con IQ3_XXS a 62 token/s e con IQ3_S, considerata la variante più accurata ma anche la più lenta, a 53 token/s.

Una Radeon RX 9070 XT da 16 GB, in abbinamento a un Ryzen 9 3900X e 47 GB di RAM, raggiunge i 60 token/s con Q2_0, 52 con IQ2_XS e 44 con la build Coder. Chi dispone di 24 GB di memoria video, come sulla GeForce RTX 3090, potrebbe raggiungere una velocità compresa tra 100 e 140 token/s, ma si tratta di una stima.

Il modello utilizza un’architettura a esperti composta da 24.576 moduli specializzati, dei quali solo 10 vengono attivati per ogni token. Il progetto mantiene sulla scheda video le poche migliaia di esperti più utilizzati, parcheggia l’intero insieme nella RAM, assegna al processore il lavoro residuo e scarica sull’SSD una tabella di lookup.

Viene impiegato anche il decoding speculativo: un modello ausiliario propone le parole successive che vengono verificate in blocco dal modello principale, con un guadagno dichiarato compreso tra 1,6 e 1,8 volte a parità di risposta. La lettura dei testi lunghi avviene a pacchetti fino a 8.192 token alla volta, superando i mille token al secondo.

Cosa cambia e quali sono gli effetti

La scelta della quantizzazione dipende dalla quantità di memoria installata. Con 32 GB si propone la variante Coder, ottenuta rimuovendo metà degli esperti, che raggiunge il 91% del punteggio SWE-bench Verified del modello completo, ma risulta meno performante con testi CJK e codice. Con 64 GB sono disponibili tutte le dimensioni; la UD-Q4_K_XL di Unsloth, più vicina all’originale, viene letta principalmente da SSD e scende a 7-8,5 token/s.

L’accesso avviene tramite browser su 127.0.0.1:8080, con chat e monitoraggio delle risorse, oppure via API attraverso endpoint compatibili OpenAI (/v1), Anthropic (/v1/messages) e Responses API (/v1/responses). Il sistema elabora una richiesta alla volta e l’elaborazione delle immagini su schede AMD funziona solo sotto Linux.

All’avvio, il sistema carica tra 35 e 55 GB in memoria e può risultare bloccato per uno-tre minuti. L’elaborazione del primo messaggio di una conversazione richiede circa un minuto ogni 30.000 token.

Fonte e approfondimento su modello da 125: articolo originale.

* Contenuto realizzato con l'ausilio di sistemi di intelligenza artificiale.