Se LM Studio non usa la GPU su Windows 11, non significa automaticamente che la scheda video sia incompatibile. Nella maggior parte dei casi il problema va cercato tra runtime, driver, GPU offload, VRAM disponibile, dimensione del modello e context.
La cosa più utile è evitare reinstallazioni casuali e partire dal sintomo. Se devi ancora installare il programma o scaricare il primo modello, usa prima la nostra guida a LM Studio su Windows 11. Qui ci concentriamo soltanto sul caso in cui LM Studio si apre, il modello esiste, ma la GPU sembra non lavorare oppure il carico resta quasi tutto sulla CPU.
| Sintomo | Causa da verificare per prima | Controllo rapido |
|---|---|---|
| GPU a 0% durante la generazione | runtime o offload | controlla runtime e configurazione di caricamento |
| CPU al 100% e GPU quasi ferma | offload basso o assente | verifica quanta parte del modello va sulla GPU |
| VRAM piena e modello lento | modello/context troppo pesanti | riduci context o usa un modello più leggero |
| Modello non si carica | memoria insufficiente | stima RAM e VRAM prima del caricamento |
| GPU dedicata presente ma non rilevata | driver o runtime | verifica Windows, driver e LM Runtime |
| Task Manager mostra poca GPU ma LM Studio è veloce | grafico non rappresentativo | controlla memoria GPU e motore visualizzato |
Prima domanda: LM Studio non usa la GPU o Task Manager non la mostra?
È una distinzione importante. Un valore basso nel grafico principale di Gestione attività non dimostra da solo che LM Studio stia lavorando esclusivamente sulla CPU. Windows può mostrare motori GPU differenti e il grafico selezionato può non essere quello più rappresentativo dell’inferenza.
Apri Ctrl + Shift + Esc, vai in Prestazioni > GPU e osserva il comportamento mentre il modello genera testo. Controlla anche la memoria GPU dedicata: se aumenta quando carichi il modello, è un indizio molto più utile del solo numero percentuale mostrato in un singolo grafico.

Se la GPU dedicata resta inattiva, la memoria video non cambia e contemporaneamente la CPU è molto impegnata, allora ha senso passare ai controlli successivi.
Controlla prima il runtime di LM Studio
LM Studio usa runtime dedicati per eseguire i modelli. La documentazione ufficiale di LM Studio indica che su Windows e Linux puoi aprire la gestione dei runtime con Ctrl + Shift + R.
Questo è uno dei primi controlli da fare quando una GPU che prima funzionava smette improvvisamente di essere utilizzata, oppure quando hai appena cambiato scheda video o aggiornato il sistema.
- apri LM Studio;
- premi Ctrl + Shift + R;
- verifica quali LM Runtime sono installati;
- aggiorna il runtime quando l’applicazione segnala una versione più recente;
- riavvia il modello e controlla di nuovo l’utilizzo della GPU.
Non serve invece installare runtime a caso. L’obiettivo è capire se la configurazione che LM Studio sta usando è coerente con l’hardware presente.
Verifica che Windows riconosca correttamente la GPU
Prima di attribuire il problema a LM Studio, controlla che Windows veda la scheda video senza errori.
- apri Gestione dispositivi;
- espandi Schede video;
- verifica che la GPU dedicata compaia correttamente;
- controlla che non siano presenti simboli di errore;
- aggiorna i driver dal canale ufficiale NVIDIA, AMD o Intel se sono obsoleti o se hai appena effettuato un importante aggiornamento di Windows.
Evita pacchetti driver provenienti da siti di terze parti. Se Windows non riconosce correttamente la GPU, LM Studio non può risolvere il problema da solo.
GPU offload: cosa significa e perché cambia tutto
Il punto centrale è il GPU offload. In pratica indica quanta parte del lavoro del modello viene spostata sulla GPU invece di restare sulla CPU.
La documentazione del comando lms load conferma che LM Studio può impostare l’offload tra off, un valore compreso tra 0 e 1 e max. Se non specifichi manualmente un valore, LM Studio prova a determinare automaticamente l’uso ottimale della GPU.
Questo chiarisce un punto importante: non devi necessariamente impostare tutto al massimo. Se il modello non entra nella VRAM disponibile, forzare un offload eccessivo può causare errori di caricamento o peggiorare la stabilità.
Quando provare un offload maggiore
Ha senso aumentarlo quando:
- hai una GPU dedicata con VRAM libera;
- il modello entra comodamente nella memoria disponibile;
- la CPU è molto impegnata;
- la GPU resta quasi inutilizzata;
- la generazione è molto più lenta del previsto.
Quando non conviene forzare il massimo
Se la VRAM è quasi piena già al caricamento, il problema non si risolve aumentando l’offload. In quel caso conviene ridurre il peso del modello, usare una quantizzazione più leggera oppure diminuire il context.
Controlla quanta memoria serve prima di caricare il modello
LM Studio mette a disposizione anche una stima delle risorse. Con la CLI puoi usare:
lms load --estimate-only <model_key>
Secondo la documentazione ufficiale, la stima tiene conto anche di elementi come context length, flash attention e modelli vision. È utile perché la dimensione del file scaricato non coincide necessariamente con tutta la memoria richiesta durante l’esecuzione.
Se il tuo PC ha poca memoria, consulta anche la nostra guida su AI locale con 8, 16 o 32 GB di RAM. Un modello che si carica al limite può funzionare, ma lasciare Windows senza abbastanza memoria per lavorare in modo fluido.
VRAM piena: perché LM Studio può tornare sulla CPU
La GPU non ha memoria infinita. Se la VRAM disponibile non basta per il carico desiderato, una parte del lavoro deve restare fuori dalla scheda video oppure il modello può non caricarsi come previsto.
La pagina ufficiale dei requisiti di LM Studio raccomanda su Windows almeno 16 GB di RAM e una GPU con 4 GB di VRAM dedicata. Sono indicazioni generali, non una garanzia che qualsiasi modello funzioni con 4 GB di VRAM.
Modello, quantizzazione e context possono cambiare la richiesta di memoria di molti gigabyte. Per questo il test corretto non è soltanto chiedersi se la GPU sia compatibile, ma se quella GPU ha abbastanza VRAM per quel modello con quella configurazione.

Il context può essere la causa anche se il modello entra nella VRAM
Un errore comune è pensare che basti far entrare i pesi del modello nella memoria. Durante l’uso servono risorse anche per il context e per le strutture utilizzate durante l’inferenza.
Se LM Studio funziona con un context ridotto ma diventa lento, instabile o smette di sfruttare bene la GPU quando aumenti molto il valore, hai già un indizio concreto.
- prova un context più basso;
- riapri una nuova chat;
- controlla di nuovo RAM e VRAM;
- confronta la velocità di generazione.
Se le prestazioni tornano normali, il problema era molto probabilmente il rapporto tra modello, context e memoria, non un guasto della GPU.
Notebook con GPU integrata e dedicata: quale sta usando LM Studio?
Sui notebook è frequente avere una grafica integrata e una GPU dedicata. Questo rende la diagnosi meno immediata perché Gestione attività mostra più adattatori.
Controlla quale GPU aumenta l’uso di memoria mentre carichi il modello. Se la GPU dedicata resta completamente ferma, verifica prima driver e runtime, poi le impostazioni di caricamento.
Non confondere inoltre memoria GPU condivisa e VRAM dedicata. La memoria condivisa usa una parte della RAM di sistema e non equivale, per prestazioni e comportamento, alla memoria video fisicamente presente sulla scheda dedicata.
LM Studio usa la CPU: è sempre un problema?
No. L’uso della CPU non significa di per sé che qualcosa non funzioni. LM Studio può distribuire il carico tra CPU e GPU e il comportamento dipende dal modello e dal runtime.
Devi preoccuparti soprattutto quando osservi una combinazione coerente di segnali:
- GPU dedicata praticamente inattiva;
- VRAM che non viene utilizzata;
- CPU costantemente satura;
- generazione molto lenta;
- modello che dovrebbe invece essere compatibile con la memoria della GPU.
Se il modello risponde velocemente e la memoria GPU viene utilizzata, non inseguire necessariamente un valore del 100% nel grafico.
Se LM Studio è lento, prova prima un modello più piccolo
Prima di modificare decine di impostazioni, prova una verifica semplice: carica un modello sensibilmente più piccolo.
Se con il modello leggero la GPU viene usata correttamente e la velocità aumenta, hai escluso molte cause software. Il problema è probabilmente il carico richiesto dal modello precedente.
Se hai 16 GB di RAM, puoi confrontare le opzioni nella guida ai modelli AI locali per PC con 16 GB. Scegliere una dimensione realistica spesso produce un miglioramento maggiore rispetto a qualsiasi ottimizzazione marginale.
LM Studio senza GPU dedicata: può funzionare?
Sì, con modelli compatibili e aspettative realistiche. Una GPU dedicata è raccomandata, ma l’inferenza locale può funzionare anche facendo maggiore affidamento su CPU e RAM.
In questo caso vedere un uso elevato della CPU è normale. Non c’è un problema da correggere se il computer non dispone di una GPU adatta da utilizzare per l’offload.
Se invece stai valutando un software diverso per il tuo hardware, abbiamo confrontato LM Studio e Ollama spiegando quando conviene un’interfaccia grafica e quando è più utile un ambiente orientato a terminale, API e automazioni.
La sequenza di controlli più veloce
- Verifica che Windows riconosca la GPU.
- Controlla driver e LM Runtime.
- Carica un modello piccolo. Serve come test di base.
- Osserva VRAM e GPU durante la generazione.
- Controlla il GPU offload. Non forzare il massimo se la VRAM non basta.
- Riduci il context.
- Stima la memoria necessaria se usi la CLI.
- Confronta con un secondo modello. Se uno funziona e l’altro no, il problema è probabilmente nelle risorse richieste.
Quando ha senso reinstallare LM Studio?
La reinstallazione dovrebbe arrivare tardi nella diagnosi, non all’inizio.
Ha più senso prenderla in considerazione se:
- nessun modello riesce a utilizzare correttamente la GPU;
- Windows vede la scheda senza problemi;
- driver e runtime sono aggiornati;
- hai provato modelli piccoli e context ridotti;
- la configurazione continua a comportarsi in modo anomalo.
Se invece un modello piccolo usa correttamente la GPU, reinstallare tutto difficilmente risolverà il problema del modello più grande.
Cosa significa in pratica
LM Studio che non mostra il 100% di GPU non è automaticamente mal configurato. La diagnosi corretta nasce dall’insieme di utilizzo della VRAM, velocità, CPU, runtime, offload e risorse richieste dal modello.
Parti da un modello piccolo, verifica che Windows e LM Studio riconoscano correttamente la scheda, poi aumenta gradualmente carico e context. È molto più efficace che forzare impostazioni al massimo o reinstallare il programma senza aver prima identificato il collo di bottiglia.





Entra nella conversazione
Condividi il tuo punto di vista: non serve creare un account. I contributi restano soggetti alla moderazione editoriale.