Vai al contenuto
iCrewPlay.com Un progetto editoriale indipendente
Continua con App e software
App e software · Guide · Intelligenza Artificiale · Tecnologia

LM Studio non usa la GPU su Windows 11: cosa controllare

Se LM Studio usa solo la CPU o la GPU resta quasi ferma, il problema può dipendere da runtime, offload, VRAM o modello: ecco l'ordine giusto dei controlli.

8 min di lettura
Migliori modelli ai locali per pc con 16 gb di ram: quali scegliere

Se LM Studio non usa la GPU su Windows 11, non significa automaticamente che la scheda video sia incompatibile. Nella maggior parte dei casi il problema va cercato tra runtime, driver, GPU offload, VRAM disponibile, dimensione del modello e context.

La cosa più utile è evitare reinstallazioni casuali e partire dal sintomo. Se devi ancora installare il programma o scaricare il primo modello, usa prima la nostra guida a LM Studio su Windows 11. Qui ci concentriamo soltanto sul caso in cui LM Studio si apre, il modello esiste, ma la GPU sembra non lavorare oppure il carico resta quasi tutto sulla CPU.

SintomoCausa da verificare per primaControllo rapido
GPU a 0% durante la generazioneruntime o offloadcontrolla runtime e configurazione di caricamento
CPU al 100% e GPU quasi fermaoffload basso o assenteverifica quanta parte del modello va sulla GPU
VRAM piena e modello lentomodello/context troppo pesantiriduci context o usa un modello più leggero
Modello non si caricamemoria insufficientestima RAM e VRAM prima del caricamento
GPU dedicata presente ma non rilevatadriver o runtimeverifica Windows, driver e LM Runtime
Task Manager mostra poca GPU ma LM Studio è velocegrafico non rappresentativocontrolla memoria GPU e motore visualizzato

Prima domanda: LM Studio non usa la GPU o Task Manager non la mostra?

È una distinzione importante. Un valore basso nel grafico principale di Gestione attività non dimostra da solo che LM Studio stia lavorando esclusivamente sulla CPU. Windows può mostrare motori GPU differenti e il grafico selezionato può non essere quello più rappresentativo dell’inferenza.

Pubblicità

Apri Ctrl + Shift + Esc, vai in Prestazioni > GPU e osserva il comportamento mentre il modello genera testo. Controlla anche la memoria GPU dedicata: se aumenta quando carichi il modello, è un indizio molto più utile del solo numero percentuale mostrato in un singolo grafico.

Controllo di ram e gpu su windows 11 durante l'uso di lm studio

Se la GPU dedicata resta inattiva, la memoria video non cambia e contemporaneamente la CPU è molto impegnata, allora ha senso passare ai controlli successivi.

Controlla prima il runtime di LM Studio

LM Studio usa runtime dedicati per eseguire i modelli. La documentazione ufficiale di LM Studio indica che su Windows e Linux puoi aprire la gestione dei runtime con Ctrl + Shift + R.

Questo è uno dei primi controlli da fare quando una GPU che prima funzionava smette improvvisamente di essere utilizzata, oppure quando hai appena cambiato scheda video o aggiornato il sistema.

  • apri LM Studio;
  • premi Ctrl + Shift + R;
  • verifica quali LM Runtime sono installati;
  • aggiorna il runtime quando l’applicazione segnala una versione più recente;
  • riavvia il modello e controlla di nuovo l’utilizzo della GPU.

Non serve invece installare runtime a caso. L’obiettivo è capire se la configurazione che LM Studio sta usando è coerente con l’hardware presente.

Verifica che Windows riconosca correttamente la GPU

Prima di attribuire il problema a LM Studio, controlla che Windows veda la scheda video senza errori.

  1. apri Gestione dispositivi;
  2. espandi Schede video;
  3. verifica che la GPU dedicata compaia correttamente;
  4. controlla che non siano presenti simboli di errore;
  5. aggiorna i driver dal canale ufficiale NVIDIA, AMD o Intel se sono obsoleti o se hai appena effettuato un importante aggiornamento di Windows.

Evita pacchetti driver provenienti da siti di terze parti. Se Windows non riconosce correttamente la GPU, LM Studio non può risolvere il problema da solo.

GPU offload: cosa significa e perché cambia tutto

Il punto centrale è il GPU offload. In pratica indica quanta parte del lavoro del modello viene spostata sulla GPU invece di restare sulla CPU.

La documentazione del comando lms load conferma che LM Studio può impostare l’offload tra off, un valore compreso tra 0 e 1 e max. Se non specifichi manualmente un valore, LM Studio prova a determinare automaticamente l’uso ottimale della GPU.

Questo chiarisce un punto importante: non devi necessariamente impostare tutto al massimo. Se il modello non entra nella VRAM disponibile, forzare un offload eccessivo può causare errori di caricamento o peggiorare la stabilità.

Quando provare un offload maggiore

Ha senso aumentarlo quando:

  • hai una GPU dedicata con VRAM libera;
  • il modello entra comodamente nella memoria disponibile;
  • la CPU è molto impegnata;
  • la GPU resta quasi inutilizzata;
  • la generazione è molto più lenta del previsto.

Quando non conviene forzare il massimo

Se la VRAM è quasi piena già al caricamento, il problema non si risolve aumentando l’offload. In quel caso conviene ridurre il peso del modello, usare una quantizzazione più leggera oppure diminuire il context.

Controlla quanta memoria serve prima di caricare il modello

LM Studio mette a disposizione anche una stima delle risorse. Con la CLI puoi usare:

lms load --estimate-only <model_key>

Secondo la documentazione ufficiale, la stima tiene conto anche di elementi come context length, flash attention e modelli vision. È utile perché la dimensione del file scaricato non coincide necessariamente con tutta la memoria richiesta durante l’esecuzione.

Se il tuo PC ha poca memoria, consulta anche la nostra guida su AI locale con 8, 16 o 32 GB di RAM. Un modello che si carica al limite può funzionare, ma lasciare Windows senza abbastanza memoria per lavorare in modo fluido.

VRAM piena: perché LM Studio può tornare sulla CPU

La GPU non ha memoria infinita. Se la VRAM disponibile non basta per il carico desiderato, una parte del lavoro deve restare fuori dalla scheda video oppure il modello può non caricarsi come previsto.

La pagina ufficiale dei requisiti di LM Studio raccomanda su Windows almeno 16 GB di RAM e una GPU con 4 GB di VRAM dedicata. Sono indicazioni generali, non una garanzia che qualsiasi modello funzioni con 4 GB di VRAM.

Modello, quantizzazione e context possono cambiare la richiesta di memoria di molti gigabyte. Per questo il test corretto non è soltanto chiedersi se la GPU sia compatibile, ma se quella GPU ha abbastanza VRAM per quel modello con quella configurazione.

Interfaccia di lm studio per caricare un modello ai locale

Il context può essere la causa anche se il modello entra nella VRAM

Un errore comune è pensare che basti far entrare i pesi del modello nella memoria. Durante l’uso servono risorse anche per il context e per le strutture utilizzate durante l’inferenza.

Se LM Studio funziona con un context ridotto ma diventa lento, instabile o smette di sfruttare bene la GPU quando aumenti molto il valore, hai già un indizio concreto.

  • prova un context più basso;
  • riapri una nuova chat;
  • controlla di nuovo RAM e VRAM;
  • confronta la velocità di generazione.

Se le prestazioni tornano normali, il problema era molto probabilmente il rapporto tra modello, context e memoria, non un guasto della GPU.

Notebook con GPU integrata e dedicata: quale sta usando LM Studio?

Sui notebook è frequente avere una grafica integrata e una GPU dedicata. Questo rende la diagnosi meno immediata perché Gestione attività mostra più adattatori.

Controlla quale GPU aumenta l’uso di memoria mentre carichi il modello. Se la GPU dedicata resta completamente ferma, verifica prima driver e runtime, poi le impostazioni di caricamento.

Non confondere inoltre memoria GPU condivisa e VRAM dedicata. La memoria condivisa usa una parte della RAM di sistema e non equivale, per prestazioni e comportamento, alla memoria video fisicamente presente sulla scheda dedicata.

LM Studio usa la CPU: è sempre un problema?

No. L’uso della CPU non significa di per sé che qualcosa non funzioni. LM Studio può distribuire il carico tra CPU e GPU e il comportamento dipende dal modello e dal runtime.

Devi preoccuparti soprattutto quando osservi una combinazione coerente di segnali:

  • GPU dedicata praticamente inattiva;
  • VRAM che non viene utilizzata;
  • CPU costantemente satura;
  • generazione molto lenta;
  • modello che dovrebbe invece essere compatibile con la memoria della GPU.

Se il modello risponde velocemente e la memoria GPU viene utilizzata, non inseguire necessariamente un valore del 100% nel grafico.

Se LM Studio è lento, prova prima un modello più piccolo

Prima di modificare decine di impostazioni, prova una verifica semplice: carica un modello sensibilmente più piccolo.

Se con il modello leggero la GPU viene usata correttamente e la velocità aumenta, hai escluso molte cause software. Il problema è probabilmente il carico richiesto dal modello precedente.

Se hai 16 GB di RAM, puoi confrontare le opzioni nella guida ai modelli AI locali per PC con 16 GB. Scegliere una dimensione realistica spesso produce un miglioramento maggiore rispetto a qualsiasi ottimizzazione marginale.

LM Studio senza GPU dedicata: può funzionare?

Sì, con modelli compatibili e aspettative realistiche. Una GPU dedicata è raccomandata, ma l’inferenza locale può funzionare anche facendo maggiore affidamento su CPU e RAM.

In questo caso vedere un uso elevato della CPU è normale. Non c’è un problema da correggere se il computer non dispone di una GPU adatta da utilizzare per l’offload.

Se invece stai valutando un software diverso per il tuo hardware, abbiamo confrontato LM Studio e Ollama spiegando quando conviene un’interfaccia grafica e quando è più utile un ambiente orientato a terminale, API e automazioni.

La sequenza di controlli più veloce

  1. Verifica che Windows riconosca la GPU.
  2. Controlla driver e LM Runtime.
  3. Carica un modello piccolo. Serve come test di base.
  4. Osserva VRAM e GPU durante la generazione.
  5. Controlla il GPU offload. Non forzare il massimo se la VRAM non basta.
  6. Riduci il context.
  7. Stima la memoria necessaria se usi la CLI.
  8. Confronta con un secondo modello. Se uno funziona e l’altro no, il problema è probabilmente nelle risorse richieste.

Quando ha senso reinstallare LM Studio?

La reinstallazione dovrebbe arrivare tardi nella diagnosi, non all’inizio.

Ha più senso prenderla in considerazione se:

  • nessun modello riesce a utilizzare correttamente la GPU;
  • Windows vede la scheda senza problemi;
  • driver e runtime sono aggiornati;
  • hai provato modelli piccoli e context ridotti;
  • la configurazione continua a comportarsi in modo anomalo.

Se invece un modello piccolo usa correttamente la GPU, reinstallare tutto difficilmente risolverà il problema del modello più grande.

Cosa significa in pratica

LM Studio che non mostra il 100% di GPU non è automaticamente mal configurato. La diagnosi corretta nasce dall’insieme di utilizzo della VRAM, velocità, CPU, runtime, offload e risorse richieste dal modello.

Parti da un modello piccolo, verifica che Windows e LM Studio riconoscano correttamente la scheda, poi aumenta gradualmente carico e context. È molto più efficace che forzare impostazioni al massimo o reinstallare il programma senza aver prima identificato il collo di bottiglia.

La tua opinione in un clic

Cosa ne pensi?

La sala è aperta

Entra nella conversazione

Condividi il tuo punto di vista: non serve creare un account. I contributi restano soggetti alla moderazione editoriale.

Traguardo della community0 / 5
Mancano 5 interventi al prossimo traguardo.

Aggiungi la tua voce

Partecipazione libera: inserisci i dati richiesti e pubblica senza registrarti.