Intermedio 14 minAPU

Ryzen AI Max+ 395 (Strix Halo): 128 GB di memoria per LLM locaux

Il Ryzen AI Max+ 395 (nome in codice Strix Halo) è l'APU con cui AMD affronta direttamente il settore dell'IA locale, finora dominato dai Mac con memoria unificata e dalle GPU da 24 GB. Il suo argomento più forte: fino a 128 GB di memoria condivisa tra CPU, GPU e NPU, di cui si può allocare la stragrande maggioranza al modello. Questa guida fa il punto con onestà su ciò che il Ryzen AI Max+ 395 permette davvero di fare con i LLM — quali modelli 70B e MoE diventano accessibili, a quale velocità, come si confronta con le GPU dedicate e i Mac, e come configurarlo con ROCm e Vulkan.

Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda mini-PC Ryzen AI Max 128 GB →

Di Samir K.·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Perché il Ryzen AI Max+ 395 cambia le carte in tavola per gli LLM locali

Eseguire un modello di grandi dimensioni in locale significa quasi sempre scontrarsi con lo stesso limite: la memoria video. Una RTX 4090 si ferma a 24 GB, una RTX 5090 a 32 GB, e oltre bisogna combinare più schede o passare a un Mac Studio. Il Ryzen AI Max+ 395 affronta questo limite da un'altra prospettiva: invece di una VRAM dedicata limitata, condivide un ampio pool di memoria unificata tra CPU, GPU integrata e NPU. Su un modello dotato di 128 GB, si possono riservare più di 90 GB alla GPU per l'inferenza.

In concreto, questo apre una categoria di macchine che prima non esisteva nel mondo PC: mini-PC e laptop dai prezzi molto variabili, per i quali va verificata la capacità di caricare un modello 70B o persino modelli mixture-of-experts molto più grandi, senza scheda grafica dedicata e senza configurazione multi-GPU. È il primo concorrente x86 credibile del Mac Studio per l’IA locale con un’elevata capacità di memoria.

i
Strix Halo, Ryzen AI Max, Radeon 8060S: di cosa si tratta?
« Strix Halo » è il nome in codice della generazione. « Ryzen AI Max+ 395 » è il modello di fascia alta della serie Ryzen AI Max. La sua GPU integrata si chiama Radeon 8060S. I tre nomi indicano aspetti diversi dello stesso chip: li incontrerai tutti e tre a seconda delle schede prodotto.

#Il chip in dettaglio

Il Ryzen AI Max+ 395 è un'APU monolitica che combina tre motori di calcolo su un solo die, tutti collegati allo stesso controller di memoria. Per il LLM contano soprattutto la GPU e la memoria, ma l'insieme forma un sistema coerente.

CPU — 16 core Zen 5
16 core / 32 thread Zen 5, utili per la preelaborazione, l'offload parziale sulla CPU e tutto ciò che non è l'inferenza sulla GPU vera e propria.
GPU — Radeon 8060S (RDNA 3.5)
40 unità di calcolo con architettura RDNA 3.5. È la GPU integrata più grande sul mercato PC, ed è proprio questa a eseguire l'inferenza tramite ROCm o Vulkan.
NPU — XDNA 2, ~50 TOPS
Un acceleratore dedicato all'IA a basso consumo. Adatto ad alcuni carichi di lavoro ottimizzati, ma la maggior parte dei runtime LLM (Ollama, llama.cpp) oggi è progettata per la GPU, non per la NPU.
Memoria — LPDDR5X fino a 128 GB
Bus a 256 bit, LPDDR5X a 8000 MT/s, pari a circa 256 GB/s di larghezza di banda condivisa. Memoria unificata tra CPU, GPU e NPU.
!
La memoria è saldata: va scelta al momento dell'acquisto
La memoria LPDDR5X di Strix Halo è saldata sulla scheda: niente moduli SO-DIMM, nessuna possibilità di espansione successiva. Se punti a modelli 70B+, scegli fin da subito la variante da 128 GB. Le versioni da 32 o 64 GB limitano tutti i vantaggi della piattaforma per i LLM di grandi dimensioni.
i
Perché questo chip è storico
Da dieci anni, eseguire un modello di grandi dimensioni a casa significava accumulare GPU costosissime per racimolare un po' di VRAM. Strix Halo ribalta la situazione: AMD salda 16 core Zen 5, una GPU di classe RTX 4060-4070 e una NPU da 50 TOPS attorno a un unico pool di memoria da 128 GB — e di colpo un modello 70B quantizzato ci sta per intero, mentre una RTX 5090, a circa 5 700 € a fine settembre 2026, si ferma a 32 GB. È il primo chip per il grande pubblico progettato per l'inferenza locale, anziché adattato a questo scopo.

#128 GB di memoria unificata, il vero punto di forza

Su una GPU classica, la VRAM e la RAM di sistema sono due aree di memoria separate: un modello che supera la capacità della VRAM passa alla RAM tramite PCIe e le prestazioni di inferenza crollano. Sul Ryzen AI Max+ 395 c'è un'unica area di memoria fisica. La GPU accede direttamente alla memoria unificata, esattamente come avviene con la memoria unificata di un Mac Apple Silicon. Nessuna copia tra due spazi di memoria, nessun collo di bottiglia PCIe.

La quantità effettivamente disponibile per il modello dipende dalla ripartizione tra memoria «di sistema» e memoria «GPU». A seconda del firmware e del sistema operativo, si riserva una parte fissa alla GPU (parametro UMA nel BIOS) e/o si lascia che il driver allochi dinamicamente il resto (GTT su Linux). In pratica, su una macchina da 128 GB, è comune rendere accessibili alla GPU 96 GB, e spesso anche di più, per l'inferenza.

Un solo pool
128 GB condivisi. Ciò che il modello non utilizza rimane disponibile per il sistema, e viceversa.
Assegnazione GPU generosa
90 GB e oltre utilizzabili per i pesi del modello e la cache di contesto, a seconda della configurazione del BIOS/driver.
Nessuna barriera PCIe
A differenza di una GPU dedicata che ricorre alla RAM di sistema quando la VRAM non basta, qui tutto rientra nello stesso spazio di memoria ad alta velocità.
Gestione agevole di contesti lunghi
Il margine di memoria permette finestre di contesto estese laddove una GPU da 24 GB deve sacrificare o la dimensione del modello o il contesto.

#Quali modelli ci stanno (70B Q4, MoE)

Con circa 90 GB utilizzabili, il Ryzen AI Max+ 395 cambia completamente l'elenco dei modelli che puoi prendere in considerazione rispetto a una GPU da 16–24 GB. Ecco le fasce concrete, mantenendo i consueti valori di riferimento della VRAM in Q4: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB.

70B in Q4_K_M (~40 GB)
Ci sta ampiamente, con margine per un contesto lungo. È il caso d'uso principale: un modello denso da 70B o equivalente, impossibile su una sola RTX 4090.
70B in Q8_0 (~75 GB)
Ci sta anche questo, quasi senza perdita di qualità. Impensabile su una GPU consumer senza una configurazione multi-GPU.
MoE come Qwen 3.6 35B-A3B o GLM 4.7 Flash
I modelli mixture-of-experts sono ideali: si caricano tutti i pesi in memoria (con un ingombro elevato), ma solo alcuni miliardi di parametri sono attivi per token, quindi la velocità rimane buona.
Modello MoE di grandi dimensioni (200B+ in Q4)
Modelli come Qwen3-235B-A22B in quantizzazione aggressiva possono essere contenuti in 90 GB. Il throughput dipende dal numero di parametri attivi, non dalla dimensione totale.
DeepSeek 671B e simili
Troppo grandi anche in Q4 (ben oltre 100 GB per i pesi). Restano fuori portata senza offload su disco — preferisci un Mac Studio con una quantità molto elevata di memoria o una workstation dedicata a llama.cpp.
→
I MoE sono fatti per questa macchina
Un modello denso da 70B legge 40 GB di pesi per ogni token: la banda passante diventa il fattore limitante. Un MoE con la stessa occupazione di memoria ma con soli 3B di parametri attivi legge solo una frazione della memoria per token, quindi funziona molto più velocemente. Su Strix Halo, privilegia le architetture MoE quando la velocità conta.

#Prestazioni reali: la larghezza di banda è determinante

È il punto da capire prima di ogni acquisto. La generazione di token da parte di un modello denso è limitata dalla larghezza di banda della memoria, non dalla potenza di calcolo pura. La velocità massima teorica si calcola approssimativamente dividendo la larghezza di banda per le dimensioni del modello in memoria.

Il Ryzen AI Max+ 395 offre circa 256 GB/s. Un modello 70B in Q4 (~40 GB) ha quindi un limite teorico di circa 6 token/s, mentre in pratica si osservano piuttosto 4–5 token/s durante la generazione — leggibile, ma non veloce. Al contrario, un MoE 30B-A3B legge solo una piccola parte dei pesi per token e raggiunge facilmente diverse decine di token/s. La preelaborazione del prompt, invece, sfrutta le 40 CU della GPU e mantiene prestazioni accettabili.

Modello denso 70B Q4
≈ 4–5 tok/s in generazione. Comodo per la redazione e l'analisi, lento per chat molto interattive.
Modello denso 32B Q4
Molto più fluido (~19 GB letti/token), buon compromesso qualità/velocità nella vita quotidiana.
MoE 30B-A3B
Decine di tok/s: la velocità dipende dai ~3B attivi, non dai 30B totali.
Confronto RTX
Una RTX 4090 (~1000 GB/s) supera di gran lunga lo Strix Halo in termini di puro throughput, ma si ferma a 24 GB e da sola non può proprio caricare un modello da 70B.
i
Capacità vs velocità: il giusto equilibrio
Con il Ryzen AI Max+ 395 compri capacità di memoria, non velocità. Se la tua esigenza è «eseguire un modello grande che nessuna scheda da 24 GB riesce a caricare», è eccellente. Se la tua esigenza è «ottenere il massimo di token/s con un modello da 7B–14B», una GPU dedicata rimane più veloce e più economica.

#Mini-PC vs laptop vs Mac Studio, il confronto onesto

Il Ryzen AI Max+ 395 è disponibile in diversi formati. La scelta dipende dalla mobilità, dalla capacità di mantenere un raffreddamento efficace nel tempo e dal prezzo, mentre il chip rimane identico. Il riferimento da battere resta il Mac Studio con le sue varianti M-Max/Ultra dotate di un'ampia memoria unificata.

Mini-PC (es. Framework Desktop, GMKtec EVO-X2)
Il miglior rapporto tra prestazioni mantenute nel tempo e prezzo. Raffreddamento stabile per sessioni di inferenza prolungate, compatto, silenzioso, ideale come server domestico 24/7.
Laptop (es. HP ZBook Ultra G1a, Asus ROG Flow Z13)
La stessa capacità di memoria anche in mobilità, ma con throttling termico sotto carico prolungato e autonomia limitata durante l'inferenza. Pratico per lavorare ovunque, meno adatto come server.
Mac Studio (M-Max / Ultra)
Banda passante della memoria molto superiore (diverse centinaia di GB/s, fino a circa 800 GB/s su Ultra) ed ecosistema MLX molto ottimizzato. Più veloce sui modelli densi, ma decisamente più costoso a parità di memoria.
Mac mini M4 Pro
Meno memoria massima, ma eccellente per i modelli fino a 32B. Da considerare se non hai bisogno di modelli da 70B in su.

In sintesi: Strix Halo vince sul prezzo quando serve una capacità di memoria elevata e sull'ecosistema x86/Linux; il Mac Studio vince sulla velocità di generazione e sulla maturità del software. Per usare un modello 70B in modo «accessibile» senza spendere una fortuna, oggi il Ryzen AI Max+ 395 in un mini-PC con 128 GB è l'opzione x86 più indicata.

#Configurazione ROCm e Vulkan su Linux

Su Linux, due strade permettono di utilizzare la GPU integrata: ROCm (lo stack di calcolo AMD) e Vulkan (portabile e spesso più semplice da far funzionare su questa GPU recente). Il passaggio chiave, comune a entrambe, è rendere accessibile alla GPU una quantità sufficiente di memoria.

  1. 01
    Impostare l'allocazione della memoria GPU nel BIOS
    Entra nel BIOS/UEFI e cerca il parametro UMA Frame Buffer Size (o «Dedicated GPU Memory»). Riserva alla GPU una quota generosa della memoria. Il resto sarà allocato dinamicamente dal driver amdgpu tramite la memoria GTT.
  2. 02
    Verificare la memoria GTT rilevata dal driver
    Su Linux, la memoria allocabile dinamicamente alla GPU passa attraverso il meccanismo GTT del driver amdgpu. Un kernel recente (6.10+) e un firmware amdgpu aggiornato massimizzano la parte utilizzabile per l'inferenza.
  3. 03
    Installare uno stack che utilizzi la GPU
    Il modo più semplice è usare una build di Ollama o di llama.cpp con backend Vulkan, che rileva la Radeon 8060S senza una complessa configurazione di ROCm. Per ROCm, installa il pacchetto ufficiale e verifica che la GPU sia effettivamente presente nell'elenco.
  4. 04
    Forzare il target GPU se necessario
    Poiché la GPU integrata non è sempre nell'elenco ufficiale dei target ROCm, a volte è necessario indicare la versione dell'architettura GFX tramite una variabile d'ambiente affinché Ollama/llama.cpp la accetti.
  5. 05
    Avviare un modello e verificare l'offload
    Avvia un modello e verifica che venga effettivamente eseguito sulla GPU (e non sulla CPU) prima di trarre qualsiasi conclusione sulle prestazioni.
Terminale — verificare la GPU e avviare un modello
# Vérifier que le GPU AMD est détecté par ROCm
rocminfo | grep -i "gfx"

# Voir l'occupation mémoire du GPU en temps réel
rocm-smi

# Lancer un gros MoE 2026 avec Ollama
ollama run qwen3.6:35b

# Confirmer que le modèle est sur GPU (et pas CPU)
ollama ps
Terminale — forzare il target GFX per ROCm (se non rilevato)
# Le Radeon 8060S (RDNA 3.5) n'est pas toujours reconnu par défaut.
# Indiquez la version GFX pour qu'Ollama accepte le GPU.
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
→
Vulkan prima, ROCm poi
Su questa piattaforma molto recente, il backend Vulkan di llama.cpp/Ollama è spesso la via più breve per far funzionare la GPU: meno dipendenze, rilevamento automatico. Riserva ROCm all'ottimizzazione delle prestazioni, una volta che tutto funziona. La guida Vulkan del sito spiega in dettaglio la compilazione.

#Configurazione su Windows

Su Windows, l'esperienza è più «plug and play» per quanto riguarda i driver, ma l'allocazione della memoria rimane il punto delicato. La logica è la stessa: assegnare abbastanza memoria alla GPU, poi usare un runtime che la sfrutti.

  1. 01
    Installare l'ultimo driver AMD Adrenalin
    Usa il driver più recente per il Ryzen AI Max+ 395: il supporto agli LLM della GPU integrata e l'allocazione della memoria migliorano a ogni versione. I driver recenti espongono una parte significativa della memoria unificata come VRAM.
  2. 02
    Impostare la memoria grafica dedicata
    Nel BIOS (UMA Frame Buffer Size) o tramite l'utilità AMD, aumenta la memoria grafica dedicata per lasciare spazio ai modelli più grandi. Un valore troppo basso farà sì che parte del modello passi alla CPU.
  3. 03
    Installare LM Studio o Ollama
    LM Studio rileva la GPU AMD e propone un backend adatto; è l'opzione più semplice senza riga di comando. Anche Ollama per Windows funziona ed espone il suo endpoint su http://localhost:11434.
  4. 04
    Caricare un GGUF e verificare l'offload GPU
    In LM Studio, carica un modello 70B in Q4 e porta al massimo il cursore di offload sulla GPU. Verifica che i livelli siano effettivamente sulla GPU e non sulla CPU.
PowerShell — Ollama su Windows
# Vérifier la version d'Ollama
ollama --version

# Lancer un gros MoE 2026 ; l'endpoint local reste sur :11434
ollama run qwen3.6:35b

# Vérifier l'exécution sur GPU
ollama ps
i
Stack consigliata
La combinazione più comoda rimane Ollama (il daemon di inferenza, con endpoint compatibile con OpenAI su :11434) più un'interfaccia come Open WebUI o LM Studio. Qui non c'è nulla di specifico per Strix Halo: una volta sfruttata la GPU, il resto del workflow è identico a quello di qualsiasi altra macchina.

#Risoluzione dei problemi e consigli

Il modello funziona su CPU, non su GPU
Verifica «ollama ps» / «rocm-smi». Spesso la quantità di memoria allocata alla GPU è troppo bassa: aumenta l'UMA Frame Buffer nel BIOS o controlla la GTT su Linux.
ROCm non rileva il Radeon 8060S
La GPU integrata RDNA 3.5 non è sempre presente nell'elenco ufficiale. Esporta HSA_OVERRIDE_GFX_VERSION oppure passa al backend Vulkan, che la rileva senza bisogno di un override.
Generazione insolitamente lenta su un 70B denso
È previsto: ~4–5 tok/s è il limite realistico a 256 GB/s. Per una maggiore velocità, passa a un MoE o a un modello più piccolo — non è un bug.
Impossibile allocare 90 GB alla GPU
Firmware BIOS e driver/kernel troppo vecchi limitano l'allocazione. Aggiorna il BIOS, il driver Adrenalin (Windows) o il kernel/firmware amdgpu (Linux).
Contesto lungo che causa crash
La cache KV si aggiunge ai pesi in memoria. Riduci num_ctx o la dimensione del modello se ti avvicini al limite di circa 90 GB.

#Le macchine che integrano Strix Halo (agosto 2026)

Il successo del chip si vede nella gamma di macchine che lo montano: più di una dozzina lo integrano già, dal mini-PC competitivo alla workstation di marca, dalla console portatile al sistema modulare. I prezzi indicativi qui sotto sono quelli rilevati ad agosto 2026 per le configurazioni da 128 GB — cambiano rapidamente.

Macchine Ryzen AI Max+ 395 disponibili o annunciate (prezzi indicativi di agosto 2026, configurazione da 128 GB)
MacchinaFormatoParticolaritàPrezzo indicativo
Bosgame M5Mini-PCIl più economico del segmento~1 700 $
GMKtec EVO-X2Mini-PC4 uscite 8Kprezzo molto variabile, da verificare
Beelink GTR9 ProMini-PCDoppio 10 GbE~2 000 $
Framework DesktopCase modulareRiparabile, un oggetto di culto tra gli sviluppatoriprezzo molto variabile, da verificare
Corsair AI Workstation 300SFFMarca consolidata, garanzia solida2 000-3 400 $
Minisforum MS-S1 MAXMini-PCSlot PCIe x16: l’unica macchina espandibile~2 500 $
HP Z2 Mini G1aWorkstation 2,7 LCertificata ISV, canale professionale (PRO 395)2 400-3 500 $
Geekom A9 MegaMini-PCSSD da 2 TB di serie~3 200 $
Peladn YO1Mini-PC 2,4 LVenduto per «distribuire un 70B»~1 850 $
Acemagic M1A Pro+Mini-PCFino a 24 TB di archiviazionen.c.
Aoostar NEX395Mini-PCTDP 140 W (il più potente)Cina, UE in arrivo
GPD Win 5Console portatileUn 70B tra le maniannunciato
Minix ER939-AIMini-PCVariante con doppia interfaccia 10 GbEn.c.

Il nostro consiglio d'acquisto si riassume in una riga: a parità di specifiche (il chip è lo stesso ovunque), scegli in base al prezzo, alla garanzia e al raffreddamento. I test di ogni macchina arrivano progressivamente nella nostra sezione Recensioni & test.

#Domande frequenti

I 128 GB di memoria sono veramente utilizzabili per un LLM?+
In gran parte sì. La memoria è unificata: alla GPU possono essere assegnati fino a 96 GB su Windows, e ancora di più su Linux con le impostazioni corrette. Un modello 70B quantizzato in Q4 (~40 GB) entra quindi interamente nella memoria GPU, con spazio anche per il contesto.
Qual è il modello più grande utilizzabile su Strix Halo?+
Un modello 70B quantizzato gira senza difficoltà. AMD ha dimostrato di poter arrivare a circa 120 miliardi di parametri tramite LM Studio aumentando l'allocazione di memoria. Oltre questa soglia, il limite non è più la capacità ma la velocità: la banda passante di 256 GB/s rende lenta la generazione sui modelli densi molto grandi. I MoE (come GLM o Qwen3-30B-A3B) funzionano particolarmente bene su questa piattaforma: pochi parametri attivi, molti parametri ospitati in memoria.
Strix Halo sostituisce una RTX 5090?+
No: non competono sullo stesso terreno. La RTX 5090 è molto più veloce con tutto ciò che rientra nei suoi 32 GB. Strix Halo vince non appena il modello supera questa soglia: esegue ciò che la 5090 semplicemente non riesce a caricare, a un prezzo per il computer completo inferiore a quello della sola scheda.
Quale macchina Strix Halo scegliere?+
Poiché il chip è identico in tutte le macchine, i veri criteri sono il prezzo (Bosgame M5 è il più competitivo), la garanzia e l'affidabilità dell'assistenza post-vendita (Corsair, HP e Framework rassicurano), la possibilità di espansione (il Minisforum MS-S1 MAX è l'unico con uno slot PCIe x16) e il raffreddamento. Consulta le nostre recensioni di ciascuna macchina prima di acquistare.
Windows o Linux per l'IA locale su Strix Halo?+
Entrambi funzionano. Linux offre l'allocazione di memoria GPU più generosa e le migliori prestazioni con llama.cpp/ROCm; Windows è più semplice con LM Studio, che gestisce il chip nativamente. La nostra guida alla configurazione copre entrambi i sistemi, sezione per sezione.

#Per approfondire

Il Ryzen AI Max+ 395 si inserisce in una riflessione più ampia sull'hardware e sui modelli per l'IA locale. Queste guide del sito approfondiscono gli argomenti trattati in questa guida:

Scegliere la GPU per l'IA locale
La guida all'acquisto che mette in prospettiva Strix Halo rispetto alle RTX e ai Mac, in base al tuo budget e ai modelli che vuoi utilizzare.
Ollama con GPU AMD (ROCm)
La configurazione dettagliata di ROCm, utile per ottenere il massimo dal Radeon 8060S una volta che hai la piattaforma a disposizione.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per scegliere tra Q4 veloce e Q8 quasi senza perdita di qualità quando la memoria non manca — esattamente il caso di una macchina da 128 GB.

I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.