Ryzen AI Max+ 395 (Strix Halo): 128 GB di memoria per LLM locaux
Il Ryzen AI Max+ 395 (nome in codice Strix Halo) è l'APU con cui AMD affronta direttamente il settore dell'IA locale, finora dominato dai Mac con memoria unificata e dalle GPU da 24 GB. Il suo argomento più forte: fino a 128 GB di memoria condivisa tra CPU, GPU e NPU, di cui si può allocare la stragrande maggioranza al modello. Questa guida fa il punto con onestà su ciò che il Ryzen AI Max+ 395 permette davvero di fare con i LLM — quali modelli 70B e MoE diventano accessibili, a quale velocità, come si confronta con le GPU dedicate e i Mac, e come configurarlo con ROCm e Vulkan.
Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda mini-PC Ryzen AI Max 128 GB →
Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Perché il Ryzen AI Max+ 395 cambia le carte in tavola per gli LLM locali
Eseguire un modello di grandi dimensioni in locale significa quasi sempre scontrarsi con lo stesso limite: la memoria video. Una RTX 4090 si ferma a 24 GB, una RTX 5090 a 32 GB, e oltre bisogna combinare più schede o passare a un Mac Studio. Il Ryzen AI Max+ 395 affronta questo limite da un'altra prospettiva: invece di una VRAM dedicata limitata, condivide un ampio pool di memoria unificata tra CPU, GPU integrata e NPU. Su un modello dotato di 128 GB, si possono riservare più di 90 GB alla GPU per l'inferenza.
In concreto, questo apre una categoria di macchine che prima non esisteva nel mondo PC: mini-PC e laptop dai prezzi molto variabili, per i quali va verificata la capacità di caricare un modello 70B o persino modelli mixture-of-experts molto più grandi, senza scheda grafica dedicata e senza configurazione multi-GPU. È il primo concorrente x86 credibile del Mac Studio per l’IA locale con un’elevata capacità di memoria.
#Il chip in dettaglio
Il Ryzen AI Max+ 395 è un'APU monolitica che combina tre motori di calcolo su un solo die, tutti collegati allo stesso controller di memoria. Per il LLM contano soprattutto la GPU e la memoria, ma l'insieme forma un sistema coerente.
- CPU — 16 core Zen 5
- 16 core / 32 thread Zen 5, utili per la preelaborazione, l'offload parziale sulla CPU e tutto ciò che non è l'inferenza sulla GPU vera e propria.
- GPU — Radeon 8060S (RDNA 3.5)
- 40 unità di calcolo con architettura RDNA 3.5. È la GPU integrata più grande sul mercato PC, ed è proprio questa a eseguire l'inferenza tramite ROCm o Vulkan.
- NPU — XDNA 2, ~50 TOPS
- Un acceleratore dedicato all'IA a basso consumo. Adatto ad alcuni carichi di lavoro ottimizzati, ma la maggior parte dei runtime LLM (Ollama, llama.cpp) oggi è progettata per la GPU, non per la NPU.
- Memoria — LPDDR5X fino a 128 GB
- Bus a 256 bit, LPDDR5X a 8000 MT/s, pari a circa 256 GB/s di larghezza di banda condivisa. Memoria unificata tra CPU, GPU e NPU.
#128 GB di memoria unificata, il vero punto di forza
Su una GPU classica, la VRAM e la RAM di sistema sono due aree di memoria separate: un modello che supera la capacità della VRAM passa alla RAM tramite PCIe e le prestazioni di inferenza crollano. Sul Ryzen AI Max+ 395 c'è un'unica area di memoria fisica. La GPU accede direttamente alla memoria unificata, esattamente come avviene con la memoria unificata di un Mac Apple Silicon. Nessuna copia tra due spazi di memoria, nessun collo di bottiglia PCIe.
La quantità effettivamente disponibile per il modello dipende dalla ripartizione tra memoria «di sistema» e memoria «GPU». A seconda del firmware e del sistema operativo, si riserva una parte fissa alla GPU (parametro UMA nel BIOS) e/o si lascia che il driver allochi dinamicamente il resto (GTT su Linux). In pratica, su una macchina da 128 GB, è comune rendere accessibili alla GPU 96 GB, e spesso anche di più, per l'inferenza.
- Un solo pool
- 128 GB condivisi. Ciò che il modello non utilizza rimane disponibile per il sistema, e viceversa.
- Assegnazione GPU generosa
- 90 GB e oltre utilizzabili per i pesi del modello e la cache di contesto, a seconda della configurazione del BIOS/driver.
- Nessuna barriera PCIe
- A differenza di una GPU dedicata che ricorre alla RAM di sistema quando la VRAM non basta, qui tutto rientra nello stesso spazio di memoria ad alta velocità.
- Gestione agevole di contesti lunghi
- Il margine di memoria permette finestre di contesto estese laddove una GPU da 24 GB deve sacrificare o la dimensione del modello o il contesto.
#Quali modelli ci stanno (70B Q4, MoE)
Con circa 90 GB utilizzabili, il Ryzen AI Max+ 395 cambia completamente l'elenco dei modelli che puoi prendere in considerazione rispetto a una GPU da 16–24 GB. Ecco le fasce concrete, mantenendo i consueti valori di riferimento della VRAM in Q4: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB.
- 70B in Q4_K_M (~40 GB)
- Ci sta ampiamente, con margine per un contesto lungo. È il caso d'uso principale: un modello denso da 70B o equivalente, impossibile su una sola RTX 4090.
- 70B in Q8_0 (~75 GB)
- Ci sta anche questo, quasi senza perdita di qualità. Impensabile su una GPU consumer senza una configurazione multi-GPU.
- MoE come Qwen 3.6 35B-A3B o GLM 4.7 Flash
- I modelli mixture-of-experts sono ideali: si caricano tutti i pesi in memoria (con un ingombro elevato), ma solo alcuni miliardi di parametri sono attivi per token, quindi la velocità rimane buona.
- Modello MoE di grandi dimensioni (200B+ in Q4)
- Modelli come Qwen3-235B-A22B in quantizzazione aggressiva possono essere contenuti in 90 GB. Il throughput dipende dal numero di parametri attivi, non dalla dimensione totale.
- DeepSeek 671B e simili
- Troppo grandi anche in Q4 (ben oltre 100 GB per i pesi). Restano fuori portata senza offload su disco — preferisci un Mac Studio con una quantità molto elevata di memoria o una workstation dedicata a llama.cpp.
#Prestazioni reali: la larghezza di banda è determinante
È il punto da capire prima di ogni acquisto. La generazione di token da parte di un modello denso è limitata dalla larghezza di banda della memoria, non dalla potenza di calcolo pura. La velocità massima teorica si calcola approssimativamente dividendo la larghezza di banda per le dimensioni del modello in memoria.
Il Ryzen AI Max+ 395 offre circa 256 GB/s. Un modello 70B in Q4 (~40 GB) ha quindi un limite teorico di circa 6 token/s, mentre in pratica si osservano piuttosto 4–5 token/s durante la generazione — leggibile, ma non veloce. Al contrario, un MoE 30B-A3B legge solo una piccola parte dei pesi per token e raggiunge facilmente diverse decine di token/s. La preelaborazione del prompt, invece, sfrutta le 40 CU della GPU e mantiene prestazioni accettabili.
- Modello denso 70B Q4
- ≈ 4–5 tok/s in generazione. Comodo per la redazione e l'analisi, lento per chat molto interattive.
- Modello denso 32B Q4
- Molto più fluido (~19 GB letti/token), buon compromesso qualità/velocità nella vita quotidiana.
- MoE 30B-A3B
- Decine di tok/s: la velocità dipende dai ~3B attivi, non dai 30B totali.
- Confronto RTX
- Una RTX 4090 (~1000 GB/s) supera di gran lunga lo Strix Halo in termini di puro throughput, ma si ferma a 24 GB e da sola non può proprio caricare un modello da 70B.
#Mini-PC vs laptop vs Mac Studio, il confronto onesto
Il Ryzen AI Max+ 395 è disponibile in diversi formati. La scelta dipende dalla mobilità, dalla capacità di mantenere un raffreddamento efficace nel tempo e dal prezzo, mentre il chip rimane identico. Il riferimento da battere resta il Mac Studio con le sue varianti M-Max/Ultra dotate di un'ampia memoria unificata.
- Mini-PC (es. Framework Desktop, GMKtec EVO-X2)
- Il miglior rapporto tra prestazioni mantenute nel tempo e prezzo. Raffreddamento stabile per sessioni di inferenza prolungate, compatto, silenzioso, ideale come server domestico 24/7.
- Laptop (es. HP ZBook Ultra G1a, Asus ROG Flow Z13)
- La stessa capacità di memoria anche in mobilità, ma con throttling termico sotto carico prolungato e autonomia limitata durante l'inferenza. Pratico per lavorare ovunque, meno adatto come server.
- Mac Studio (M-Max / Ultra)
- Banda passante della memoria molto superiore (diverse centinaia di GB/s, fino a circa 800 GB/s su Ultra) ed ecosistema MLX molto ottimizzato. Più veloce sui modelli densi, ma decisamente più costoso a parità di memoria.
- Mac mini M4 Pro
- Meno memoria massima, ma eccellente per i modelli fino a 32B. Da considerare se non hai bisogno di modelli da 70B in su.
In sintesi: Strix Halo vince sul prezzo quando serve una capacità di memoria elevata e sull'ecosistema x86/Linux; il Mac Studio vince sulla velocità di generazione e sulla maturità del software. Per usare un modello 70B in modo «accessibile» senza spendere una fortuna, oggi il Ryzen AI Max+ 395 in un mini-PC con 128 GB è l'opzione x86 più indicata.
#Configurazione ROCm e Vulkan su Linux
Su Linux, due strade permettono di utilizzare la GPU integrata: ROCm (lo stack di calcolo AMD) e Vulkan (portabile e spesso più semplice da far funzionare su questa GPU recente). Il passaggio chiave, comune a entrambe, è rendere accessibile alla GPU una quantità sufficiente di memoria.
- 01Impostare l'allocazione della memoria GPU nel BIOSEntra nel BIOS/UEFI e cerca il parametro UMA Frame Buffer Size (o «Dedicated GPU Memory»). Riserva alla GPU una quota generosa della memoria. Il resto sarà allocato dinamicamente dal driver amdgpu tramite la memoria GTT.
- 02Verificare la memoria GTT rilevata dal driverSu Linux, la memoria allocabile dinamicamente alla GPU passa attraverso il meccanismo GTT del driver amdgpu. Un kernel recente (6.10+) e un firmware amdgpu aggiornato massimizzano la parte utilizzabile per l'inferenza.
- 03Installare uno stack che utilizzi la GPUIl modo più semplice è usare una build di Ollama o di llama.cpp con backend Vulkan, che rileva la Radeon 8060S senza una complessa configurazione di ROCm. Per ROCm, installa il pacchetto ufficiale e verifica che la GPU sia effettivamente presente nell'elenco.
- 04Forzare il target GPU se necessarioPoiché la GPU integrata non è sempre nell'elenco ufficiale dei target ROCm, a volte è necessario indicare la versione dell'architettura GFX tramite una variabile d'ambiente affinché Ollama/llama.cpp la accetti.
- 05Avviare un modello e verificare l'offloadAvvia un modello e verifica che venga effettivamente eseguito sulla GPU (e non sulla CPU) prima di trarre qualsiasi conclusione sulle prestazioni.
#Configurazione su Windows
Su Windows, l'esperienza è più «plug and play» per quanto riguarda i driver, ma l'allocazione della memoria rimane il punto delicato. La logica è la stessa: assegnare abbastanza memoria alla GPU, poi usare un runtime che la sfrutti.
- 01Installare l'ultimo driver AMD AdrenalinUsa il driver più recente per il Ryzen AI Max+ 395: il supporto agli LLM della GPU integrata e l'allocazione della memoria migliorano a ogni versione. I driver recenti espongono una parte significativa della memoria unificata come VRAM.
- 02Impostare la memoria grafica dedicataNel BIOS (UMA Frame Buffer Size) o tramite l'utilità AMD, aumenta la memoria grafica dedicata per lasciare spazio ai modelli più grandi. Un valore troppo basso farà sì che parte del modello passi alla CPU.
- 03Installare LM Studio o OllamaLM Studio rileva la GPU AMD e propone un backend adatto; è l'opzione più semplice senza riga di comando. Anche Ollama per Windows funziona ed espone il suo endpoint su http://localhost:11434.
- 04Caricare un GGUF e verificare l'offload GPUIn LM Studio, carica un modello 70B in Q4 e porta al massimo il cursore di offload sulla GPU. Verifica che i livelli siano effettivamente sulla GPU e non sulla CPU.
#Risoluzione dei problemi e consigli
- Il modello funziona su CPU, non su GPU
- Verifica «ollama ps» / «rocm-smi». Spesso la quantità di memoria allocata alla GPU è troppo bassa: aumenta l'UMA Frame Buffer nel BIOS o controlla la GTT su Linux.
- ROCm non rileva il Radeon 8060S
- La GPU integrata RDNA 3.5 non è sempre presente nell'elenco ufficiale. Esporta HSA_OVERRIDE_GFX_VERSION oppure passa al backend Vulkan, che la rileva senza bisogno di un override.
- Generazione insolitamente lenta su un 70B denso
- È previsto: ~4–5 tok/s è il limite realistico a 256 GB/s. Per una maggiore velocità, passa a un MoE o a un modello più piccolo — non è un bug.
- Impossibile allocare 90 GB alla GPU
- Firmware BIOS e driver/kernel troppo vecchi limitano l'allocazione. Aggiorna il BIOS, il driver Adrenalin (Windows) o il kernel/firmware amdgpu (Linux).
- Contesto lungo che causa crash
- La cache KV si aggiunge ai pesi in memoria. Riduci num_ctx o la dimensione del modello se ti avvicini al limite di circa 90 GB.
#Le macchine che integrano Strix Halo (agosto 2026)
Il successo del chip si vede nella gamma di macchine che lo montano: più di una dozzina lo integrano già, dal mini-PC competitivo alla workstation di marca, dalla console portatile al sistema modulare. I prezzi indicativi qui sotto sono quelli rilevati ad agosto 2026 per le configurazioni da 128 GB — cambiano rapidamente.
| Macchina | Formato | Particolarità | Prezzo indicativo |
|---|---|---|---|
| Bosgame M5 | Mini-PC | Il più economico del segmento | ~1 700 $ |
| GMKtec EVO-X2 | Mini-PC | 4 uscite 8K | prezzo molto variabile, da verificare |
| Beelink GTR9 Pro | Mini-PC | Doppio 10 GbE | ~2 000 $ |
| Framework Desktop | Case modulare | Riparabile, un oggetto di culto tra gli sviluppatori | prezzo molto variabile, da verificare |
| Corsair AI Workstation 300 | SFF | Marca consolidata, garanzia solida | 2 000-3 400 $ |
| Minisforum MS-S1 MAX | Mini-PC | Slot PCIe x16: l’unica macchina espandibile | ~2 500 $ |
| HP Z2 Mini G1a | Workstation 2,7 L | Certificata ISV, canale professionale (PRO 395) | 2 400-3 500 $ |
| Geekom A9 Mega | Mini-PC | SSD da 2 TB di serie | ~3 200 $ |
| Peladn YO1 | Mini-PC 2,4 L | Venduto per «distribuire un 70B» | ~1 850 $ |
| Acemagic M1A Pro+ | Mini-PC | Fino a 24 TB di archiviazione | n.c. |
| Aoostar NEX395 | Mini-PC | TDP 140 W (il più potente) | Cina, UE in arrivo |
| GPD Win 5 | Console portatile | Un 70B tra le mani | annunciato |
| Minix ER939-AI | Mini-PC | Variante con doppia interfaccia 10 GbE | n.c. |
Il nostro consiglio d'acquisto si riassume in una riga: a parità di specifiche (il chip è lo stesso ovunque), scegli in base al prezzo, alla garanzia e al raffreddamento. I test di ogni macchina arrivano progressivamente nella nostra sezione Recensioni & test.
#Domande frequenti
I 128 GB di memoria sono veramente utilizzabili per un LLM?+
Qual è il modello più grande utilizzabile su Strix Halo?+
Strix Halo sostituisce una RTX 5090?+
Quale macchina Strix Halo scegliere?+
Windows o Linux per l'IA locale su Strix Halo?+
#Per approfondire
Il Ryzen AI Max+ 395 si inserisce in una riflessione più ampia sull'hardware e sui modelli per l'IA locale. Queste guide del sito approfondiscono gli argomenti trattati in questa guida:
- Scegliere la GPU per l'IA locale
- La guida all'acquisto che mette in prospettiva Strix Halo rispetto alle RTX e ai Mac, in base al tuo budget e ai modelli che vuoi utilizzare.
- Ollama con GPU AMD (ROCm)
- La configurazione dettagliata di ROCm, utile per ottenere il massimo dal Radeon 8060S una volta che hai la piattaforma a disposizione.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per scegliere tra Q4 veloce e Q8 quasi senza perdita di qualità quando la memoria non manca — esattamente il caso di una macchina da 128 GB.
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.