Migliore LLM per Ryzen AI 9
Scegliere il migliore LLM per Ryzen AI 9 non è una questione di potenza bruta, ma di corrispondenza tra la memoria unificata disponibile, l'architettura del modello (densa o Mixture-of-Experts) e il throughput effettivo dell'iGPU RDNA e della NPU XDNA. Su queste piattaforme, un modello MoE con pochi parametri attivi supera spesso un modello denso più piccolo. Questo articolo illustra le specifiche di VRAM per ciascuna quantizzazione, i throughput attesi, le licenze, i riferimenti dei benchmark e i casi d'uso concreti per costruire una postazione di inferenza locale coerente su Ryzen AI 9.
Capire la limitazione di memoria del Ryzen AI 9
Le APU Ryzen AI 9 (HX e Max) si basano su una memoria unificata condivisa tra CPU, iGPU e NPU. La quantità di memoria allocabile alla GPU determina direttamente il modello che potrai caricare. Su una configurazione Ryzen AI Max 395 dotata di 128 GB di memoria unificata, la memoria utilizzabile per l'inferenza supera ampiamente quella di un HX 370 limitato a circa 32 GB.
Indicazioni per il dimensionamento (ordini di grandezza, da confermare in base alla memoria allocata nel BIOS):
- Q4 : ~0,55–0,60 GB di VRAM per miliardo di parametri memorizzati
- Q5 : circa +20 % rispetto al Q4
- Q8 : circa il doppio del Q4
- FP16 : circa quattro volte il Q4
Per la procedura completa di allocazione NPU/iGPU, consulta la guida Ryzen AI 9 HX e il guida Ryzen AI Max 395. La scelta della quantizzazione è dettagliata nel nostro guida Q4/Q5/Q8.
Perché privilegiare modelli MoE a bassa attivazione
Su una iGPU con una larghezza di banda della memoria moderata, il fattore limitante è il numero di parametri actifs per token, non il totale. Un modello Mixture-of-Experts attiva solo una frazione dei suoi pesi a ogni passaggio.
- Qwen3.8 Flash Next 125B-A6B (125B, ~72 GB Q4, ctx 256000): solo ~6B di parametri attivi, il che lo rende un candidato efficiente per una velocità di generazione interattiva con un'ampia memoria unificata. Vedi la scheda Qwen3.8 Flash Next e l'editore Alibaba su Hugging Face.
- Qwen 3.5 122B-A10B (122B, ~73 GB Q4, ctx 262000, Apache 2.0) : ~10B attivi, buon compromesso qualità/velocità. Vedi la scheda Qwen 3.5 122B-A10B.
- Mixtral 8x22B Instruct (141B, ~82 GB Q4, ctx 64000, Apache 2.0) : architettura MoE storica di Mistral AI su Hugging Face, una scelta affidabile. Vedi la scheda Mixtral 8x22B.
Questi tre modelli rientrano in memoria in Q4 solo su una configurazione con un'elevata memoria unificata (tipo Ryzen AI Max 395, 128 GB). Su un HX 370 con 32 GB, sono fuori portata in locale senza un offload su disco molto lento.
Modelli densi compatti e alternative
Se il tuo carico di lavoro richiede un modello denso più prevedibile:
- Mistral Small 4 (119B, ~72 GB Q4, ctx 256000, Apache 2.0) : licenza permissiva per uso commerciale. Vedi la scheda Mistral Small 4.
- Nemotron 3 Super 120B (120B, ~72 GB Q4, ctx 128000, NVIDIA Open Model License): vedere la scheda Nemotron 3 Super et NVIDIA su Hugging Face.
- DBRX Instruct (132B, ~76 GB Q4, ctx 32768, Databricks Open Model License): vedi la scheda DBRX Instruct.
- dots.llm1 Instruct (142B, ~85 GB Q4, ctx 32768, MIT) : vedere la scheda dots.llm1.
A parità di VRAM, un modello denso richiede più banda passante per token rispetto a un MoE a bassa attivazione: aspettati una velocità inferiore sull'iGPU. Le velocità precise in token/sec su Ryzen AI dipendono dal backend e dall'allocazione della memoria e restano da confermare sulla tua macchina.
Licenze e conformità
Per un uso professionale, la licenza conta quanto il throughput:
- Apache 2.0 : Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4 — uso commerciale esteso.
- MIT : dots.llm1 Instruct — molto permissiva.
- NVIDIA Open Model License : Nemotron 3 Super 120B — controlla le clausole di attribuzione.
- Databricks Open Model License : DBRX Instruct — condizioni specifiche da leggere.
Per le questioni normative europee, consulta la nostra guida alla conformità all'AI Act.
Backend di inferenza raccomandati
La scelta del motore influisce fortemente sul throughput ottenuto:
- llama.cpp : supporto per Vulkan/ROCm per iGPU AMD, formato quantizzato GGUF, ideale per l'uso autogestito su Ryzen AI.
- Ollama : livello software aggiuntivo pratico per gestire i modelli GGUF localmente.
- vLLM : orientato al throughput del server, utile se esponi un'API interna.
Mantieni l'inferenza rigorosamente locale: l'obiettivo di una postazione Ryzen AI 9 è mantenere i tuoi dati sulla macchina.
FAQ
Q: Quale modello entra nella memoria di un Ryzen AI 9 HX 370 (32 GB)?
Con circa 32 GB di memoria unificata, di cui una parte riservata alla GPU, i modelli elencati qui (68 GB o più in Q4) non entrano in memoria. L'HX 370 è pensato piuttosto per modelli più leggeri, non inclusi in questa selezione. Consulta il catalogo filtrato per VRAM e il configuratore per un dimensionamento adeguato alla memoria effettivamente a tua disposizione.
Q: MoE o denso per una iGPU AMD?
Un MoE a bassa attivazione come Qwen3.8 Flash Next 125B-A6B (~6B attivi) richiede meno banda passante per token rispetto a un modello denso da 120B. Su iGPU a banda passante limitata, il MoE offre generalmente un migliore throughput interattivo a qualità comparabile, al prezzo di un maggiore ingombro complessivo in memoria.
Q: Quale quantizzazione scegliere?
Il Q4 massimizza il numero di parametri caricabili e resta il punto di equilibrio comunemente adottato. Il Q5 migliora leggermente la fedeltà con circa il 20% di VRAM in più. Il Q8 raddoppia l'occupazione di memoria: riservalo alle configurazioni da 128 GB. Dettagli nel guida Q4/Q5/Q8.
Q: La NPU accelera l'inferenza degli LLM?
La NPU XDNA è destinata soprattutto a carichi specifici e la sua integrazione nei backend LLM open-source è in evoluzione. In pratica, l'iGPU RDNA tramite Vulkan/ROCm svolge oggi la maggior parte dell'inferenza. Verifica il supporto aggiornato in llama.cpp — lo stato esatto resta da confermare in base al tuo driver.
Q: Qual è la licenza per un uso commerciale?
Preferisci Apache 2.0 (Qwen 3.5 122B-A10B, Mixtral 8x22B, Mistral Small 4) o MIT (dots.llm1 Instruct) per la massima libertà d'uso. Le licenze NVIDIA e Databricks impongono condizioni specifiche da leggere prima di qualsiasi deployment.
Conclusione
Le migliore LLM per Ryzen L'AI 9 dipende soprattutto dalla tua memoria unificata: su una configurazione da 128 GB tipo Ryzen AI Max 395, i modelli MoE a bassa attivazione come Qwen 3.5 122B-A10B o Qwen3.8 Flash Next 125B-A6B offrono il migliore rapporto tra velocità e qualità in Q4, mentre Mistral Small 4 rimane un'opzione densa permissiva. Verifica i tuoi dati di velocità prima di scegliere. Dimensiona il tuo sistema con il configuratore o sfoglia il catalogo complet.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QualeLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.