2026-10-06
Qwen3.8-Flash-Next, l'anteprima di Qwen4
Qwen3.8-Flash-Next FP8 gira su 4× RTX PRO 6000 a circa 1,3 $/h misurati, oppure in Q4 GGUF su una RTX 5090.
Qwen3.8-Flash-Next è l'anteprima della famiglia Qwen4. In catalogo ci sono tre strade, dalla più economica alla più veloce.
Le ricette
- Q4 GGUF su 1× RTX 5090 (llama.cpp/Unsloth): circa 1,2 $/h misurati. Multimodale in ingresso, testo in uscita.
- FP8 su 4× RTX PRO 6000 (vLLM): circa 1,3 $/h misurati, con tabella n-gram nella RAM dell'host per accelerare la generazione.
- FP8 su 4× H200 (vLLM, NVLink): circa 22,8 $/h misurati, per chi cerca il massimo throughput.
I prezzi sono quelli misurati in catalogo e seguono il mercato Vast: l'app mostra il prezzo reale prima di ogni avvio.
Per chi fa sicurezza
È una buona base per code review e triage su repository del cliente: abbastanza leggero da tenerlo acceso a lungo, senza mandare il codice a un'API esterna.