2026-10-06
Qwen3.8-Flash-Next, el adelanto de Qwen4
Qwen3.8-Flash-Next FP8 funciona en 4× RTX PRO 6000 por unos 1,3 $/h medidos, o en Q4 GGUF en una RTX 5090.
Qwen3.8-Flash-Next es el adelanto de la familia Qwen4. En el catálogo hay tres opciones, de la más barata a la más rápida.
Las recetas
- Q4 GGUF en 1× RTX 5090 (llama.cpp/Unsloth): unos 1,2 $/h medidos. Entrada multimodal, salida de texto.
- FP8 en 4× RTX PRO 6000 (vLLM): unos 1,3 $/h medidos, con una tabla n-gram en la RAM del host para acelerar la generación.
- FP8 en 4× H200 (vLLM, NVLink): unos 22,8 $/h medidos, para el máximo rendimiento.
Los precios son los medidos en el catálogo y siguen el mercado de Vast: la app muestra el precio real antes de cada inicio.
Para el trabajo de seguridad
Una buena base para revisión de código y triaje en repositorios de clientes: lo bastante ligero para tenerlo encendido mucho tiempo, sin enviar el código a una API externa.