2026-10-06
Qwen3.8-Flash-Next, l'avant-première de Qwen4
Qwen3.8-Flash-Next FP8 tourne sur 4× RTX PRO 6000 pour environ 1,3 $/h mesurés, ou en Q4 GGUF sur une RTX 5090.
Qwen3.8-Flash-Next est l'avant-première de la famille Qwen4. Le catalogue propose trois voies, de la moins chère à la plus rapide.
Les recettes
- Q4 GGUF sur 1× RTX 5090 (llama.cpp/Unsloth) : environ 1,2 $/h mesurés. Entrée multimodale, sortie texte.
- FP8 sur 4× RTX PRO 6000 (vLLM) : environ 1,3 $/h mesurés, avec une table n-gram en RAM hôte pour accélérer la génération.
- FP8 sur 4× H200 (vLLM, NVLink) : environ 22,8 $/h mesurés, pour un débit maximal.
Les prix sont ceux mesurés au catalogue et suivent le marché Vast : l'application affiche le prix réel avant chaque démarrage.
Pour le travail de sécurité
Une bonne base pour la revue de code et le triage sur les dépôts clients : assez léger pour rester allumé longtemps, sans envoyer le code à une API externe.