2026-10-06
Qwen3.8-Flash-Next, die Vorschau auf Qwen4
Qwen3.8-Flash-Next FP8 läuft auf 4× RTX PRO 6000 für etwa 1,3 $/h gemessen, oder in Q4 GGUF auf einer RTX 5090.
Qwen3.8-Flash-Next ist die Vorschau auf die Qwen4-Familie. Im Katalog gibt es drei Wege, vom günstigsten zum schnellsten.
Die Rezepte
- Q4 GGUF auf 1× RTX 5090 (llama.cpp/Unsloth): etwa 1,2 $/h gemessen. Multimodale Eingabe, Textausgabe.
- FP8 auf 4× RTX PRO 6000 (vLLM): etwa 1,3 $/h gemessen, mit einer N-Gramm-Tabelle im Host-RAM zur Beschleunigung der Generierung.
- FP8 auf 4× H200 (vLLM, NVLink): etwa 22,8 $/h gemessen, für maximalen Durchsatz.
Die Preise sind die im Katalog gemessenen und folgen dem Vast-Markt: Die App zeigt vor jedem Start den echten Preis.
Für Security-Arbeit
Eine gute Basis für Code-Review und Triage in Kunden-Repositories: leicht genug, um lange zu laufen, ohne Code an eine externe API zu schicken.