IA Act Applicable depuis le 2 août 2026 : les preuves que BrainDup produit. Voir la conformité
← Blog

27. August 2026

Qwen3.8 Flash Next: der Entwurf von Qwen4 schlägt Opus 4.6 bereits

Ein geöffnetes Paket auf einem Zolltresen, aus dem ein blauer Schein von Schaltkreisen dringt, als Bild für Qwen3.8 Flash Next und die chinesischen Modelle mit offenen Gewichten

Am 26. August 2026 stellte Alibaba auf Hugging Face ein Modell mit 125 Milliarden Parametern ein, von denen je Token nur 6 angesprochen werden. Keine Pressekonferenz, keine Warteliste, kein Rahmenvertrag. Ein Verzeichnis, Gewichte, eine Lizenz. Während Washington und Brüssel über Zölle auf Halbleiter verhandeln, kommt die Technik, auf die es ankommt, über einen Kanal herein, den niemand besteuert: den Download. Es ist derselbe Weg wie bei den Paketen von Alibaba, nur ohne das Paket.

Und das ist nicht einmal das fertige Erzeugnis.

Eine Vorschau auf Qwen4, kein Produktionsmodell

Die Endung Next ist kein Verkaufsargument, sie ist eine Warnung. Das amtliche Datenblatt nennt dieses Modell eine experimentelle Vorschau auf die Architektur, die für Qwen4 gedacht ist. Alibaba veröffentlicht nicht sein Flaggschiff, es veröffentlicht den Prüfstand, auf dem dieses Schiff gebaut werden wird, und gibt ihn der ganzen Welt zur Erprobung, noch bevor die endgültige Fassung angekündigt ist.

Die Verfasser stehen ohne Umschweife zu dieser Einordnung: es handelt sich um einen Schritt der Effizienz, nicht um ein Schaustück. Das erklärte Ziel ist, die Wirkung der Architekturentscheidungen auf die Inferenzkosten im großen Maßstab zu messen.

Genau das macht die Zahlen im nächsten Abschnitt interessant. Ein Modell, das sein eigener Anbieter als technische Zwischenübung vorstellt, liegt bereits vor dem besten Modell von Anthropic, bei den Aufgaben, wo beide verglichen werden. Die Frage lautet nicht mehr, was Qwen3.8 Flash Next taugt. Sie lautet, was Qwen4 taugen wird, von dem dieses Verzeichnis nur die Skizze ist.

Was Qwen3.8 Flash Next bringt, in Zahlen

Das Modell heißt Qwen3.8-Flash-Next. Seine Architektur verbindet Gated-DeltaNet-Blöcke mit einer eigenen dünnbesetzten Aufmerksamkeit, der Qwen Sparse Attention, die auf der Ebene von Mikroblöcken arbeitet statt auf einzelnen Token. Achtundvierzig Schichten, eine Schicht von n-Gramm-Einbettungen mit 51 Milliarden Parametern, indiziert auf Bigramme und Trigramme, eine Schicht zur Vorhersage mehrerer Token mit 4 Milliarden.

Die Ergebnisse verdienen eine Pause. Bei jedem der vier Tests, in denen das amtliche Datenblatt es Claude Opus 4.6 gegenüberstellt, zieht das chinesische Modell vorbei.

PrüfstandQwen3.8-Flash-NextClaude Opus 4.6Andere
SWE-bench Pro62,553,4DeepSeek-V4-Flash: 56,0
SWE-bench Multilingual81,077,5Qwen3.7-Plus: 75,8
CoWorkBench73,968,2DeepSeek-V4-Flash: 45,1
AndroidWorld84,562,0Qwen3.8-27B: 81,9
DeepSWE 1.158,7nicht verglichenDeepSeek-V4-Flash: 54,4

Zwei Vorbehalte sind angebracht: diese Zahlen stammen vom Anbieter, nicht von einer unabhängigen Prüfstelle, und das Feld betrifft agentische Aufgaben und Code, nicht die Gesamtheit dessen, was ein Assistent kann.

Bemerkenswert ist nicht der rohe Wert, sondern das Verhältnis. Qwen3.7-Plus setzt insgesamt 397 Milliarden Parameter ein und spricht je Token 17 davon an. Der Neuling spricht 6 an, bei insgesamt 125, und zieht vorbei. Fast dreimal weniger Rechenarbeit je Token, für bessere Ergebnisse.

Der eigene Kontext fasst 262 144 Token, erweiterbar auf eine Million. Für eine Dokumentensuchmaschine im Unternehmen ändert dieses Fenster, wie man Korpora zerlegt.

Offene Gewichte sind nicht Open Source

Hier kommt die Unterscheidung, die die meisten Kommentare plattwalzen werden. Qwen3.8 Flash Next erscheint unter der Lizenz qwen-community-1.0, nicht unter Apache 2.0. Beide sind nicht gleichwertig.

Was die Lizenz weitgehend erlaubt: benutzen, kopieren, verändern, weiterverbreiten, verkaufen, betreiben, nachtrainieren und abgeleitete Werke erstellen. Eine Namensnennung wird erst oberhalb von 100 Millionen monatlich aktiven Nutzenden oder 20 Millionen Dollar Monatsumsatz verpflichtend. Also nie, für einen deutschsprachigen Mittelständler.

Was die Lizenz einschränkt: das Modell als Model as a Service anzubieten verlangt eine gesonderte Vereinbarung mit Qwen. Dasselbe gilt für ein eigenständiges Erzeugnis zur Unterstützung beim Programmieren oder im Büro. Die interne Nutzung der Ableitungen bleibt frei.

Diese Grenze entscheidet über die Architektur. Sie trennt zwei Welten.

Auf der einen Seite die lokale Ausführung: das Modell läuft auf der Infrastruktur des Unternehmens, auf dessen eigenen Unterlagen, für dessen eigene Leute. Keine Genehmigung einzuholen, kein Zähler, keine Gebühr. Das ist der einzige Fall, in dem die Formel vom Paket ohne Zoll wörtlich zutrifft.

Auf der anderen Seite das Teilen: ein Anbieter, der das Modell betreibt und den Zugang weiterverkauft, betreibt Model as a Service und muss eine gesonderte Lizenz mit Qwen aushandeln. Der Zoll taucht genau an dieser Stelle wieder auf, in Gestalt eines Vertrags.

Genau dieser Linie folgt BrainDup vom ersten Tag an. Die Maschine wird beim Kunden ausgerollt, die Unterlagen verlassen ihn nicht, das Modell läuft lokal. Diese Architektur wurde nicht gewählt, um einer chinesischen Lizenzklausel zuvorzukommen, sie wurde für die Vertraulichkeit der Korpora gewählt. Aber sie erzeugt hier eine nützliche Nebenwirkung: sie stellt die Nutzung auf die freie Seite der Grenze.

Bleiben wir bei den Worten genau: dieses Modell hat offene Gewichte, es ist nicht Open Source im Sinne der Open Source Initiative. Der Unterschied zählt an dem Tag, an dem eine Juristin den Vertrag liest.

Sechs Milliarden aktive Parameter heißt nicht kleiner Server

Die Falle ist bekannt, und sie gehört entschärft. Ein MoE-Modell spricht je Token nur einen Teil seiner Experten an, muss sie aber alle in den Speicher laden. Die 180 Milliarden Parameter des vollständigen Modells belegen rund 360 GB in BF16, und immer noch 90 GB auf 4 Bit quantisiert.

Die aktiven Parameter bestimmen die Geschwindigkeit der Inferenz und die Kosten je Token, nicht den Speicherbedarf. Ein Mittelständler, der Qwen3.8 Flash Next bei sich betreiben will, braucht einen ordentlichen GPU-Server, keinen Turm unter dem Schreibtisch. Das Modell verspricht besseren Ertrag bei gleicher Hardware, kein Wunder an Zugänglichkeit.

Was wir in BrainDup erproben werden

Bleibt die praktische Folge aus dem Status dieses Modells: eine experimentelle Vorschau geht nicht in den Betrieb. Wir warten auf die stabile, amtliche Fassung. Drei Fragen werden die Erprobung in BrainDup dann leiten:

  1. Die Treue zu den Quellen. Unsere Invarianten verlangen eine Antwort, die sich bis zum Dokument verfolgen lässt. Ein schnelles Modell, das einen Beleg erfindet, ist ausgeschieden, wie hoch sein Testwert auch sei.
  2. Das Verhalten auf Deutsch. Die veröffentlichten Werte betreffen Code und wissenschaftliche Fragen auf Englisch. Das Korpus einer Kanzlei oder einer Verwaltung im deutschen Sprachraum ist ein anderes Gelände.
  3. Die tatsächlichen Kosten je Anfrage. Sechs Milliarden aktive Parameter kündigen eine geringere Inferenzrechnung an. Wir werden sie auf unseren eigenen Korpora messen, mit unserer eigenen Hardware.

Schluss

China gewinnt diese Runde nicht, indem es Hardware verkauft, sondern indem es Gewichte verschenkt. Und behalten Sie im Kopf, was dieses Modell ist: eine Vorschau. Das Modell, auf das es ankommen wird, heißt Qwen4, es ist noch nicht heraus, und dies ist nur sein Prüfstand.

Merken Sie sich die Bedingung, sie passt in einen Satz: die Unentgeltlichkeit gilt für die lokale Ausführung, nicht für den Weiterverkauf von Zugang. Lesen Sie die Lizenz, bevor Sie eine Architektur festlegen, denn die Architektur entscheidet, auf welche Seite Sie fallen.

Wollen Sie wissen, was eine souveräne Maschine für Ihre internen Unterlagen ändern würde? Die Schulungen The Next Takers behandeln diese Abwägungen an echten Fällen, und eine ein Gespräch mit unserem Team beziffert den Abstand zwischen Ihrer heutigen Lage und einer beherrschten Architektur.

Quellen

Zuerst erschienen auf as3p.de, der allgemeinen Seite von AS3P.