Op 26 augustus 2026 zette Alibaba op Hugging Face een model neer van 125 miljard parameters waarvan er per token maar 6 worden aangesproken. Geen persconferentie, geen wachtlijst, geen raamcontract. Een opslagplaats, gewichten, een licentie. Terwijl Washington en Brussel over invoerrechten op halfgeleiders spreken, komt de technologie die telt binnen langs een kanaal dat niemand belast: de download. Het is dezelfde weg als de pakketten van Alibaba, zonder het pakket.
En dit is niet eens het afgewerkte product.
Een voorproef van Qwen4, geen productiemodel
Het achtervoegsel Next is geen verkoopargument, het is een waarschuwing. De officiële fiche noemt dit model een experimentele voorproef van de architectuur die voor Qwen4 is bedoeld. Alibaba publiceert niet zijn vlaggenschip, het publiceert de proefbank waarop dat schip gebouwd zal worden, en geeft die aan de hele wereld ter beproeving nog vóór de definitieve versie is aangekondigd.
De auteurs nemen die omkadering zonder omhaal op zich: het gaat om een stap in doelmatigheid, niet om een uitstalmodel. Het opgegeven doel is het effect van de architectuurkeuzes op de inferentiekosten op grote schaal te meten.
Dat maakt de cijfers in de volgende afdeling juist interessant. Een model dat de uitgever zelf als een tussentijdse technische oefening voorstelt, gaat het beste model van Anthropic al voorbij op de taken waar beide worden vergeleken. De vraag is niet langer wat Qwen3.8 Flash Next waard is. De vraag is wat Qwen4 waard zal zijn, waarvan deze opslagplaats slechts de schets is.
Wat Qwen3.8 Flash Next brengt, in cijfers
Het model heet Qwen3.8-Flash-Next. De architectuur combineert Gated DeltaNet-blokken met een eigen ijle aandacht, de Qwen Sparse Attention, die op het niveau van microblokken werkt in plaats van op afzonderlijke tokens. Achtenveertig lagen, een laag n-gram-inbeddingen van 51 miljard parameters geïndexeerd op bigrammen en trigrammen, een laag voor voorspelling van meerdere tokens van 4 miljard.
De uitkomsten verdienen aandacht. Op elk van de vier tests waarop de officiële fiche het tegenover Claude Opus 4.6 zet, gaat het Chinese model voorop.
| Test | Qwen3.8-Flash-Next | Claude Opus 4.6 | Andere |
|---|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 | DeepSeek-V4-Flash: 56,0 |
| SWE-bench Multilingual | 81,0 | 77,5 | Qwen3.7-Plus: 75,8 |
| CoWorkBench | 73,9 | 68,2 | DeepSeek-V4-Flash: 45,1 |
| AndroidWorld | 84,5 | 62,0 | Qwen3.8-27B: 81,9 |
| DeepSWE 1.1 | 58,7 | niet vergeleken | DeepSeek-V4-Flash: 54,4 |
Twee voorbehouden zijn op hun plaats: die cijfers komen van de uitgever, niet van een onafhankelijke beoordelaar, en het panel gaat over agentische taken en code, niet over het geheel van wat een assistent kan.
Het opmerkelijke is niet de ruwe score, het is de verhouding. Qwen3.7-Plus zet 397 miljard parameters in totaal in en spreekt er 17 aan per token. De nieuwkomer spreekt er 6 aan, op een totaal van 125, en gaat eroverheen. Bijna drie keer minder rekenwerk per token, voor betere uitkomsten.
Het eigen context houdt 262 144 tokens, uit te breiden tot een miljoen. Voor een documentaire zoekmotor van een onderneming verandert dat venster de manier waarop men corpora opdeelt.
Open gewichten is niet open source
Hier komt de nuance die de meeste commentaren zullen platwalsen. Qwen3.8 Flash Next verschijnt onder de licentie qwen-community-1.0, niet onder Apache 2.0. De twee zijn niet gelijkwaardig.
Wat de licentie ruim toestaat: gebruiken, kopiëren, wijzigen, herverdelen, verkopen, hosten, bijschaven en afgeleide werken maken. Naamsvermelding wordt pas verplicht boven 100 miljoen maandelijkse actieve gebruikers of 20 miljoen dollar maandelijkse inkomsten. Met andere woorden nooit, voor een Vlaamse of Nederlandse kmo.
Wat de licentie beperkt: het model als Model as a Service aanbieden vereist een afzonderlijke overeenkomst met Qwen. Hetzelfde geldt voor een zelfstandig product voor hulp bij het programmeren of voor kantoorwerk. Het interne gebruik van afgeleiden blijft vrij.
Die grens bepaalt de architectuur. Ze scheidt twee werelden.
Aan de ene kant de lokale uitvoering: het model draait op de infrastructuur van de onderneming, op haar eigen documenten, voor haar eigen mensen. Geen toestemming te vragen, geen teller, geen vergoeding. Dat is het enige geval waarin de formule van het pakket zonder douane letterlijk waar is.
Aan de andere kant het delen: een uitgever die het model host en toegang doorverkoopt, doet aan Model as a Service en moet een afzonderlijke licentie met Qwen bedingen. De douane duikt op dat precieze punt weer op, in de vorm van een contract.
Dat is precies de lijn die BrainDup vanaf de eerste dag volgt. De motor wordt bij de klant uitgerold, de documenten gaan er niet uit, het model draait lokaal. Die architectuur is niet gekozen om op een Chinese licentiebepaling vooruit te lopen, ze is gekozen voor de vertrouwelijkheid van de corpora. Maar ze levert hier een nuttig neveneffect op: ze zet het gebruik aan de vrije kant van de grens.
Laten wij nauwkeurig blijven in de woorden: dit model heeft open gewichten, het is geen open source in de zin van het Open Source Initiative. Dat onderscheid telt op de dag dat een jurist het contract leest.
Zes miljard actieve parameters betekent geen kleine server
De valstrik is bekend en moet worden ontmanteld. Een MoE-model spreekt maar een deel van zijn experts aan per token, maar het moet ze allemaal in het geheugen laden. De 180 miljard parameters van het volledige model nemen ongeveer 360 GB in beslag in BF16, en nog altijd 90 GB gekwantiseerd op 4 bits.
De actieve parameters bepalen de snelheid van de inferentie en de kosten per token, niet de geheugenvoetafdruk. Een kmo die Qwen3.8 Flash Next bij zich wil laten draaien, heeft een degelijke GPU-server nodig, geen toren onder een bureau. Het model belooft een beter rendement bij gelijk materieel, geen wonder van toegankelijkheid.
Wat wij in BrainDup gaan beproeven
Blijft het praktische gevolg van de status van dit model: een experimentele voorproef gaat niet in productie. Wij wachten op de stabiele, officiële versie. Drie vragen zullen de proef in BrainDup dan sturen:
- De trouw aan de bronnen. Onze invarianten eisen een antwoord dat tot het document te volgen is. Een snel model dat een bronvermelding verzint, valt af, wat zijn testscore ook is.
- Het gedrag in het Nederlands. De gepubliceerde scores gaan over code en wetenschappelijke vragen in het Engels. Het corpus van een kantoor of een bestuur in het Nederlands is een ander terrein.
- De werkelijke kosten per vraag. Zes miljard actieve parameters kondigen een lagere inferentierekening aan. Wij zullen die meten op onze eigen corpora, met ons eigen materieel.
Besluit
China wint deze ronde niet door materieel te verkopen, het wint ze door gewichten weg te geven. En onthoud wat dit model is: een voorproef. Het model dat zal tellen heet Qwen4, het is nog niet uit, en dit is er slechts de proefbank van.
Onthoud de voorwaarde, ze past in één zin: de kosteloosheid geldt voor de lokale uitvoering, niet voor het doorverkopen van toegang. Lees de licentie voordat u een architectuur vastlegt, want het is de architectuur die bepaalt aan welke kant u valt.
Wilt u weten wat een soevereine motor voor uw interne documenten zou veranderen? De opleidingen The Next Takers, in het Frans behandelen deze afwegingen op echte gevallen, en een een gesprek met ons team becijfert het verschil tussen uw huidige toestand en een beheerste architectuur.
Bronnen
Eerst verschenen op as3p.nl, de algemene site van AS3P.