Qwen3.8-Flash-Next – otwarte wagi i pierwszy podgląd architektury Qwen4
Qwen udostępnił wagi Qwen3.8-Flash-Next – eksperymentalnego modelu, który wprost pokazuje, w którym kierunku zmierza architektura Qwen4. To nie jest kolejny checkpoint do kolekcji. To bardziej deklaracja intencji niż gotowy produkt. 🧪
Konstrukcja łączy 125 mld parametrów modelu językowego z 51 mld parametrów embeddingów n-gramowych i 4 mld parametrów modułu MTP. Brzmi imponująco, ale w pojedynczym kroku inferencji aktywowanych jest tylko 6 mld parametrów. To ambitna próba przeniesienia części pojemności modelu poza kosztowną ścieżkę obliczeń.
Model zadebiutował 26 sierpnia 2026 roku i już przy pierwszym niezależnym pomiarze (stan na 28 sierpnia) uzyskał 56 punktów i 4. miejsce na 110 modeli w Artificial Analysis Intelligence Index. Wygląda to całkiem poważnie jak na „eksperyment”.
Najważniejsze fakty o modelu
- Eksperymentalny model multimodalny – podgląd architektury zapowiadanej dla Qwen4
- 125 mld parametrów LM + 51 mld embeddingów n-gramowych + 4 mld MTP; aktywnych 6 mld na token
- 512 ekspertów MoE, z czego aktywnych 10 trasowanych i 1 współdzielony
- Natywne okno kontekstowe 262 144 tokeny, rozszerzalne do 1 mln
- Wejście: tekst, obraz, wideo. Wyjście: tekst
- Wagi zajmują około 360 GB na Hugging Face (131 plików Safetensors)
- Licencja: Qwen Community License 1.0 – wiele zastosowań komercyjnych tak, ale z istotnymi ograniczeniami dla MaaS i asystentów do kodowania
| Cecha | Qwen3.8-Flash-Next |
|---|---|
| Typ | Model przyczynowy z enkoderem obrazu, Mixture of Experts |
| Parametry modelu językowego | 125 mld, w tym 6 mld aktywnych na token |
| Dodatkowe parametry | 51 mld embeddingów n-gramowych i 4 mld MTP |
| Liczba ekspertów | 512; aktywnych 10 trasowanych i 1 współdzielony |
| Warstwy | 48 |
| Kontekst | 262 144 tokeny natywnie, do 1 mln po rozszerzeniu |
| Modalności | Wejście: tekst, obraz i wideo; wyjście: tekst |
| Rozmiar repozytorium | Około 360 GB |
| Licencja | Qwen Community License 1.0 |
Małe ostrzeżenie matematyczne: określenie „180 mld parametrów” jest formalnie poprawne (125+51+4), ale zaciera rzeczywistość. Model nie pracuje na 180 mld parametrach jednocześnie. Z drugiej strony – 6 mld aktywnych to nie znaczy, że model zajmie tyle pamięci co typowy model 6B. Wagi ekspertów i tablice n-gramów trzeba gdzieś przechowywać. 💾
Flash-Next vs Qwen3.8-Flash – czym się różnią
W nazwie kluczowe jest słowo „Next”. To nie jest po prostu szybsza odmiana modelu produkcyjnego – to eksperymentalne środowisko testowe dla rozwiązań budowanych z myślą o Qwen4.
Qwen udostępnia też osobny Qwen3.8-Flash jako wersję produkcyjną opartą na Flash-Next. Ma ona domyślny kontekst 1 mln tokenów i wbudowane narzędzia. Tych właściwości nie należy automatycznie przypisywać surowym wagom Flash-Next – to ważna różnica dla kogoś, kto planuje własne wdrożenie.
Architektura – co Qwen zaprojektował z myślą o Qwen4
Hybryda Gated DeltaNet i rzadkiej uwagi
Trzy warstwy Gated DeltaNet są przeplatane jedną warstwą Qwen Sparse Attention (QSA). Gated DeltaNet utrzymuje stan o stałym rozmiarze, co ma ograniczać koszt przetwarzania długiego kontekstu. Warstwa QSA zachowuje dostęp do odległych fragmentów, ale zamiast oceniać każdy token z osobna – wybiera istotne mikrobloki kontekstu.
Qwen twierdzi, że przy kontekście 1 mln tokenów kernel QSA jest 7,6× szybszy od gęstej uwagi podczas prefilla i 4,9× szybszy w dekodowaniu. To pomiar konkretnego kernela – nie gwarancja takiego samego przyspieszenia całej aplikacji. Na czas odpowiedzi wpływają też ładowanie wag, komunikacja między urządzeniami, router MoE, przygotowanie wejścia i silnik serwujący.
Czterogałęziowy strumień resztkowy (Gated Residual)
Zamiast jednego klasycznego strumienia resztkowego model utrzymuje cztery gałęzie, a bramki decydują, które informacje odczytać i gdzie zapisać. Według Qwen rozwiązanie poprawia stabilność treningu i pozwala przechowywać stan resztkowy w FP8 przy niewielkiej stracie jakości.
Embeddingi n-gramowe – największa egzotyka całego projektu
Krótkie sekwencje tokenów służą jako klucze do dużych tablic, które mogą pozostawać w pamięci hosta i być pobierane z wyprzedzeniem. To sposób na zwiększenie pojemności pamięci modelu bez proporcjonalnego wzrostu liczby operacji na token. Ceną jest duży rozmiar wag i zależność od sprawnego transferu danych między pamięcią hosta a akceleratorem.
Co wiemy o treningu, a czego nadal nie ujawniono
Qwen użył dwóch optymalizatorów. Muon obsługiwał dwuwymiarowe macierze pełniące funkcję przekształceń liniowych, a AdamW pozostał przy embeddingach, głowicy wyjściowej, routerze MoE i niskorangowych projekcjach Gated Residual. Zespół zwiększył docelowy batch i learning rate oraz zrezygnował z rozgrzewania rozmiaru batcha – w eksperymentach zwiększało ono liczbę kroków optymalizatora o 18,8% bez żadnej poprawy wyniku.
Model bazowy trenowano na około jednej trzeciej liczby tokenów użytych dla Qwen3.7-Plus-Base i przy około jednej dziewiątej FLOPs. Ale – i tu zaczyna się lista białych plam – raport nie ujawnia bezwzględnej liczby tokenów pełnego treningu, składu danych, liczby akceleratorów ani kosztów. Wartości 400 mld i 80 mld tokenów widoczne w raporcie dotyczą mniejszego modelu z ablacji architektury, nie finalnego checkpointu Flash-Next. Nie warto ich cytować jako rozmiaru treningu tego modelu. 🚫
Niezależne wyniki – mocny start, ale wciąż mało danych
Artificial Analysis zmierzył 56 punktów w Intelligence Index i 4. miejsce na 110 modeli (stan na 28 sierpnia). Przy okazji: 73,4 tokenu wyjściowego na sekundę i 2,99 s czasu do pierwszego tokenu z API Alibaba. To niezależniejszy punkt odniesienia niż tabela producenta, ale pozycja może się zmieniać wraz z dodawaniem kolejnych modeli.
Arena.ai w tablicy WebDev pokazuje wynik AutoEval 1617 (±15). Model nie ma jeszcze głosów użytkowników ani pełnej pozycji opartej na głosowaniu – to wczesny automatyczny pomiar, nie ranking popularności.
Model card Qwen zawiera więcej wyników, ale wszystkie pochodzą z ewaluacji producenta:
- SWE-bench Pro: 62,5
- GPQA Diamond: 91,7
- LiveCodeBench v6: 91,9
- HLE: 35,9 (wobec 40,0 dla Claude Opus 4.6 Max)
- NL2Repo-Bench: 48,1 (wobec 54,2 dla DeepSeek-V4-Flash-0731)
Część testów używała własnych harnessów Qwen, poprawionych zadań lub benchmarków wewnętrznych. Nie jest to proste odpowiedniki niezależnej tablicy.
Cena API i rzeczywiste koszty własnego wdrożenia
Artificial Analysis podaje dla Flash-Next 0,15 USD za 1 mln tokenów wejściowych i 0,47 USD za 1 mln tokenów wyjściowych w API Alibaba. Produkcyjny Qwen3.8-Flash pokazuje bardzo podobne 0,16 i 0,47 USD oraz 0,016 USD za wejście z implicit cache (ceny ze stanu na 28 sierpnia 2026).
Ale uwaga – to nie są koszty samodzielnego hostingu. Własne wdrożenie wymaga pamięci na checkpoint (~360 GB repozytorium), akceleratorów, pamięci hosta i szybkiego transferu. 360 GB to nie jest minimalny wymagany VRAM – rzeczywiste wymagania zależą od precyzji wag, kwantyzacji i sposobu offloadingu. Flash-Next to projekt dla solidnej infrastruktury, nie dla jednej karty konsumenckiej.
Licencja – otwarte wagi to nie to samo co open source
Wagi są publicznie dostępne, ale licencja to nie Apache 2.0. Qwen Community License 1.0 pozwala używać, modyfikować, dystrybuować, hostować i dostrajać model – z istotnymi wyjątkami komercyjnymi:
- Firma świadcząca Model as a Service albo sprzedająca niezależnego asystenta AI do kodowania lub pracy biurowej musi uzyskać od Qwen osobną licencję komercyjną
- Produkty przekraczające 100 mln aktywnych użytkowników miesięcznie lub 20 mln USD miesięcznego przychodu muszą wyraźnie pokazywać nazwę modelu w interfejsie
Możliwość pobrania checkpointu daje kontrolę techniczną i ułatwia badania. Nie gwarantuje jednak pełnej swobody biznesowej ani dostępu do danych treningowych. Warto to przemyśleć przed podjęciem decyzji o wdrożeniu. ⚖️
Dla kogo to ma sens – a dla kogo niekoniecznie
Flash-Next jest interesujący przede wszystkim dla:
- Zespołów badających architekturę LLM
- Operatorów własnej infrastruktury na poważną skalę
- Twórców silników inferencyjnych
- Agentów analizujących interfejsy, dokumenty i nagrania (multimodalność + długi kontekst)
Nie jest natomiast oczywistym wyborem dla małej firmy, która chce po prostu wywołać gotowy model. Produkcyjny Qwen3.8-Flash oferuje łatwiejsze API, domyślny kontekst 1 mln tokenów i wbudowane narzędzia bez bólu głowy. Własny Flash-Next daje większą kontrolę, ale przerzuca na użytkownika odpowiedzialność za infrastrukturę, zgodność licencyjną, monitoring i optymalizację.
Wnioski – co ta premiera mówi o Qwen4
Najważniejszym sygnałem nie jest żaden pojedynczy benchmark. To kierunek projektu: Qwen próbuje rozdzielić pojemność modelu od kosztu każdego tokenu. Rzadki MoE ogranicza liczbę aktywnych parametrów, Gated DeltaNet kompresuje historię, QSA wybiera fragmenty długiego kontekstu, a tablice n-gramowe pracują poza główną ścieżką akceleratora.
Flash-Next nie dowodzi, że Qwen4 będzie najlepszym modelem na rynku ani że cała architektura zachowa przewagę w innych skalach. Pokazuje jednak, że Qwen szuka efektywności nie tylko przez kwantyzację i tańsze API – lecz na poziomie konstrukcji i przepisu treningowego.
Warto obserwować, czy niezależne rankingi potwierdzą wczesny wynik 56 punktów i czy produkcyjne wdrożenia utrzymają deklarowane korzyści przy kontekście zbliżonym do 1 mln tokenów. Na razie to bardzo obiecujący eksperyment. 👀