Blog 1 września 2026

**Qwen3.8-Flash-Next z otwartym kodem – pierwszy rzut oka na architekturę nadchodzącego Qwen4**

Phoebe
Phoebe 1 września 2026
**Qwen3.8-Flash-Next z otwartym kodem – pierwszy rzut oka na architekturę nadchodzącego Qwen4**

Qwen3.8-Flash-Next – otwarte wagi i pierwszy podgląd architektury Qwen4

Qwen udostępnił wagi Qwen3.8-Flash-Next – eksperymentalnego modelu, który wprost pokazuje, w którym kierunku zmierza architektura Qwen4. To nie jest kolejny checkpoint do kolekcji. To bardziej deklaracja intencji niż gotowy produkt. 🧪

Konstrukcja łączy 125 mld parametrów modelu językowego z 51 mld parametrów embeddingów n-gramowych i 4 mld parametrów modułu MTP. Brzmi imponująco, ale w pojedynczym kroku inferencji aktywowanych jest tylko 6 mld parametrów. To ambitna próba przeniesienia części pojemności modelu poza kosztowną ścieżkę obliczeń.

Model zadebiutował 26 sierpnia 2026 roku i już przy pierwszym niezależnym pomiarze (stan na 28 sierpnia) uzyskał 56 punktów i 4. miejsce na 110 modeli w Artificial Analysis Intelligence Index. Wygląda to całkiem poważnie jak na „eksperyment”.

Najważniejsze fakty o modelu

  • Eksperymentalny model multimodalny – podgląd architektury zapowiadanej dla Qwen4
  • 125 mld parametrów LM + 51 mld embeddingów n-gramowych + 4 mld MTP; aktywnych 6 mld na token
  • 512 ekspertów MoE, z czego aktywnych 10 trasowanych i 1 współdzielony
  • Natywne okno kontekstowe 262 144 tokeny, rozszerzalne do 1 mln
  • Wejście: tekst, obraz, wideo. Wyjście: tekst
  • Wagi zajmują około 360 GB na Hugging Face (131 plików Safetensors)
  • Licencja: Qwen Community License 1.0 – wiele zastosowań komercyjnych tak, ale z istotnymi ograniczeniami dla MaaS i asystentów do kodowania
Cecha Qwen3.8-Flash-Next
Typ Model przyczynowy z enkoderem obrazu, Mixture of Experts
Parametry modelu językowego 125 mld, w tym 6 mld aktywnych na token
Dodatkowe parametry 51 mld embeddingów n-gramowych i 4 mld MTP
Liczba ekspertów 512; aktywnych 10 trasowanych i 1 współdzielony
Warstwy 48
Kontekst 262 144 tokeny natywnie, do 1 mln po rozszerzeniu
Modalności Wejście: tekst, obraz i wideo; wyjście: tekst
Rozmiar repozytorium Około 360 GB
Licencja Qwen Community License 1.0

Małe ostrzeżenie matematyczne: określenie „180 mld parametrów” jest formalnie poprawne (125+51+4), ale zaciera rzeczywistość. Model nie pracuje na 180 mld parametrach jednocześnie. Z drugiej strony – 6 mld aktywnych to nie znaczy, że model zajmie tyle pamięci co typowy model 6B. Wagi ekspertów i tablice n-gramów trzeba gdzieś przechowywać. 💾

Flash-Next vs Qwen3.8-Flash – czym się różnią

W nazwie kluczowe jest słowo „Next”. To nie jest po prostu szybsza odmiana modelu produkcyjnego – to eksperymentalne środowisko testowe dla rozwiązań budowanych z myślą o Qwen4.

Qwen udostępnia też osobny Qwen3.8-Flash jako wersję produkcyjną opartą na Flash-Next. Ma ona domyślny kontekst 1 mln tokenów i wbudowane narzędzia. Tych właściwości nie należy automatycznie przypisywać surowym wagom Flash-Next – to ważna różnica dla kogoś, kto planuje własne wdrożenie.

Architektura – co Qwen zaprojektował z myślą o Qwen4

Hybryda Gated DeltaNet i rzadkiej uwagi

Trzy warstwy Gated DeltaNet są przeplatane jedną warstwą Qwen Sparse Attention (QSA). Gated DeltaNet utrzymuje stan o stałym rozmiarze, co ma ograniczać koszt przetwarzania długiego kontekstu. Warstwa QSA zachowuje dostęp do odległych fragmentów, ale zamiast oceniać każdy token z osobna – wybiera istotne mikrobloki kontekstu.

Qwen twierdzi, że przy kontekście 1 mln tokenów kernel QSA jest 7,6× szybszy od gęstej uwagi podczas prefilla i 4,9× szybszy w dekodowaniu. To pomiar konkretnego kernela – nie gwarancja takiego samego przyspieszenia całej aplikacji. Na czas odpowiedzi wpływają też ładowanie wag, komunikacja między urządzeniami, router MoE, przygotowanie wejścia i silnik serwujący.

Czterogałęziowy strumień resztkowy (Gated Residual)

Zamiast jednego klasycznego strumienia resztkowego model utrzymuje cztery gałęzie, a bramki decydują, które informacje odczytać i gdzie zapisać. Według Qwen rozwiązanie poprawia stabilność treningu i pozwala przechowywać stan resztkowy w FP8 przy niewielkiej stracie jakości.

Embeddingi n-gramowe – największa egzotyka całego projektu

Krótkie sekwencje tokenów służą jako klucze do dużych tablic, które mogą pozostawać w pamięci hosta i być pobierane z wyprzedzeniem. To sposób na zwiększenie pojemności pamięci modelu bez proporcjonalnego wzrostu liczby operacji na token. Ceną jest duży rozmiar wag i zależność od sprawnego transferu danych między pamięcią hosta a akceleratorem.

Co wiemy o treningu, a czego nadal nie ujawniono

Qwen użył dwóch optymalizatorów. Muon obsługiwał dwuwymiarowe macierze pełniące funkcję przekształceń liniowych, a AdamW pozostał przy embeddingach, głowicy wyjściowej, routerze MoE i niskorangowych projekcjach Gated Residual. Zespół zwiększył docelowy batch i learning rate oraz zrezygnował z rozgrzewania rozmiaru batcha – w eksperymentach zwiększało ono liczbę kroków optymalizatora o 18,8% bez żadnej poprawy wyniku.

Model bazowy trenowano na około jednej trzeciej liczby tokenów użytych dla Qwen3.7-Plus-Base i przy około jednej dziewiątej FLOPs. Ale – i tu zaczyna się lista białych plam – raport nie ujawnia bezwzględnej liczby tokenów pełnego treningu, składu danych, liczby akceleratorów ani kosztów. Wartości 400 mld i 80 mld tokenów widoczne w raporcie dotyczą mniejszego modelu z ablacji architektury, nie finalnego checkpointu Flash-Next. Nie warto ich cytować jako rozmiaru treningu tego modelu. 🚫

Niezależne wyniki – mocny start, ale wciąż mało danych

Artificial Analysis zmierzył 56 punktów w Intelligence Index i 4. miejsce na 110 modeli (stan na 28 sierpnia). Przy okazji: 73,4 tokenu wyjściowego na sekundę i 2,99 s czasu do pierwszego tokenu z API Alibaba. To niezależniejszy punkt odniesienia niż tabela producenta, ale pozycja może się zmieniać wraz z dodawaniem kolejnych modeli.

Arena.ai w tablicy WebDev pokazuje wynik AutoEval 1617 (±15). Model nie ma jeszcze głosów użytkowników ani pełnej pozycji opartej na głosowaniu – to wczesny automatyczny pomiar, nie ranking popularności.

Model card Qwen zawiera więcej wyników, ale wszystkie pochodzą z ewaluacji producenta:

  • SWE-bench Pro: 62,5
  • GPQA Diamond: 91,7
  • LiveCodeBench v6: 91,9
  • HLE: 35,9 (wobec 40,0 dla Claude Opus 4.6 Max)
  • NL2Repo-Bench: 48,1 (wobec 54,2 dla DeepSeek-V4-Flash-0731)

Część testów używała własnych harnessów Qwen, poprawionych zadań lub benchmarków wewnętrznych. Nie jest to proste odpowiedniki niezależnej tablicy.

Cena API i rzeczywiste koszty własnego wdrożenia

Artificial Analysis podaje dla Flash-Next 0,15 USD za 1 mln tokenów wejściowych i 0,47 USD za 1 mln tokenów wyjściowych w API Alibaba. Produkcyjny Qwen3.8-Flash pokazuje bardzo podobne 0,16 i 0,47 USD oraz 0,016 USD za wejście z implicit cache (ceny ze stanu na 28 sierpnia 2026).

Ale uwaga – to nie są koszty samodzielnego hostingu. Własne wdrożenie wymaga pamięci na checkpoint (~360 GB repozytorium), akceleratorów, pamięci hosta i szybkiego transferu. 360 GB to nie jest minimalny wymagany VRAM – rzeczywiste wymagania zależą od precyzji wag, kwantyzacji i sposobu offloadingu. Flash-Next to projekt dla solidnej infrastruktury, nie dla jednej karty konsumenckiej.

Licencja – otwarte wagi to nie to samo co open source

Wagi są publicznie dostępne, ale licencja to nie Apache 2.0. Qwen Community License 1.0 pozwala używać, modyfikować, dystrybuować, hostować i dostrajać model – z istotnymi wyjątkami komercyjnymi:

  • Firma świadcząca Model as a Service albo sprzedająca niezależnego asystenta AI do kodowania lub pracy biurowej musi uzyskać od Qwen osobną licencję komercyjną
  • Produkty przekraczające 100 mln aktywnych użytkowników miesięcznie lub 20 mln USD miesięcznego przychodu muszą wyraźnie pokazywać nazwę modelu w interfejsie

Możliwość pobrania checkpointu daje kontrolę techniczną i ułatwia badania. Nie gwarantuje jednak pełnej swobody biznesowej ani dostępu do danych treningowych. Warto to przemyśleć przed podjęciem decyzji o wdrożeniu. ⚖️

Dla kogo to ma sens – a dla kogo niekoniecznie

Flash-Next jest interesujący przede wszystkim dla:

  • Zespołów badających architekturę LLM
  • Operatorów własnej infrastruktury na poważną skalę
  • Twórców silników inferencyjnych
  • Agentów analizujących interfejsy, dokumenty i nagrania (multimodalność + długi kontekst)

Nie jest natomiast oczywistym wyborem dla małej firmy, która chce po prostu wywołać gotowy model. Produkcyjny Qwen3.8-Flash oferuje łatwiejsze API, domyślny kontekst 1 mln tokenów i wbudowane narzędzia bez bólu głowy. Własny Flash-Next daje większą kontrolę, ale przerzuca na użytkownika odpowiedzialność za infrastrukturę, zgodność licencyjną, monitoring i optymalizację.

Wnioski – co ta premiera mówi o Qwen4

Najważniejszym sygnałem nie jest żaden pojedynczy benchmark. To kierunek projektu: Qwen próbuje rozdzielić pojemność modelu od kosztu każdego tokenu. Rzadki MoE ogranicza liczbę aktywnych parametrów, Gated DeltaNet kompresuje historię, QSA wybiera fragmenty długiego kontekstu, a tablice n-gramowe pracują poza główną ścieżką akceleratora.

Flash-Next nie dowodzi, że Qwen4 będzie najlepszym modelem na rynku ani że cała architektura zachowa przewagę w innych skalach. Pokazuje jednak, że Qwen szuka efektywności nie tylko przez kwantyzację i tańsze API – lecz na poziomie konstrukcji i przepisu treningowego.

Warto obserwować, czy niezależne rankingi potwierdzą wczesny wynik 56 punktów i czy produkcyjne wdrożenia utrzymają deklarowane korzyści przy kontekście zbliżonym do 1 mln tokenów. Na razie to bardzo obiecujący eksperyment. 👀

Phoebe

O autorze: Phoebe

Cześć od ponad 3 lat zasuwam i tworzę content na potrzeby nasze i naszych klientów. Oprócz tego 24/7 wertuję internet we wszystkich językach po to by przygotować czytelną treść dla Ciebie. Staram się być przy tym bardzo skrupulatna, ale ze znaną mi sporą dozą humoru i czasem oderwania od rzeczywistości. W tzw. międzyczasie korzystając z ElevenLabs śpiewam wszystkim 'Smelly Cat 🐈'. Także Enjoy your silent 😁