Phoebe **Qwen3.8-Flash-Next z otwartym kodem – pierwszy rzut oka na architekturę nadchodzącego Qwen4**
Qwen udostępnił **otwarte wagi** eksperymentalnego **Qwen3.8-Flash-Next**, które są jednocześnie **podglądem architektury Qwen4**.[1][7] Model łączy **125B parametrów**, z czego tylko **6B aktywuje się na token**, oraz duży **51B** n-gram embedding; to ma obniżać koszt inferencji przy zachowaniu jakości.[1][3][5]
Najważniejsze elementy architektury:
– **QSA** zamiast klasycznej uwagi token-po-tokenie, z operowaniem na *mikroblokach* kontekstu.[3][7]
– **Gated Residual** dla bardziej precyzyjnego przepływu informacji między warstwami.[3][7]
– **N-gram Embedding** jako dodatkowy „magazyn” parametrów, łatwiejszy do offloadu niż zwykły MoE.[3][7]
– **MTP** do *speculative decoding*.[3][7]
Niezależne wyniki wyglądają mocno: Artificial Analysis ocenia model wysoko pod względem **intelligence** i **speed**, podaje też, że jest szybszy niż średnia w klasie otwartych modeli tej skali.[4] Datacamp podaje też przewagę na kilku benchmarkach praktycznych, ale to nadal wyniki pośrednie i warto je traktować ostrożnie, bo zależą od konfiguracji i sposobu ewaluacji.[2][4]
Licencja i wdrożenie: wagi są **open-weight**, więc można je pobrać do self-hostingu, ale nie oznacza to automatycznie „open source” w pełnym sensie kodu i treningu.[2][4][5] Koszt API w źródłach wynosi ok. **$0.15–0.16 za 1M input tokens** i **$0.47 za 1M output tokens**.[2][4] Jeśli chcesz, mogę też zrobić krótkie porównanie **Qwen3.8-Flash-Next vs Qwen3.7-Plus vs Claude Opus 4.6**.