Gemini 3.7 Flash w GA – mocniejszy asystent dla programistów i agentów AI 🚀
Google oficjalnie udostępnił Gemini 3.7 Flash w wersji ogólnie dostępnej (GA) od 13 sierpnia 2026 roku. Największe zmiany dotyczą kodowania, obsługi narzędzi i dłuższych zadań agentowych – i nie są to puste słowa marketingowe. Niezależna tablica Code Arena pokazuje wyraźny skok: wariant gemini-3.7-flash-high zajmuje 8. miejsce z wynikiem 1587,5 Elo, podczas gdy jego poprzednik gemini-3.6-flash-high plasuje się na 21. pozycji z wynikiem 1536,9.
Zanim jednak zaczniesz świętować – jest kilka rzeczy, które warto wiedzieć zanim przeniesiesz całą produkcję na nowy model. 👇
Najważniejsze fakty na start
- Dostępny w GA od 13 sierpnia 2026 roku pod identyfikatorem
gemini-3.7-flash - Obsługuje kontekst do 1 048 576 tokenów i maksymalnie 65 536 tokenów wyjścia
- Przyjmuje tekst, obrazy, audio, wideo i PDF – zwraca tekst
- Google deklaruje największe postępy w kodowaniu, agentach i zgodności wygenerowanego frontendu z projektem
- Wagi modelu nie zostały opublikowane – szczegóły architektury i treningu pozostają niejawne
Wyniki w Code Arena: skok o 13 pozycji 📊
Najbardziej użytecznym zewnętrznym punktem odniesienia jest Code Arena w kategorii WebDev. Ranking opiera się na porównaniach wyników modeli w zadaniach tworzenia frontendu, obejmujących również wieloetapową pracę agentową.
| Model w Code Arena | Miejsce | Elo | Przedział wyniku | Głosy |
|---|---|---|---|---|
gemini-3.7-flash-high |
8 | 1587,5 | 1574,3–1600,6 | 2543 |
gemini-3.6-flash-high |
21 | 1536,9 | 1527,8–1546,1 | 5494 |
Warto jednak zachować ostrożność. Wynik 3.7 Flash powstał z mniejszej liczby głosów, a Arena pokazuje dla niego przedział rang 8–11. Wariant high jest oznaczony jako „pre-release”, mimo że bazowy identyfikator API jest już stabilny. Ranking potwierdza poprawę, ale nie dowodzi przewagi w każdym typie zadania.
Benchmarki producenta: duży skok, ale nie wszędzie
Model card Google DeepMind zawiera szerokie porównanie z 3.6 Flash. Pamiętaj, że to wyniki opublikowane przez producenta – warto traktować je jako wskazówkę, nie wyrocznię.
| Test | Gemini 3.7 Flash | Gemini 3.6 Flash | Różnica |
|---|---|---|---|
| FrontierCode 1.1 Main | 43,6% | 34,4% | +9,2 pkt proc. |
| DeepSWE v1.1 | 65,3% | 48,6% | +16,7 pkt proc. |
| Terminal-bench 2.1 | 85,8% | 78,0% | +7,8 pkt proc. |
| AutomationBench | 30,4% | 17,0% | +13,4 pkt proc. |
| CharXiv bez narzędzi | 84,5% | 85,2% | −0,7 pkt proc. |
| CharXiv z narzędziami | 88,7% | 89,4% | −0,7 pkt proc. |
Największy wzrost dotyczy długich zadań inżynierii oprogramowania – DeepSWE skoczył o prawie 17 punktów procentowych. Jednocześnie drobny spadek w CharXiv pokazuje, że to nie jest uniwersalny skok jakości. W tabeli Google pojawiają się też rywale, którzy wygrywają z 3.7 Flash w wybranych testach – GPT-5.6 Terra ma wyższe wyniki w DeepSWE i Terminal-bench. Nie ma więc podstaw, by nazywać Gemini 3.7 Flash bezwarunkowo najlepszym modelem na rynku.
Specyfikacja techniczna
| Element | Gemini 3.7 Flash |
|---|---|
| Identyfikator API | gemini-3.7-flash |
| Status | GA, model stabilny |
| Wejście | tekst, obraz, wideo, audio, PDF |
| Wyjście | tekst |
| Okno kontekstowe | 1 048 576 tokenów |
| Maksymalne wyjście | 65 536 tokenów |
| Poziomy rozumowania | low, medium, high |
| Narzędzia | function calling, wykonanie kodu, wyszukiwanie, File Search i Computer Use (preview) |
| Wagi | nieopublikowane, model własnościowy |
Domyślnym poziomem rozumowania jest medium. Low ogranicza opóźnienie i zużycie tokenów, high pozwala modelowi dłużej rozumować i częściej korzystać z narzędzi. Ważna informacja dla tych, którzy planują migrację: poziom minimal nie jest obsługiwany. Jeśli Twoja aplikacja wymuszała minimalne rozumowanie w poprzednim modelu, nie przeniesiesz tej konfiguracji bez zmian. ⚠️
Cena: brzmi atrakcyjnie, ale miej plan na 2027 rok 💰
Stawki są promocyjne i obowiązują tylko do końca 2026 roku. Od 1 stycznia 2027 ceny rosną dwukrotnie. Co więcej – Google zastosował tę samą obniżkę wobec Gemini 3.6 Flash, więc oba modele kosztują teraz tyle samo. Nagłówki o „dwukrotnie tańszym 3.7 Flash” są więc trochę naciągane.
| Tryb | Wejście do 31.12.2026 | Wyjście do 31.12.2026 | Wejście od 1.01.2027 | Wyjście od 1.01.2027 |
|---|---|---|---|---|
| Standard | 0,75 USD | 3,75 USD | 1,50 USD | 7,50 USD |
| Batch / Flex | 0,375 USD | 1,875 USD | 0,75 USD | 3,75 USD |
| Priority | 1,35 USD | 6,75 USD | 2,70 USD | 13,50 USD |
Przy długich pętlach agentowych pamiętaj też, że liczysz nie tylko odpowiedź końcową – wchodzą tu tokeny rozumowania, wyniki narzędzi i kolejne kroki agenta. Koszty mogą rosnąć szybciej, niż się spodziewasz.
Co zmienił Google w API i jak to wpływa na migrację
Gemini 3.7 Flash jest dostępny w Google AI Studio, Gemini API, Gemini Enterprise, platformie agentowej Google i w wariancie Spark aplikacji Gemini. Został też domyślnym modelem agenta Antigravity.
Deweloperzy przechodzący z wcześniejszych modeli Gemini 3.x powinni szczególnie zwrócić uwagę na zmiany w API:
- Google wycofał parametry
temperature,top_pitop_k - Budżet rozumowania zastąpiono ustawieniem
thinking_level - Parametr
candidate_countnie jest obsługiwany
Nowy model ma szczególnie sens w projektach, gdzie AI poprawia kod, porównuje implementację z projektem albo wykonuje kilka zależnych operacji. To zupełnie inne zastosowanie niż prosty chatbot.
Czego Google wciąż nie ujawnia 🤐
Dokumentacja nie podaje liczby parametrów całkowitych ani aktywnych, dokładnej architektury, składu danych treningowych, etapów post-treningu, infrastruktury ani kosztu szkolenia. Model card odsyła w tych kwestiach do 3.6 Flash i ogranicza się do wzmianki o „algorytmicznych ulepszeniach”. To zbyt mało, by niezależnie ocenić, skąd dokładnie wziął się wzrost jakości – trzeba więc ufać benchmarkom i własnym testom.
Google wymienia też standardowe ograniczenia: halucynacje, sporadyczne spowolnienia i timeouty. Granica wiedzy to marzec 2026 roku, choć w niektórych dziedzinach może odpowiadać nawet styczniowi 2025 roku. W zadaniach agentowych błąd ma większy koszt niż w zwykłej rozmowie – model może wykonać całą serię działań zanim cokolwiek zweryfikujesz.
Moje zdanie: warto testować, ale bez ślepego zaufania
Dla użytkowników Gemini 3.6 Flash odpowiedź jest prosta: przetestuj, szczególnie w kodowaniu i wieloetapowych workflow. Cena jest teraz taka sama, a wyniki wskazują na realną poprawę. Migracji nie rób jednak wyłącznie na podstawie jednego rankingu.
Najlepszy test to własny zestaw zadań – z pomiarem liczby ponowień, kosztu całej pętli, czasu do poprawnej odpowiedzi i odsetka działań wymagających interwencji człowieka. Dobry wynik benchmarku nie zwalnia z walidacji kodu, ograniczenia uprawnień i rejestrowania operacji. Gemini 3.7 Flash to mocniejszy model roboczy, nie przełom architektoniczny – i w tym kontekście naprawdę może być solidnym wyborem. 🎯