Co Google faktycznie wprowadził 1 września

Google dodał agentowe rozumienie wideo do trzech modeli w swojej linii Gemini Flash 1 września 2026 roku: Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite, zgodnie z własnym ogłoszeniem Google oraz niezależnym doniesieniem Android Authority. Funkcja jest techniką przetwarzania, a nie nowym modelem ani nową linią produktową, i nie należy jej mylić z Gemini 3.8 Flash, odrębnym modelem, który Google wydał dzień później, 2 września, z własnymi kwestiami cenowymi i tempa wydań, opisanymi już gdzie indziej. Agentowe rozumienie wideo zmienia sposób, w jaki te trzy modele Flash odczytują wideo, natomiast wagi bazowego modelu i jego dotychczasowe możliwości pozostają bez zmian.

Jak model decyduje, co ogląda

Mechanizm zastępuje skanowanie ze stałą częstotliwością klatek modelem, który segment po segmencie decyduje, co sprawdzić, jak szybko przez to przejść i jakiej modalności użyć. Starsze podejścia do rozumienia wideo próbkują nagranie ze stałą liczbą klatek na sekundę niezależnie od treści, więc statyczne dwugodzinne nagranie z ochrony otrzymuje takie samo traktowanie klatka po klatce jak dwie minuty szybkiej akcji. Agentowe podejście Google przeszukuje natomiast wideo w poszukiwaniu istotnych fragmentów i sprawdza tylko je, przełączając się między klatkami, dźwiękiem i transkrypcjami zależnie od tego, czego wymaga pytanie. Właśnie to ukierunkowane przeszukiwanie umożliwia odnajdywanie momentów z dokładnością do ułamka sekundy w długich, wielogodzinnych nagraniach, wykrywanie wizualnych anomalii lub artefaktów oraz liczenie obiektów lub czynności w obrębie klipu, zadania, z którymi jednolite próbkowanie klatek radzi sobie znacznie mniej efektywnie.

Liczby w zestawieniu

Google publikuje trzy główne liczby dla nowego trybu przetwarzania i żadna z nich nie opisuje nowego poziomu cenowego.

WskaźnikDeklaracja Google
Zużycie tokenówDo 88% mniej
Koszt przetwarzaniaDo 66% mniej
Jakość/dokładnośćDo 7% więcej

Wszystkie trzy liczby pochodzą z własnych testów Google i obowiązują przy standardowych cenach tokenów API Gemini; włączenie trybu agentowego nie wiąże się z żadną dodatkową opłatą. Deweloperzy włączają go, ustawiając parametr processing API na agentic, dostępny już w Google AI Studio oraz w Gemini Enterprise Agent Platform.

Dlaczego to historia o ekonomii obciążeń, a nie o cenach

Dla zespołów w UE i Wielkiej Brytanii prowadzących obciążenia AI intensywnie wykorzystujące wideo, redukcja zużycia tokenów o 88% decyduje o tym, czy analiza wideo na dużą skalę jest w ogóle opłacalna w skali produkcyjnej, a nie tylko ile kosztuje pojedyncze zapytanie. To inna historia niż osobne zmiany cen i tempa wydań Gemini 3.8 Flash: Google łączy tu technikę efektywności z istniejącą linią Flash bez dodatkowej opłaty, zamiast sprzedawać nowy poziom. Przed 1 września w wielu projektach analizy wideo, ciągłym monitoringu kamer bezpieczeństwa, wielogodzinnym przeglądzie nagrań pod kątem moderacji treści, monitoringu mediów w archiwach nadawczych, kontroli jakości reklam wideo w całej bibliotece, rzeczywistą przeszkodą był często koszt tokenów za pozyskiwanie klatka po klatce, a nie ograniczenie możliwości modelu. Redukcja tego kosztu pozyskiwania o 88% przenosi kilka z tych zastosowań z pozycji wykreślanej podczas przeglądu budżetu do takiej, którą zespół rzeczywiście może uruchomić w sposób ciągły.

Servola Journal

Robimy to dla wszystkich, którzy starają się nadążyć za tym, co technologia robi z naszym życiem. Dla ludzi, którzy ją budują, i dla ludzi, którym się to przydarza. Servola Journal istnieje, aby to, czego się uczymy, należało do nich wszystkich.

Nikt nam za to nie płaci. Żadnych reklam, żadnego muru płatności, za darmo dla wszystkich. Po prostu wierzymy, że zrozumienie tego, co dzieje się z nami wszystkimi, nie powinno zależeć od tego, kogo stać na zapłacenie za to.

Jeśli to dało ci dziś coś, powiedz nam, żebyśmy kontynuowali. Obserwuj nas, zostaw polubienie, albo napisz pozytywny komentarz. Czytamy każdy jeden, i to oni sprawiają, że działamy dalej.