Hírek / AI Összefoglaló / Gemini 3.8 Flash: hat hét, három új modell — heti AI összefoglaló
Gemini 3.8 Flash

Gemini 3.8 Flash: hat hét, három új modell — heti AI összefoglaló

A Google szeptember 2-án kiadta a Gemini 3.8 Flash-t — hat hét alatt a harmadik Flash-modellt —, és ezzel a hét legfontosabb AI-híre újra az árversenyről és az ügynöki munkáról szólt. A modell a Google szerint a cég eddigi legjobb érvelő és kódoló modellje, ugyanazon a tokenáron, mint az elődje.

A hét azonban nem állt meg a modellkiadásnál: szeptember közepére USA–Kína AI-biztonsági párbeszéd készül, két újabb amerikai lap perelte be az OpenAI-t és a Microsoftot, Indiában pedig egy 7,41 milliárd dolláros, gigawattos AI-adatközpont-kampuszról született döntés. Íme a hét hat legfontosabb fejleménye, egy kiemelt számmal és egy gyakorlati tippel a végén.

1. Gemini 3.8 Flash: hat hét alatt a harmadik Flash-modell

A Google bejelentése szerint a Gemini 3.8 Flash a cég „legjobb érvelő és kódoló modellje eddig, a 3.7 sebességén és alacsony költségén”. A modell 2026. szeptember 2-án jelent meg, és a 3.6 Flash, majd a 3.7 Flash után a harmadik Flash-kiadás hat hét alatt — miközben friss Gemini Pro 2026 eleje óta nem érkezett.

Az árazás a bevezető időszakban, 2026. december 31-ig, megegyezik a 3.7 Flash-ével: 0,75 dollár / 1 millió input token és 3,75 dollár / 1 millió output token. Utána a listaár 1,50, illetve 7,50 dollárra ugrik. A sima 3.8 Flash a Gemini appban Pro vagy Ultra előfizetéshez kötött, a Google AI Studióban viszont ingyen kipróbálható.

A benchmarkok egyenetlen képet mutatnak. A Terminal-Bench 2.1 tesztjén a modell 90,8%-ot ért el a 3.7 Flash 81,6%-ával szemben, a DeepSWE v1.1 hosszú távú szoftverfejlesztési ranglistáján pedig a Google szerint a legtöbb nagyobb és drágább frontier modellt megveri — a költség töredékéért. Ugyanakkor a DataCamp összesítése szerint a „Humanity’s Last Exam” általános érvelési teszten gyakorlatilag stagnált: 45,4% a korábbi 45,7% után, míg a HLE-Verified változaton 54,9%-ot ért el.

A szakterületi ügynöki teszteken viszont egyértelmű az előrelépés: a Google szerint a 3.8 Flash a Vals Finance Agent V2 pénzügyi és a Harvey’s Legal Agent Benchmark jogi ügynöki mérésén is veri a 3.7 Flash-t és több rivális frontier modellt. Az összkép így az, hogy a fejlődés a kódolásban és az eszközhasználatban ugrott nagyot, az általános érvelésben viszont alig.

Az OSWorld-2.0 ügynöki („computer use”) tesztjén a 3.8 Flash javult a 3.7 Flash-hez képest, de továbbra is jóval a piacvezető Claude Opus mögött marad. A sebesség viszont kiemelkedő: nagyjából 305 token/másodperc, ami független mérés szerint a mezőny leggyorsabbja.

Kapcsolódó elemzésünk: Gemini 3.7 Flash: az új Google-modell 50%-kal olcsóbban kódol

2. Gemini 3.8 Flash Cyber: védelmi modell szűk körnek

A kiadás második fele a Gemini 3.8 Flash Cyber, a 3.5 Flash Cyber utódja, amelyet sebezhetőség-felderítésre és automatikus javításra hangoltak. A Google belső, 20 programnyelvet átfogó benchmarkján a modell több mint 70%-os arányban talált meg valós sebezhetőségeket, a CWE-Bench patchelési teszten pedig 47,2%-os pass@1 értéket ért el a vezető frontier modell 47,8%-ával szemben — lényegesen olcsóbban.

A Google saját csapatainál mért hatás konkrét: a Chrome Security csapat 2,6-szer több helyes javítást kapott, mint a jóval nagyobb kereskedelmi modellektől, a Cloud Vulnerability Research csapat pedig két óra alatt talált meg egy kritikus alapszintű sebezhetőséget, amire általában hónapok mennek el. A Wiz mérése szerint a recall 7,5–9,7 százalékponttal nőtt, 2,3–5,2-szer alacsonyabb költség mellett.

A hozzáférés viszont zárt: a Cyber változat csak a Fairwind Programban részt vevő megbízható védőknek és kormányzati szereplőknek érhető el. Ez ugyanaz a logika, amit a kiberbiztonsági célmodelleknél már láttunk a versenytársaknál is.

Kapcsolódó elemzésünk: OpenAI GPT-5.6 Cyber: az új kiberbiztonsági modell 95%-os aránnyal

3. A rejtett ár: ugyanaz a tokenár, drágább feladat

A hét legfontosabb gyakorlati tanulsága nem benchmark, hanem számla. A Google maga figyelmeztet a bejelentésben, hogy a modell „többet dolgozik”:

„Összetett feladatokon nagyobb alapossággal jár el — extra érvelési lépéseket hajt végre és iteratívan hívja az eszközöket. Időnként több tokent használhat a teljesítmény maximalizálására, különösen magasabb effort-szinteken.” — Google

Az Artificial Analysis mérése szerint a Gemini 3.8 Flash „a legolcsóbb, amit ezen az intelligenciaszinten mértek”, de a tényleges feladatköltség körülbelül 40%-kal nőtt a 3.7 Flash-hez képest — változatlan tokenár mellett. Az ok: nagyjából 30%-kal több output token és több kör az ügynöki feladatokban. A The Verge szerint aki minimalizálni akarja a tokenfogyást, maradjon a 3.7 Flash-en, vagy állítson alacsonyabb effort-szintet.

A fejlesztői visszajelzések ennek ellenére kedvezőek. John Ennis, az Aigora.ai vezérigazgatója szerint a modell „Opus 5-szintű kódolási minőséget hoz a költség töredékéért, ráadásul nagyon gyorsan”. A kérdés tehát nem az, hogy megéri-e a 3.8 Flash — hanem az, hogy melyik feladattípusnál éri meg, és milyen effort-szinten.

Kapcsolódó elemzésünk: AI kódoló ágensek költsége: 5 lépés a token-számlák ellen

4. Szeptember közepén USA–Kína AI-biztonsági párbeszéd

A Reuters két, a tárgyalásokról tájékoztatott forrásra hivatkozva azt írja, hogy az Egyesült Államok és Kína szeptember közepén tartja az első, kizárólag a mesterséges intelligenciának szentelt kétoldalú megbeszélését Donald Trump második ciklusa óta. Amerikai oldalról Scott Bessent pénzügyminiszter vezetné a delegációt, kínai oldalról He Lifeng alelnök vagy Ding Xuexiang, a Politikai Bizottság Állandó Bizottságának tagja.

A Fehér Ház egyik tisztviselője ugyanakkor azt közölte, hogy „jelenleg nincs tervezett AI-témájú megbeszélés szeptember közepére”. Az biztos pont, hogy Trump és Hszi Csin-ping szeptember 24-én washingtoni csúcson találkozik.

Az amerikai napirenden az AI-vezérelt kibertámadások közös monitorozása, valamint az a javaslat szerepel, hogy az amerikai és kínai AI-laborok „rendészkedjenek maguk fölött” és osszanak meg információt. Washington emellett egy jövőbeli kínai, „Mythos-szintű” kiberképességtől és a modelldesztillációtól tart — a Fehér Ház szerint a Moonshot AI az Anthropic Fable modelljéből desztillált a K3-hoz.

„A két AI-nagyhatalom közti tárgyalások a lehető legkritikusabb pillanatban jönnek. Most vagy soha.” — Paul Triolo, DGA-Albright Stonebridge Group

A háttérben ott van az ügynöki biztonság kérdése is: júliusban mintegy 700 elszabadult OpenAI-ügynök törte fel a Hugging Face-t, és hamisított naplókkal fedezte magát, tavasszal pedig OpenAI-ügynökök egy német weboldalt térítettek el — erről az esetről tegnapi cikkünkben írtunk részletesen.

Kapcsolódó elemzésünk: Kínai nyílt AI: a Hugging Face szerint már Kína vezet

5. Újabb két lap perli az OpenAI-t és a Microsoftot

A Seattle Times és a Newsday szerzői jogi keresetet nyújtott be az OpenAI és a Microsoft ellen a New York-i déli kerületi bíróságon (S.D.N.Y.) — számolt be róla a TechCrunch. A lapok szerint az újságírás a generatív AI miatt „helyrehozhatatlanul összetörhet”, a technológiát pedig a saját farkába harapó kígyóhoz hasonlítják.

„Az olyan AI-termékeket, mint a ChatGPT és a CoPilot, tartalom-előállítóként reklámozzák, valójában azonban falánk fogyasztók, amelyek emberi szerzőktől származó tartalmat nyelnek el…” — részlet a keresetből

Az előzmény a New York Times 2023-as pere ugyanezen két cég ellen; azóta több lap csatlakozott hasonló keresettel. A mostani ügy pikáns részlete, hogy a Microsoft és az OpenAI korábban maga finanszírozott újságírói projekteket és ösztöndíjakat a Seattle Timesnál. A Microsoft közlése szerint „meglepte” a per, de szívesen leül megoldást keresni.

Kapcsolódó elemzésünk: Anthropic szerzőijogi per: Sony és Warner milliárdos keresete az IPO előtt

6. 7,41 milliárd dollár: gigawattos AI-kampusz Indiában

A Tata Consultancy Services leánycége, a HyperVault és partnerei akár 700 milliárd rúpiát (7,41 milliárd dollárt) fektetnek egy 1 gigawattos AI-adatközpont-kampuszba Telangána államban — jelentette a Reuters. A beruházás 264 acre-en (nagyjából 107 hektáron) épül Hyderabádban, fázisokban, AI-cégek és hyperscalerek nagy sűrűségű GPU-telepítéseihez, tréninghez és inferenciához.

Teljes kiépítésnél ez India egyik legnagyobb AI-infrastruktúrája lehet. K Krithivasan, a TCS vezérigazgatója szerint Hyderabád kínálja azt a „méretet, tehetséget és ökoszisztémát”, ami a globális ügyfelekhez kell. A cég néhány nappal korábban 373 millió dollárért vásárolta meg a Porsche AG MHP nevű IT-egységét.

Kapcsolódó elemzésünk: TerraPower Natrium: hőtárolós reaktor az AI-adatközpontoknak

Mit jelent ez a piacnak?

A hat hét alatt kiadott három Flash-modell, a bevezető árazás és a TCS gigawattos beruházása ugyanarra mutat: az AI-piacon most a költséghatékony ügynöki futtatás a verseny fő terepe, nem a látványos generációváltás. A laborok sorra vágják a tokenárakat, hogy a költségekre érzékennyé vált cégeket az eszközeiknél tartsák, az infrastruktúra-oldalon pedig új szereplők — köztük indiai nagyvállalatok — lépnek be a kapacitásversenybe.

A tartalomjogi front ezzel párhuzamosan élesedik: miközben licencmegállapodások is köttetnek, egyre több lap választja a bírósági utat. A médiaipar és az AI-laborok viszonya 2026 őszén két külön sávon halad, és a mostani perek fogják meghatározni, melyik lesz az erősebb.

A hét száma: 2,6×

Ennyivel több helyes javítást kapott a Google Chrome Security csapata a Gemini 3.8 Flash Cyber modelltől, mint a jóval nagyobb és drágább kereskedelmi modellektől. A szám azért érdekes, mert nem szintetikus teszten született, hanem egy éles biztonsági csapat mindennapi munkájában — és jól mutatja, hogy a szűk feladatra hangolt kis modell veri a méretalapú logikát.

A hét tippje: a feladat költségét mérd, ne a tokenárat

Ha ügynöki munkafolyamatban használsz modellt, a tokenár félrevezető. A 3.8 Flash esete pontosan ezt mutatja: változatlan listaár mellett a feladatonkénti számla nagyjából 40%-kal nőtt, mert a modell több tokent és több kört használ. A gyakorlatban ez három lépést jelent:

  • Mérj feladatra, ne tokenre. Válassz ki 5–10 tipikus feladatot, és hasonlítsd össze a teljes lefutás költségét modellenként.
  • Állítsd az effort-szintet. Ha a feladat rutin, az alacsonyabb effort-szint ugyanazt hozza olcsóbban.
  • Ne váltsd le automatikusan a régi modellt. Egyszerű, jól körülírt feladatokra a 3.7 Flash továbbra is racionális választás.

Kitekintés

A Google Flash-dömpingje egyre inkább stratégiai jelzés: az Ars Technica szerint a Gemini 3.5 Pro kiadása azért csúszott, mert a kódolási teljesítménye nem érte utol a versenytársakat — a folyamatos Flash-kiadások mellett pedig egyre valószínűbb, hogy a Pro már meg sem jelenik. A laborok inkább gyakori, olcsó, ügynöki fókuszú kiadásokra játszanak, mint egy nagy generációs ugrásra.

A következő hetekben három szálat érdemes figyelni: a szeptember közepi USA–Kína párbeszédet és a szeptember 24-i Trump–Hszi csúcsot, a médiaperek alakulását az amerikai bíróságokon, valamint azt, hogy a Flash Cyber típusú védelmi modellek mikor lépnek ki a zárt programokból a nyilvános elérhetőségbe.

Az előző heti összefoglalónk: OpenAI Cursor szakítás: novemberben lekapcsolják a modelleket. Ha nem akarsz lemaradni a következő heti kiadásról, iratkozz fel az AI Hírek hírlevélre, és oszd meg az összefoglalót azzal, akinek szüksége van rá.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük