Hírek / AI Modellek / GLM-5.3: az új nyílt modell, ami 2436 sebezhetőséget talált
GLM-5.3

GLM-5.3: az új nyílt modell, ami 2436 sebezhetőséget talált

A GLM-5.3 augusztus 14-én jelent meg, és rögtön két dolgot tett le az asztalra: a legerősebb nyílt súlyú kódoló modell címét, és egy olyan biztonsági képességet, amire maga a fejlesztő cég sem számított. A kínai Z.ai (korábbi nevén Zhipu AI) modellje 2436 valós sebezhetőséget talált 269 nyílt forrású projektben — köztük olyanokat, amelyek évtizedek óta ott lapultak a kódban.

A kiadás azért érdekes, mert nem új alapmodellről szól. A Z.ai ugyanazt a 743 milliárd paraméteres alapot használja, mint a GLM-5.2-nél — minden javulás kizárólag a post-trainingből jön.

„Scaling post-training is all we did for GLM-5.3.” — Z.ai, hivatalos technikai bejelentés

Mi új a GLM-5.3-ban: ugyanaz a modell, más tanítás

A Z.ai az elmúlt hónapban nem újratanította a modellt, hanem a köré épített tanítási rendszert skálázta: több környezet, változatosabb feladatok, több számítási kapacitás a megerősítéses tanulásra.

A tanítókörnyezetek egyre kevésbé hasonlítanak programozási feladványokra. A cég leírása szerint az ágens ugyanazt a munkakörnyezetet kapja meg, mint egy mérnök: hozzáférést kódbázisokhoz, dokumentációhoz, számítási klaszterekhez, tárolórendszerekhez és kísérleti eredményekhez. Ezután diagnosztizálnia kell a szűk keresztmetszeteket, be kell építenie az optimalizációt, le kell futtatnia a kísérleteket — és mérhető gyorsulást kell felmutatnia úgy, hogy közben a helyesség nem sérül.

Egyes feladatok szándékosan több napnyi munkát modelleznek egy tapasztalt mérnök tempójában. Ez magyarázza, hogy a hosszú távú, több lépéses feladatoknál a legnagyobb az ugrás.

Hogyan teljesít a benchmarkokon

A generációk közötti különbség több helyen látványos. A Terminal-Bench 3.0-on a GLM-5.2 mindössze 4,6 pontot ért el — a GLM-5.3 28,3-at. A DeepSWE v1.1-en 46,2-ről 66,9-re, az AutomationBenchen 26,2-ről 48,2-re nőtt az eredmény.

A képet viszont pontosan kell nézni: a Z.ai saját táblázatában sem előzi meg mindenhol a zárt konkurenciát. A Terminal-Bench 3.0-on a GPT-5.6 Sol 34,6, a Claude Fable 5 pedig 33,7 pontot kap — mindkettő a GLM-5.3 fölött. A DeepSWE v1.1-en 72,7 és 69,7 áll szemben a 66,9-cel.

Egyetlen sort nem a Z.ai futtatott: a GDPval-AA v2 Elo-értékelést az Artificial Analysis mérte. Itt a GLM-5.3 1769 ponttal az élen áll, a Fable 5 (1743) és a GPT-5.6 Sol (1730) előtt. Ez a kiadás legerősebb független adata.

A token-hatékonyság a gyakorlatban fontosabb

A Z.ai saját, zárt Code Bench mérésén a GLM-5.3 Max beállításon 34,5%-ot ér el nagyjából 75 000 output tokenből feladatonként. A GLM-5.2 ugyanitt 23,4%-ot hozott 96 000 tokenből.

A beszédesebb összevetés: High beállításon a GLM-5.3 31,4%-ot ér el 50 000 tokenből, míg a Claude Opus 4.8 29,5%-ot 120 000-ből. Ha kódoló ágenst üzemeltetsz, ez a különbség közvetlenül a számládon jelenik meg. A kódoló ágensek költségéről szóló elemzésünkben részletesen írtunk arról, miért itt dől el a valódi üzemeltetési ár.

Fontos fenntartás: a Code Bench privát benchmark, kívülről nem reprodukálható. A Z.ai saját mérése, nem független eredmény. A Fable 5 egyébként itt is előrébb van: 39,5% Max beállításon.

A cyber-képesség, amit a Z.ai sem tervezett

A cég sebezhetőség-felderítő adatokat tett a tanítási keverékbe, azt várva, hogy a modell jobban megtalálja a hibákat. Ehelyett a GLM-5.3 elkezdett teljes exploit-láncokban gondolkodni: nem elszigetelt hibákat azonosít, hanem összefüggő tervet készít a kihasználás több szakaszára.

„As we scaled post-training, cyber capability developed faster than we expected.” — Z.ai

A számok követik a leírást. A CyberGym-en, amely forráskódból induló sebezhetőség-azonosítást mér, a GLM-5.3 84,5%-ot ért el a GLM-5.2 77,2%-a után — ezzel a Mythos 5 (83,8%) és a GPT-5.6 Sol (83,6%) elé került.

Az ExploitBenchen viszont, ahol működő exploitot kell megépíteni, 54,4% az eredmény. Ez több mint a duplája a GLM-5.2 24,4%-ának, de a Mythos 5 78,0%-a és a GPT-5.6 Sol 76,5%-a messze előrébb van. Az ExploitGymön a GLM-5.3 két óra alatt 105, hat óra alatt 130 feladatot old meg — a Mythos 5 181-et és 247-et.

A Z.ai maga fogalmazza meg a mintát a legőszintébben: a képesség pontosan ott nő a leggyorsabban, ahol a legnagyobb a lemaradásuk. Ez a fajta önkritika ritka egy modellbejelentésben, és érdemes komolyan venni. Az OpenAI GPT-5.6 Cyber bemutatásakor ugyanez a dilemma került elő zárt oldalról.

2436 sebezhetőség, 45 év hatókör

A benchmarkoknál konkrétabb a valós eredmény. Kínai biztonsági csapatokkal együttműködve, szakértői átnézés és deduplikáció után a modell 2436 sebezhetőséget azonosított 269 projektben. Ebből 1097 közepes vagy magas súlyosságú: 107 kritikus és 990 magas besorolású.

A találatok rendszermagokat, operációs rendszereket, böngészőmotorokat, nyílt forrású infrastruktúrát és hálózati protokollokat érintenek. A legrégebbi hiba 1981-ben került a kódba, és egy sebezhetőség átlagosan 26,6 évet élt felfedezetlenül.

A Z.ai nyilvános nyilvántartást vezet a folyamatról (Security Disclosure Ledger): 53 hiba már nyilvános, 2383 pedig embargó alatt van, amíg végigmegy a koordinált közzétételen.

A legtöbbet idézett eset egyelőre nem megerősített: a Z.ai egyik fejlesztői kapcsolattartója az X-en azt állította, hogy a modell „potenciálisan súlyos” sebezhetőséget talált a Cursorban — abban a kódoló eszközben, amelyet nemrég a SpaceX vásárolt fel. A Cursor a VentureBeat megkeresésére a cikk megjelenéséig nem reagált, tehát ezt állításként, nem tényként érdemes kezelni.

Árazás és elérhetőség: itt van a csavar

A GLM-5.3 egyelőre kizárólag a GLM Coding Planen és a Z.ai saját ZCode környezetében érhető el. Az önálló API és a nyílt súlyok később jönnek — a cég szerint a súlyok nagyjából két héttel a megjelenés után, „miután a biztonsági kiértékelés és a megerősítés lezárult”.

Egyéni előfizetés (akciós listaár): Lite 12,60 $/hó (10 000 kredit/hét) · Pro 56 $/hó (6× Lite) · Max 117,60 $/hó (14× Lite). Csapatra: Standard 88 $, Premium 188 $ / fő / hó.

A Coding Plan pontalapú kvótára állt át, amely külön számolja az inputot, a cache-elt inputot és az outputot. Aki nem csúcsidőben dolgozik, fele annyi pontot fogyaszt — a csúcsidő hétköznap 14:00–18:00 (UTC+8), tehát magyar idő szerint jellemzően a kora reggeli órák esnek bele.

Amit nem tudunk: a GLM-5.3 tokenalapú API-ára. A Z.ai a megjelenéskor nem tette közzé, és a GLM-5.2 díjszabása (1,40 $ / 1M input, 4,40 $ / 1M output) nem feltételezhető automatikus átvitelként. Ha az API-költség a döntő szempontod, ezt meg kell várnod. Összehasonlítási alapért nézd meg az olcsó AI modellek árait összefoglaló cikkünket.

Egy migrációs csapda, ami elrontja a napodat

Aki meglévő GLM-alkalmazást futtat, annak ez a legfontosabb bekezdés. A GLM-5.3 három gondolkodási szintet ismer (low, high, max, alapértelmezetten max), de a gondolkodás kikapcsolása már nem támogatott.

Ha az alkalmazásod jelenleg thinking.type: „disabled” értéket küld, azt át kell írnod enabled-re és be kell állítanod a reasoning_effort-ot, mielőtt átváltasz a modellazonosítóra. Különben a kérés egyszerűen hibára fut. Ez tehát valódi migráció, nem modellnév-csere.

5 döntéshozói következtetés

  1. A post-training még nincs kimerítve. Ugyanabból az alapmodellből egy hónap alatt hatszoros Terminal-Bench-eredmény jött ki. Ez azt jelenti, hogy a modellváltás üteme nem a drága pretraining-ciklusokhoz van kötve — a stratégiádat ehhez érdemes igazítani.
  2. A token-hatékonyság fontosabb lett a ranglista-helyezésnél. Egy modell, amely fele annyi tokenből ér el hasonló eredményt, éves szinten nagyságrendi különbséget jelent egy ágensflottánál.
  3. A vendor-benchmarkot kezeld vendor-benchmarkként. A „+50%” a Z.ai privát mérése. A független Artificial Analysis-eredmény többet ér, mint a táblázat többi sora együtt.
  4. A nyílt modell biztonsági kérdéssé vált. Ugyanaz a képesség, amitől jó biztonsági kutató lesz egy modellből, teszi jó támadóvá is. A Z.ai emiatt szakaszolja a kiadást és vezet be „trusted access” kontrollokat — ez a mintázat mostantól minden nyílt frontier kiadásnál visszatér.
  5. Ne tervezz még GLM-5.3 API-költséggel. Amíg nincs publikált tokenár és nyílt súly, ez előfizetéses kódoló eszköz, nem beépíthető API-komponens.

Kinek éri meg most váltania

Ha kódoló ágenssel dolgozol napi szinten, és eddig is előfizetéses konstrukcióban gondolkodtál, a Lite csomag havi 12,60 dollárért reális belépő — különösen, mert a modell működik Claude Code és OpenCode alatt is, nem csak a Z.ai saját eszközében.

Ha viszont saját infrastruktúrán futtatnál nyílt súlyú modellt, vagy API-ra építesz terméket, várj két hetet. Addig a GLM-5.2 MIT-licences súlyai maradnak a stabil választás.

És ha biztonsági csapatban vagy: a 2383 embargó alatt álló sebezhetőség előbb-utóbb nyilvánosságra kerül. A kérdés nem az, hogy érdemes-e figyelni a Z.ai hivatalos bejelentését és nyilvántartását, hanem hogy melyik találat érinti a te stackedet.

Kapcsolódó elemzésünkben részletesen bemutatjuk: Legjobb AI kódoló asszisztens 2026: 3 erős eszköz teljes tesztje.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük