Hírek / AI Modellek / MAI-Code-1.1-Flash: negyedáron kódol, de a DeepSeek elhúz mellette
MAI-Code-1.1-Flash

MAI-Code-1.1-Flash: negyedáron kódol, de a DeepSeek elhúz mellette

A MAI-Code-1.1-Flash a Microsoft új, kifejezetten kódolásra épített kis modellje, amely a bejelentés szerint negyedannyiba kerül, mint a júniusi elődje, és 25%-kal token-hatékonyabban dolgozik. A modell 2026. augusztus 11-én jelent meg, és már éles üzemben fut a GitHub Copilotban. A hivatalos közlemény viszont egyetlen versenytárssal sem hasonlítja össze magát — és amikor a független mérések ezt megteszik, más kép rajzolódik ki.

Mit ígér a Microsoft?

A Microsoft AI bejelentése végig a saját elődjéhez, a júniusi Microsoft Buildon bemutatott MAI-Code-1.0-hoz méri az új modellt. Ehhez képest a cég szerint jobb minőségű kódot ír, negyedáron, és lényegesen takarékosabban bánik a tokenekkel.

A fejlesztés iránya explicit módon a felhasználói visszajelzésekből jött. A Microsoft megfogalmazásában megtanulták, hogy a parancssori (CLI) feladatok és a .NET-teljesítmény számít a fejlesztőknek, ezért oda fókuszáltak.

  • 22%-os javulás a Terminal-Bench 2.1-en a GitHub Copilot CLI-ben
  • 15%-os javulás .NET-feladatokon
  • A tokenek 25%-kal gyorsabban áramlanak a Copilotban
  • A modell 25%-kal kevesebb tokenből old meg egy feladatot

A cég két éles üzemi mutatót is kiemel a benchmarkok helyett. A kód túlélési aránya 4%-kal nőtt — vagyis a fejlesztők ennyivel többet hagytak meg abból, amit a modell írt —, a visszatérő használat pedig 9%-kal emelkedett. A Microsoft szerint az olcsóbb ár mögött jobb tanítási és kiszolgálási hatékonyság áll, amit több százezer megerősítéses tanulási környezetben értek el, közvetlenül a GitHub Copilotra optimalizálva.

„A benchmarkok hasznos iránytűk, de az éles üzem az, ahol a gumi találkozik az úttal” — fogalmaz a Microsoft AI bejelentése.

A benchmarkok, amiket a bejelentés nem mutat meg

Az idézett mondat önmagában védhető, de van egy mellékhatása: a hivatalos poszt egyetlen konkrét benchmark-eredményt sem közöl abszolút értékben, és semmilyen versenytárssal nem veti össze a modellt. A számok a model cardban vannak — a német The Decoder ezeket szedte össze, és a lista magyarázza, miért maradtak ki a főoldalról.

SWE-bench Verified (valós GitHub-hibák javítása):

  • MAI-Code-1.1-Flash: 72,6%
  • MAI-Code-1-Flash (elődje): 71,6%
  • Claude Haiku 4.5: 69,8%
  • GPT-5.4 mini: 69,2%
  • DeepSeek-V4-Flash-0731: nincs közölve

Terminal-Bench 2.1 (parancssori, többlépéses feladatok):

  • DeepSeek-V4-Flash-0731: 82,7%
  • MAI-Code-1.1-Flash: 62,9%
  • GPT-5.4 mini: 60,7%
  • MAI-Code-1-Flash (elődje): 51,7%
  • Claude Haiku 4.5: 49,4%

A SWE-bench Verified mezőnyében a MAI-Code-1.1-Flash valóban vezet: 72,6%-kal megelőzi a saját elődjét, a Claude Haiku 4.5-öt és a GPT-5.4 minit is. Ez a valós GitHub-hibák javítását méri, és a kis modellek kategóriájában tisztes eredmény.

A Terminal-Bench 2.1 viszont pont az a terület, amit a Microsoft a fejlesztés fő irányaként nevezett meg. Itt a 62,9% önmagához képest komoly ugrás az 51,7%-ról — de a nyílt súlyú DeepSeek-V4-Flash 82,7%-a mellett húsz százalékpontos a lemaradás. A Terminal-Bench pont azt méri, amiért a modellt fejlesztették.

Az ár, ami nem a legolcsóbb

A „negyedáron” állítás a saját elődhöz szól, nem a piachoz. Millió tokenre vetítve a kép így néz ki:

  • DeepSeek-V4-Flash: 0,14 $ input | 0,0028 $ cache-elt input | 0,28 $ output
  • MAI-Code-1.1-Flash: 0,20 $ input | 0,02 $ cache-elt input | 1,20 $ output
  • Claude Haiku 4.5: 1,00 $ input | 0,10 $ cache-elt input | 5,00 $ output

A különbség a kimeneti tokeneknél a legélesebb: a MAI-Code-1.1-Flash több mint négyszer drágább a DeepSeek-nél, cache-elt bemeneten pedig hétszeres a szorzó. Kódoló ágenseknél éppen a kimenet és a cache-elt kontextus a fő költségtétel. A Haiku 4.5-höz képest viszont a Microsoft modellje látványosan olcsóbb — a mezőny tehát nem kétpólusú.

A Decoder értékelése szerint a MAI-Code-1.1-Flash papíron budget modellnek látszik, a gyakorlatban viszont árban és teljesítményben is elmarad a képesebb DeepSeek mögött. A lap ezt egy szélesebb mintázatba illeszti: a Copilot átalakításakor a Microsoft OpenAI- és Anthropic-modelleket cserélt saját, olcsóbb MAI-alternatívákra, vagyis gyengébb teljesítményt vállalt jobb árrésért.

Csakhogy a DeepSeek-előny sem áll szilárdan

Az összevetés akkor lenne egyértelmű, ha a benchmark-fölény éles üzemben is megmaradna. A VentureBeat augusztus 16-i cikke szerint nem ez a helyzet. A Composio nyolc különböző ágens-környezetben — köztük Claude Code, Codex és OpenCode — futtatta végig a V4 Flasht 30 szándékosan nehéz, többlépéses feladaton, élő eszközökkel: Gmail, GitHub, Slack, Google Sheets.

  • A modell a komplex ágens-feladatoknak mindössze 53,8%-át teljesítette
  • 240 futásból 129 ment át
  • A 30 workflow közül mindössze hatot teljesített minden tesztelt környezet

Ugyanaz a modell tehát látványosan más eredményt hozott attól függően, milyen harnessben, milyen eszközkonfigurációval, cache-viselkedéssel és szolgáltatói stacken futott. Ehhez jön, hogy a DeepSeek épp most emeli a V4 árait — modelltől, tokentípustól és napszaktól függően akár 1100%-kal. A Flash off-peak 0,22 dollár input és 0,66 dollár output, csúcsidőben 0,44, illetve 1,32 dollár lesz. Erről részletesen is írtunk a DeepSeek V4 Pro áremeléséről szóló cikkünkben.

„Ez nem egyszerű áremelés. Ez egy árazási architektúra, amely a következtetés időzítését gazdasági változóvá teszi” — Sanchit vir Gogia, Greyhound Research.

Vagyis a fenti árak közül a DeepSeek sora a legmozgékonyabb. A 0,14 dolláros input a régi árazás; az új struktúrában a különbség érdemben szűkül.

Mit jelent ez a gyakorlatban?

Ha GitHub Copilotot használsz, a MAI-Code-1.1-Flash valószínűleg nem külön döntés lesz a számodra, hanem alapértelmezés. Ez a lényegi pont: a Decoder szerint a Microsoft előbb-utóbb szinte biztosan saját modelljeit teszi alapbeállítássá, és ez önmagában komoly piaci részesedést zár le, mert a felhasználók többsége soha nem választ tudatosan modellt.

Aki viszont API-szinten dolgozik, annak érdemes a Meta mérnöke, Naman Ahuja által javasolt metrikát nézni: nem a token árát, hanem a sikeresen befejezett workflow költségét. Egy olcsóbb modell, amelyik a feladatok felét elrontja, és háromszor kell újrafuttatni, drágább, mint egy magasabb listaárú, ami elsőre megcsinálja. A Terminal-Bench 82,7%-a és az éles ágens-feladatok 53,8%-a közötti szakadék pontosan ezt mutatja.

Kapcsolódó elemzésünk: MAI-Cyber-1-Flash: a Microsoft új kiberbiztonsági AI-modellje 96%-os benchmarkkal és Legjobb AI kódoló asszisztens 2026: 3 erős eszköz teljes tesztje.

Összegzés

A MAI-Code-1.1-Flash önmagához képest jó modell: olcsóbb, gyorsabb és takarékosabb, mint a júniusi elődje, és a SWE-bench Verifieden a saját súlycsoportjában vezet. A Microsoft kommunikációja viszont pont azt kerüli el, amit a fejlesztők nézni fognak — a Terminal-Bench 2.1-en, vagyis a saját bevallott fókuszterületén húsz százalékponttal marad el a nyílt DeepSeek-alternatívától, miközben a kimeneti tokenekért négyszeres árat kér.

A valódi kérdés nem az, melyik modell nyer egy táblázatban. Hanem az, hogy a Copilot-felhasználók milyen alapértelmezéssel találkoznak majd — és hogy megnézik-e egyáltalán, mi fut a háttérben.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük