A MAI-Code-1.1-Flash a Microsoft új, kifejezetten kódolásra épített kis modellje, amely a bejelentés szerint negyedannyiba kerül, mint a júniusi elődje, és 25%-kal token-hatékonyabban dolgozik. A modell 2026. augusztus 11-én jelent meg, és már éles üzemben fut a GitHub Copilotban. A hivatalos közlemény viszont egyetlen versenytárssal sem hasonlítja össze magát — és amikor a független mérések ezt megteszik, más kép rajzolódik ki.
Mit ígér a Microsoft?
A Microsoft AI bejelentése végig a saját elődjéhez, a júniusi Microsoft Buildon bemutatott MAI-Code-1.0-hoz méri az új modellt. Ehhez képest a cég szerint jobb minőségű kódot ír, negyedáron, és lényegesen takarékosabban bánik a tokenekkel.
A fejlesztés iránya explicit módon a felhasználói visszajelzésekből jött. A Microsoft megfogalmazásában megtanulták, hogy a parancssori (CLI) feladatok és a .NET-teljesítmény számít a fejlesztőknek, ezért oda fókuszáltak.
- 22%-os javulás a Terminal-Bench 2.1-en a GitHub Copilot CLI-ben
- 15%-os javulás .NET-feladatokon
- A tokenek 25%-kal gyorsabban áramlanak a Copilotban
- A modell 25%-kal kevesebb tokenből old meg egy feladatot
A cég két éles üzemi mutatót is kiemel a benchmarkok helyett. A kód túlélési aránya 4%-kal nőtt — vagyis a fejlesztők ennyivel többet hagytak meg abból, amit a modell írt —, a visszatérő használat pedig 9%-kal emelkedett. A Microsoft szerint az olcsóbb ár mögött jobb tanítási és kiszolgálási hatékonyság áll, amit több százezer megerősítéses tanulási környezetben értek el, közvetlenül a GitHub Copilotra optimalizálva.
„A benchmarkok hasznos iránytűk, de az éles üzem az, ahol a gumi találkozik az úttal” — fogalmaz a Microsoft AI bejelentése.
A benchmarkok, amiket a bejelentés nem mutat meg
Az idézett mondat önmagában védhető, de van egy mellékhatása: a hivatalos poszt egyetlen konkrét benchmark-eredményt sem közöl abszolút értékben, és semmilyen versenytárssal nem veti össze a modellt. A számok a model cardban vannak — a német The Decoder ezeket szedte össze, és a lista magyarázza, miért maradtak ki a főoldalról.
SWE-bench Verified (valós GitHub-hibák javítása):
- MAI-Code-1.1-Flash: 72,6%
- MAI-Code-1-Flash (elődje): 71,6%
- Claude Haiku 4.5: 69,8%
- GPT-5.4 mini: 69,2%
- DeepSeek-V4-Flash-0731: nincs közölve
Terminal-Bench 2.1 (parancssori, többlépéses feladatok):
- DeepSeek-V4-Flash-0731: 82,7%
- MAI-Code-1.1-Flash: 62,9%
- GPT-5.4 mini: 60,7%
- MAI-Code-1-Flash (elődje): 51,7%
- Claude Haiku 4.5: 49,4%
A SWE-bench Verified mezőnyében a MAI-Code-1.1-Flash valóban vezet: 72,6%-kal megelőzi a saját elődjét, a Claude Haiku 4.5-öt és a GPT-5.4 minit is. Ez a valós GitHub-hibák javítását méri, és a kis modellek kategóriájában tisztes eredmény.
A Terminal-Bench 2.1 viszont pont az a terület, amit a Microsoft a fejlesztés fő irányaként nevezett meg. Itt a 62,9% önmagához képest komoly ugrás az 51,7%-ról — de a nyílt súlyú DeepSeek-V4-Flash 82,7%-a mellett húsz százalékpontos a lemaradás. A Terminal-Bench pont azt méri, amiért a modellt fejlesztették.
Az ár, ami nem a legolcsóbb
A „negyedáron” állítás a saját elődhöz szól, nem a piachoz. Millió tokenre vetítve a kép így néz ki:
- DeepSeek-V4-Flash: 0,14 $ input | 0,0028 $ cache-elt input | 0,28 $ output
- MAI-Code-1.1-Flash: 0,20 $ input | 0,02 $ cache-elt input | 1,20 $ output
- Claude Haiku 4.5: 1,00 $ input | 0,10 $ cache-elt input | 5,00 $ output
A különbség a kimeneti tokeneknél a legélesebb: a MAI-Code-1.1-Flash több mint négyszer drágább a DeepSeek-nél, cache-elt bemeneten pedig hétszeres a szorzó. Kódoló ágenseknél éppen a kimenet és a cache-elt kontextus a fő költségtétel. A Haiku 4.5-höz képest viszont a Microsoft modellje látványosan olcsóbb — a mezőny tehát nem kétpólusú.
A Decoder értékelése szerint a MAI-Code-1.1-Flash papíron budget modellnek látszik, a gyakorlatban viszont árban és teljesítményben is elmarad a képesebb DeepSeek mögött. A lap ezt egy szélesebb mintázatba illeszti: a Copilot átalakításakor a Microsoft OpenAI- és Anthropic-modelleket cserélt saját, olcsóbb MAI-alternatívákra, vagyis gyengébb teljesítményt vállalt jobb árrésért.
Csakhogy a DeepSeek-előny sem áll szilárdan
Az összevetés akkor lenne egyértelmű, ha a benchmark-fölény éles üzemben is megmaradna. A VentureBeat augusztus 16-i cikke szerint nem ez a helyzet. A Composio nyolc különböző ágens-környezetben — köztük Claude Code, Codex és OpenCode — futtatta végig a V4 Flasht 30 szándékosan nehéz, többlépéses feladaton, élő eszközökkel: Gmail, GitHub, Slack, Google Sheets.
- A modell a komplex ágens-feladatoknak mindössze 53,8%-át teljesítette
- 240 futásból 129 ment át
- A 30 workflow közül mindössze hatot teljesített minden tesztelt környezet
Ugyanaz a modell tehát látványosan más eredményt hozott attól függően, milyen harnessben, milyen eszközkonfigurációval, cache-viselkedéssel és szolgáltatói stacken futott. Ehhez jön, hogy a DeepSeek épp most emeli a V4 árait — modelltől, tokentípustól és napszaktól függően akár 1100%-kal. A Flash off-peak 0,22 dollár input és 0,66 dollár output, csúcsidőben 0,44, illetve 1,32 dollár lesz. Erről részletesen is írtunk a DeepSeek V4 Pro áremeléséről szóló cikkünkben.
„Ez nem egyszerű áremelés. Ez egy árazási architektúra, amely a következtetés időzítését gazdasági változóvá teszi” — Sanchit vir Gogia, Greyhound Research.
Vagyis a fenti árak közül a DeepSeek sora a legmozgékonyabb. A 0,14 dolláros input a régi árazás; az új struktúrában a különbség érdemben szűkül.
Mit jelent ez a gyakorlatban?
Ha GitHub Copilotot használsz, a MAI-Code-1.1-Flash valószínűleg nem külön döntés lesz a számodra, hanem alapértelmezés. Ez a lényegi pont: a Decoder szerint a Microsoft előbb-utóbb szinte biztosan saját modelljeit teszi alapbeállítássá, és ez önmagában komoly piaci részesedést zár le, mert a felhasználók többsége soha nem választ tudatosan modellt.
Aki viszont API-szinten dolgozik, annak érdemes a Meta mérnöke, Naman Ahuja által javasolt metrikát nézni: nem a token árát, hanem a sikeresen befejezett workflow költségét. Egy olcsóbb modell, amelyik a feladatok felét elrontja, és háromszor kell újrafuttatni, drágább, mint egy magasabb listaárú, ami elsőre megcsinálja. A Terminal-Bench 82,7%-a és az éles ágens-feladatok 53,8%-a közötti szakadék pontosan ezt mutatja.
Kapcsolódó elemzésünk: MAI-Cyber-1-Flash: a Microsoft új kiberbiztonsági AI-modellje 96%-os benchmarkkal és Legjobb AI kódoló asszisztens 2026: 3 erős eszköz teljes tesztje.
Összegzés
A MAI-Code-1.1-Flash önmagához képest jó modell: olcsóbb, gyorsabb és takarékosabb, mint a júniusi elődje, és a SWE-bench Verifieden a saját súlycsoportjában vezet. A Microsoft kommunikációja viszont pont azt kerüli el, amit a fejlesztők nézni fognak — a Terminal-Bench 2.1-en, vagyis a saját bevallott fókuszterületén húsz százalékponttal marad el a nyílt DeepSeek-alternatívától, miközben a kimeneti tokenekért négyszeres árat kér.
A valódi kérdés nem az, melyik modell nyer egy táblázatban. Hanem az, hogy a Copilot-felhasználók milyen alapértelmezéssel találkoznak majd — és hogy megnézik-e egyáltalán, mi fut a háttérben.