A d-Matrix NVLink Fusion-bejelentése szerint az inferencia-chipekre szakosodott startup következő generációs Raptor XPU-it az NVIDIA saját, rack-szintű összeköttetésén keresztül köti be az NVIDIA AI-infrastruktúrájába. A hír azért jelentős, mert az NVIDIA ezzel egy olyan cég chipjei előtt nyitja meg a platformját, amely az inferencia-piacon eddig a GPU-k alternatívájaként pozicionálta magát.
A 2026. szeptember 10-én kiadott d-Matrix-sajtóközlemény többéves termék-útiterv együttműködésről szól. Az NVIDIA blogja szerint a d-Matrix ezzel a bővülő NVLink Fusion-partnerkörhöz csatlakozik. A rackbe integrált Raptor XPU-k első elérhetősége 2027 negyedik negyedéve, vagyis ma útitervet jelentettek be, nem szállítható terméket.
d-Matrix NVLink Fusion: mi történt pontosan?
A d-Matrix egy 2019-ben alapított, a kaliforniai Santa Clarában működő chipcég, amely kizárólag AI-inferenciára, vagyis a már betanított modellek futtatására tervez processzorokat. Jelenleg a Corsair XPU platformja van gyártásban, a mostani megállapodás ennek utódjáról, a Raptorról szól. Az XPU itt gyűjtőnév: olyan speciális gyorsítót jelent, amely nem általános célú GPU, hanem egy konkrét feladatra optimalizált chip.
Az együttműködés középpontjában egy NVLink Fusion-képes, rack-szintű rendszer áll. Ezt AI-laborok, hyperscalerek és úgynevezett neocloud-szolgáltatók telepíthetik ultra-alacsony késleltetésű, prémium szintű token-szolgáltatásokhoz. A Raptor XPU-k az NVIDIA MGX rack-architektúrájába kerülnek, a következő NVIDIA-elemek mellé:
- NVIDIA Vera CPU-k — a rack központi processzorai,
- NVLink switchek — a chipek közötti nagysebességű kapcsolók,
- BlueField-4 DPU-k — adatfeldolgozó egységek a hálózati és tárolási terheléshez,
- ConnectX-9 SuperNIC-ek — hálózati kártyák,
- Spectrum-X Ethernet — a rackek közötti, kifelé skálázó hálózat.
Az NVIDIA oldaláról Jensen Huang alapító-vezérigazgató fogalmazta meg a platform üzenetét:
„NVLink Fusion enables partners to integrate custom silicon with NVIDIA’s deep ecosystem of NVLink, advanced packaging, rack-scale systems and networking technologies.” — Jensen Huang, az NVIDIA alapító-vezérigazgatója
A d-Matrix alapító-vezérigazgatója, Sid Sheth a közleményben „meghatározó pillanatnak” nevezte az együttműködést a cég útján a „végtelen, mindenki számára elérhető inferencia” felé. A megállapodásban harmadik félként az Astera Labs is részt vesz, amely a konnektivitási megoldást adja az NVLink Fusion-ökoszisztémán belül.
Kapcsolódó elemzésünk: Nvidia Vera CPU: új processzor AI-ügynökökhöz
Mi az az NVLink Fusion, és miért számít?
Az NVLink az NVIDIA saját, nagysebességű összeköttetése, amely a chipeket egy rackon belül úgy köti össze, hogy azok egyetlen nagy gyorsítóként dolgozhassanak. Évekig csak NVIDIA-chipek között működött. Az NVLink Fusion ezt nyitja meg: más gyártók egyedi chipjei — processzorok és gyorsítók — is csatlakozhatnak ugyanahhoz a hálózathoz.
Az NVIDIA által közölt adatok a hatodik generációs NVLinkre vonatkoznak:
- 3-szor kisebb XPU–XPU késleltetés a szabványos Ethernethez képest,
- 10-szer nagyobb csomagráta,
- 3 TB/s all-to-all sávszélesség XPU-nként,
- az XPU és a CPU közötti NVLink-C2C kapcsolaton akár 6-szoros energiahatékonyság a PCIe-hez képest,
- 72 XPU-s scale-up domain.
A scale-up domain azt a chipcsoportot jelenti, amely a gyors belső hálózaton keresztül közösen, egyetlen logikai egységként dolgozik. Minél nagyobb ez a csoport, annál nagyobb modellt lehet futtatni anélkül, hogy az adatnak a lassabb, rackek közötti hálózaton kellene utaznia.
A platform mögött széles partnerkör áll. Az NVIDIA listáján az AWS, Arm, Intel, Fujitsu, SiFive, Alchip, Astera Labs, GUC, Marvell, MediaTek, Samsung, Cadence, Synopsys, Ayar Labs és Lightmatter szerepel, a támogatott processzor-architektúrák pedig az Arm, az x86 és a RISC-V. A Unite.AI elemzése szerint a rendszer az NVIDIA DSX referencia-architektúrájához illeszkedik, amely az AI-gyárak épületét, áramellátását, hűtését, számítási és hálózati rétegét egyben tervezi meg.
Hogyan működik: prefill a GPU-n, decode a d-Matrix chipen
A megállapodás technikai lényege a heterogén szétválasztás (disaggregation). Egy nyelvi modell válaszadása két, egymástól jól elkülöníthető fázisból áll, és a két fázis más hardveren fut a leghatékonyabban.
- Prefill: a modell beolvassa és feldolgozza a teljes bemenetet — a kérdést, a csatolt dokumentumot, kódolásnál a projekt kontextusát. Ez számításigényes feladat, ebben a GPU-k erősek.
- Decode: a modell tokenről tokenre előállítja a választ, és minden új token az előzőre épül. Ez a késleltetés-érzékeny szakasz: itt dől el, milyen gyorsan „gépel” a chatbot vagy a kódoló asszisztens.
Az új felállásban a GPU-alapú rendszerek végzik a prefillt, a d-Matrix XPU-k pedig a decode-ot. A két fázis közötti munkamegosztást az NVIDIA Dynamo és NIXL szoftverei szervezik. A Unite.AI szerint a fő felhasználási terület az AI-alapú kódolás, ahol a válaszsebesség közvetlenül a termék minősége.
Kapcsolódó elemzésünk: Token-gazdaságtan: miért a token ára számít, nem a GPU óradíja
Raptor: memóriára épített inferencia-chip
A d-Matrix a Raptort memória-központú architektúraként írja le. A chip a cég szerint az első a maga nemében, amely 3D DRAM-stackinget használ: egy DRAM memóriachipet és egy SRAM-alapú számítóchipet egyetlen, „kétszintes” tokban egyesít. Az SRAM a nagyon gyors, de kis kapacitású, chipen belüli memória, a DRAM a nagyobb kapacitású munkamemória. A kettő egymásra helyezése a decode-fázisban kritikus adatmozgatást gyorsítja.
A közlemény további részletei:
- a megoldást több mint 100 szabadalom védi,
- a tape-out, vagyis a gyártásra kész terv leadása 2026 vége előtt várható,
- a chipet már tesztelik hyperscalereknél és frontier AI-laboroknál,
- a 3D DRAM-technológia részleteit az IEEE publikálta, és a 2026-os Hot Chips konferencián Sudeep Bhoja, a d-Matrix társalapító-technológiai igazgatója mutatta be.
A háttér: 2 milliárd dolláros értékelés, Microsoft-tőke
A d-Matrix nem kis szereplő. A Yahoo Finance beszámolója szerint a cég 275 millió dolláros C-körös finanszírozást zárt 2 milliárd dolláros értékelés mellett. A kört a BullhoundCapital, a Triatomic Capital és a szingapúri Temasek vezette, a Microsoft az M12 kockázatitőke-ágán keresztül fektetett be. A 2019-es alapítás óta összesen mintegy 450 millió dollárt vont be.
Ugyanitt olvasható a cég saját teljesítményállítása is: a GPU-alapú rendszerekhez képest 10-szer jobb teljesítményt, 3-szor jobb költséghatékonyságot és akár 5-ször jobb energiahatékonyságot ígér. Ezek a d-Matrix saját számai, a forrásokban független mérés nem szerepel, ezért kezeld őket vállalati állításként.
Kapcsolódó elemzésünk: Cerebras tőzsdére megy — az NVIDIA egyetlen igazi kihívója
Mit jelent ez a gyakorlatban?
A bejelentés három szereplő szemszögéből is más üzenetet hordoz.
Az AI-laboroknak és fejlesztőknek
A d-Matrix a „prémium token-gazdaság” piacát célozza: AI kódoló asszisztenseket, valós idejű chatbotokat és hangalapú ügynököket, ahol a sebességért a felhasználó hajlandó többet fizetni. Ha a prefill és a decode külön, a feladatra optimalizált hardveren fut egy közös rackben, ugyanabból az infrastruktúrából gyorsabb válasz nyerhető ki. Egy kódoló asszisztensnél ez közvetlenül érezhető: kevesebb várakozás a generált kódra.
A hyperscalereknek és felhőszolgáltatóknak
A legnagyobb gyakorlati előny a kisebb kockázat és a rövidebb bevezetési idő. Egy nem NVIDIA-gyorsítóhoz eddig jellemzően külön rackplatformot, hálózatot és hűtést kellett építeni. Itt az MGX-rack, a hálózati réteg és az ellátási lánc készen adott. Sheth a Unite.AI által idézett sajtótájékoztatón úgy fogalmazott, hogy az inferencia iránti kereslet szárnyal, a tőke, az idő és az energia viszont véges — a Raptor ezért egy széles körben telepített, folyadékhűtéses architektúrába érkezik.
Az NVIDIA-nak
A stratégiai logika egyértelmű: az NVIDIA nem engedi át teljesen a riválisoknak az egyedi gyorsítók piacát, hanem az összekötő réteget — az összeköttetést, a rackrendszert és a hálózatot — adja hozzá. A rivális szilícium így az NVIDIA dobozában marad, az ügyfél pedig továbbra is NVIDIA-infrastruktúrát vásárol. A d-Matrix ezzel validációt és elérést kap, a versenytárs szerepe helyett pedig kiegészítő pozícióba kerül: a GPU végzi a prefillt, az XPU a decode-ot.
Ez a lépés illeszkedik abba a trendbe, amelyben a nagy AI-szereplők saját vagy speciális inferencia-chipekkel csökkentik a futtatás költségét. Ugyanerről a mozgásról szólt az OpenAI Jalapeño inferencia-chipjéről írt cikkünk is.
Mire figyelj a következő hónapokban?
- Az idővonal: a tape-out 2026 végére, az éles rack-termék 2027 negyedik negyedévére várható. A kettő között több mint egy év telik el.
- A független mérések: a 10-szeres teljesítmény és az 5-szörös energiahatékonyság ma a cég saját állítása.
- Az ökoszisztéma: az NVLink Fusion-partnerek listája már most tizenöt nagy nevet tartalmaz; érdemes figyelni, melyik chipgyártó csatlakozik következőként.
Összefoglaló
A d-Matrix és az NVIDIA megállapodása ma még útiterv, de iránya világos: az inferencia-hardver piaca a „vagy GPU, vagy alternatív chip” döntésről a vegyes, feladatra szabott rackek felé mozdul. A felhasználó ebből annyit érzékel majd, hogy a kódoló asszisztensek és a hangalapú ügynökök gyorsabban válaszolnak. A következő mérföldkő a Raptor tape-outja 2026 végén, utána pedig az első független teljesítménymérések.
Ha az NVIDIA AI-gyár koncepciójának hátterére vagy kíváncsi, az NVIDIA Vera Rubin platformról szóló elemzésünk jó kiindulópont. Ha pedig nem akarsz lemaradni a következő chip- és infrastruktúra-hírekről, iratkozz fel az AI Hírek hírlevelére — hetente küldjük a lényeget, marketingszöveg nélkül.