Az NVIDIA Nemotron 3 Nano Omni egy nyílt súlyú multimodális AI-modell, amelyet az NVIDIA 2026. április 28-án mutatott be, és amely egyetlen rendszerbe integrálja a látást, a hangot és a szöveget. A modell 9x magasabb throughputot ér el más nyílt omni-modellekhez képest, kifejezetten vállalati AI-ágens rendszerekhez tervezve.
A lényeg egy mondatban: a mai ágens-rendszerek külön modelleket használnak látásra, hangra és szövegre, ami latenciát és kontextusvesztést okoz. A Nemotron 3 Nano Omni ezt egyetlen modellbe vonja össze. A modell 31 milliárd paramétert tartalmaz, de tokenenként csak ~3 milliárdot aktivál.
Mi új az NVIDIA Nemotron 3 Nano Omni modellben?
A legnagyobb újdonság az integráció. A modell a vision és audio enkódereket közvetlenül a magjába építi, így nincs szükség külön percepciós modellekre. Ez csökkenti a latenciát, a kontextus-töredezettséget és a költségeket.
A bemenetnél videót, hangot, képet és szöveget fogad, a kimenet szöveg. A kontextus-ablak 256 ezer token, ami hosszú dokumentumok és videók feldolgozását is lehetővé teszi.
Az architektúra egy Mamba2-Transformer hibrid Mixture of Experts (MoE). A Mamba rétegek a szekvencia- és memóriahatékonyságért felelősek, a Transformer rétegek pedig a pontos reasoningot adják. A vizuális enkóder a C-RADIOv4-H, a hang enkóder az NVIDIA Parakeet, a videót pedig 3D konvolúciók és Efficient Video Sampling (EVS) tömörítik.
A modell tanítása is komoly léptékű volt: a teljes adathalmaz ~354,6 millió mintát és 1 395 adathalmazt ölel fel, összesen ~717 milliárd token nagyságrendben. Ebből nagyjából 127 milliárd token volt kifejezetten multimodális tanítási adat, kiegészítve mintegy 124 millió kurált post-training példával és 20 megerősítéses tanulási adathalmazzal 25 különböző környezetben.
Hogyan teljesít benchmarkokon?
A teljesítményszámok látványosak és konkrétak. A modell ~9,2x nagyobb rendszerkapacitást ér el videó-reasoning feladatoknál, és ~7,4x nagyobb kapacitást multi-dokumentum reasoningnál. A hibrid MoE mag 4x jobb memória- és számítási hatékonyságot hoz.
A modell 6 leaderboardon vezet a nyílt modellek között. Dokumentum-intelligenciában az MMlongbench-Doc és az OCRBenchV2 ranglistán, videó- és hangmegértésben pedig a WorldSense, a DailyOmni és a VoiceBench listán áll az élen. A legmagasabb throughputot NVIDIA Blackwell GPU-kon, NVFP4 kvantizálással éri el. A részletes benchmarkokat az NVIDIA fejlesztői blogja teszi közzé.
„Ahhoz, hogy hasznos ágenseket építsünk, nem várhatsz másodperceket arra, hogy egy modell értelmezzen egy képernyőt. A Nemotron 3 Nano Omnira építve az ágenseink gyorsan értelmezik a teljes HD képernyőfelvételeket — ez korábban nem volt gyakorlatias.” — Gautier Cloix, a H Company vezérigazgatója.
Az erősségek mellett érdemes látni a korlátot is: a modell kimenete kizárólag szöveg, tehát hangot vagy képet nem generál — ez értés-orientált, nem generáló omni-modell.
Mire használható a gyakorlatban?
Az NVIDIA három fő felhasználási területet emel ki, mindegyik az agentic AI irányába mutat.
- Computer use ágensek: GUI-navigálás, képernyő-értelmezés és a UI-állapot időbeli követése. A natív bemeneti felbontás 1920×1080 pixel.
- Dokumentum-intelligencia: dokumentumok, grafikonok, táblázatok, képernyőképek és vegyes média értelmezése vállalati analitikához és megfelelőséghez.
- Hang- és videómegértés: hang-videó kontextus fenntartása ügyfélszolgálati, kutatási és monitorozási feladatokhoz.
A korai felhasználók névsora jelzi a komolyságot: már alkalmazza a Palantir, a Foxconn, a H Company (számítógép-vezérlő ágens), az Eka Care (egészségügy, India), a Pyler (videótartalom-moderálás), az Aible és az Applied Scientific Intelligence. Értékelés alatt van többek között a Dell, az Oracle, az Infosys, a Docusign, a K-Dense, a Lila és a Zefr — vagyis a vállalati és védelmi szektor is figyeli a modellt.
Árazás, hardver és elérhetőség
A modell nyílt súlyú, és az NVIDIA Open Model Agreement licenc alatt globálisan kereskedelmi használatra is elérhető. A súlyok mellett az adathalmazok és a teljes tanítási recept is nyilvános.
Elérhető a Hugging Face-en, NVIDIA NIM mikroszervízként a build.nvidia.com-on, valamint az OpenRouteren ingyenesen — ez utóbbi azt jelenti, hogy bárki azonnal kipróbálhatja. A felhőszolgáltatók közül az AWS, az OCI és a Microsoft Azure támogatja.
A hardverigény a precizitástól függ: BF16-on egy NVIDIA H100 80GB, FP8-on egy L40S 48GB, NVFP4-en pedig egy RTX 5090 32GB is elég. Helyi futtatás lehetséges vLLM, SGLang, TensorRT-LLM, Ollama, llama.cpp és LM Studio alatt is, sőt NVIDIA Jetson, DGX Spark és DGX Station eszközökön peremhálózati telepítésre is alkalmas.
A testreszabáshoz és értékeléshez az NVIDIA a NeMo eszközöket kínálja, így a vállalatok saját adataikra finomhangolhatják a modellt anélkül, hogy az alapsúlyokat el kellene hagyniuk.
Hol a helye a Nemotron 3 családban?
A Nemotron 3 Nano Omni a multimodális tagja egy szélesebb modellcsaládnak. Mellette áll a Nemotron 3 Super, amelyet magas frekvenciájú végrehajtásra terveztek, és a Nemotron 3 Ultra, amely a komplex tervezési feladatokat célozza.
A skálázás jól mutatja az NVIDIA stratégiáját: egyetlen modellcsaládon belül a fejlesztő a feladat súlyához igazíthatja a kapacitást. Az ágens-rendszerek percepciós rétegéhez a Nano Omni elég, a nehéz reasoninghoz a nagyobb testvérek állnak rendelkezésre.
Mit jelent ez a vállalati AI-stratégiának?
A modell nem csupán technikai bejelentés: az NVIDIA a hardver (Blackwell GPU-k) mellé a szoftver-ökoszisztmát is építi a NIM és NeMo eszközökkel. A teljes Nemotron 3 család 50 millió letöltést ért el az elmúlt évben, ami a fejlesztői érdeklődés erősségét mutatja.
Döntéshozói szempontból érdemes öt pontot kiemelni.
- Költséghatékonyság: a 9x throughput és 4x memóriahatékonyság közvetlenül csökkenti az ágens-rendszerek inference-költségét.
- Nyílt súlyok = adatkontroll: a helyben futtathatóság érzékeny adatok esetén megfelelőségi előny, nem kell felhőbe küldeni a tartalmat.
- Egyszerűbb stack: a külön látás/hang/szöveg modellek kiváltása csökkenti a workflow komplexitását és hibapontjait.
- Vendor-flexibilitás: az OpenRouter, NIM és helyi inference több útat ad ugyanahhoz a modellhez, csökkentve a beszállítói függőséget.
- Agentic-készség: a computer-use és dokumentum-intelligencia fókusz pontosan a 2026-os vállalati AI-irányt célozza.
A nyílt omni-modellek új mércéje
Az NVIDIA Nemotron 3 Nano Omni azt mutatja, hogy a nyílt modellek már nem feltétlenül maradnak le a zárt omni-rendszerek (GPT-4o, Gemini) mögött hatékonyságban. Az igazi tét nem egyetlen benchmark, hanem hogy a multimodális értés érdemben olcsóbbá és gyorsabbá válik az ágens-rendszerekben.
Az NVIDIA pozicionálása egyértelmű: a vállalat szerint ez a „legjobb nyílt omni-modális reasoning modell”, amely a legmagasabb hatékonyságot és pontosságot adja a computer use, dokumentum-intelligencia és hang-videó reasoning típusú agentic workflow-khoz. Ez nem marketing-túlzás, hanem a 6 leaderboard-vezető pozicióval alátámasztott állítás.
A gyakorlatban ez azt jelenti, hogy egy vállalat, amely eddig három különböző szolgáltatótól vásárolt látás-, hang- és szövegmodellt, mostantól egyetlen nyílt modellre cserélheti a percepciós rétegét. A megtakarítás nem csak licencköltség, hanem integrációs idő, karbantartás és a hibapontok számának csökkenése is.
Aki ma agentic workflow-t épít, annak ez a modell konkrét, ingyenesen kipróbálható alternatíva — a kérdés már nem az, hogy a nyílt modellek versenyképesek-e, hanem hogy mikor éri meg átváltani rájuk.
Kapcsolódó modell-elemzésünk: Microsoft MAI modellek: 7 új saját AI az OpenAI mellett. További AI-modell összehasonlításokért iratkozz fel az AI Hírek hírlevelére.