A local AI adatvédelem 2026-ra abból a kérdésből, hogy „egyáltalán működik-e”, azzá alakult, hogy „mikor éri meg”. A nyílt súlyú modellek — Llama, Qwen, Gemma, Mistral, DeepSeek — a legtöbb hétköznapi feladatban a frontier felhőmodellek 10–15%-os közelébe kerültek, a futtatókörnyezetek (Ollama, LM Studio, vLLM) telepítése pedig percek kérdése lett. A döntés viszont nem bináris: nem „minden helyben” vagy „minden felhőben”, hanem öt szempont egyúttállása dönti el.
Ez a cikk szándékosan nem telepítési útmutató. Arról szól, hogy mikor indokolt egyáltalán a saját gépen futtatni egy modellt — adatvédelmi, költség- és üzemeltetési oldalról egyaránt.
Local AI adatvédelem: milyen problémát old meg a helyi futtatás?
A felhő-AI legnagyobb rejtett költsége nem a token-számla, hanem a megfelelőségi felület. Minden API-hívás, amely személyes adatot, ügyféldokumentumot vagy védett forráskódot visz ki a szervezetből, új jogi kötelezettséget hoz magával. Helyi futtatásnál a prompt és a dokumentum el sem hagyja a gépet: nincs harmadik országba történő adattovábbítás, nincs adatfeldolgozói szerződéskényszer, és teljes az audit trail.
„Every AI tool you use — ChatGPT, Copilot, Claude — sends your data to someone else’s server. For most developers, that’s fine. For companies handling customer data under GDPR, it’s a compliance nightmare waiting to happen.” — Jörg Fuchs, ai-engineering.at
A kockázat mérhető. Egy adatvédelmi incidens átlagos költsége az IBM 2023-as adata szerint 4,44 millió dollár, a nem felügyelt, „shadow AI” eszközöket érintő incidenseké az IBM 2025-ös mérésében nagyjából 4,6 millió dollár — összefoglalja a DigitalApplied elemzése. A GDPR-bírság felső határa emellett a globális éves árbevétel 4%-a.
Az öt döntési szempont
- Adatérzékenység. Ha személyes adatot, egészségügyi, jogi vagy pénzügyi dokumentumot, esetleg védett forráskódot dolgoznál fel, a helyi futtatás alapból megszünteti az adattovábbítást — ez a GDPR 25. cikkének „privacy by design” elve a gyakorlatban.
- Havi volumen. A MindStudio ökölszabálya: napi 1 millió token alatt a felhő általában olcsóbb, napi 5 millió token fölött a saját hardver gyakran megtérül.
- Minőségi igény. Sablonos dokumentumból strukturált kinyerés, összefoglaló, rutin kódkiegészítés: egy jól promptolt 7–14B modell elég. Komplex érvelés, árnyalt szövegírás, megbízható ágensviselkedés vagy multimodális elemzés: itt a frontier felhőmodell nagyjából 3–6 hónapos előnnyel jobb.
- Latencia. Háttérben futó, aszinkron feldolgozásnál a hálózati késleltetés nem számít. Valós idejű, felhasználó előtti interakciónál a helyi inferencia stabilabb, mert nincs hálózati kör.
- Üzemeltetési kapacitás. Van-e valaki, aki karbantartja a CUDA-drivereket, a firmware-t, az uptime-ot? A saját GPU-ra nincs SLA: egy hardverhiba azonnal leállítja az inferenciát.
„Cost comparisons are only meaningful at specific volume levels. Under 1M tokens/day, cloud is usually cheaper. Over 5M tokens/day, local hardware often pays off.” — MindStudio
Három szint, nem két opció
A gyakorlatban nem egy kapcsolóról van szó, hanem egy lépcsőről. Érdemes onnan indulni, ahol vagy, és csak akkor lépni tovább, ha a küszöböt átléped.
- 1. szint — menedzselt zárt API (OpenAI, Anthropic, Google): kevés volumen, legmagasabb minőség, nulla mérnökidő. Tipikus továbblépési küszöb: 200 dollár/hó fölött.
- 2. szint — menedzselt open-weight API (Deepinfra, Groq, Together.ai, Fireworks): a frontier minőség 80–95%-a, 10–50-szer olcsóbban. Ez a legtöbb csapatnak a helyes köztes lépcső, mielőtt hardvert vásárolna. Küszöb: 300 dollár/hó fölött.
- 3. szint — teljesen lokális (Ollama, vLLM, llama.cpp saját hardveren): nagy volumenű batch, adatvédelem-kritikus munka vagy meglévő, kihasználatlan GPU esetén.
Sok csapatnál a végállapot hibrid: a rutinmunka 70–80%-a helyben fut, a nehéz maradék a felhőben. A köztes lépcső árazását és a szolgáltatók közti különbségeket korábban részletesen összevetettük.
Kapcsolódó elemzésünk: Legolcsóbb AI 2026: melyikkel lehet tényleg dolgozni?
Mekkora a minőségi rés valójában?
A „lokális modell gyengébb” tétel 2026-ban már feladattípusonként másképp igaz. Általános érvelésben, kódgenerálásban, hosszú dokumentumok feldolgozásában és matematikában a rés kicsi vagy minimális — a Qwen 3 32B, a DeepSeek R1 32B és a Llama 3.3 70B mind ebbe a sávba esik. Képértésben és kreatív írásban viszont mérsékelt, de érzékelhető a különbség. A 24 GB fölötti VRAM-ot igénylő 70B-s modellek az LLM Configurator összevetése szerint a frontier teljesítmény 10–15%-án belül maradnak.
A fordulatot nem egyetlen áttörés hozta, hanem két folyamat egyszerre: a nyílt súlyú modellek felzárkózása, illetve a kvantálás és az inferencia-optimalizáció — paged attention, continuous batching, speculative decoding — együtt írta át a gazdaságosságot. A felhő továbbra is vezet a csúcsképességben és a nulla üzemeltetésben; a különbség az, hogy a „legtöbb hétköznapi feladat” ma már nem igényel csúcsképességet.
A promptok, dokumentumok és kimenetek „never leave your device — no third-party logging, no training on your data, and no exposure surface.” — Iternal.ai
Mennyibe kerül? Konkrét számok
A megtérülés attól függ, mennyit használod. Néhány dokumentált forgatókönyv:
- Kis csapat, napi AI-használat: felhő API 500–2000 dollár/hó, self-hosted (amortizált hardver és áram) körülbelül 50 dollár/hó — a megtakarítás havi 450–1950 dollár. (DEV Community)
- Power user, ~15 millió token/hó: GPT-4o API 187,50 dollár/hó, lokális RTX 4090-es gép 80–95 dollár/hó, Mac Mini M4 Pro 48 GB nagyjából 60 dollár/hó. Megtérülés 3–8 hónap. (LLM Configurator)
- Vállalati, 20 fejlesztő, ~60 millió token/hó: GPT-4o API 750 dollár/hó, egy RTX 4090-es lokális szerver körülbelül 95 dollár/hó.
A belépő hardver olcsóbb, mint sokan gondolják. Egy használt RTX 3090 24 GB workstation nagyjából 800–1200 euró, havi 40 euró áramfogyasztással, és 1–3 hónap alatt megtérülhet. Kis csapatnak a sweet spot egy használt RTX 3060 12 GB, körülbelül 250 euróért. A VRAM-igény nagyjából így alakul: egy 8B-s modell 5–6 GB-ot kér (4 bites kvantálással körülbelül 60%-kal kevesebbet), egy 70B-s modell 40 GB körül jár, ami már két GPU-t jelent. Minimum praktikus rendszermemória: 16 GB.
A sebesség viszont reális elvárást kíván. CPU-n 10–25 token/másodperc a jellemző, a felhő 80–150 között jár; GPU-n, RTX 3090-en egy llama3.1:8b körülbelül 80 token/másodpercet hoz, egy 24B-s modell 35 körül teljesít — foglalja össze a PromptQuorum. A telepítés 20–40 perc, szemben a felhő öt percével.
A rejtett költségek, amiket senki nem számol
A megtérülési számítások általában csak a hardvert és az áramot nézik. A teljes kép ennél összetettebb: 2–5 óra setup és folyamatos karbantartás, havi 2–25 dollár áram, 2–3 éves hardver-elavulás, IT-overhead, hiányzó SLA, és a VRAM alternatívaköltsége — ha a kártya inferenciát futtat, mást nem csinál. Ezek nem érvek a lokális ellen, de a döntést őszintén kell felírni. A token-alapú költségek kordában tartásáról külön is írtunk.
Kapcsolódó elemzésünk: AI kódoló ágensek költsége: 5 lépés a token-számlák ellen
GDPR-checklist a lokális telepítéshez
Ha adatvédelmi okból lépsz helyi futtatásra, ezt a négy pontot kell tudnod dokumentálni:
- 25. cikk (privacy by design): nincs harmadik fél API-ja, tehát alapból nincs adattovábbítás. A felületre viszont kell hozzáférés-kontroll: SSO vagy lokális felhasználók.
- 30. cikk (nyilvántartás): rögzítsd, hogy az AI-inferencia lokális hardveren, belső használatra fut; nincs külső feldolgozói DPA; listázd a használt modelleket és a feldolgozás célját.
- 32. cikk (biztonság): a modellszervert — például az Ollama 11434-es portját — tedd reverse proxy mögé, ne exponiáld a hálózatra. HTTPS belül is, hozzáférés IP- vagy VPN-korlátozással.
- V. fejezet (harmadik országba továbbítás): teljesen lokálisan nulla. Ellenőrizd viszont az integrációk — workflow-motor, monitoring, hibajelentés — felhő-visszahívásait, mert ezek észrevétlenül kiviszik az adatot.
Az érintetti jogok (15–22. cikk) természetesen a helyi rendszerre is érvényesek, és ahol lehet, érdemes anonim vagy szintetikus adaton dolgozni. A felhő oldalán ez ennél lényegesen több papírmunka: a GDPR Local összefoglalója szerint egy USA-beli adatközpont a GDPR V. fejezete szerinti adattovábbítás, kell hozzá 28. cikk szerinti adatfeldolgozói szerződés, dokumentálni kell a 30. cikkes nyilvántartásban, incidens esetén pedig 72 órán belül bejelentési kötelezettség áll fenn. Az EU–US Data Privacy Framework engedi a továbbítást tanúsított amerikai szolgáltatókhoz, de folyamatos jogi támadás alatt áll, ezért nem tekinthető tartós alapnak.
Kapcsolódó elemzésünk: ChatGPT GDPR: 6 lépés a jogszerű céges használathoz
Mikor NE válaszd a lokálist
A helyi futtatás rossz döntés, ha:
- valós idejű chatbotot építesz, ahol 2 másodperc alatti válasz az elvárás, a lokális pedig 5–10 másodpercnél jár;
- napi 1000+ dokumentumos batch fut, ahol a felhő automatikusan skálázódik;
- production kódgenerálást futtatsz a legmagasabb pontosságon — itt a frontier modellek 90% körül, egy lokális 7B-s 45–55% körül teljesít;
- 100 000 tokennél hosszabb kontextusú dokumentumokkal dolgozol;
- nulla karbantartást akarsz, vagy 99,9%-os rendelkezésre állás kell redundancia nélkül;
- kis volumenű, feltáró vagy prototípus-munkáról van szó — itt a felhő kényelme verhetetlen.
Kinek ajánljuk?
Szabályozott iparágnak — egészségügy, jog, pénzügy, közigazgatás — ahol az adat nem hagyhatja el a szervezetet, a lokális vagy air-gapped telepítés gyakran nem opció, hanem követelmény. Kkv-knak és egyéni szakembereknek akkor éri meg, ha napi, adatvédelem-érzékeny használatról van szó: a belépő egy használt középkategóriás GPU vagy egy erős Mac, a megtérülés hónapokban mérhető. Fejlesztőcsapatoknak pedig a hibrid a reális cél: rutinmunka helyben, a nehéz 20–30% felhőben.
„The quality gap that once justified cloud-only strategies has nearly disappeared for the most common workloads.” — Kunal Ganglani, local LLM break-even elemzés
Hol kezdd el?
A legegyszerűbb belépő az Ollama: egy paranccsal letölt és futtat egy nyílt súlyú modellt, GPU nélkül is elindul. Ha grafikus felületet szeretnél, vagy több modellt hasonlítanál össze egymás mellett, a lehetőségeket korábban végigvettük.
Kapcsolódó elemzésünk: Legjobb Ollama alternatíva 2026: 5 eszköz saját gépre
Ha saját hardver nélkül tesztelnéd a 3. szintet, a bérelt GPU jó köztes megoldás — az árakról és a reális havi költségről külön cikkben írtunk. Ha pedig még a felhős előfizetéseknél tartasz, a 100–200 dolláros csomagok megtérülését érdemes megnézni, mielőtt hardvert vennél: ez pontosan az a küszöb, ahol a 2. szintre lépés kérdése felmerül.
Összefoglaló
A helyi AI 2026-ban már nem kompromisszum, hanem opció — de csak akkor a jó opció, ha a saját számaid indokolják. A képlet röviden: érzékeny adat + napi 5 millió token fölötti volumen + van, aki üzemelteti — ekkor megéri. Ha ebből bármelyik hiányzik, a menedzselt open-weight API a racionálisabb lépés. Az adatvédelmi „megtérülés” pedig nem csak a megspórolt API-díj: az elkerült incidens- és bírságkockázat gyakran nagyobb tétel, mint a hardver ára.
Hetente hozzuk a nyílt súlyú modellek és a helyi futtatás friss számait — iratkozz fel az AI Hírek hírlevelére, hogy ne maradj le róla.