Hírek / AI Eszközök / Local AI adatvédelem: mikor éri meg saját gépen futtatni?
local AI adatvédelem

Local AI adatvédelem: mikor éri meg saját gépen futtatni?

A local AI adatvédelem 2026-ra abból a kérdésből, hogy „egyáltalán működik-e”, azzá alakult, hogy „mikor éri meg”. A nyílt súlyú modellek — Llama, Qwen, Gemma, Mistral, DeepSeek — a legtöbb hétköznapi feladatban a frontier felhőmodellek 10–15%-os közelébe kerültek, a futtatókörnyezetek (Ollama, LM Studio, vLLM) telepítése pedig percek kérdése lett. A döntés viszont nem bináris: nem „minden helyben” vagy „minden felhőben”, hanem öt szempont egyúttállása dönti el.

Ez a cikk szándékosan nem telepítési útmutató. Arról szól, hogy mikor indokolt egyáltalán a saját gépen futtatni egy modellt — adatvédelmi, költség- és üzemeltetési oldalról egyaránt.

Local AI adatvédelem: milyen problémát old meg a helyi futtatás?

A felhő-AI legnagyobb rejtett költsége nem a token-számla, hanem a megfelelőségi felület. Minden API-hívás, amely személyes adatot, ügyféldokumentumot vagy védett forráskódot visz ki a szervezetből, új jogi kötelezettséget hoz magával. Helyi futtatásnál a prompt és a dokumentum el sem hagyja a gépet: nincs harmadik országba történő adattovábbítás, nincs adatfeldolgozói szerződéskényszer, és teljes az audit trail.

„Every AI tool you use — ChatGPT, Copilot, Claude — sends your data to someone else’s server. For most developers, that’s fine. For companies handling customer data under GDPR, it’s a compliance nightmare waiting to happen.” — Jörg Fuchs, ai-engineering.at

A kockázat mérhető. Egy adatvédelmi incidens átlagos költsége az IBM 2023-as adata szerint 4,44 millió dollár, a nem felügyelt, „shadow AI” eszközöket érintő incidenseké az IBM 2025-ös mérésében nagyjából 4,6 millió dollár — összefoglalja a DigitalApplied elemzése. A GDPR-bírság felső határa emellett a globális éves árbevétel 4%-a.

Az öt döntési szempont

  1. Adatérzékenység. Ha személyes adatot, egészségügyi, jogi vagy pénzügyi dokumentumot, esetleg védett forráskódot dolgoznál fel, a helyi futtatás alapból megszünteti az adattovábbítást — ez a GDPR 25. cikkének „privacy by design” elve a gyakorlatban.
  2. Havi volumen. A MindStudio ökölszabálya: napi 1 millió token alatt a felhő általában olcsóbb, napi 5 millió token fölött a saját hardver gyakran megtérül.
  3. Minőségi igény. Sablonos dokumentumból strukturált kinyerés, összefoglaló, rutin kódkiegészítés: egy jól promptolt 7–14B modell elég. Komplex érvelés, árnyalt szövegírás, megbízható ágensviselkedés vagy multimodális elemzés: itt a frontier felhőmodell nagyjából 3–6 hónapos előnnyel jobb.
  4. Latencia. Háttérben futó, aszinkron feldolgozásnál a hálózati késleltetés nem számít. Valós idejű, felhasználó előtti interakciónál a helyi inferencia stabilabb, mert nincs hálózati kör.
  5. Üzemeltetési kapacitás. Van-e valaki, aki karbantartja a CUDA-drivereket, a firmware-t, az uptime-ot? A saját GPU-ra nincs SLA: egy hardverhiba azonnal leállítja az inferenciát.

„Cost comparisons are only meaningful at specific volume levels. Under 1M tokens/day, cloud is usually cheaper. Over 5M tokens/day, local hardware often pays off.” — MindStudio

Három szint, nem két opció

A gyakorlatban nem egy kapcsolóról van szó, hanem egy lépcsőről. Érdemes onnan indulni, ahol vagy, és csak akkor lépni tovább, ha a küszöböt átléped.

  • 1. szint — menedzselt zárt API (OpenAI, Anthropic, Google): kevés volumen, legmagasabb minőség, nulla mérnökidő. Tipikus továbblépési küszöb: 200 dollár/hó fölött.
  • 2. szint — menedzselt open-weight API (Deepinfra, Groq, Together.ai, Fireworks): a frontier minőség 80–95%-a, 10–50-szer olcsóbban. Ez a legtöbb csapatnak a helyes köztes lépcső, mielőtt hardvert vásárolna. Küszöb: 300 dollár/hó fölött.
  • 3. szint — teljesen lokális (Ollama, vLLM, llama.cpp saját hardveren): nagy volumenű batch, adatvédelem-kritikus munka vagy meglévő, kihasználatlan GPU esetén.

Sok csapatnál a végállapot hibrid: a rutinmunka 70–80%-a helyben fut, a nehéz maradék a felhőben. A köztes lépcső árazását és a szolgáltatók közti különbségeket korábban részletesen összevetettük.

Kapcsolódó elemzésünk: Legolcsóbb AI 2026: melyikkel lehet tényleg dolgozni?

Mekkora a minőségi rés valójában?

A „lokális modell gyengébb” tétel 2026-ban már feladattípusonként másképp igaz. Általános érvelésben, kódgenerálásban, hosszú dokumentumok feldolgozásában és matematikában a rés kicsi vagy minimális — a Qwen 3 32B, a DeepSeek R1 32B és a Llama 3.3 70B mind ebbe a sávba esik. Képértésben és kreatív írásban viszont mérsékelt, de érzékelhető a különbség. A 24 GB fölötti VRAM-ot igénylő 70B-s modellek az LLM Configurator összevetése szerint a frontier teljesítmény 10–15%-án belül maradnak.

A fordulatot nem egyetlen áttörés hozta, hanem két folyamat egyszerre: a nyílt súlyú modellek felzárkózása, illetve a kvantálás és az inferencia-optimalizáció — paged attention, continuous batching, speculative decoding — együtt írta át a gazdaságosságot. A felhő továbbra is vezet a csúcsképességben és a nulla üzemeltetésben; a különbség az, hogy a „legtöbb hétköznapi feladat” ma már nem igényel csúcsképességet.

A promptok, dokumentumok és kimenetek „never leave your device — no third-party logging, no training on your data, and no exposure surface.” — Iternal.ai

Mennyibe kerül? Konkrét számok

A megtérülés attól függ, mennyit használod. Néhány dokumentált forgatókönyv:

  • Kis csapat, napi AI-használat: felhő API 500–2000 dollár/hó, self-hosted (amortizált hardver és áram) körülbelül 50 dollár/hó — a megtakarítás havi 450–1950 dollár. (DEV Community)
  • Power user, ~15 millió token/hó: GPT-4o API 187,50 dollár/hó, lokális RTX 4090-es gép 80–95 dollár/hó, Mac Mini M4 Pro 48 GB nagyjából 60 dollár/hó. Megtérülés 3–8 hónap. (LLM Configurator)
  • Vállalati, 20 fejlesztő, ~60 millió token/hó: GPT-4o API 750 dollár/hó, egy RTX 4090-es lokális szerver körülbelül 95 dollár/hó.

A belépő hardver olcsóbb, mint sokan gondolják. Egy használt RTX 3090 24 GB workstation nagyjából 800–1200 euró, havi 40 euró áramfogyasztással, és 1–3 hónap alatt megtérülhet. Kis csapatnak a sweet spot egy használt RTX 3060 12 GB, körülbelül 250 euróért. A VRAM-igény nagyjából így alakul: egy 8B-s modell 5–6 GB-ot kér (4 bites kvantálással körülbelül 60%-kal kevesebbet), egy 70B-s modell 40 GB körül jár, ami már két GPU-t jelent. Minimum praktikus rendszermemória: 16 GB.

A sebesség viszont reális elvárást kíván. CPU-n 10–25 token/másodperc a jellemző, a felhő 80–150 között jár; GPU-n, RTX 3090-en egy llama3.1:8b körülbelül 80 token/másodpercet hoz, egy 24B-s modell 35 körül teljesít — foglalja össze a PromptQuorum. A telepítés 20–40 perc, szemben a felhő öt percével.

A rejtett költségek, amiket senki nem számol

A megtérülési számítások általában csak a hardvert és az áramot nézik. A teljes kép ennél összetettebb: 2–5 óra setup és folyamatos karbantartás, havi 2–25 dollár áram, 2–3 éves hardver-elavulás, IT-overhead, hiányzó SLA, és a VRAM alternatívaköltsége — ha a kártya inferenciát futtat, mást nem csinál. Ezek nem érvek a lokális ellen, de a döntést őszintén kell felírni. A token-alapú költségek kordában tartásáról külön is írtunk.

Kapcsolódó elemzésünk: AI kódoló ágensek költsége: 5 lépés a token-számlák ellen

GDPR-checklist a lokális telepítéshez

Ha adatvédelmi okból lépsz helyi futtatásra, ezt a négy pontot kell tudnod dokumentálni:

  1. 25. cikk (privacy by design): nincs harmadik fél API-ja, tehát alapból nincs adattovábbítás. A felületre viszont kell hozzáférés-kontroll: SSO vagy lokális felhasználók.
  2. 30. cikk (nyilvántartás): rögzítsd, hogy az AI-inferencia lokális hardveren, belső használatra fut; nincs külső feldolgozói DPA; listázd a használt modelleket és a feldolgozás célját.
  3. 32. cikk (biztonság): a modellszervert — például az Ollama 11434-es portját — tedd reverse proxy mögé, ne exponiáld a hálózatra. HTTPS belül is, hozzáférés IP- vagy VPN-korlátozással.
  4. V. fejezet (harmadik országba továbbítás): teljesen lokálisan nulla. Ellenőrizd viszont az integrációk — workflow-motor, monitoring, hibajelentés — felhő-visszahívásait, mert ezek észrevétlenül kiviszik az adatot.

Az érintetti jogok (15–22. cikk) természetesen a helyi rendszerre is érvényesek, és ahol lehet, érdemes anonim vagy szintetikus adaton dolgozni. A felhő oldalán ez ennél lényegesen több papírmunka: a GDPR Local összefoglalója szerint egy USA-beli adatközpont a GDPR V. fejezete szerinti adattovábbítás, kell hozzá 28. cikk szerinti adatfeldolgozói szerződés, dokumentálni kell a 30. cikkes nyilvántartásban, incidens esetén pedig 72 órán belül bejelentési kötelezettség áll fenn. Az EU–US Data Privacy Framework engedi a továbbítást tanúsított amerikai szolgáltatókhoz, de folyamatos jogi támadás alatt áll, ezért nem tekinthető tartós alapnak.

Kapcsolódó elemzésünk: ChatGPT GDPR: 6 lépés a jogszerű céges használathoz

Mikor NE válaszd a lokálist

A helyi futtatás rossz döntés, ha:

  • valós idejű chatbotot építesz, ahol 2 másodperc alatti válasz az elvárás, a lokális pedig 5–10 másodpercnél jár;
  • napi 1000+ dokumentumos batch fut, ahol a felhő automatikusan skálázódik;
  • production kódgenerálást futtatsz a legmagasabb pontosságon — itt a frontier modellek 90% körül, egy lokális 7B-s 45–55% körül teljesít;
  • 100 000 tokennél hosszabb kontextusú dokumentumokkal dolgozol;
  • nulla karbantartást akarsz, vagy 99,9%-os rendelkezésre állás kell redundancia nélkül;
  • kis volumenű, feltáró vagy prototípus-munkáról van szó — itt a felhő kényelme verhetetlen.

Kinek ajánljuk?

Szabályozott iparágnak — egészségügy, jog, pénzügy, közigazgatás — ahol az adat nem hagyhatja el a szervezetet, a lokális vagy air-gapped telepítés gyakran nem opció, hanem követelmény. Kkv-knak és egyéni szakembereknek akkor éri meg, ha napi, adatvédelem-érzékeny használatról van szó: a belépő egy használt középkategóriás GPU vagy egy erős Mac, a megtérülés hónapokban mérhető. Fejlesztőcsapatoknak pedig a hibrid a reális cél: rutinmunka helyben, a nehéz 20–30% felhőben.

„The quality gap that once justified cloud-only strategies has nearly disappeared for the most common workloads.” — Kunal Ganglani, local LLM break-even elemzés

Hol kezdd el?

A legegyszerűbb belépő az Ollama: egy paranccsal letölt és futtat egy nyílt súlyú modellt, GPU nélkül is elindul. Ha grafikus felületet szeretnél, vagy több modellt hasonlítanál össze egymás mellett, a lehetőségeket korábban végigvettük.

Kapcsolódó elemzésünk: Legjobb Ollama alternatíva 2026: 5 eszköz saját gépre

Ha saját hardver nélkül tesztelnéd a 3. szintet, a bérelt GPU jó köztes megoldás — az árakról és a reális havi költségről külön cikkben írtunk. Ha pedig még a felhős előfizetéseknél tartasz, a 100–200 dolláros csomagok megtérülését érdemes megnézni, mielőtt hardvert vennél: ez pontosan az a küszöb, ahol a 2. szintre lépés kérdése felmerül.

Összefoglaló

A helyi AI 2026-ban már nem kompromisszum, hanem opció — de csak akkor a jó opció, ha a saját számaid indokolják. A képlet röviden: érzékeny adat + napi 5 millió token fölötti volumen + van, aki üzemelteti — ekkor megéri. Ha ebből bármelyik hiányzik, a menedzselt open-weight API a racionálisabb lépés. Az adatvédelmi „megtérülés” pedig nem csak a megspórolt API-díj: az elkerült incidens- és bírságkockázat gyakran nagyobb tétel, mint a hardver ára.

Hetente hozzuk a nyílt súlyú modellek és a helyi futtatás friss számait — iratkozz fel az AI Hírek hírlevelére, hogy ne maradj le róla.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük