
Az adatminőség, mint az AI legnagyobb szűk keresztmetszete
A mesterséges intelligencia projektek sikertelenségének legfőbb oka nem a technológia hiánya, hanem a vállalati adatok silány minősége. A torz, zajos vagy hiányos bemeneti adatok közvetlen pénzügyi veszteséget, működési kiesést és reputációs kockázatot okoznak a szervezeteknek. A sikeres AI-bevezetés előfeltétele a stratégiai szintű adatgazdálkodás (Data Governance), amely a döntéshozói szemléletváltáson és az adatfolyamatok proaktív kezelésén alapul. A Rendszerinformatika tapasztalatai és a nemzetközi kutatások szerint a jó minőségű, valós idejű adatalapok mérhetően növelik a vállalatok profitmarzsát és versenyelőnyét.
Miért az adatminőség az AI legnagyobb szűk keresztmetszete?
Az AI-modellek matematikai és statisztikai alapokon működnek, így ha a bemeneti adatminőség rossz, a modell által adott végeredmény és az abból származó döntés is hibás lesz-
AI-ready adat: Olyan strukturált, tiszta, konzisztens és reprezentatív adathalmaz, amely közvetlenül alkalmas gépi tanulási modellek tanítására és éles környezetben történő valós idejű futtatására kézi utómunkálatok nélkül.
A mesterséges intelligencia rendszerek adatigénye óriási, azonban a kockázat is nagy. Egy sikeres projekt korlátja már nem a technológia, hanem a megfelelő adat. Az olajhoz hasonlóan természetesen ezt is finomítani kell, nem lehet közvetlenül a tankba tölteni. Az IBM szerint az elakadt AI projektek esetében a leggyakrabban megnevezett ok az adatminőség.
Aki már ült olyan projektbemutatón, ahol a fejlesztő csillogó szemmel mutatta be a 95%-os pontosságú modellt, az tudja, mi jön ezután. Valaki megkérdezi, hogy ez éles környezetben is működik-e majd. Ilyenkor pedig hirtelen csend lesz a teremben.
Miért alakul ki a skálázási hiba a pilot fázis után?
Tesztelési fázisban általában egy kicsi, jól összeállított adathalmazon dolgoznak a fejlesztők. Ezt azonban valós környezetben és valós időben sokszor nagyon nehéz előállítani. A hiba lehet csupán az adat zajossága, amit kézzel egy kis halmazon könnyű megszünteni. Ha azonban nincs a folyamatba építve, akkor lehetetlenné is válhat a valós idejű adattisztítás. Ahhoz, hogy ezt a problémát megoldjuk, vezetői szemléletváltás szükséges. Az adatminőség nem „IT-probléma”, hanem stratégiai kockázatkezelési kérdés. Ugyanúgy, mint a kiberbiztonság.
Mennyibe kerül valójában a rossz adatminőség?
A rossz adatminőség szervezetenként átlagosan 12,9 millió dollár éves kiesést okoz.
Adatminőségi mutatók és kutatási eredmények
| Forrás / Kutatás | Megállapítás | Hatás |
| Gartner | Átlagosan 12,9 millió USD éves veszteség | Cégenkénti közvetlen pénzügyi kár |
| IBM | A cégek 25%-a >5M USD, 7%-a >25M USD veszteséget becsül | Skálázott vállalati kockázat |
| Forbes | Az adattudósok idejük 60%-át adattisztításra fordítják | Erőforrás-pazarlás, kieső produktivitás |
| MIT Sloan | Megbízható adatvezéreltség: +62% bevételnövekedés, +97% profitmarzs | Kimagasló piaci versenyelőny |
Természetesen egy hazai vállalat könnyen mondhatja, hogy ezek a számok itthon irreálisak. Lehet, hogy nálunk sokkal kisebb a fejlesztések volumene, de pont ugyanazokat a hibákat követjük el mi is. A Forbes cikke szerint az adattudósok a munkaidejük 60%-át töltik adattisztítással és az adatok strukturálásával. Ez óriási mennyiségű munkát jelent, amelyet nagyon nehéz kiadni más területen dolgozó kollégának.
Saját tapasztalataim alapján hiába lelkesek a különböző osztályokon dolgozók, amikor az adat összeállítása szóba kerül, nagyon sok hibát vétenek. Ők ugyanis nem rendelkeznek a szükséges tudással és szemlélettel ahhoz, hogy AI-ready módon állítsák össze azokat az adatokat, amikkel napi szinten dolgoznak. Egy ilyen belsős projekt esetén jobb esetben csak a munkaidejük egy része vész kárba, rosszabb esetben az egész projekt sikertelen lesz.
Milyen AI-kudarcokat okozott már a rossz adatminőség?
A rossz adatminőség nem technológiai hibát, hanem téves egészségügyi diagnózisokat, emberi életet veszélyeztető javaslatokat vagy szisztémás diszkriminációt okozhat az algoritmusokban.
A rémtörténeteket szeretjük távolinak érezni, mert megnyugtató azt gondolni, hogy ilyen csak a Szilícium-völgyben vagy a Fortune 500-as cégeknél történik. A valóság az, hogy ugyanezek a hibák bármelyik szervezetben megismétlődhetnek, csak éppen kisebb léptékben és kevesebb sajtóvisszhanggal.
Strukturált Esettanulmányok
IBM Watson for Oncology
- Probléma: A rendszer éles alkalmazás során helytelen és nem biztonságos kezelési javaslatokat adott.
- Kiváltó ok: Az Association of Health Care Journalists cikke szerint a modellt nem valós klinikai adatokon, hanem szintetikus és hipotetikus eseteken tanították.
- Tanulság: Ha az alapadat nem reprezentálja a valóságot, a tét nem egy hibás riport, hanem emberi élet.
Amazon AI Toborzórendszer
- Probléma: Az automatizált toborzó AI szisztematikusan hátrébb sorolta a női jelentkezőket, emiatt le kellett állítani.
- Kiváltó ok: A Reuters vizsgálata alapján a rendszer a vállalat korábbi, torz felvételi adatain tanult.
- Tanulság: A rossz adat bebetonozza és felnagyítja a szervezet meglévő, tudattalan torzításait.
A statisztikák mögött konkrét, névvel is azonosítható vállalati történetek állnak. Ezek talán pont attól ijesztőek, hogy nem kis, ismeretlen cégekről van szó, hanem olyanokról, amelyek a technológiai élvonalba tartoznak. Egy közös pont pedig biztosan van mindkét esetben. Egyiknél sem az algoritmus architektúrája volt hibás.
A bukás oka, hogy a bemeneti adat torz, elavult vagy nem reprezentatív volt. Ez pontosan azt üzeni a vezetőknek, hogy nagyobb büdzséből vagy jobb csapatból sem lehet kiváltani a megfelelő adatalapokat.
Miért versenyelőny az adatgazdálkodás, és miért nem csak teher?
A jól strukturált adatgazdálkodás megszünteti a működési szűk keresztmetszeteket, gyorsítja a döntéshozatalt, és a MIT kutatása szerint 97%-kal magasabb profitmarzsot eredményez.
Adatgazdálkodás (Data Governance): Olyan vállalati keretrendszer, szabályrendszer és felelősségi körök sora, amely biztosítja az adatok minőségét, megbízhatóságát, biztonságát és stratégiai felhasználhatóságát a teljes szervezetben.
A saját tapasztalataim szerint az adatgazdálkodást (data governance) sok vezető máig elsősorban megfelelőségi kényszerként éli meg. Ez számukra valami olyasmi, amit egy GDPR-audit vagy az AI Act megfelelőség miatt kell „letudni”. A kutatások viszont egészen más képet mutatnak. Azok a vállalatok, amelyek komolyan veszik az adatgazdálkodást, mérhetően jobban teljesítenek, mint versenytársaik.
A MIT Sloan és a MIT CISR kutatása szerint azok a vállalatok, amelyek megbízható, valós idejű adatra és egyszerűsített adatgazdálkodásra építik működésüket, 62%-kal magasabb bevételnövekedést és 97%-kal magasabb profitmarzsot érnek el, mint az alsó negyedbe tartozó cégek. Ez pedig nem elhanyagolható különbség.
Fontos tudatosítani, hogy a jó adatgazdálkodás nem lassítja, hanem gyorsítja a szervezetet. A jó governance pedig nem azt jelenti, hogy mindenre rátesszük a kezünket és megakadályozzuk a csapatokat a munkájukban. Sokkal inkább arról van szó, hogy egyértelmű szabályok és felelősségek mentén a csapatok gyorsabban, magabiztosabban tudnak dolgozni az adattal.
A Schneider Electric tökéletesen összefoglalja egy mondatban az adatgazdálkodás lényegét. Szerintük az AI skálázásának előfeltétele az adat skálázása. Vagyis az adatgazdálkodás ma már nem az IT osztály belső folyamata, amelyről jókat lehet vitatkozni a negyedéves értekezleteken, hanem stratégiai versenyelőny forrása, amely a szervezet egészét érinti.
Hogyan térül meg az adatminőségbe fektetett befektetés?
Az adatminőségbe fektetett források a hibás elemzések megelőzésével, az adattisztítási munkaórák csökkentésével és a valós idejű üzleti döntések közvetlen profitnövelő hatásával térülnek meg.
Mivel a jó adat mindennek az alapja, minden egyes forint, amelyet erre költünk, sokszorosan térül meg a későbbiekben.
A minőségi adat-előállítás 4 alappillére:

Ezek elsőre nagyon általánosnak tűnnek, de minden cégnek a saját igényei alapján kell kialakítania a folyamatokat. Amennyiben nem tűzi ki a menedzsment egy elérendő célként az adatgazdálkodás kialakítását, sosem valósul meg. Saját belső sztenderdekre van szükség, amely alapján minden adatpontról eldönthető, hogyan és mikor érdemes tárolni, illetve mire és milyen módon akarjuk felhasználni.
A United Airlines esete a MIT CISR kutatásában jó illusztráció arra, hogyan válik a megbízható adat üzleti eredménnyé. A légitársaság stratégiai prioritásként kezelte, hogy a döntéshozók valós idejű, megbízható adathoz férjenek hozzá, és tudatosan egyszerűsítette az adatgazdálkodási folyamatait. Ez volt az alapja annak, hogy valós idejű, adatvezérelt működésre tudjon váltani.
Mit tehet a CEO az adatminőségért?
A vezérigazgatónak az adatot nem IT-témaként, hanem stratégiai üzleti erőforrásként kell kezelnie, kijelölve az adatfelelősöket és biztosítva az elvárható adatminőségi KPI-kat.
A korábbi bekezdésekből már egyértelmű, az adatgazdálkodás kialakítása egy olyan folyamat, amihez a legmagasabb szintű támogatásra van szükség. Ezt nem lehet úgy megvalósítani, hogy odaadjuk valakinek a cégnél, mert ez a szervezet egészét érinti.
A CEO hatpontos adatgazdálkodási cselekvési terve:
- Rendeld hozzá az adatstratégiát az üzleti stratégiához, ne külön „IT-témaként” kezeld!
- Nevezz ki egyértelmű adatfelelősöket minden kritikus adatterületre!
- Vezess be mérhető adatminőségi KPI-kat és auditálható adatkövetést!
- A data governance legyen megengedő és proaktív, nem pedig korlátozó.
- Fektess be a forrásnál! Egy alapoktól kiinduló javítás mindig olcsóbb, mint az utólagos tisztítás.
- Építs közös, újrahasznosítható adatplatformot! Sokkal hatékonyabb minden adatpontot együtt kezelni, mintha minden AI projekt saját adatfolyamot építene

Rendszeres vezetői kérdés: „Mennyire bízunk abban az adatban, amire ez a döntés épül?”
Ez a kérdés nyugodtan elhangozhat minden egyes megbeszélésen, ahol AI-ról vagy adatalapú döntésekről van szó.
Összegzés
A vállalati adatvagyon a szervezet legértékesebb erőforrása, ám a nyers adat önmagában még nem használható fel közvetlenül. Nem ez lesz az a projekt, amelyért az értekezleteken az emberek egymást túllicitálva versenyeznek, viszont ez lesz az a háttérmunka, amely a céget versenyképessé teszi hosszú távon úgy, hogy biztosítja az AI-alapú projektek sikerét. Ha az adat pontos, friss és jól feldolgozott, az AI valódi versenyelőnyt hoz. Ha viszont az adat torz, hiányos vagy megbízhatatlan, az AI ezeket a hibákat is felnagyítja.
A valódi kérdés az, hogy ki és hogyan finomítja az adatot, mielőtt az AI-hoz kerül. A cikkben bemutatott kutatások is igazolják, ez végső soron nem technológiai kérdés, hanem vezetői döntés. A jó hír, hogy ehhez nem kell azonnal mindent újraépíteni. Elég a következő vezetői értekezleten feltenni a kérdést: tudjuk-e pontosan, honnan származik és mennyire megbízható az az adat, amire a legfontosabb döntéseinket építjük? Ha erre nincs egyértelmű válasz a szervezetben, az egy jel arra, hogy itt az idő elkezdeni a finomítást. Ha ehhez külső szempontra vagy szakértői támogatásra van szükség, a Rendszerinformatika csapata szívesen segít ebben.
Gyakran Ismételt Kérdések (FAQ)
Az adat az új olaj_Gyakran Ismételt Kérdések (FAQ)
Miért az adatminőség a mesterséges intelligencia projektek elakadásának legfőbb oka?
Az AI-modell teljesítménye a tanításra és használatra átadott adatok minőségétől függ. Ha az adat zajos, pontatlan vagy hiányos, a modell téves eredményeket ad, a pilot fázis után pedig nem skálázható éles környezetben.
Mennyi kárt okozhat egy vállalatnak a nem megfelelő adatminőség?
A Gartner kutatása szerint a rossz adatminőség átlagosan 12,9 millió dollár veszteséget okoz évente szervezetenként. Ezen kívül az adattudósok munkaidejének mintegy 60%-a megy kárba az adatok kézi tisztítása miatt.
Mi a különbség a nyers adat és az AI-ready adat között?
A nyers adat gyakran hiányos, nem strukturált, zajos és korábbi torzításokat tartalmaz. Az AI-ready adat tisztított, konzisztens, reprezentatív és olyan formátumban áll rendelkezésre, amelyet a gépi tanulási algoritmusok azonnal fel tudnak dolgozni.
Hogyan érhet el a vezetés mérhető megtérülést a data governance bevezetésével?
A MIT Sloan kutatása kimutatta, hogy a megbízható adatalapokra építkező vállalatok 62%-kal magasabb bevételnövekedést és 97%-kal magasabb profitmarzsot érnek el, mivel a határozott adatgazdálkodás gyorsítja az üzleti döntéshozatalt.

Dr. Vécsey Richárd Ádám
jogász, AI fejlesztő
– Szolgáltatásaink csak cégek és gazdasági társaságok számára elérhetőek –












