Vissza blogra

2021. 04. 29. - olvasási idő: 13 perc

Gépi tanulás a korai iskolaelhagyás ellen

Nagy-Rácz István
Nagy-Rácz István

Évente nagyjából 80 ezer fiatal marad középfokú végzettség nélkül. Egy közös projektben a DPMK domain tudásával, a Microsoft technológiájával és a Dmlab adatelemzésével három szinten néztük meg, mit tud hozzátenni az adat: mi történt, miért történt, és mi fog történni.

Section background image

Mit tehet a gépi tanulás az emberi tanulásért? Egy közös projektben a Digitális Pedagógiai Módszertani Központ, a Microsoft és a Dmlab arra kereste a választ, hogyan segítheti az adatelemzés a korai iskolaelhagyás elleni munkát. A válasz három szinten született meg: mi történt, miért történt, és mi fog történni.

A projekt adatai egy helyen

TerületKözoktatás, korai iskolaelhagyás
PartnerekDPMK (domain tudás), Microsoft (technológia), Dmlab (adatelemzés)
AdatforrásokIntézményi és tanári adatok, országos kompetenciamérés, PISA, Kréta rendszer
TechnológiaAzure, Power BI
Megoldási szintekLeíró elemzés és dashboard, összefüggés-feltárás, előrejelzés
Kiemelt eredmény92 százalékos pontosságú előrejelzés a rejtett kockázatú intézményekre

Miért probléma a korai iskolaelhagyás?

Korai iskolaelhagyónak azt a 18 és 24 év közötti fiatalt nevezzük, aki legfeljebb általános iskolai végzettséggel rendelkezik. Magyarországon ez az arány nagyjából 12 százalék, ami évente körülbelül 80 ezer fiatalt jelent.

Érdemes ezt a számot egy másik mellé tenni: évente körülbelül 50 ezer magyar fiatal szerez felsőfokú diplomát, miközben 80 ezren maradnak középfokú végzettség nélkül. Az Európa 2020 stratégia célja 10 százalék, és amíg európai szinten 2002 és 2019 között összességében 7 százalékpontos csökkenés történt, Magyarországon a mutató lényegében stagnál.

A probléma tehát mérhető, nagy volumenű, és több évtizedes hatása van az érintettek életére. Pont az a fajta kérdés, ahol az adat nem önmagáért érdekes, hanem azért, mert a beavatkozás helyét és idejét segít megtalálni.

Lemorzsolódók aránya az EU-ban és Magyarországon
Forrás: Eurostat Education and Training, https://ec.europa.eu/eurostat/web/education-and-training/data/main-tables/

Három szint, három kérdés

A projektben nem egyetlen megoldást építettünk, hanem három, egymásra épülő referenciamegoldást. Ez a felosztás megfelel annak, ahogyan a data science projektek négy típusa épül egymásra: előbb látni kell, mi történik, aztán megérteni, miért, és csak ezután érdemes előrejelezni.

SzintA kérdésA megoldásMire használható
LeíróMi történt?Integrált adatkép és dashboardIntézmények összehasonlítása, kiugró esetek felismerése
DiagnosztikusMiért történt?Automatikus összefüggés-feltárásA kockázatot hordozó intézményi jellemzők azonosítása
PrediktívMi fog történni?Előrejelző modellA rejtett kockázatú intézmények kiszűrése beavatkozás előtt

Mi történt? Egységes adatkép és dashboard

Az első szint önmagában is meglepően sokat ad, pedig technológiailag ez a legegyszerűbb. Az oktatási adatok több helyen, több rendszerben keletkeznek: intézményi, tanári és tanulói szinten egyaránt. Az egységes adatkép és dashboard lényege, hogy ezek egy nézőpontból legyenek vizsgálhatók, vagyis megszülessen az az egyetlen közös igazságforrás, amire a szakmai vita építhet.

A legfontosabb megfigyelés ezen a szinten az volt, hogy egymáshoz hasonló intézmények között jelentős eltérések mutatkoznak a lemorzsolódás arányában, és ezek az eltérések nem magyarázhatók a földrajzi közelséggel. Ez a felismerés önmagában is irányt ad: ha két hasonló iskola eredménye nagyon eltér, akkor van mit tanulni az egyiktől.

Power BI dashboard az intézményi lemorzsolódási adatokról

Miért történt? Rejtett összefüggések feltárása

A második szinten automatikus tulajdonságfelismeréssel kerestük azokat az intézményi részcsoportokat, amelyeken belül más összefüggések érvényesülnek, mint a teljes halmazon. A módszer több mint tízezer lehetséges jellemző közül választja ki azokat, amelyek valóban elkülönítenek egy csoportot, tehát nem előzetes hipotéziseket ellenőriz, hanem maga keresi meg a mintázatot.

Az egyik legbeszédesebb eredmény egy olyan intézménycsoportnál jött ki, ahol vegyes az etnikai összetétel és magas az évfolyamismétlők aránya. Ebben a csoportban azokban az iskolákban, ahol nem volt iskolatitkár, a lemorzsolódási arány 57 százalék volt, ahol pedig volt, 36 százalék.

A különbség nagy, és éppen ezért kell vele óvatosan bánni. Az összefüggés nem jelent ok-okozati kapcsolatot: nem az iskolatitkár alkalmazása csökkenti a lemorzsolódást, sokkal inkább arról lehet szó, hogy az iskolatitkár megléte olyan szervezeti és adminisztratív kapacitás jele, amely más módon hat. Az ilyen eredmény nem intézkedés, hanem nyom: megmutatja, hol érdemes a szakértőnek tovább vizsgálódnia. Ez a szakasz az, ahol az adatelemzés és a domain szakértő munkája elválaszthatatlan.

Mi fog történni? Előrejelzés

A harmadik szinten azt vizsgáltuk, mennyire jelezhető előre a lemorzsolódás. Két eredmény született.

Az egyik, hogy az országos kompetenciamérés intézményi átlagai és szórásai előrejelezhetők a korábbi kompetenciamérési és iskolai statisztikai adatokból.

A másik, és gyakorlati szempontból ez az érdekesebb, azokra az intézményekre vonatkozik, ahol a kompetenciamérés alapján nem várható magas lemorzsolódás, mégis bekövetkezik. Ezek a rejtett kockázatú iskolák, amelyek egy hagyományos szűrésen átcsúsznak. További intézményi jellemzők bevonásával ezek az esetek 92 százalékos pontossággal előrejelezhetők.

Ez az a pont, ahol az elemzésből döntéstámogatás lesz: nem egy általános kockázati rangsor készül, hanem azoknak az intézményeknek a listája, amelyekre senki nem figyelne oda magától.

Mire képes ez nagyban? Egy nemzetközi példa

Hogy a hasonló megközelítés milyen léptékű hatást tud elérni, arra jó példa a Microsoft Tacoma körzetben megvalósult prediktív megoldása. Ott a program bevezetése előtt a diákok 55 százaléka fejezte be sikeresen a középiskolát, utána 83 százaléka.

Ez nem egy modell érdeme önmagában. A szám azt mutatja meg, mi történik akkor, ha az előrejelzés beépül a mindennapi működésbe, tehát ha van, aki a jelzés alapján cselekszik is.

Milyen adatokra lehet ezt Magyarországon építeni?

A projekt egyik mellékeredménye a magyar adatvagyon feltérképezése volt. Négy forráscsoport bizonyult használhatónak:

  • Intézményi adatok: épületek, infrastruktúra, működési jellemzők.
  • Tanári adatok: végzettségek, elvégzett képzések, munkaterhelés.
  • Tanulói kompetenciák: az országos kompetenciamérés és a PISA teszt eredményei.
  • Kréta rendszer: a diákok mindennapi iskolai viselkedéséről szóló adatok.

A legnagyobb érték abban van, hogy ezek együtt nézhetők. Külön-külön mindegyik ismert, a kérdésre viszont csak összekapcsolva adnak választ.

Kinek mi volt a szerepe?

A projekt három szereplő együttműködésére épült, és mindegyik mást hozott. A DPMK a domain tudást, a Microsoft a technológiát, az Azure és a Power BI képességeit, a Dmlab pedig az adatelemzési szakértelmet.

Horváth Ádám, a DPMK divízióvezetője így foglalta össze: "olyan szakmai megállapítások születtek a közös projekt során, melyekre hagyományos adatelemzési eszközökkel esély sem lett volna."

Ez a felosztás nem véletlen. Egy közszférás adatprojekt akkor hoz eredményt, ha a szakmai kérdést az érti, aki a területen dolgozik, az adatot pedig az, aki elemzi, és a kettő nem egymás után, hanem egyszerre van jelen.

Mit jelent ez egy másik szervezetnek?

Három tanulság vihető át bármilyen területre.

  1. Több szinten érdemes keresni a hasznosítást. Még egy jól körülhatárolt problémánál is igaz, hogy a leíró elemzés, az összefüggés-feltárás és az előrejelzés mást ad. Aki rögtön a predikcióval kezd, gyakran kihagyja azt a felismerést, ami a legolcsóbban a legtöbbet hozta volna.
  2. Az eredmény a szakértővel együtt értelmezhető. Az adatelemző megtalálja a mintázatot, de azt, hogy az mit jelent, és mi kezdhető vele, csak a terület ismerőjével közösen lehet eldönteni.
  3. Az összefüggés nem ok-okozat. Ez nem elméleti figyelmeztetés. Egy közszférás döntésnél a rosszul értelmezett korreláció valódi intézkedéssé válhat, ezért a modellnek nemcsak pontosnak, hanem értelmezhetőnek is kell lennie.

Ugyanez a logika működik más iparágakban is, ahogy az esettanulmányaink mutatják. Minél nagyobb folyamat lesz adatvezéreltté, annál nagyobb az üzleti és társadalmi hatás.

Gyakori kérdések

Kit nevezünk korai iskolaelhagyónak? Azt a 18 és 24 év közötti fiatalt, aki legfeljebb általános iskolai végzettséggel rendelkezik. Magyarországon ez az arány nagyjából 12 százalék, ami évente körülbelül 80 ezer fiatalt jelent.

Mennyire pontosan jelezhető előre a lemorzsolódás? A projektben azoknál az intézményeknél, ahol a kompetenciamérés alapján nem várható magas lemorzsolódás, mégis bekövetkezik, 92 százalékos pontosságú előrejelzést sikerült elérni további intézményi jellemzők bevonásával.

Az előrejelzés diákokat vagy intézményeket rangsorol? Ebben a projektben intézményi szinten dolgoztunk. Ennek adatvédelmi és szakmai oka is van: intézményi szinten a beavatkozás is szervezeti, és nem keletkezik egyéni szintű kockázati bélyeg.

Kell hozzá új adatgyűjtés? Nem feltétlenül. A projekt a meglévő forrásokra épült: intézményi és tanári adatokra, a kompetenciamérésre, a PISA eredményekre és a Kréta rendszerre. A munka nagy része nem az adat beszerzése, hanem az összekapcsolása és értelmezése volt.

Átvihető ez más közszférás területre? A szerkezet igen. A leíró, diagnosztikus és prediktív szintek egymásra építése, a domain szakértővel való közös értelmezés és a kauzalitás óvatos kezelése ugyanúgy érvényes az egészségügyben, a szociális ellátásban vagy a foglalkoztatáspolitikában.

Hasonló kihívásod van?

Ha van egy társadalmi vagy üzleti probléma, amiről érzitek, hogy több van az adataitokban, mint amit ma kiolvastok belőlük, érdemes ezzel a három szinttel elindulni. Az első kérdés mindig az, hogy mi történt valójában.

Beszéljünk róla

További cikkek

Magyarázható mesterséges intelligencia: a modell döntése mögötti tényezők

XAI, avagy a magyarázható mesterséges intelligencia

A magyarázható MI nem egy modelltípus, hanem eszközkészlet arra, hogy megtudjuk, mire alapoz a modell. Áttekintés az ante-hoc és post-hoc módszerekről, a LIME-ról és a SHAP-ról, valamint arról, mit vár a magyarázattól a szabályozás.

Összes cikk

Kapcsolódó esettanulmányok

Továbbiak