A mesterséges intelligencia megtanulja az előítéleteinket is

A nagy nyelvi modellek az emberi szövegekből a társadalmi előítéleteket is megtanulhatják, és ez a válaszaikban akkor is megjelenhet, ha a modell közvetlenül nem kapja meg a felhasználó nemét. A CIFAR kutatói az okok feltárásán és a torzítások csökkentésén dolgoznak.
- A nagy nyelvi modellek az emberi szövegekből társadalmi előítéleteket is megtanulhatnak.
- A nem elrejtése nem akadályozza meg, hogy a modell közvetett jelekből következtessen rá.
- A szemantikai szivárgás látszólag jelentéktelen fogalmakat is bevonhat a válaszadásba.
- Az utólagos finomhangolás csökkentheti a nyilvánvaló torzításokat, de nem feltétlenül változtatja meg az alapjukat.
- A kutatók szerint az AI használatához kritikus gondolkodásra és emberi felügyeletre van szükség.
Az adatokból a történelmi előítéletek is bekerülnek
A nagy nyelvi modellek hatalmas mennyiségű, emberek által létrehozott szöveget dolgoznak fel. A tanítás során statisztikai kapcsolatokat tanulnak meg a szavak és a fogalmak között. Ha a tanítóanyagok például erős kapcsolatot mutatnak a nők és bizonyos foglalkozások között, a modell ezeket a mintázatokat is elsajátíthatja.
Zhijing Jin, a Vector Institute Canada CIFAR AI Chair kutatója, a Torontói Egyetem informatikai tanszékének adjunktusa és az EuroSafeAI társalapítója szerint a modellek a múltbeli és jelenlegi adatokra támaszkodnak, ezért történelmi és aktuális előítéleteket is tükrözhetnek. A korai példák között szerepelt, hogy a rendszerek a nőket inkább ápolókkal, a férfiakat pedig orvosokkal társították.
Jin kutatása, amelyet a NAACL 2025 konferencián mutattak be, és amely a NeurIPS 2024 konferencián a legjobb tanulmánynak járó díjat kapta, azt vizsgálja, hogyan hatnak az érzékeny demográfiai adatok a modellek működésére.
A nem elrejtése önmagában nem szünteti meg a torzítást
Jin a korreláció helyett ok-okozati következtetést használ. A korreláció azt mutatja meg, hogy két adatpont együtt jelenik-e meg, a kauzális megközelítés viszont azt próbálja feltérképezni, mi milyen hatást vált ki. Ez azért fontos, mert a modell a nemet közvetett jelekből, például hobbikból is kikövetkeztetheti.
A kutatók ok-okozati gráfokkal azonosíthatják azokat az útvonalakat, amelyeknek nem szabadna befolyásolniuk egy döntést. Így elkülöníthetők a nemhez kapcsolódó, de az adott döntés szempontjából irreleváns jellemzők a munkára való alkalmasság szempontjából indokolt kapcsolatoktól, például a képzettségtől és a tapasztalattól.
Hila Gonen, a Brit Columbiai Egyetem informatikai tanszékének adjunktusa és az Amii Canada CIFAR AI Chair kutatója egy másik jelenséget, az úgynevezett szemantikai szivárgást vizsgálja. Ilyenkor egy felszólításban szereplő fogalom akkor is befolyásolja a választ, ha annak nincs érdemi kapcsolata a kérdéssel. Ha például a szövegben szerepel egy virágüzlet, a modell nagyobb eséllyel feltételezheti, hogy az érintett személy nő, még akkor is, ha az illető nem vásárol virágot és nem lép kapcsolatba az üzlettel.
A felhasználóknak továbbra is szükségük van emberi kontrollra
Az ilyen asszociációk ártalmatlannak tűnhetnek, de nagy tétű döntésekben veszélyessé válhatnak. A CIFAR példája szerint egy klinikai AI-rendszer alábecsülheti egy női páciens tüneteinek súlyosságát a sürgősségi osztályozás során.
Gonen szerint a modellek erősödése és folyékonyabb nyelvhasználata miatt könnyű azt feltételezni, hogy már túl vannak az ilyen torzításokon. „Ezek a modellek egyre erősebbek, nagyon jól teljesítenek és annyira gördülékenyek, hogy hajlamosak vagyunk azt feltételezni, túl vannak az ilyen előítéleteken. De nincsenek túl rajtuk, mert ezek az asszociációk továbbra is jelen vannak” , mondta.
A modell utólagos finomhangolásával megtanítható, hogy bizonyos torz válaszok nem kívánatosak. Ez azonban a kutatók szerint különbözik az alapul szolgáló asszociációk megváltoztatásától, ezért kevésbé nyilvánvaló előítéletek továbbra is megjelenhetnek.
Jin azt tanácsolja, hogy az AI maradjon eszköz, ne váljon döntéshozóvá. „Amikor az AI megszólal, használjuk eszközként, de ne tegyük meg ügynöknek” , fogalmazott. Gonen időnként nem közli a nemét olyan tanácskéréseknél, ahol ez befolyásolhatja a választ, és arra kéri a felhasználókat, figyeljék, eltérően viselkedik-e a modell különböző nemek és felhasználási helyzetek esetén.
CIFAR: How AI learns our biases — and how to fix it


