Az infini-gram megmutatja, honnan származhatnak az AI szövegei

Az Ai2 infini-gram nevű keresőeszköze azt vizsgálja, hogy az AI által írt szövegek ritka kifejezései felbukkannak-e korábban megjelent művekben. Egy új kutatás szerint az Amazon legnagyobb bevételű, önállóan kiadott könyvei között az AI-szöveget nagy arányban tartalmazó művekben gyakrabban találhatók ilyen fordulatok.
- Az infini-gram nagy nyilvános szövegkorpuszokban keresi a kifejezéseket.
- Az AI-szöveget nagy arányban tartalmazó Amazon-könyvekben több ritka fordulatot találtak.
- A 100 legnagyobb bevételű könyvnél az arány 43,2, illetve 37,6 százalék volt.
- A módszer önmagában nem bizonyítja egy kifejezés pontos eredetét.
- Az Ai2 szerzői jogi vizsgálatokhoz is teszteli az eszközt.
A detektor önmagában kevés
Az AI-szövegdetektorok megbecsülhetik, hogy egy részletet valószínűleg gép generált-e, de nem mutatják meg, mely kifejezések szerepelnek korábbi forrásokban, és azt sem, hogy ezek a források hol találhatók. Az Ai2 infini-gram motorja ezt a hiányt próbálja kezelni: nagy szöveges adathalmazokat indexel, majd megszámolja, hogy egy tetszőleges hosszúságú kifejezés hányszor jelenik meg bennük.
Az eszközt Tuhin Chakrabarty, a Stony Brook University számítástechnikai tanszékének adjunktusa és szerzőtársai használták egy, az arXivon közzétett tanulmányban. A kutatás az Amazonon értékesített, önállóan kiadott könyvek között vizsgálta az AI által generált szöveg elterjedtségét és kereskedelmi jelenlétét, valamint a korábban megjelent művekkel való nyelvi átfedést.
Chakrabarty szerint a detektor eredménye csak becslés. „Nem mutat semmi ezen túl” - mondta az Ai2 által közölt beszámolóban. A kutató úgy látja, hogy miután megállapították, egy szöveg AI által készülhetett, az infini-gramhoz hasonló eszközökkel lehet részletesebben megvizsgálni a szöveg és a forráskorpuszok átfedését.
Ritka kifejezések az Amazon könyveiben
A kutatócsoport a Google Books és az infini-gram segítségével hasonlította össze az Amazon legnagyobb bevételű, önállóan kiadott könyveit. A 200 legnagyobb bevételű könyv mindkét vizsgált csoportjában az AI által nagy arányban írt szöveget tartalmazó művekben 4,4 százalékponttal több, korábbi könyvekből származó ritka kifejezést találtak. Amikor a viszonyítás alapját díjazott vagy jelölt irodalmi művek adták, a különbség 22,5 százalékpontra nőtt.
A csoportok 100 legnagyobb bevételű könyvét külön vizsgálva a korábbi művekből származó ritka kifejezések az AI-szöveget nagy arányban tartalmazó könyvek szövegének 43,2 százalékát fedték le. Az ilyen szöveget nem tartalmazó könyveknél ez az arány 37,6 százalék volt. A 200 könyves összehasonlításban a különbség szűkült, de statisztikailag továbbra is jelentős maradt.
A díjazott vagy jelölt irodalmi művekből álló külön referenciahalmazban a ritka kifejezések átlagosan a szöveg 19,1 százalékát fedték le. Ez az arány 37,2 százalék volt az AI-szöveget nem tartalmazó, legnagyobb bevételű könyveknél, és 41,6 százalék az AI-szöveget nagy arányban tartalmazó műveknél. Az Ai2 hangsúlyozza, hogy az irodalmi halmaz referenciaérték volt, nem pedig a piaccal azonos módon összeállított kontrollcsoport.
Mit keres az infini-gram?
A kutatók olyan több szóból álló kifejezésekre összpontosítottak, amelyek legfeljebb öt Google Books-kötetben szerepeltek, és az infini-gram webes pillanatképében egyáltalán nem fordultak elő. Ezzel igyekeztek elkülöníteni a néhány könyvre jellemző fordulatokat a köznyelvi vagy műfaji sablonoktól, például a „her heart skipped a beat” típusú, gyakori mondatoktól.
Egy ilyen találat önmagában nem bizonyítja, hogy egy kifejezés pontosan honnan származik, vagy ki írta le először. Ha azonban egy detektor által AI-szövegként azonosított részletben sok hasonló fordulat jelenik meg, ezek együtt további bizonyítékot adhatnak arra, hogy a szöveg könyvekből származó nyelvi anyagra támaszkodik.
Az Ai2 szerint a GrantaGate néven emlegetett ügyben, amely egy Commonwealth Foundation-díjat nyert novella gépi eredetének gyanújához kapcsolódott, az infini-gram használata több jellegzetes töredéket is felszínre hozott. A „sour tang of fermenting” kifejezés például egy rajongói fikciós oldalon megjelent sor megfogalmazására emlékeztetett. Ez az Ai2 szerint azt mutatja, hogy a fordulat a nyilvános korpuszban máshol is szerepelt.
Nyílt eszköz a szövegek eredetének vizsgálatához
Chakrabarty az infini-gramhoz két Ai2-projekten keresztül jutott el. Az OlmoTrace az infini-gramra támaszkodva kapcsolja össze az Ai2 teljesen nyílt Olmo modelljeinek kimenetét a tanítási adatokban található egyező szövegekkel. A Creativity Index egy referencia-korpuszhoz viszonyítva méri a szöveg eredetiségét.
Az Ai2 szerint az ilyen elemzésekhez szükség van egy olyan eszközre, amely nagy mennyiségű emberi szöveget képes kereshetővé tenni. Az infini-gram és az Olmo nyílt tanítási adatkészletei, köztük a Dolma, lehetővé teszik, hogy a kutatók megvizsgálják egy kifejezés gyakoriságát azokban a nyilvános korpuszokban, amelyek egy modell tanításában is szerepelhettek.
A kutatócsoport a módszert szerzői jogi vizsgálatokban is teszteli. A cél annak feltárása, hogy egy szerzői jog által védett könyv részletei hol jelentek meg az interneten, és egy modell esetleg kalózmásolatból vagy online kiszivárgott kéziratból tanulhatta-e meg őket.


