Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az infini-gram megmutatja, honnan származhatnak az AI szövegei

2026. július 31. 10:00Forrás: Ai2
Az infini-gram megmutatja, honnan származhatnak az AI szövegei
Kép: Ai2

Az Ai2 infini-gram nevű keresőeszköze azt vizsgálja, hogy az AI által írt szövegek ritka kifejezései felbukkannak-e korábban megjelent művekben. Egy új kutatás szerint az Amazon legnagyobb bevételű, önállóan kiadott könyvei között az AI-szöveget nagy arányban tartalmazó művekben gyakrabban találhatók ilyen fordulatok.

A lényeg röviden
  • Az infini-gram nagy nyilvános szövegkorpuszokban keresi a kifejezéseket.
  • Az AI-szöveget nagy arányban tartalmazó Amazon-könyvekben több ritka fordulatot találtak.
  • A 100 legnagyobb bevételű könyvnél az arány 43,2, illetve 37,6 százalék volt.
  • A módszer önmagában nem bizonyítja egy kifejezés pontos eredetét.
  • Az Ai2 szerzői jogi vizsgálatokhoz is teszteli az eszközt.

A detektor önmagában kevés

Az AI-szövegdetektorok megbecsülhetik, hogy egy részletet valószínűleg gép generált-e, de nem mutatják meg, mely kifejezések szerepelnek korábbi forrásokban, és azt sem, hogy ezek a források hol találhatók. Az Ai2 infini-gram motorja ezt a hiányt próbálja kezelni: nagy szöveges adathalmazokat indexel, majd megszámolja, hogy egy tetszőleges hosszúságú kifejezés hányszor jelenik meg bennük.

Az eszközt Tuhin Chakrabarty, a Stony Brook University számítástechnikai tanszékének adjunktusa és szerzőtársai használták egy, az arXivon közzétett tanulmányban. A kutatás az Amazonon értékesített, önállóan kiadott könyvek között vizsgálta az AI által generált szöveg elterjedtségét és kereskedelmi jelenlétét, valamint a korábban megjelent művekkel való nyelvi átfedést.

Chakrabarty szerint a detektor eredménye csak becslés. „Nem mutat semmi ezen túl” - mondta az Ai2 által közölt beszámolóban. A kutató úgy látja, hogy miután megállapították, egy szöveg AI által készülhetett, az infini-gramhoz hasonló eszközökkel lehet részletesebben megvizsgálni a szöveg és a forráskorpuszok átfedését.

Ritka kifejezések az Amazon könyveiben

A kutatócsoport a Google Books és az infini-gram segítségével hasonlította össze az Amazon legnagyobb bevételű, önállóan kiadott könyveit. A 200 legnagyobb bevételű könyv mindkét vizsgált csoportjában az AI által nagy arányban írt szöveget tartalmazó művekben 4,4 százalékponttal több, korábbi könyvekből származó ritka kifejezést találtak. Amikor a viszonyítás alapját díjazott vagy jelölt irodalmi művek adták, a különbség 22,5 százalékpontra nőtt.

A csoportok 100 legnagyobb bevételű könyvét külön vizsgálva a korábbi művekből származó ritka kifejezések az AI-szöveget nagy arányban tartalmazó könyvek szövegének 43,2 százalékát fedték le. Az ilyen szöveget nem tartalmazó könyveknél ez az arány 37,6 százalék volt. A 200 könyves összehasonlításban a különbség szűkült, de statisztikailag továbbra is jelentős maradt.

A díjazott vagy jelölt irodalmi művekből álló külön referenciahalmazban a ritka kifejezések átlagosan a szöveg 19,1 százalékát fedték le. Ez az arány 37,2 százalék volt az AI-szöveget nem tartalmazó, legnagyobb bevételű könyveknél, és 41,6 százalék az AI-szöveget nagy arányban tartalmazó műveknél. Az Ai2 hangsúlyozza, hogy az irodalmi halmaz referenciaérték volt, nem pedig a piaccal azonos módon összeállított kontrollcsoport.

Mit keres az infini-gram?

A kutatók olyan több szóból álló kifejezésekre összpontosítottak, amelyek legfeljebb öt Google Books-kötetben szerepeltek, és az infini-gram webes pillanatképében egyáltalán nem fordultak elő. Ezzel igyekeztek elkülöníteni a néhány könyvre jellemző fordulatokat a köznyelvi vagy műfaji sablonoktól, például a „her heart skipped a beat” típusú, gyakori mondatoktól.

Egy ilyen találat önmagában nem bizonyítja, hogy egy kifejezés pontosan honnan származik, vagy ki írta le először. Ha azonban egy detektor által AI-szövegként azonosított részletben sok hasonló fordulat jelenik meg, ezek együtt további bizonyítékot adhatnak arra, hogy a szöveg könyvekből származó nyelvi anyagra támaszkodik.

Az Ai2 szerint a GrantaGate néven emlegetett ügyben, amely egy Commonwealth Foundation-díjat nyert novella gépi eredetének gyanújához kapcsolódott, az infini-gram használata több jellegzetes töredéket is felszínre hozott. A „sour tang of fermenting” kifejezés például egy rajongói fikciós oldalon megjelent sor megfogalmazására emlékeztetett. Ez az Ai2 szerint azt mutatja, hogy a fordulat a nyilvános korpuszban máshol is szerepelt.

Nyílt eszköz a szövegek eredetének vizsgálatához

Chakrabarty az infini-gramhoz két Ai2-projekten keresztül jutott el. Az OlmoTrace az infini-gramra támaszkodva kapcsolja össze az Ai2 teljesen nyílt Olmo modelljeinek kimenetét a tanítási adatokban található egyező szövegekkel. A Creativity Index egy referencia-korpuszhoz viszonyítva méri a szöveg eredetiségét.

Az Ai2 szerint az ilyen elemzésekhez szükség van egy olyan eszközre, amely nagy mennyiségű emberi szöveget képes kereshetővé tenni. Az infini-gram és az Olmo nyílt tanítási adatkészletei, köztük a Dolma, lehetővé teszik, hogy a kutatók megvizsgálják egy kifejezés gyakoriságát azokban a nyilvános korpuszokban, amelyek egy modell tanításában is szerepelhettek.

A kutatócsoport a módszert szerzői jogi vizsgálatokban is teszteli. A cél annak feltárása, hogy egy szerzői jog által védett könyv részletei hol jelentek meg az interneten, és egy modell esetleg kalózmásolatból vagy online kiszivárgott kéziratból tanulhatta-e meg őket.

Ai2infini-gramOlmoTraceOlmoCreativity IndexStony Brook Universitynyelvi modellekszerzői jogkutatási eredmény

Kapcsolódó hírek

Az Ai2 megnyitotta az AstaBrief tudományos jelentéskészítő modellt
Modellek2026. október 2. 10:00

Az Ai2 megnyitotta az AstaBrief tudományos jelentéskészítő modellt

Az Ai2 nyílt súlyokkal és a tanításához használt adatokkal együtt tette közzé az AstaBrief 8B modellt, amely tudományos kérdésekből és visszakeresett szakirodalmi…

Az Ai2 megnyitotta az AstaBrief tudományos riportmodellt
Modellek2026. október 2. 10:00

Az Ai2 megnyitotta az AstaBrief tudományos riportmodellt

Az Ai2 nyílt forrásúvá tette az AstaBrief 8B modellt, amely kutatási kérdésekből és visszakeresett szakirodalmi részletekből készít hivatkozásokkal ellátott riportokat.…

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt…