Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Pydantic szerint az AI-k egymástól tanulják a furcsa szavakat

2026. szeptember 8.Forrás: Pydantic
A Pydantic szerint az AI-k egymástól tanulják a furcsa szavakat
Kép: Pydantic

A Pydantic szerint a frontier modellek egyre gyakrabban használnak olyan kifejezéseket, amelyek korábban ritkák vagy szokatlanok voltak a fejlesztők számára. A cég ezt nyelvi sodródásnak nevezi, és egy saját eszközzel próbálja korlátozni a jelenséget.

A lényeg röviden
  • A Pydantic szerint a frontier modellek nyelvi sodródást okozhatnak.
  • A „seam” kifejezés 2026-os GitHub-pull requestekben ugrott meg.
  • A vizsgált pull requestek 45 százalékában szerepelt a „Claude Code” jelölés.
  • A Pydantic README-k elemzésével is vizsgálta a változó szókincset.
  • A cég a vocabguard csomaggal és Pydantic AI Capability megoldással korlátozná a kimenetek szókincsét.

A „seam” lett a példa a nyelvi sodródásra

A Pydantic szeptember 8-án közzétett írásában egy konkrét példán keresztül mutatja be, hogyan terjedhetnek el bizonyos szavak az AI által generált szövegekben. A cég szerzője szerint az Anthropic Claude modelljei egyre gyakrabban használják a seam szót olyan pontokra, ahol egy szoftverrendszer két komponense kapcsolódik egymáshoz. A szerző erre inkább az interface, vagyis interfész, illetve a contract, azaz szerződés kifejezést használná.

A Pydantic szerint a Fable 5 ezt a szót nagy mennyiségben kezdte el használni a kódokban, megjegyzésekben, dokumentációs karakterláncokban és Markdown-fájlokban. Amikor a szerző rákérdezett a Fable 5.1-nél, a modell Michael Feathers 2004-es, Working Effectively With Legacy Code című könyvére hivatkozott. A Pydantic értelmezése szerint egy régebbi, kevéssé használt terminus így került be erőteljesen a modell válaszaiba.

A GitHub-adatok alapján 2026-ban ugrott meg a használat

A szerző a GitHubon nagyjából 700 ezer pull requestet talált, amelyben szerepelt a seam szó. Állítása szerint ezek közül körülbelül 685 ezer 2026-ból származott, míg mintegy 15 ezer korábbi évekből.

A vizsgálat a pull requestekben vagy a hozzájuk kapcsolódó szövegekben található AI-jelöléseket is összevetette. A „Claude Code” kifejezés 307 971, a „Generated with Claude Code” pontos lábléc pedig 247 275 esetben szerepelt. A „Codex” 119 845, a „Copilot” 53 726, a „Cursor” 51 974, a „Gemini” 25 514, a „Devin” pedig 4 970 alkalommal jelent meg. A Pydantic szerint a „Claude Code” jelölés a seam-et tartalmazó pull requestekben 3,6-szor felülreprezentált volt a 2026-os összes pull requesthez képest.

A bejegyzés szerint a tendencia más modellekre is átterjedhet, amikor azok meglévő kódbázisokat olvasnak. A szerző azt írja, hogy a GPT 5.6 Sol, a DeepSeek v4 Flash 0731, a Qwen 3.8 27b és a Z.AI GLM 5.3 Flash is használni kezdte a „seam” kifejezést az ilyen kódok feldolgozása után.

A Pydantic korlátokkal védené a modellek kimenetét

A Pydantic a jelenséget visszacsatolási folyamatként írja le. A cég szerint az Opus 4.6 lehetett a „beteg nulla”, a tendencia később az Opus 4.7-ben erősödött, az Opus 4.8 megjelenésekor pedig nagyot ugrott. A szerző ezt nem önmagában hibás működésként értékeli, hanem olyan nyelvi változásként, amelyre az AI-rendszerek felhasználóinak figyelniük kell.

A bejegyzés készítője 4319, 2025 előtti README-fájlt vizsgált 22 programozási nyelvből, valamint 1047, 2026-os README-t olyan tárolókból, amelyekben Claude Code által jelölt commitok voltak. A régebbi mintánál legalább 500 csillagos tárolókat használt, a 2026-os készletnél nem alkalmazott csillagszám szerinti szűrést. A szövegeket TF-IDF-vektorizálóval, szingulárisérték-felbontással és t-SNE-eljárással elemezte, majd a két csoport eltérését a nyelvi sodródás vizualizációjaként mutatta be.

A Pydantic erre válaszul egy Pydantic AI Capability megoldást és a vocabguard nevű PyPI-csomagot mutatott be. A leírás szerint az eszköz tetszőleges szövegrészletet képes vizsgálni, és ember által meghatározott korlátokkal lehet használni egy Pydantic AI-ügynök kimeneténél. A cég egy légitársasági ügyfélszolgálati példával szemlélteti a kockázatot: ha egy modell a késést egy szokatlan szóval jelölné, az emberi ügyintézők félreérthetnék a strukturált összefoglalót. A Pydantic szerint a szókincsre vonatkozó korlátok ezt a fajta félreértést hivatottak megelőzni.

Kapcsolódó hírek

Modellek
Modellek2026. október 2.

Az OpenAI útmutatót adott ki a GPT-6 modellek használatához

Az OpenAI gyakorlati útmutatóban mutatja be, hogyan érdemes kiválasztani és használni a GPT-6 család modelljeit. A dokumentum a fejlesztési feladatoktól a több napon át…

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast
Modellek2026. október 1.

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

Elérhető az Amazon Bedrockon az OpenAI GPT-6.1 Sol modellje
Termékek és eszközök2026. szeptember 29.

Elérhető az Amazon Bedrockon az OpenAI GPT-6.1 Sol modellje

Általánosan elérhetővé vált az Amazon Bedrockon a GPT-6.1 Sol, amelyet az OpenAI szerint kódolási, számítógép-használati és professzionális munkafolyamatokra…