Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Cohere: a többnyelvű AI önmagában nem lesz kulturálisan érzékeny

2026. augusztus 19.Forrás: Cohere
Cohere: a többnyelvű AI önmagában nem lesz kulturálisan érzékeny
Kép: Cohere

A Cohere 2026. augusztus 19-én ismertetett kutatása szerint a globálisan használható AI-hoz nem elég, ha egy modell sok nyelven beszél. A cég több mint 5,6 millió tanítási minta elemzése alapján azt állítja, hogy a kulturális sokszínűség jelentős része eltűnik, mire az adatok az LLM-ek utótanítási szakaszába jutnak.

A lényeg röviden
  • A Cohere több mint 5,6 millió tanítási mintát elemzett.
  • A cég szerint az utótanítás során jelentősen csökken a kulturális sokszínűség.
  • A több nyelv növeli a földrajzi lefedettséget, de nem feltétlenül a kulturális tartalom arányát.
  • A kulturális adatok földrajzi eloszlása erősen egyenetlen.
  • A Cohere szerint szándékos adatválogatás kell a kulturálisan érzékenyebb AI-hoz.

A nyelvtudás és a kulturális megértés nem ugyanaz

A Cohere bejegyzése szerint a globális AI-rendszerek fejlesztésénél a többnyelvűség önmagában nem elegendő. Egy modell képes lehet több tucat nyelven folyékonyan válaszolni, miközben nem érti pontosan azokat a helyi normákat, értékeket, társas elvárásokat és kommunikációs összefüggéseket, amelyek meghatározzák, hogyan beszélnek egymással az emberek.

A cég friss előtanulmánya, a The Culture Funnel: You Can’t Align What isn’t in the Data azt vizsgálja, hogy a kulturális információ hogyan jelenik meg a nagy nyelvi modellek tanítási adatfolyamában. A kutatás kiindulópontja az a feltételezés volt, hogy a kulturális tudás hiányosságai talán nem a modell használatakor, hanem jóval korábban, magukban az adatokban keletkeznek.

A Cohere szerint a jelenlegi megközelítések gyakran arra építenek, hogy a modellben már megvan a szükséges kulturális tudás, és azt csak elő kell hívni jobb promptolással, igazítással vagy következtetéssel. A vállalat elemzése ezt a feltételezést kérdőjelezi meg: ha a kulturális tartalom nem szerepel kellő mértékben az adatokban, akkor azt később nehéz a modellből kinyerni.

Több mint 5,6 millió minta alapján rajzolódott ki a kultúratölcsér

A Cohere több mint 5,6 millió tanítási adatmintát vizsgált meg a nyelvi modellek fejlesztésének különböző szakaszaiból, köztük az előtanításból, az SFT-ből, az igazításból és a következtetési adatokból. A mintákban kulturális jeleket címkéztek, a feladatot a Cohere Command A modelljével automatizálták, majd a generált címkék minőségét hat nyelven, kézi ellenőrzéssel validálták.

A kutatás nem kezelte a nyelvet vagy a földrajzi helyet a kultúra egyszerű helyettesítőjeként. A címkézés több dimenziót vett figyelembe, például a domént, a feladat szándékát, a nyelvet, a földrajzi helyet és a kulturális jellemzőket. Utóbbiaknál a Cohere az AlKhamissi et al. (2026) taxonómiájára támaszkodott.

Az elemzés fő megállapítása a Cohere által culture funnel, magyarul kultúratölcsérként leírt jelenség. Eszerint az előtanítási adatokban még viszonylag sok kulturálisan beágyazott tartalom található, az utótanítási adatkészletekben viszont ennek aránya erősen lecsökken, egyes esetekben szinte vagy teljesen eltűnik.

Az utótanítás technikai feladatokra szűkíti az adatokat

A Cohere magyarázata szerint az utótanítási adatkészletek gyakran olyan célokat szolgálnak, mint a következtetési képességek vagy az igazítás javítása. Ezek az adatok nagy arányban technikai feladatokra épülnek, például matematikai számításokra vagy kódírásra. Emiatt azok az adatkészletek, amelyekben több kulturális jel található, kevésbé hangsúlyosak a folyamat későbbi szakaszaiban.

A kutatás azt is megállapította, hogy a megmaradó kulturális tartalom nagy része kulturális tudáshoz vagy általános kultúrához kapcsolódik. Ilyenek lehetnek például az ételek, ünnepek, tulajdonnevek vagy fordítási kontextusok. A Cohere szerint ez segíthet megérteni, miért teljesítenek a modellek viszonylag jól tényszerű vagy kvízszerű kulturális teszteken, miközben nehezebben kezelik azokat a feladatokat, amelyek implicit kulturális preferenciák, normák vagy társas dinamikák értelmezését igénylik.

A bejegyzés egy 2025-ös kutatócsoport elvét is idézi magyar fordításban: „Minden értékelési és adatválasztási döntést kulturálisan függő szempontok szerint is meg kell vizsgálni.” A Cohere ezt a gondolatot a dokumentálás, az adatfeldolgozás és az értékelés egyik központi tényezőjeként kezeli.

A több nyelv több földrajzi lefedettséget ad, de nem arányosan több kultúrát

A kutatás másik fontos eredménye, hogy a nyelvek számának növelése nem automatikusan növeli a kulturálisan gazdag tartalom arányát. A Cohere szerint amikor egy adatkészletben egyre több nyelv adatait adják hozzá, a földrajzi sokszínűség tovább nő, a kulturális tartalom aránya viszont egy ponton telítődik.

A bejegyzés példaként említi az Aya adatkészletet, amelyben magasabb volt a kulturális tartalom aránya, mert azt szándékosan kulturálisan megalapozott promptokkal és válaszokkal állították össze egy nemzetközi közreműködői közösség segítségével. A Cohere szerint ebből az következik, hogy a kulturális lefedettséget erősen befolyásolja az adatok válogatásának stratégiája.

A földrajzi reprezentáció ugyanakkor erősen egyenetlen. A kulturálisan címkézett adatokon belül India jelent meg a leggyakrabban képviselt földrajzi helyként, emellett ázsiai és európai országok koncentrációja volt látható. A Cultura X példájában a top 50 földrajzi hely között csak egy dél-amerikai, egy afrikai és egy észak-amerikai ország szerepelt. A bejegyzés szerint India mellett Kína és az USA más adatkészletekben is a top 10 domináns helyei között volt.

Mit jelent ez a felhasználóknak és a fejlesztőknek?

A Cohere következtetése szerint a kulturálisan érzékenyebb AI-hoz nem elég a többnyelvű képességek skálázása. Olyan adatokra van szükség, amelyek szélesebb regionális lefedettséget adnak, és szándékosan tartalmaznak kulturálisan reprezentatív tartalmakat.

Ez a felhasználók szempontjából azért lényeges, mert a modell válasza nem csak nyelvtani vagy szakmai pontosságon múlik. A mindennapi használatban fontos lehet, hogy a rendszer felismerje a helyi normákat, a társas elvárásokat és a kulturális háttérből fakadó finom jelentéseket is.

A Cohere a tanulmányhoz kapcsolódó teljes előtanulmányt és a CultureMarkers adatkészletet is elérhetővé tette. A vállalat szerint ígéretes eredményeket mutat, ha a kultúrát explicitebb módon jelenítik meg a tanítási adatokban, mert ez segíthet a modelleknek változatosabb és alulreprezentáltabb kulturális szempontokat megőrizni.

Kapcsolódó hírek

AutoSynthData: vállalati ügynökök képzési adatain dolgozik a Hugging Face
Kutatás2026. október 2.

AutoSynthData: vállalati ügynökök képzési adatain dolgozik a Hugging Face

A Hugging Face oldalán megjelent az „AutoSynthData: Generating Training Data for Enterprise Agents” című anyag. A forrás címe szerint a téma a vállalati ügynökök számára…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1.

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható
Kutatás2026. október 1.

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a…