Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AWS Trainiumra optimalizált nyelvi modelleket keres az Amazon

2026. augusztus 10.Forrás: Amazon Science
Az AWS Trainiumra optimalizált nyelvi modelleket keres az Amazon
Kép: Amazon Science

Az Amazon olyan versenyt indít, amelyben a résztvevők nyelvi modelleket tanítanak be az AWS saját Trainium2 chipjein. A cél annak feltárása, milyen modellarchitektúrák működnek a legjobban, ha a hardver alapvetően eltér a hagyományos gyorsítóktól.

A lényeg röviden
  • Az AWS Trainium Frontier nyelvi modellek Trainium2 chipeken történő fejlesztésére épül.
  • Az első fázisban egy chipen, 30 perc alatt mérik a validációs bit per bájt értéket.
  • A legjobb 10 csapat négyórás, teljes Trainium2 szerveres második fázisba jut.
  • A fődíj 25 000 dollár, a második díj 10 000, a harmadik 5 000 dollár.
  • A döntősök a NeurIPS 2026 idején, Sydneyben mutathatják be munkájukat.

A hardverhez igazított modelltervezés a központi kérdés

Az AWS Science augusztus 10-i bejelentése szerint az AWS Trainium Frontier versenyben a kutatók egy körülbelül 50 millió paraméteres, nanochat-alapú kiinduló modellből fejleszthetnek saját nyelvi modellt. A GPT-stílusú, sűrű nagy nyelvi modell RMSNormot, rotációs beágyazásokat és ReLU² MLP-t használ, de a résztvevők szabadon módosíthatják az architektúrát, az optimalizálót és a tanítási folyamatot.

Az Amazon szerint a Trainium olyan tervezési lehetőségeket kínál, amelyek eltérnek a hagyományos gyorsítókétól. A chip több, SBUF nevű, chipen belüli SRAM-ot használ, a legalacsonyabb szinten is lehetővé teszi az adatmozgatás és a gyorsítás vezérlését, valamint energiahatékony szisztolés mátrixszorzást alkalmaz. Emiatt egyes, más gyorsítókon memóriaigényes műveletek a Trainiumon inkább számítási korlátba ütközhetnek.

A verseny így azt vizsgálja, hogyan változik az optimális figyelmi mechanizmus, MLP-felépítés és párhuzamosítási stratégia a hardver megváltozásával. A résztvevők saját NKI-kernelt is írhatnak, vagyis közvetlenül használhatják a Trainium alacsony szintű képességeit.

Két fázisban mérik a tanítási hatékonyságot

Az első szakaszban minden csapat egyetlen Trainium2 chipet és 30 perc tanítási időt kap. A rangsorolás alapja a validációs bit per bájt mutató lesz, amelynél az alacsonyabb érték számít jobbnak. A csapatok bármilyen fejlesztést bevethetnek, amely belefér az időkeretbe, legyen szó modellarchitektúráról, optimalizálóról, tanítási ütemezésről vagy egyedi kernelről.

Az első szakasz augusztus 31-én nyílik meg, a lezárása szeptember 30-án lesz. A legjobb 10 csapat jut tovább a második fázisba, ahol egy teljes Trainium2 szerver és négyórás keret áll rendelkezésükre. Ebben a szakaszban már az elosztott párhuzamosítás és a kommunikáció figyelembevétele is szerepet kaphat.

A második fázisban az inferenciateljesítményt is mérik a CORE értékelőrendszerrel. Ez többek között következtetési, szövegértési és világismereti feladatokat fog össze. A végső eredmény fele a tanítási hatékonyságból, fele az inferenciateljesítményből áll.

Kutatóknak és AI-ügynökökkel dolgozó csapatoknak szól

A szervezők szerint a versenyre egy és négy fő közötti csapatok jelentkezhetnek. A célcsoportba azokat a kutatókat sorolják, akik modellarchitektúrákkal, optimalizálókkal vagy tanítási receptekkel foglalkoznak, továbbá azokat a gépi tanulási rendszermérnököket, akik a hardverhez igazított optimalizálást és az egyedi kerneleket vizsgálják.

A PyTorch és a transzformerek tanításának ismerete elvárt, de a kernelprogramozási tapasztalat nem feltétel a gépi tanulási szintű versenyhez. A CUDA, a Triton vagy hasonló technológiák ismerete átvihető az NKI használatára.

Az Amazon teljes nanochat-alapú tanítási folyamatot, Trainiumra optimalizált kísérleti keretrendszert, NKI-dokumentációt és profilozó eszközt biztosít. A jogosult akadémiai csapatok AWS-promóciós krediteket is kaphatnak a Trainium számítási kapacitásához és az Amazon Bedrock eléréséhez.

Pénzdíj és bemutatkozási lehetőség a NeurIPS 2026-on

A három legjobb döntős a NeurIPS 2026 konferencia idején, Sydneyben mutathatja be eredményeit egy Annapurna Labs által szervezett kutatási eseményen. A legjobb csapatoknak lehetőségük nyílhat arra is, hogy az Annapurna Labs kutatóival közösen publikálják eredményeiket egy hardverközeli modelltervezéssel foglalkozó tanulmányban.

Az első helyezett 25 000 dollárt, a második 10 000 dollárt, a harmadik 5 000 dollárt kap. A legjobb 10 csapat tagjai egyedi Neuron-csapatdzsekit és döntősi ajándékcsomagot kapnak. A döntősök utazási és egyéb költségeit maguknak kell fedezniük.

A verseny a felhasználók számára elsősorban kutatási lehetőséget jelent, az AWS számára pedig olyan modellek és optimalizálási módszerek feltérképezését, amelyek közvetlenül a Trainium képességeire építenek. A forrás szerint a rögzített időkeret miatt a résztvevőknek a modellkapacitás és a tanítási sebesség közötti egyensúlyt kell megtalálniuk.

Kapcsolódó hírek

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…

Az Aleph Alpha 512 B200 GPU-n skálázta 30 milliárd paraméteres modelljét
Kutatás2026. szeptember 30.

Az Aleph Alpha 512 B200 GPU-n skálázta 30 milliárd paraméteres modelljét

Az Aleph Alpha 16-ról 512 NVIDIA B200 GPU-ra növelte egy 30B-A3B MoE modell előtanításának számítási kapacitását. A vállalat szerint a hierarchikus módszerrel 35,3…

Így épített az Amazon egy évtized alatt saját chipportfóliót
Chipek és infrastruktúra2026. szeptember 22.

Így épített az Amazon egy évtized alatt saját chipportfóliót

Az Amazon saját és ügyfelei valós munkaterhelései alapján tervezi egyedi chipjeit, ahelyett hogy elsősorban szabványos tesztekkel optimalizálná azokat. A vállalat a…