Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A letölthető modellek korában az adat és a visszacsatolás dönt

2026. augusztus 19. 21:46Forrás: Anaconda
A letölthető modellek korában az adat és a visszacsatolás dönt
Kép: Anaconda

A Bridgewater AIA Labs kísérlete szerint egy nyílt súlyú modell szakértői adatokkal betanítva felülmúlta a vizsgált élvonalbeli modelleket. Az Anaconda szerint a vállalati AI legfontosabb értéke a modell köré épített, saját adatokon és szakértői visszacsatoláson alapuló folyamat lehet.

A lényeg röviden
  • A Bridgewater Qwen3-235B modellje szakértői adatokkal 84,7 százalékos pontosságot ért el.
  • A finomhangolt modell körülbelül 30 százalékkal kevesebb hibát vétett a legjobb tesztelt frontier modellnél.
  • A modell feladatonként nagyjából tizennegyed akkora következtetési költséggel működött.
  • A szakértői időt a modell és a címkék közötti eltérésekre összpontosították.
  • Az Anaconda szerint a tartós vállalati értéket a hordozható adatok, értékelések és visszacsatolási folyamatok adják.

A szakértői adatokkal betanított modell megelőzte a frontier modelleket

2026 júniusában a Bridgewater AIA Labs a Thinking Machines Lab közreműködésével hat, befektetők napi munkájából származó információs osztályozási feladaton közölt eredményeket. A feladatok között szerepelt annak eldöntése, hogy releváns-e egy hírcikk egy makrogazdasági befektető számára, jelez-e egy jegybanki dokumentum kamatváltozást, illetve hol kezdődik a sablonszöveg egy kutatási anyagban.

A modellek először csak a feladat leírását kapták meg, így az élvonalbeli modellek 50 százalék alatti pontosságot értek el. A Bridgewater szakértői részletes utasításokat készítettek, és néhány kérdést is átfogalmaztak. Ezzel a legjobb vizsgált modell 78,2 százalékra javult. Az automatikus promptoptimalizálás ezután már nem hozott további javulást, miközben a Bridgewater a megbízható használathoz legalább 80 százalékos eredményt tartott szükségesnek.

A vállalat ezért egy nyílt súlyú modellt finomhangolt. A Qwen3-235B alapállapotban 44,8 százalékot ért el, a Bridgewater szakértői által címkézett adatokon végzett tanítás után viszont 84,7 százalékra jutott. Az Anaconda által ismertetett eredmények szerint így körülbelül 30 százalékkal kevesebb hibát vétett, mint a legjobb tesztelt frontier modell, miközben feladatonként nagyjából tizennegyed akkora következtetési költséggel működött.

A Qwen3-235B nyilvánosan elérhető, ezért bárki letöltheti. A Bridgewater azért választotta, mert a finomhangolási viselkedése jól dokumentált a szakirodalomban. A vállalat különbségét így nem maga az alapmodell adta, hanem a saját címkézett adata és az adatminőség biztosítására kialakított folyamata.

A szakértői figyelmet a vitatott példákra irányították

A Bridgewater első kísérletében külső szolgáltató végezte a nem szakértői címkézést. Az ezekkel az adatokkal betanított modellek gyengén teljesítettek, a modell gondolkodási nyomainak vizsgálatakor pedig kiderült, hogy maguk a címkék is gyakran hibásak voltak.

A szakértői befektetők képesek voltak helyes címkéket készíteni, az összes példa kézi ellenőrzése azonban túl sok időt igényelt volna. A csapat ezért olyan útválasztási rendszert alakított ki, amely a szakértői figyelmet a vitatott esetekre összpontosította. Először egy olcsó címkékkel betanított modellt értékeltek ugyanazon az adathalmazon, amelyen a modell tanult. Minden olyan példa szakértőhöz került, amelynél a modell nem értett egyet a saját tanítási címkéjével.

Az eljárás logikája szerint ilyenkor vagy valóban nehéz példáról van szó, vagy hibás a címke, ezért mindkét eset szakértői ellenőrzést igényel. A Bridgewater folyamatának lépései a következők:

  • Szakértői ítélet rögzítése: a szakértők valós munkából származó feladatokon határozzák meg, milyen a jó válasz.
  • Az értékelés megépítése: minden feladathoz mérőszámot és olyan elkülönített tesztadatot készítenek, amelyhez a tanítás nem fér hozzá.
  • Az eltérések megkeresése: a modell hibái alapján azonosítják a megbízhatatlan példákat.
  • Szakértői ellenőrzés: az eltérő példák kerülnek emberhez, a többi adat érintetlen marad.
  • A teljes recept tesztelése: az egyes elemeket külön-külön eltávolítják, majd újramérik a hatásukat.
  • Visszacsatolás: a megtisztított adathalmaz és a javított modell a következő iteráció alapjává válik.

Az Anaconda szerint ezek a lépések nem kötődnek egyetlen alapmodellhez. A Qwen3-235B később más modellre cserélhető úgy, hogy maga a folyamat változatlanul működjön.

A modell önmagában nem jelent tartós megkülönböztetést

Az Anaconda három okot emel ki, amiért egy modell önmagában kevés lehet. Előfordulhat, hogy egy nyilvános mérésen jól teljesítő modell nem tudja teljesíteni a vállalat késleltetési, kapacitás- vagy rendelkezésre állási követelményeit. A szolgáltatók árazása változik, a keresletet pedig nem mindig tudják kiszolgálni. A forrás példaként említi, hogy a Moonshot Kimi K3 modelljének megjelenésekor az átviteli sebesség másodpercenként 30 tokenről 13 tokenre csökkent, ezért a vállalatnak szüneteltetnie kellett az új előfizetéseket a meglévő felhasználók védelmében.

A modellek útválasztása sem old meg minden problémát. Az Anaconda szerint egy modellgyártó saját útválasztója előnyben részesítheti a saját kapacitását, egy átjáró pedig önálló függőséggé válhat. A vállalati érték ezért abban is rejlik, hogy a szervezet megőrizze a modellek és szolgáltatók cseréjének lehetőségét, miközben a munkafolyamat és az irányelvek megmaradnak.

A nyílt súlyok használata stratégiai előnyöket adhat, például privát telepítést, offline működést, regionális kontrollt, testreszabást és kisebb függést a hosztolt API-któl. Két vállalat ugyanazzal a modellel mégsem feltétlenül ér el azonos eredményt. A kontextus, a címkék, az értékelések, a mérnöki szabványok és a visszacsatolási hurkok mind befolyásolják a végeredményt.

Az Anaconda Alex Karp, a Palantir vezérigazgatójának egy CNBC-interjúban elhangzott érvelését is idézi. Karp szerint a vállalatoknak ellenőrzésük alatt kell tartaniuk a számítási kapacitást, a modelleket, az adatvermet és a saját, a piaci teljesítménytől megkülönböztető tudásukat. A szervezeteknek szerinte nem szabad úgy bérelniük az intelligenciát, hogy közben ne őrizzék meg a tanulást.

A vállalati érték a kormányzott AI-hurokban halmozódik

Ali Ghodsi, a Databricks vezérigazgatója 2026 májusában a CNBC-nek azt mondta: „Az AI-nak nincs intelligenciaproblémája. Az AI-nak kontextusproblémája van. Hogyan adjuk át neki ezt a kontextust? Ez a kontextus az adatokban van.” Az Anaconda értelmezése szerint az általános modell akkor válik vállalati értékké, amikor összekapcsolódik a szervezeti tudással és az alkalmazásához szükséges működési rendszerrel.

Ez a rendszer több elemből áll: a munka megfelelő modellhez irányításából, a szervezeti kontextus átadásából, a szakértői ítéletek rögzítéséből, az eredmények értékeléséből, a gyártásba vezetés szabályozásából és a tanulságok visszaforgatásából. A vállalat saját adatai, értékelései, szabályai és működési története így akkor is hordozható maradhat, ha az alapul szolgáló modellt később lecserélik.

Két feltétel különösen fontos. A rendszernek kellően semlegesnek kell lennie ahhoz, hogy a szervezet modellt, szolgáltatót vagy infrastruktúrát válthasson a teljes munkafolyamat újraépítése nélkül. Emellett a felhalmozódó tudásnak a szervezet saját tulajdonában és ellenőrzése alatt kell maradnia.

Az Anaconda a Kilo és az Anaconda közös működését ehhez az irányhoz kapcsolja. A cég szerint a Kilo lehetővé teszi, hogy a fejlesztők frontier, nyílt súlyú és helyi modellek között dolgozzanak saját kulcsaikkal és szolgáltatóikkal, miközben a szervezetek meghatározhatják az engedélyezett útvonalakat. Az Anaconda reprodukálható környezeteket, megbízható csomagokat és modellirányítást kínál, hogy a létrehozott rendszerek a mögöttes modell változásakor is ellenőrizhetők és hordozhatók maradjanak.

A vállalat szerint a jövőben a nyílt és zárt modellek együtt használhatók, a tartós előnyt pedig az adhatja, hogy egy szervezet mennyire képes saját visszacsatolási hurkot kiépíteni és fejleszteni.

BridgewaterAIA LabsThinking Machines LabQwen3-235Bnyílt forráskódú modellekvállalati AIkutatási eredménybenchmark
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt
Modellek2026. október 3.

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt

Az Aleph Alpha bemutatta a Kolibrit, egy német és angol nyelvre fejlesztett, nyílt súlyú Mixture-of-Experts modellt. A 78 milliárd teljes és 3 milliárd aktív…

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch szerint a TLX gyorsabb lett a Blackwell Jagged Flash Attentionjénél

A PyTorch csapata olyan Jagged Flash Attention kernelt mutatott be NVIDIA Blackwell B200 GPU-kra, amely a vállalat mérései szerint a GEM munkaterhelésén gyorsabb volt a…

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch TLX-kernellel gyorsította a Meta hirdetési modelljének figyelmét

A PyTorch olyan Jagged Flash Attention-kernelt mutatott be, amely az NVIDIA Blackwell B200 gyorsítón a Meta Generative Ads Model modelljéhez fontos alakzatokon…