A letölthető modellek korában az adat és a visszacsatolás dönt

A Bridgewater AIA Labs kísérlete szerint egy nyílt súlyú modell szakértői adatokkal betanítva felülmúlta a vizsgált élvonalbeli modelleket. Az Anaconda szerint a vállalati AI legfontosabb értéke a modell köré épített, saját adatokon és szakértői visszacsatoláson alapuló folyamat lehet.
- A Bridgewater Qwen3-235B modellje szakértői adatokkal 84,7 százalékos pontosságot ért el.
- A finomhangolt modell körülbelül 30 százalékkal kevesebb hibát vétett a legjobb tesztelt frontier modellnél.
- A modell feladatonként nagyjából tizennegyed akkora következtetési költséggel működött.
- A szakértői időt a modell és a címkék közötti eltérésekre összpontosították.
- Az Anaconda szerint a tartós vállalati értéket a hordozható adatok, értékelések és visszacsatolási folyamatok adják.
A szakértői adatokkal betanított modell megelőzte a frontier modelleket
2026 júniusában a Bridgewater AIA Labs a Thinking Machines Lab közreműködésével hat, befektetők napi munkájából származó információs osztályozási feladaton közölt eredményeket. A feladatok között szerepelt annak eldöntése, hogy releváns-e egy hírcikk egy makrogazdasági befektető számára, jelez-e egy jegybanki dokumentum kamatváltozást, illetve hol kezdődik a sablonszöveg egy kutatási anyagban.
A modellek először csak a feladat leírását kapták meg, így az élvonalbeli modellek 50 százalék alatti pontosságot értek el. A Bridgewater szakértői részletes utasításokat készítettek, és néhány kérdést is átfogalmaztak. Ezzel a legjobb vizsgált modell 78,2 százalékra javult. Az automatikus promptoptimalizálás ezután már nem hozott további javulást, miközben a Bridgewater a megbízható használathoz legalább 80 százalékos eredményt tartott szükségesnek.
A vállalat ezért egy nyílt súlyú modellt finomhangolt. A Qwen3-235B alapállapotban 44,8 százalékot ért el, a Bridgewater szakértői által címkézett adatokon végzett tanítás után viszont 84,7 százalékra jutott. Az Anaconda által ismertetett eredmények szerint így körülbelül 30 százalékkal kevesebb hibát vétett, mint a legjobb tesztelt frontier modell, miközben feladatonként nagyjából tizennegyed akkora következtetési költséggel működött.
A Qwen3-235B nyilvánosan elérhető, ezért bárki letöltheti. A Bridgewater azért választotta, mert a finomhangolási viselkedése jól dokumentált a szakirodalomban. A vállalat különbségét így nem maga az alapmodell adta, hanem a saját címkézett adata és az adatminőség biztosítására kialakított folyamata.
A szakértői figyelmet a vitatott példákra irányították
A Bridgewater első kísérletében külső szolgáltató végezte a nem szakértői címkézést. Az ezekkel az adatokkal betanított modellek gyengén teljesítettek, a modell gondolkodási nyomainak vizsgálatakor pedig kiderült, hogy maguk a címkék is gyakran hibásak voltak.
A szakértői befektetők képesek voltak helyes címkéket készíteni, az összes példa kézi ellenőrzése azonban túl sok időt igényelt volna. A csapat ezért olyan útválasztási rendszert alakított ki, amely a szakértői figyelmet a vitatott esetekre összpontosította. Először egy olcsó címkékkel betanított modellt értékeltek ugyanazon az adathalmazon, amelyen a modell tanult. Minden olyan példa szakértőhöz került, amelynél a modell nem értett egyet a saját tanítási címkéjével.
Az eljárás logikája szerint ilyenkor vagy valóban nehéz példáról van szó, vagy hibás a címke, ezért mindkét eset szakértői ellenőrzést igényel. A Bridgewater folyamatának lépései a következők:
- Szakértői ítélet rögzítése: a szakértők valós munkából származó feladatokon határozzák meg, milyen a jó válasz.
- Az értékelés megépítése: minden feladathoz mérőszámot és olyan elkülönített tesztadatot készítenek, amelyhez a tanítás nem fér hozzá.
- Az eltérések megkeresése: a modell hibái alapján azonosítják a megbízhatatlan példákat.
- Szakértői ellenőrzés: az eltérő példák kerülnek emberhez, a többi adat érintetlen marad.
- A teljes recept tesztelése: az egyes elemeket külön-külön eltávolítják, majd újramérik a hatásukat.
- Visszacsatolás: a megtisztított adathalmaz és a javított modell a következő iteráció alapjává válik.
Az Anaconda szerint ezek a lépések nem kötődnek egyetlen alapmodellhez. A Qwen3-235B később más modellre cserélhető úgy, hogy maga a folyamat változatlanul működjön.
A modell önmagában nem jelent tartós megkülönböztetést
Az Anaconda három okot emel ki, amiért egy modell önmagában kevés lehet. Előfordulhat, hogy egy nyilvános mérésen jól teljesítő modell nem tudja teljesíteni a vállalat késleltetési, kapacitás- vagy rendelkezésre állási követelményeit. A szolgáltatók árazása változik, a keresletet pedig nem mindig tudják kiszolgálni. A forrás példaként említi, hogy a Moonshot Kimi K3 modelljének megjelenésekor az átviteli sebesség másodpercenként 30 tokenről 13 tokenre csökkent, ezért a vállalatnak szüneteltetnie kellett az új előfizetéseket a meglévő felhasználók védelmében.
A modellek útválasztása sem old meg minden problémát. Az Anaconda szerint egy modellgyártó saját útválasztója előnyben részesítheti a saját kapacitását, egy átjáró pedig önálló függőséggé válhat. A vállalati érték ezért abban is rejlik, hogy a szervezet megőrizze a modellek és szolgáltatók cseréjének lehetőségét, miközben a munkafolyamat és az irányelvek megmaradnak.
A nyílt súlyok használata stratégiai előnyöket adhat, például privát telepítést, offline működést, regionális kontrollt, testreszabást és kisebb függést a hosztolt API-któl. Két vállalat ugyanazzal a modellel mégsem feltétlenül ér el azonos eredményt. A kontextus, a címkék, az értékelések, a mérnöki szabványok és a visszacsatolási hurkok mind befolyásolják a végeredményt.
Az Anaconda Alex Karp, a Palantir vezérigazgatójának egy CNBC-interjúban elhangzott érvelését is idézi. Karp szerint a vállalatoknak ellenőrzésük alatt kell tartaniuk a számítási kapacitást, a modelleket, az adatvermet és a saját, a piaci teljesítménytől megkülönböztető tudásukat. A szervezeteknek szerinte nem szabad úgy bérelniük az intelligenciát, hogy közben ne őrizzék meg a tanulást.
A vállalati érték a kormányzott AI-hurokban halmozódik
Ali Ghodsi, a Databricks vezérigazgatója 2026 májusában a CNBC-nek azt mondta: „Az AI-nak nincs intelligenciaproblémája. Az AI-nak kontextusproblémája van. Hogyan adjuk át neki ezt a kontextust? Ez a kontextus az adatokban van.” Az Anaconda értelmezése szerint az általános modell akkor válik vállalati értékké, amikor összekapcsolódik a szervezeti tudással és az alkalmazásához szükséges működési rendszerrel.
Ez a rendszer több elemből áll: a munka megfelelő modellhez irányításából, a szervezeti kontextus átadásából, a szakértői ítéletek rögzítéséből, az eredmények értékeléséből, a gyártásba vezetés szabályozásából és a tanulságok visszaforgatásából. A vállalat saját adatai, értékelései, szabályai és működési története így akkor is hordozható maradhat, ha az alapul szolgáló modellt később lecserélik.
Két feltétel különösen fontos. A rendszernek kellően semlegesnek kell lennie ahhoz, hogy a szervezet modellt, szolgáltatót vagy infrastruktúrát válthasson a teljes munkafolyamat újraépítése nélkül. Emellett a felhalmozódó tudásnak a szervezet saját tulajdonában és ellenőrzése alatt kell maradnia.
Az Anaconda a Kilo és az Anaconda közös működését ehhez az irányhoz kapcsolja. A cég szerint a Kilo lehetővé teszi, hogy a fejlesztők frontier, nyílt súlyú és helyi modellek között dolgozzanak saját kulcsaikkal és szolgáltatóikkal, miközben a szervezetek meghatározhatják az engedélyezett útvonalakat. Az Anaconda reprodukálható környezeteket, megbízható csomagokat és modellirányítást kínál, hogy a létrehozott rendszerek a mögöttes modell változásakor is ellenőrizhetők és hordozhatók maradjanak.
A vállalat szerint a jövőben a nyílt és zárt modellek együtt használhatók, a tartós előnyt pedig az adhatja, hogy egy szervezet mennyire képes saját visszacsatolási hurkot kiépíteni és fejleszteni.
Anaconda: How to Differentiate When Everyone Can Download the Same Model
